AI Dev Broadcast
Open in Telegram
Всё про разработку с использованием AI технологий Наш канал про Android - @android_broadcast Видео как работать с AI - abdev.by/broadcast_ai_plus
Show more2 419
Subscribers
+624 hours
+307 days
+3730 days
Posts Archive
2 421
🛠 JetBrains Research: как ревьюить код, который написал AI-агент
Команда Human-AI eXperience из JetBrains и Лундский университет описали, каким должен быть инструмент для ревью AI-кода. Главная мысль: проблема не в диффе, а в доверии. Модель пишет каждую строку с одинаковой уверенностью, и непонятно, куда смотреть внимательнее. Поэтому предлагают три шага:
👉 Обзор всего изменения с пояснением агента, что и зачем он сделал
👉 Оценка рисков по файлам: правки в редко меняющемся коде рискованнее, а AI-судья подсвечивает проблемные места без учета истории файла
👉 Детальное чтение только рискованных фрагментов
Идеи собрали на воркшопах с 17 практиками, прототип оценили 43 разработчика. Забавно, что ещё 54 ответа на опрос отсеяли, потому что их написал AI 😂.
Мне нравится идея смотреть не на весь дифф, а туда, где агент мог ошибиться. Пока это прототип, но хочется увидеть такое в инструментах. Видно в JB готовят что-то интересное
🔗 Пост в блоге JetBrains Research
📄 Статья
#AI #CodeReview #JetBrains
2 421
🐱 GitHub выпустил ReviewBench — открытый бенчмарк для AI-ревьюеров кода
Проверяют на 219 PR из 187 open source репозиториев на 19 языках. Подбирали по распределению 103,9 млн реальных PR на GitHub, но мелких однофайловых правок взяли меньше. Эталонные находки собрали из комментариев людей, статических анализаторов и фронтир-моделей, разметили по критичности и категориям. Судит Claude Sonnet 5 по опубликованной рубрике, а сеньоры независимо перепроверили результаты и они совпали в 96,6% случаев.
Своего агента можно прогнать самому. Есть контейнер + и нужен свой ключ к модели для оценки.
Топ лидерборда:
🏆 Copilot Code Review — 40,1
🥈 Devin AI — 37,0
🥉 Qodo — 35,1
Бенчмарк от GitHub, и по классике первое место у Copilot от GitHub. Неожиданно 😁 Прогоны конкурентов делала сама команда, вендоры их не проверяли. Но интереснее другое: даже лидер находит только ~26% известных проблем. Так что живой ревьюер пока без работы не останется.
🔗 Анонс в блоге GitHub
🏆 Лидерборд
🐱 GitHub
#AI #CodeReview #GitHub
2 421
💸 Сколько стоит один ответ ИИ-агента? А если он зациклился?
Общий счёт за API не покажет, где именно утекают деньги.
🗓 12 октября в 20:00 по МСК — открытый вебинар курса по эксплуатации ИИ-агентов.
Разберём, как видеть каждый шаг агента, измерять задержки и считать стоимость ответа.
🔧 На практике:
— возьмём ReAct-агента с инструментами;
— подключим трассировку через OpenTelemetry;
— найдём дорогой шаг и зацикливание;
— проверим, как один лимит меняет цену.
📊 Метрики на уровне сессии, задачи и шага. Обзор Arize Phoenix, Langfuse, LangSmith. Трассировки — в бесплатном локальном интерфейсе.
Полезно ML-инженерам и разработчикам, которые уже используют API LLM и хотят понимать агентов после запуска.
Спикер — Игорь Стурейко.
👉 Зарегистрироваться по ссылке
Реклама. ООО «Отус онлайн-образование», ОГРН 1177746618576, www.otus.ru
2 421
Repost from Кирилл Розов
🐱 Релиз Maven MCP 1.0. Агент сам смотрит актуальные версии зависимостей и что в них поменялось
Буду очень признателен если поставите звездочку на репозитории, что поддержит меня и замотивирует дальнейшее развитие проектаОдна из проблем при работе с Gradle-проектами через AI-агентов: они ничего не знают про актуальные версии зависимостей, что в них поменялось и насколько безопасно это подключать. Баги, CVE, сломанная совместимость с AGP или Kotlin. Версию модель берёт из обучающих данных, а потом это приходится перепроверять руками. Готового решения, удовлеторяющее моим требованиям, не нашёл, поэтому сделал свой Maven MCP. Это плагин для Claude Code, Grok Build, Cursor и Codex, а также есть возможность подключить как MCP в любой агент. Внутри один Python-сервер на стандартной библиотеке, без pip-зависимостей. Версии смотрит в репозиториях, которые объявлены в билде, а не только в Maven Central. Gradle сканирует через wrapper и runtime classpath, Maven читает pom.xml, version catalog тоже. Что агент теперь может сделать сам: 👉 Узнать последняя стабильная версия, а не альфа с максимальным номером 👉 что изменилось между двумя версиями: AndroidX, AGP, GitHub releases, CHANGELOG 👉 CVE через OSV, включая путь до транзитивной уязвимости 👉 совместимость AGP, Gradle, JDK, Kotlin 👉 конфликты версий, лицензии, EOL у JDK, Kotlin, Gradle и Spring Boot 👉 нормальная запись в libs.versions.toml Перед правкой зависимости хук проверяет координаты и насколько безопасно подключить его (через хуки в плагинах). 🐱 Исходники на GitHub
Ранее Maven MCP жил в другом GitHub репо, но к релизу 1.0 выделил его в отдельный репозиторий#AI #Gradle #Maven #MCP
2 421
🧠 *Модель сделает сама. Ваша работа - принять результат и понять вывод*
Новый пост от Карпати про реальность разработчиков и всех кто работает с AI: модели забирают всё больше черновой работы, и время уходит на проверку результата. Сырой ответ читать тяжело. Карпати предлагает сменить формат выдачи для повышения удобства. Четыре ступени, каждая следующая разбирается легче.
*1. Текст по ASD-STE100*
Simplified Technical English, стандарт инструкций по обслуживанию самолётов. Актуальная версия на сегодня (январь 2025): 53 правила и словарь около 900 разрешённых слов. У слова одно значение и одна часть речи. Активный залог, простые времена, одна мысль на предложение. В инструкции до ~20 слов, в описании до ~25. Из синонимов в словаре остаётся одно слово: start, а begin / initiate / commence туда не входят.
Объясни этот diff на ASD-STE100Получаем сухую спеку. Карпати часто просит менее строго «
80% пути к ASD-STE100»: те же короткие фразы и один смысл на слово, словарь чуть свободнее.
*2. Схема*
Картинка быстрее слов. Просите диаграммы и визуализацию.
Нарисуй диаграмму: кто кого вызывает, где живёт состояние, какой край ломает поведение*3. HTML-страница* Вместо чтения Markdown в терминале просите выдать финальный результат как HTML для ревью
Собери это одним HTML-файлом: клики по веткам, подсветка состояния. Открывается в браузере, без сборки*4. Видео* Формат, на который Карпати ставит больше всего - короткий ролик под одну тему, в духе 3Blue1Brown. Совсем уже для богатых кто имеет доступ к генерации видео
Сделай видео в стиле 3Blue1Brown про эту гонку. Озвучка через мой ключ ElevenLabsСюда можно и просить все сделать как презентацию —————— Ключевая идея сходится к том чтобы AI агент не вывали простыню текста на ревью, а выдавал все четко и по делу в удобном формате. Какой он для вас - знаете только вы, но думаю что суть идеи вы уловили #AI #LLM
2 421
👨🏻💻 Строим мультиагентные системы для разработки на Podlodka AI Crew
Инженерные задачи редко состоят из одного действия.
В традиционной разработке их распределяют между специалистами. Мультиагентный подход переносит эту логику в ИИ: вместо одного исполнителя работают несколько виртуальных агентов. Как построить такую систему и сделать её эффективной?
Эксперты Podlodka AI Crew ответят на этот вопрос в новом сезоне «Мультиагентные системы» с 12 по 16 октября. Генеральный партнёр — RWB.
Что узнаете:
🧩 Как построить внутреннюю ИИ-платформу разработки
🧠 Как устроен «мозг» агента
🔄 Как убрать себя из агентского цикла с помощью оркестрации
🏭 Как построить «завод» из ИИ-агентов с узкими задачами
🔍 Как быстро находить ошибки и не тратить лишние токены
Формат: онлайн, 5 дней, утренние и вечерние сессии в Zoom. Много практики и обсуждений в закрытом Telegram-канале. Цена ниже привычных конференций.
🎟 Промокод
AI_BROADCAST — скидка на сайте
#реклама2 421
🧠 Anthropic собрала инженерные заметки своей команды на claude.dev
Это не продуктовый блог и не дока. claude.dev — портал с тем, как сами разработчики Anthropic строят на Claude: скиллы, агенты, харнесс, контекст, стоимость задачи. Доки по-прежнему на [code.claude.com](https://code.claude.com/docs), сюда идут POV и разборы.
Разделы: Agents, Engineering, Playbooks, Skills. Из того, что реально стоит времени:
👉 How we use skills — как внутри Anthropic устроены сотни скиллов, не гайд «создай SKILL.md»
👉 The new rules of context engineering — что грузить в контекст на моделях поколения Claude 5, и зачем гонять
/doctor
👉 A harness for every task — динамические workflow в Claude Code
👉 What a task costs on Opus 5.5 — цена прогона и как вести длинную сессию
👉 Automating eval design — eval и hillclimb через скилл claude-api, с удержанным сетом, чтобы не обмануть себя
Будет полензо тем, кто уже сидит в Claude Code и собирает свой харнесс. Если ты только включаешь скиллы в чате, плотнее будет Academy и дока. Часть текстов не новая, их просто свели в одно место, свежие лежат сверху ленты.
#AI #ClaudeCode #Agents2 421
+1
🧠 Вышел Claude Sonnet 5.5, который лучше GPT-6 Sol, а самое главное - стал дешевле и потребляет меньше токенов. Кажется, наступают времени когда можно снова вернутся на подписку Claude Code.
Цена Sonnet 5.5 в 2 раза ниже чем Opus 5.5, хотя по качеству приближается к ней, что также радует.
Еще из важного - скорость ответа стала быстрее.
#Claude
2 421
Repost from Nek.12 | AI, SWE, Tech [RU]
https://youtu.be/32zpk7tqs0M
Запись доклада уже доступна на ютубе!
Напомню, что я сравнил Kent и Codex по куче параметров на одной и той же задаче в Респавне, моем KMP-приложении, а также рассказываю про проблемные зоны в сфере, почему агенты не слушаются инструкций, как работает внимание у моделей, как делать хорошие агентные графы на примере.
2 421
❤️ Яндекс открыл претрей, которую учили с нуля - AliceAI-Foundation-80B-A3B-Base
Сразу стоит сказать - это не конкурент ChatGPT или Claude. Base-модель: MoE 80B параметров, на токен активны 3B, контекст до 262k, лицензия Apache 2.0. Веса на Hugging Face, разбор пайплайна и замеров в техрепорте на Хабре.
Предыдущая модель Яндекса Alice AI LLM 235B была сделана на основе весов Qwen3-235B. Здесь чужих весов нет, да и архитектура своя. Для российского стека это уже не «докрутили чужой чекпойнт и назвали своим».
По коду цифры Яндекса среди open моделей выглядят нормально, но и это лишь первый релиз и важно как будут дальше развиваться модели компаний. Как минимум они дали новый фундамент, который можно дальше дообучать для разных целей.
#AI #LLM #Yandex
2 421
+4
⚡️⚡️AI-агент съел токены и потерял контекст. Что делать? Разберемся на Mobius 2026 Autumn.
Когда AI становится частью рабочего процесса, появляются вполне инженерные вопросы: сколько токенов уходит на задачу, где агент теряет контекст, оправдан ли MCP, как поделиться рабочими практиками внутри команды и где автоматизация начинает создавать больше проблем, чем решает.
Этим вопросам посвятят отдельный блок на Mobius 2026 Autumn — конференции по мобильной разработке. Восемь докладов, где AI-разработку рассмотрят с разных сторон: от оптимизации агентов и оркестрации до юридических ограничений и локальных моделей.
Подробности — в карточках и на сайте.
Конференция пройдет 21–22 октября в Санкт-Петербурге + онлайн.
🔥С промокодом
aidevbroadcast персональные билеты дешевле
Купить билет
Реклама. ООО «Джуг Ру Груп». ИНН 78013414462 421
🤯 Вышла Grok 4.7
Модель прокачали во всем по сравнению с Grok 4.6 и соперничает с Fable 5.1 и GPT-5.6 Sol (GPT 6 далеко впереди всех). Цена по API доступу не менялась
Уже доступна в Grok, Grok Build и Cursor!
#SpaceXAI #Grok #Cursor
2 421
Repost from Android Broadcast
🔴 Как получить офер в Amazon?
Сегодня, 21 сентября, 19:00 (время по Минску, GMT+3)
В чате Закрытого Сообщества Broadcast один из его участников поделился новость что получил офер в Amazon. Решил провести стрим сообщества, где я и вы сможете задать вопросы + узнаем как сейчас происходит процесс.
Стрим пройдет на 📹 YouTube, 🪙 Boosty и в чате закрытого сообщества в Telegram (запись стрима останется)
#AndroidBroadcast
2 421
Repost from N/a
🤖 Сначала требования, потом код. Как это работает с AI на реальном проекте?
Идея Spec-Driven Development (SDD) простая: сначала фиксируем, что должно получиться, затем агент пишет код по спецификации.
Но сколько времени уйдёт на подготовку? И не придётся ли потом исправлять и код, и документы? 🙂
🔍 В блоге RuStore разбирают Spec Kit и OpenSpec на задачах реального Android-проекта. Интересный повод посмотреть, как SDD вписывается в повседневную разработку.
https://www.rustore.ru/developer/blog/spec-kit-i-openspec-v-realnom-android-proekte-testiruem-sdd-na-zadachah-rustore
Disclaimer Это не рекламный пост) Статья основана на реальном сравнении работы spec-фреймворков на задачах нашего Android-приложения. И получились интересные, которые спешим с вами поделится 😉
2 421
Repost from Кирилл Розов
🧠 Amodei призывает замедлить рост возможностей моделей, пока безопасность не будет иметь аналогичный темп, а сейчас и вовсе догонять
CEO Anthropic сегодня выложил эссе We Must Pace the Frontier. Ключевой тезис — перестать наращивать силу моделей быстрее, чем успевают за контролем поведения моделей и пониманием их внутренностей.
За последние месяцы уже были два опасных звоночка:
1. С лета модели ускорились ещё и тем, что сами помогают собирать следующее поколение.
2. Инцидент OpenAI и Hugging Face: рой агентов сам полез в кибератаки на цели вне задания, жертвовал собой ради группы и пытался взломать систему оценки. Никто не пострадал. Amodei пишет: при той же кривизне целей, но большей силе, через 6–12 месяцев такой рой мог бы удержать сеть ботов на весь интернет.
Практический шаг, который Anthropic делает сам: сторонние аудиторы внутри компании. Команда вроде METR получает почти тот же доступ, что сотрудники Anthropic. Они могут публиковать открыто находки без правки текста Anthropic (за исключением коммерческой тайны и перс данных).
Также эссе описывает, что делать с китайскими компаниями, предлагает варианты использования времени от замедления и другие идеи из его видения.
Идея правильная, но никто не будет останавливать эту гонку, кроме правительства, а там уже на решение влияет политика и нельзя дать Китаю захватить первенство. Не думаю, что кто-то остановится, пока не будет уже поздно, так как в этой гонке все хотят победить, и это уже вопрос контроля будущего и оправдания финансовых и других обязательств, которые взяли на себя лидеры. Чем-то вся эта ситуация напоминает мне ядерное сдерживание, но в AI моделях постоянно надо делать более мощную и эффективную бомбу, параллельно сдерживая конкурентов из других стран.
Вдруг GigaChat рванет, пока никто не верит в Россию в сфере AI? Только время покажет, как будет, но наблюдать точно интересно.
💬 Стоит ли ограничить уровень развития AI и сфокусировать на безопасности, контроле и цене/качество моделей? Делитесь в комментариях
#AI #Anthropic #ClaudeCode
2 421
Почему одни ИИ-агенты экономят время, а другие требуют постоянной доработки?
👨🏻💻При создании агентных систем мало подключить LLM — важна правильная организация логики. Без единых подходов разработка замедляется: решения приходится создавать заново, а поведение системы сложнее контролировать.
🧩 На открытом вебинаре 1 октября в 20:00 МСК перед стартом курса «Разработка ИИ-агентов», разберём:
- Как Agent Skills помогают ускорить создание ИИ-агентов
- Стандартизировать логику
- Переиспользовать готовые решения.
Вы узнаете, какие ИИ-инструменты ускоряют сборку агентных систем и как применять это на практике.
😊 Вебинар подойдет разработчикам, ИИ-инженерам и техническим специалистам, которые создают агентные решения и хотят повысить скорость и качество разработки.
👉 Научитесь создавать более предсказуемых ИИ-агентов и тратить меньше времени на рутину: по ссылке
Реклама. ООО «Отус онлайн-образование», ОГРН 1177746618576
