AI4Dev — AI for Development
Open in Telegram
Что надо знать, чтобы остаться востребованным ИТ специалистом в мире с LLM? • Обзоры продуктов, фреймворков и способы взаимодействия с LLM для разработки софта • Реальные кейсы, pet и бизнес проекты с LLM • Публичные лекции В будущее берут не всех!
Show more5 288
Subscribers
-624 hours
-97 days
-330 days
Posts Archive
Почему наука автоматизируется неравномерно? О пределах исследовательского harness расскажет Максим Шаланкин, Machine Learning Team Lead из MWS и автор телеграм-канала Maxim.ML.
27 августа 2026 года Anthropic объявила Model Hardware Standard: Claude из обычного терминала начал управлять микроскопами, роботизированными руками и qPCR-машинами. Интеграция, занимавшая недели, сократилась до часов.
Днём раньше стартап Transfyr поднял $25 млн: сенсоры и камеры записывают каждое движение учёных, превращая видеозаписи рук в обучающие данные для лабораторных роботов. Наука в физическом мире, самая сложная для автоматизации область, начала получать свой интерфейс.
Рассмотрим картину целиком: почему вычислительная наука уже упирается только в GPU, а экспериментальная — в законы природы.
⏰ Запускаем трансляцию завтра, 4 сентября, в 17:00.
Смотрите на YouTube, в ВК или прямо в этом канале — и задавайте вопросы Максиму!
🤖 AI-агент с нуля: строим Multi-Agent Systems
До сих пор мы строили одного AI-агента: дали ему инструменты, подключили MCP, добавили память и Guardrails. Он умеет получать контекст, принимать решения и выполнять действия во внешних системах.
Но что, если задача становится слишком большой для одного decision-making loop? Например, нужно одновременно исследовать несколько источников, работать с разными наборами данных и permissions, независимо проверять результаты и координировать несколько направлений работы. Кажется, очевидное решение — добавить ещё агентов. Но здесь легко усложнить систему, не сделав её лучше.
⚡️ Это пятая часть видеокурса об AI-агентах от ML-инженера Artezio Антона Максимова!
Разберём Multi-Agent Systems: где на самом деле проходит граница между одним сложным агентом и системой из нескольких агентов — и когда распределение принятия решений действительно оправдано.
Десять Tools, несколько LLM-вызовов и даже цепочка из Planner, Researcher и Reviewer ещё не делают систему Multi-Agent. MAS появляется тогда, когда существуют несколько автономных decision-making компонентов, способных самостоятельно принимать локальные решения и взаимодействовать друг с другом.
В этом выпуске:
— Где заканчивается Single-Agent System и начинается настоящая Multi-Agent System
— Homogeneous и Heterogeneous Agents: почему специализация и роли — только один из вариантов дизайна
— Cooperative, Collaboration и Mixed-Motive взаимодействие
— Point-to-point, Broadcast, Pipeline, Peer-to-peer и Shared Message Pool
— Centralized, Decentralized, Hierarchical и Blackboard / Shared Message Pool архитектуры
— A2A: как независимые agentic systems находят друг друга, передают задачи, статусы и результаты
🎬 Смотрите на YouTube или RuTube!
Andrew Ng (кофаундер Coursera, профессор Стэнфорда, экс-глава Google Brain и Baidu AI) опубликовал AI Engineering Skills Map - попытку сформулировать, какие навыки сегодня действительно нужны разработчикам в эпоху AI.
В целом идеи вполне понятные:
• уметь строить и контролировать AI-системы;
• хорошо знать базовый software engineering;
• уметь эффективно работать с coding agents;
• и, что важно, уметь shaping the build - понимать, что именно нужно строить, зачем и как это должно работать.
Последний пункт особенно интересен. По мере того как AI всё лучше пишет код по хорошему ТЗ, ценность инженера всё больше смещается от самого написания кода к пониманию задачи, архитектуре, требованиям и принятию инженерных решений.
В общем, ничего революционного. Но приятно, когда направление, в котором сам смотришь на AI-shaped engineering, примерно совпадает с тем, что формулирует Andrew Ng.
ИИ превзошёл людей в искусстве убеждения — какова зона риска?
В лекции рассматриваем третью по счету область применения, где искусственный интеллект наглядно демонстрирует свое превосходство. Если успехи AI-агентов в программировании и математике сегодня отрицают вслух только убежденные скептики, то вокруг искусства убеждения пока сохраняется относительное молчание.
Доктор технических наук Владимир Крылов познакомит вас с результатами весьма глубокого и строгого научного исследования, результатом которого стал вывод: эпоха человеческой монополии на убеждение завершена. Создана технология, которая приводит факты, формирует эмпатию и меняет поведение эффективнее, чем самые обученные и высокооплачиваемые профессионалы в мире. Вопрос больше не в том, сможет ли ИИ убеждать массы. Вопрос в том, от чьего имени он будет это делать.
🎥 Запись доступна здесь и на других площадках:
YouTube
RuTube
ВКонтакте
ЯндексМузыка
Mave
🤖 AI-агент с нуля: строим Guardrails
В прошлый раз мы дали агенту память — теперь он помнит пользователя между сессиями и может вызывать инструменты через MCP. Звучит идеально. Но у нас пока нет ни одного механизма, который контролирует, что агент читает, что делает и что отдаёт обратно.
Системный промпт с запретами — это не защита, а иллюзия безопасности. Поскольку языковая модель является вероятностной системой, при определённых входных данных она проигнорирует любую инструкцию. И пока у агента есть инструменты, это уже не проблема некорректного ответа — это удалённая таблица в базе данных, письмо, отправленное не тому адресату, или бесконечный цикл API-вызовов, который сжигает весь лимит за ночь.
⚡️ Представляем четвертую часть видеокурса об AI-агентах от ML-инженера Artezio Антона Максимова!
Guardrails — это не фильтр в системном промпте. Это детерминированный код, который принимает решение до того, как данные попали в модель, до того, как выполнено действие, и до того, как результат ушёл к пользователю.
В этом выпуске:
— Карта угроз LLM-агента: разберем Prompt Injection, Jailbreaking, Hallucination и Data Leakage
— Архитектура Guardrails
— Три класса методов: детерминированные, специализированные и вероятностные
— Allowlist, schema validation, ACL и human-in-loop — что и на каком контуре применять
— Пишем Guarded Agent: оборачиваем LangGraph-агент из прошлых уроков в четыре контура защиты
🎬 Смотрите на YouTube или RuTube!
⚡️ ИИ превзошёл людей в искусстве убеждения — какова зона риска?
Рассмотрим третью по счету область применения, где искусственный интеллект наглядно демонстрирует свое превосходство. Если успехи AI-агентов в программировании и математике сегодня отрицают вслух только убежденные скептики, то вокруг искусства убеждения пока сохраняется относительное молчание.
Доктор технических наук Владимир Крылов познакомит вас с результатами весьма глубокого и строгого научного исследования, результатом которого стал вывод: эпоха человеческой монополии на убеждение завершена. Создана технология, которая приводит факты, формирует эмпатию и меняет поведение эффективнее, чем самые обученные и высокооплачиваемые профессионалы в мире. Вопрос больше не в том, сможет ли ИИ убеждать массы. Вопрос в том, от чьего имени он будет это делать.
⏰ Запускаем трансляцию завтра, 6 августа, в 12:00.
Смотрите на YouTube, в ВК или прямо в этом канале — и задавайте вопросы лектору!
🤔 Какова вероятность выживания человечества в эпоху суперинтеллекта?
Исследователь Элиезер Юдковский и президент MIRI Нейт Соарес изложили свой прогноз в книге, которая вышла на русском языке под названием «Если кто-то его создаст — все погибнут. Почему сверхчеловеческий ИИ уничтожит нас всех».
Доктор технических наук Владимир Крылов обосновал возможность куда более оптимистичного варианта развития событий. Он основан на разработках методов коммуникации с неживым, которые развивает биолог Майкл Левин. Ведь в будущем построение конвенциональных отношений со сверхинтеллектом существенно сократит вероятность рокового исхода...
🎥 Запись доступна здесь и на других площадках:
YouTube
RuTube
ВКонтакте
ЯндексМузыка
Mave
🤖 AI-агент с нуля: создаем Memory
В прошлый раз мы подключили агента к реальному миру через MCP — и теперь у него есть инструменты. Но каждый новый разговор он начинает с чистого листа.
Разберём, почему «просто передавай всю историю» — это тупик сразу в трёх местах: токены дорожают экспоненциально, данные исчезают при перезапуске, а сама модель начинает галлюцинировать из-за эффекта Lost in the Middle. И покажем, как выглядит настоящая архитектура памяти агента.
⚡️ Это третья часть видеокурса об AI-агентах от ML-инженера Artezio Антона Максимова!
Memory — это не фича и не класс в LangChain. Это конвейер из четырёх слоёв, каждый из которых отвечает на свой вопрос.
В этом выпуске:
— Почему «большое контекстное окно» не решает проблему памяти
— Что такое Lost in the Middle и почему это важнее, чем кажется
— Архитектура memory-системы: контекстный слой, долговременное хранилище, retrieval и жизненный цикл
— Summary Buffer, Token Budget и Working Memory — как управлять тем, что видит модель
— Vector Store, Entity Memory и Knowledge Graph — что и в каком формате хранить между сессиями
— Mem0: готовый memory layer вместо самописного пайплайна
— Пишем агента, который помнит пользователя после перезапуска
🎬 Смотрите на YouTube или RuTube!
💥 Агентская фабрика на CI: автоматизируем весь цикл разработки
Лёша Берёзка, техлид iOS в "Додо Пицце" и автор канала о разработке, показал онлайн, как построить «фабрику» агентов в CI‑пайплайне — систему, которая самостоятельно закрывает полный цикл от создания issue до влития Pull Request.
В эфире:
➡️ Как организовать оркестрацию нескольких агентов и обеспечить их согласованную работу?
➡️ Как фабрика автоматически заводит issue, сама их планирует, уточняет детали, реализует и доводит Pull Request до успешного слияния?
➡️ Типовые проблемы и способы их решения.
🎥 Запись доступна здесь и на других площадках:
YouTube
RuTube
ВКонтакте
ЯндексМузыка
Mave
RSI: математика сингулярности
Разбираем одну из самых дискуссионных тем в IT-сообществе — рекурсивное самосовершенствование искусственного интеллекта (RSI). Сможет ли ИИ бесконечно улучшать собственный код и архитектуру? Или алгоритмы ждет неминуемый «коллапс» при обучении на собственных синтетических данных? Рассказывает доктор технических наук Владимир Крылов.
🎥 Запись доступна здесь и на других площадках:
YouTube
RuTube
ВКонтакте
ЯндексМузыка
Mave
Anthropic добавила в Claude Code Desktop панель iOS Simulator. Запускается стандартный симулятор Apple из Xcode, а Claude управляет им напрямую: собирает приложение, тапает по экранам, читает результат и по кругу, пока не решит задачу. Можно тапать и самому параллельно, устройство общее.
Работает без computer use, разрешения macOS на Accessibility и Screen Recording не нужны. У каждой параллельной сессии свои симуляторы, внутри сессии до 4 устройств, можно проверить сразу на iPhone и iPad.
Только локальные сессии и только macOS (т.к. симулятор Apple больше нигде не работает). Нужен Xcode с iOS-платформой, планы Pro или Max. Пока бета. Не забываем, что скриншоты устройства уходят в Anthropic, в реальные аккаунты на нём лучше не логиниться.
Индустрия спорит на языке миллиардов долларов и терафлопсов. Но у развития больших языковых моделей есть пределы, которые не двигаются ни деньгами, ни железом — они заданы геометрией данных, теорией вычислительной сложности и теорией информации.
Наш гость Александр Пономаренко —соавтор алгоритмов NSW и HNSW, на которых работает большинство векторных баз данных, а значит и внешняя память почти любой современной ИИ-системы. Лауреат стипендии им. Ильи Сегаловича и IBM PhD Fellowship Award, научный сотрудник ИПФ РАН и лаборатории ЛАТАС, доцент кафедры прикладной математики и информатики НИУ ВШЭ.
Мы не будем задавать лёгких вопросов. Вместо этого обсудим споры, которые сейчас идут в исследовательском сообществе — и попросим гостя рассудить.
⏰ Запускаем трансляцию прямо сейчас!
Смотрите на YouTube или в ВК — и задавайте вопросы Александру!
T-Search — открытый агент для сложного многошагового поиска на базе Qwen3.6-35B-A3B, обученный полностью на синтетике. Один из немногих релизов, заточенных под поиск именно в русскоязычных источниках. Модель не пишет ответ, а отдаёт ранжированный список evidence-чанков, дальнейшую генерацию доверяете любой модели под свой продукт. Выложили всё: веса, харнесс отдельным репозиторием и два бенчмарка, включая TRuST — ручной бенчмарк агентского поиска на русском. Фактически это жёсткая связка модель+харнесс: промпты и пороговые значения — ровно та конфигурация, под которую модель обучалась. При этом сам поиск по документам — эмбеддер и векторную базу — поднимаете сами, в комплекте его нет. Просто заменить свой ретривер на T-Search не получится: придётся встраивать всю конструкцию целиком и проверять, как она ищет по вашей базе документов. Подробности про обучение и ссылки на репозитории — в статье на Хабре.
Британский AI Security Institute (государственный институт безопасности ИИ) опубликовал замеры разрыва между открытыми и закрытыми моделями в хакерских навыках. GLM-5.2 показывает уровень Opus 4.6 на отдельных задачах (эксплуатация уязвимостей, реверс, крипто) и Opus 4.5 на автономных многошаговых атаках в симулированных сетях. Итого текущий лаг — 4–7 месяцев. В 2025-м было 6–10. Закрытую модель провайдер может мониторить, банить и отзывать. Открытые веса после релиза доступны всем: safeguards снимаются, копии расходятся.
Британский AI Security Institute (государственный институт безопасности ИИ) опубликовал замеры разрыва между открытыми и закрытыми моделями в хакерских навыках. GLM-5.2 показывает уровень Opus 4.6 на отдельных задачах (эксплуатация уязвимостей, реверс, крипто) и Opus 4.5 на автономных многошаговых атаках в симулированных сетях. Итого текущий лаг — 4–7 месяцев. В 2025-м было 6–10. Закрытую модель провайдер может мониторить, банить и отзывать. Открытые веса после релиза доступны всем: safeguards снимаются, копии расходятся.
Британский AI Security Institute (государственный институт безопасности ИИ) опубликовал замеры разрыва между открытыми и закрытыми моделями в хакерских навыках. GLM-5.2 показывает уровень Opus 4.6 на отдельных задачах (эксплуатация уязвимостей, реверс, крипто) и Opus 4.5 на автономных многошаговых атаках в симулированных сетях. Итого текущий лаг — 4–7 месяцев. В 2025-м было 6–10. Закрытую модель провайдер может мониторить, банить и отзывать. Открытые веса после релиза доступны всем: safeguards снимаются, копии расходятся.
Moonshot выпустили Kimi K3, 57 баллов в Artificial Analysis Intelligence Index. Выше только Claude Fable 5 (60) и GPT-5.6 Sol (59). Opus 4.8 с его 56 остался позади.
Что интересно в цифрах:
— На GDPval (реальные рабочие задачи) 1668 Elo, третье место после Fable 5 и Sol
— На AA-Briefcase (длинные многошаговые задачи) вообще второе место, обошёл Sol. По качеству аналитики практически паритет с Fable 5: 1760 против 1764
— Цена $3/$15 за миллион токенов, ~$0.94 за задачу индекса. Это примерно вдвое дешевле Opus 4.8 при сопоставимом уровне
Чтобы глубже понимать контекст: в начале июня моделей с 50+ баллами в Artificial Analysis Intelligence Index было две, у Anthropic и OpenAI. Сейчас таких шесть. Только за последние восемь дней фронтир пополнили Grok 4.5, GPT-5.6, Muse Spark 1.1 и вот теперь Kimi K3. Отрыв лидера сжался с четырёх баллов до одного.
Веса обещают опубликовать 27-го. Но чтобы поднять такое у себя, конечно, нужен кластер. Практический смысл открытых весов есть для независимых провайдеров инференса и возможность файнтюна для тех, у кого есть железо.
А ещё ждём показателей Qwen3.8 от Alibaba, которая появилась в превью вчера, и которую они так же заявляют как «second only to Fable 5».
Есть повод пересчитать экономику пайплайнов, которые держатся на дорогих моделях для агентских задач.
🤔 Какова вероятность выживания человечества в эпоху суперинтеллекта?
Исследователь Элиезер Юдковский и президент MIRI Нейт Соарес изложили свой прогноз в книге, которая только что вышла на русском языке под названием «Если кто-то его создаст — все погибнут. Почему сверхчеловеческий ИИ уничтожит нас всех».
Доктор технических наук Владимир Крылов рассмотрит этот прогноз и обоснует возможность значительно более оптимистичного варианта развития событий. Он основан на разработках методов коммуникации с неживым, которые развивает биолог Майкл Левин. Ведь в будущем построение конвенциональных отношений со сверхинтеллектом существенно сократит вероятность рокового исхода...
⏰ Запускаем трансляцию завтра, 16 июля, в 13:00.
Смотрите на YouTube, в ВК или прямо в этом канале — и задавайте вопросы лектору!
OpenWiki (LangChain, 1 июля) - открытый агент и CLI, который генерирует и поддерживает «вики» кодовой базы для агентов. Он индексирует репозиторий, фиксирует, где что лежит и как связано, а в CLAUDE.md/AGENTS.md кладёт не сотни страниц, а ссылку: агент сам подтянет нужное. Обновляется по коммитам через CI (GitHub Actions / GitLab / Bitbucket), читает diff с прошлого прогона и правит только затронутое. Провайдеры LLM: OpenRouter (дефолт), OpenAI, Anthropic, Fireworks, Baseten. Поверх DeepAgents, для трейса активностей агентов можно подключить LangSmith. Есть режим personal, локальная база знаний из ваших репо, Gmail, Notion, веб-поиска, и зачем-то даже есть коннекторы к Hacker News и X.
Вдохновлено DeepWiki, AutoWiki и концепцией LLM Wiki Карпаты.
Польза в том, что агент не должен заново разбираться во всём репозитории каждую сессию. Предполагается, что особенно эффективно, если репозиторий большой и legacy.
Открытый вопрос: что происходит с этой памятью со временем. Диффы копятся, глазами такие доки никто не читает. Нужен ли ревью владельцами модулей или дрейф не накапливается и обновления по коммитам достаточно? Если у кого-то уже крутится в CI, или был аналог - расскажите, что видите.
💥 Агентская фабрика на CI: автоматизируем весь цикл разработки
Лёша Берёзка, техлид iOS в "Додо Пицце" и автор канала о разработке, покажет онлайн, как построить «фабрику» агентов в CI‑пайплайне — систему, которая самостоятельно закрывает полный цикл от создания issue до влития Pull Request.
➡️ Разберём, как организовать оркестрацию нескольких агентов и обеспечить их согласованную работу.
➡️ Посмотрим, как фабрика автоматически заводит issue, сама их планирует, уточняет детали, реализует и доводит Pull Request до успешного слияния.
➡️ Разберём типовые проблемы и способы их решения.
Когда?
Завтра, 15 июля, в 13:00.
Смотрите на YouTube, в ВК или прямо в этом канале — и задавайте вопросы Лёше!
