Complete AI
前往频道在 Telegram
Меня зовут Андрей Кузнецов Руковожу управлением в Sber AI, построил успешную лабораторию FusionBrain в AIRI, один из основателей Kandinsky, к.т.н., 15+ лет опыта в Computer Vision, выступаю с лекциями и пишу о событиях в AI и ML
显示更多7 860
订阅者
+124 小时
-87 天
-1230 天
数据加载中...
相似频道
标签云
进出提及
---
---
---
---
---
---
吸引订阅者
十月 '2610月 '26
十月 '26
+23
在0个频道中
九月 '26
+80
在1个频道中
Get PRO
八月 '26
+122
在6个频道中
Get PRO
七月 '26
+87
在4个频道中
Get PRO
六月 '26
+102
在0个频道中
Get PRO
五月 '26
+106
在0个频道中
Get PRO
四月 '26
+98
在4个频道中
Get PRO
三月 '26
+94
在4个频道中
Get PRO
二月 '26
+82
在4个频道中
Get PRO
一月 '26
+80
在5个频道中
Get PRO
十二月 '25
+633
在3个频道中
Get PRO
十一月 '25
+158
在8个频道中
Get PRO
十月 '25
+109
在3个频道中
Get PRO
九月 '25
+138
在0个频道中
Get PRO
八月 '25
+111
在2个频道中
Get PRO
七月 '25
+129
在4个频道中
Get PRO
六月 '25
+398
在14个频道中
Get PRO
五月 '25
+288
在14个频道中
Get PRO
四月 '25
+432
在5个频道中
Get PRO
三月 '25
+146
在1个频道中
Get PRO
二月 '25
+205
在8个频道中
Get PRO
一月 '25
+182
在2个频道中
Get PRO
十二月 '24
+353
在6个频道中
Get PRO
十一月 '24
+290
在1个频道中
Get PRO
十月 '24
+189
在2个频道中
Get PRO
九月 '24
+244
在1个频道中
Get PRO
八月 '24
+396
在9个频道中
Get PRO
七月 '24
+623
在9个频道中
Get PRO
六月 '24
+301
在12个频道中
Get PRO
五月 '24
+365
在8个频道中
Get PRO
四月 '24
+214
在6个频道中
Get PRO
三月 '24
+195
在3个频道中
Get PRO
二月 '24
+202
在5个频道中
Get PRO
一月 '24
+121
在1个频道中
Get PRO
十二月 '23
+228
在5个频道中
Get PRO
十一月 '23
+263
在10个频道中
Get PRO
十月 '23
+222
在3个频道中
Get PRO
九月 '23
+229
在0个频道中
Get PRO
八月 '23
+136
在0个频道中
Get PRO
七月 '23
+521
在0个频道中
Get PRO
六月 '23
+216
在0个频道中
Get PRO
五月 '23
+303
在0个频道中
Get PRO
四月 '23
+886
在0个频道中
Get PRO
三月 '23
+306
在0个频道中
Get PRO
二月 '23
+149
在0个频道中
Get PRO
一月 '23
+563
在0个频道中
| 日期 | 订阅者增长 | 提及 | 频道 | |
| 08 十月 | +4 | |||
| 07 十月 | +5 | |||
| 06 十月 | +2 | |||
| 05 十月 | +2 | |||
| 04 十月 | +2 | |||
| 03 十月 | +2 | |||
| 02 十月 | 0 | |||
| 01 十月 | +6 |
频道帖子
Коллеги из Яндекса, мы с вами. Пусть хватит сил пройти через всё это, справиться с последствиями атак на дата-центры и как можно скорее восстановить работу инфраструктуры.
Хорошо понимаю, сколько людей, знаний и сил стоит за бесперебойной работой дата-центров. Обычно эта огромная работа остаётся незаметной — пока не происходит что-то чрезвычайное.
Берегите себя. Мысленно с вами ❤️
https://t.me/data_secrets/10137
| 2 | Приходите послушать Бориса Заикина — он расскажет про наши исследования в области RL обучения небольших моделей в харнессе ГигаАгента. Там будет про влияние на метрики, скорость и потребление токенов🎓 | 1 078 |
| 3 | Время ИИшницы! Приглашаем на митап, который пройдёт 22 октября в 18:30⤵️
В честь юбилейного года AIRI мы пересобрали формат ИИшницы и выходим в офлайн. Шесть спикеров выступят в формате печа-куча, а после обсудят тему агентов за круглым столом.
Спикеры:
➡️ Артемий Сахаров, специалист по анализу данных и машинному обучению, Р-Фарм
🔖 Цифровой контур R&D: ИИ-агенты для работы с мишенями и базами экспериментов
➡️ Ваня Ершов, руководитель разработки ИИ-агентов в «Алисе AI», Яндекс
🔖 Агент — это не только модель: как устроены современные харнессы
➡️ Владимир Димитров, Senior DS engineer в команде Авито Работа
🔖 AI Recruiter в Авито: агент, который проводит интервью
➡️ Владимир Шапошников, научный сотрудник группы «Мультимодальные архитектуры ИИ» лаборатории «Сильный ИИ в медицине», AIRI
🔖 Агент сказал «готово». Проверяем
➡️ Евгений Володин, Технический директор, Антиплагиат
🔖 ИИ-агенты в образовании
➡️ Борис Заикин, к.т.н., исполнительный директор по исследованию данных, Сбер
🔖 RL агенты в исполняемых средах: опыт обучения 9B-модели в харнессе GigaAgent
Модераторы мероприятия — директор Центра ИИ-разработки новых лекарственных препаратов в AIRI Артур Кадурин и директор по маркетингу и коммуникациям AIRI Александра Бройтман.
Кстати, вы тоже можете стать спикером печа-кучи. Для этого направьте нам тему об агентах, с которой вы хотели бы выступить, и краткое описание к ней на почту event@airi.net. Вместе с модераторами мы выберем двух спикеров и свяжемся с ними для подготовки к докладу🙂
Подробное описание митапа и регистрация на офлайн-формат на сайте.
Трансляция на YouTube и VK Видео⏯
#ИИшница | 801 |
| 4 | 🚀 Мы с командой представляем Kandinsky 6.0 Video Lite и Pro — новое поколение наших моделей генерации видео, теперь с синхронным звуком!
🎬 Video Lite — 3B параметров, акцент сделали на эффективности модели и доступности запуска
🎬 Video Pro — 29B параметров, это флагман с лучшим качеством следования промпту, качеством визуала и динамики
Обе модели понимают мультиязычные запросы и генерируют видео (режим text-to-video) или «оживляют» изображения (режим image-to-video). Разрешение видео — вплоть до FullHD с помощью нашей модели апскейла Kandinsky SR 2.0 Video. Модели поддерживают создание видео до 5 секунд с диалогами, музыкой и звуками окружения. Аудиодорожка синхронизирована с происходящим в кадре, а движения губ персонажей — с их речью
⚡️ Про качество
Модель Kandinsky 5.0 Video Pro более полугода занимала первое место среди открытых моделей в задаче text-to-video на arena.ai и была сопоставима по визуальному качеству с Veo 3. По нашим side-by-side сравнениям флагман новой линейки — Kandinsky 6.0 Video Pro — заметно превосходит Kandinsky 5.0 Video Pro по визуальному качеству, реалистичности движения и следованию запросу и показывает качество на уровне Veo 3.1 Fast. А среди открытых моделей Kandinsky 6.0 Video Pro уступает только MiniMax H3, достигая паритета с LTX 2.5. Больше сравнений и деталей — в техрепорте (кстати, буду рад апвоутам статьи, сейчас мы уже традиционно #1 Paper of the day)
🔧 Немного технических подробностей
🔘Для обучения мы подготовили 50 млн изображений, 20 млн видеосцен, 40 млн аудиотреков и 7 млн видео с синхронным аудио
🔘В основе моделей — CrossDiT с двумя башнями: видео и аудио, с bidirectional audio↔video cross-attention. Видеобашню мы инициализировали моделью Kandinsky 5.0 Video (Lite и Pro, соответственно), аудиобашню обучали сначала с нуля, а затем совместно с видеобашней на качественных видео с синхронным звуком
🔘SFT делали в два этапа: сначала улучшали визуальное качество, дообучая видеобашню с замороженной аудиобашней. Затем размораживали всю модель и совместно дообучали обе башни с фокусом на качество аудио, синхронизацию модальностей и качество липсинка. На обеих стадиях обучали отдельные модели для 11 доменов, а в конце супировали полученные компоненты, усредняя веса в одну модель
🔘Смогли завести RL: на нашем тесте доля ошибок в генерируемой речи (WER) снизилась с 23,5% до 12,4% у Pro и с 17,9% до 12,7% у Lite 💪
🔘Поработали и над ускорением: подготовили дистиллированные версии Lite и Pro с генерацией за 10 шагов. Использовали π-Flow с последующим adversarial-дообучением Sim-LADD. По нашим side-by-side сравнениям в режиме image-to-video дистиллированная Pro сохраняет качество на уровне полной версии, при этом работает быстрее: 402→175 секунд на 5-ти секундное видео для Pro и 157→98 секунд для Lite.
🔘Адаптировали и Lite, и Pro для запуска на на RTX 4090, 5060 Ti, 5080, 5090, PRO 6000
Полезные ссылки:
👉 Почитать подробнее: техрепорт
👉 Код и веса: GitHub, Hugging Face
👉 Модель уже доступна через FAL, Diffusers, ComfyUI, SGLang и vLLM-Omni
👉Больше о нашей команде, моделях и исследованиях — на сайте Kandinsky Lab
Попробовать модель Pro можно в ГигаЧат в разделе Видео. Делитесь своими генерациями и обратной связью 🙂
@dendi_math_ai | 899 |
| 5 | AI + разработка — Senior-разработчиков ждут в Ozon Tech
В компании развивается новое направление, команда, которая будет строить платформу для создания и запуска AI-агентов. Предстоит работать не над одним AI-продуктом, а над инфраструктурой для агентских систем от SDK и инструментов до оркестрации, observability и evaluation.
Ребята в поисках Senior-разработчиков. Можно приходить с любым стеком — Go будет основным, но на интервью разрешают использовать привычный язык. Go можно спокойно освоить уже после выхода: команда поможет с переходом.
Откликнуться | 2 220 |
| 6 | Мы выложили программу Practical ML Conf 2026
Я уже не первый год состою в программном комитете конференции, помогал отбирать доклады. Из того, что сам точно не пропущу:
➡️ Антон Разжигаев из AIRI в онлайне разберёт, что находится внутри Ouroboros, как устроена петля самоулучшения агента и какие грабли встретились по дороге. Про Ouroboros я здесь уже писал, поэтому особенно интересно послушать от Антона лично)
➡️ Данил Кашин из Яндекса расскажет про Agentic Vision: как научить VLM рассуждать, строить план и использовать внешние инструменты. Будут visual reasoning, OCR, детекторы, поиск и исполняемый код
➡️ Александр Куцаков из GigaChat расскажет про temporal grounding для длинных аудиозаписей: как научить Audio LLM понимать не только что произошло, но и когда именно. Внутри синтетический датасет на 13 тысяч часов, миллион семплов и снижение ошибки в тайм-кодах с 66 до 3,5 секунды
Отдельный респект кейноутам этого года) Я тоже буду на конфе, так что вечером, как всегда, встретимся на нетворк-тусовке и поболтаем!
➡️ Посмотреть программу и зарегаться | 2 305 |
| 7 | Утекли предполагаемые бенчмарки Gemini 4 - цифры выглядят безумно 🤯
В сети разошлась таблица с прогнозируемыми результатами Gemini 4:
- 99,9%+ — ARC-AGI-3
- 99,1% — FrontierMath Tier 4 v2
- 72,8% — Terminal-Bench Science 0.1
- 70,2% — HealthBench Professional
- 62,3% — Terminal-Bench 4.0
- 48,7% — AutomationBench
- 98,6% — BenchCAD
В этой таблице Gemini 4 опережает GPT-6 Astra и Fable 5.1 на всех перечисленных тестах. Особенно сильный скачок якобы приходится на математику, scientific reasoning, работу в терминале и agentic-задачи.
Сам Gemini 4 реален: Google уже подтвердил, что запустил для него свой «самый амбициозный pre-training run» на сегодняшний день. | 2 234 |
| 8 | 17 сентября в Москве пройдёт AI R&D DAY — конференция для исследователей, разработчиков, руководителей R&D-команд и специалистов, которые создают и внедряют передовые решения на основе искусственного интеллекта, где я буду выступать с лекцией «Автономный универсальный агент для повышения эффективности сотрудников Сбера».
В центре программы — NextGenAI, проект, который исследует новые вызовы и формирует образ будущего ИИ.
Вас ждут 22 доклада в рамках двух треков. Поговорим о:
🔘новых подходах к созданию и обучению моделей
🔘системах, которые одновременно работают с текстом, изображениями, звуком и другими типами данных
🔘развитии голосовых технологий
🔘оценке качества AI-решений
🔘внедрении технологий в реальные продукты
Участие бесплатное, места ограничены. 17 сентября — Москва (очно) и онлайн. Регистрируйтесь. | 3 048 |
| 9 | Сегодня вечером мы вместе с Денисом Макрушиным встретимся на стриме и разгоним базу про безопасность в нашем новом дивном мире агентов.
Обсудим потенциальные векторы атаки, как обезопаситься от них и контролировать агентов после внедрения. Будет одинаково полезно и для тех кто делает агентов, и тех, кто использует их для разработки
Присоединяйтесь | 2 304 |
| 10 | 🔥 GLM-5.3 от Z.ai — главное за 30 секунд:
1. Чистый post-training. Та же базовая модель —GLM-5.2 — все улучшения получены только масштабированием RL на длинных агентных задачах (фреймворк slime + SAO)
2. Сильнейшая open-weight модель для кода. +50% на внутреннем Z.ai Code Bench; Terminal Bench 3.0: 28.3 (было 4.6); DeepSWE v1.1: 66.9 (было 46.2). На TB 2.1 (88.2) вплотную к Fable 5 и GPT-5.6 Sol.
3. Эмерджентные способности в кибербезопасности — главный сюрприз. Модель сама начала выстраивать полные цепочки эксплуатации уязвимостей. CyberGym 84.5% — #1 среди всех моделей; ExploitBench удвоился (24→54). В реальных проектах нашла 2 436 уязвимостей в 269 OSS-проектах, включая баги возрастом до 40 лет.
4. Веса будут открыты через 2 недели после завершения safety-аудита и hardening
5. Честное позиционирование на бенчмарках. Z.ai прямо показывают, где отстают от closed frontier (Fable 5, GPT-5.6 Sol) — ExploitBench 54 vs 78, Terminal Bench 3.0 28 vs 35
Все детали по ссылке | 3 326 |
| 11 | 🐍 Сегодня мы выпустили ГигаАгента — и это не очередной чат-бот
Расскажу, что мы построили и почему это важно.
ГигаАгент — это автономный универсальный ИИ-агент на базе Ouroboros, который переписывает свой собственный код через reviewed self-evolution. Буквально: редактирует рантайм, коммитит через multi-model review gate, рестартится на новой версии. Если сломался — откатывается. Если совсем плохо — /panic.
Это результат синергии, которая редко случается в индустрии: исследовательская команда лаборатории FusionBrain AIRI отвечала за архитектуру агента и самоэволюцию, фреймворк и научный фундамент, а инженерная команда в Сбере — за продуктовую обвязку, инфраструктуру и адаптацию под бизнес-сценарии и enterprise-ограничения. Когда исследователи и инженеры работают как одна команда, получается отличная синергия:
🏆 SOTA на трёх бенчмарках разом:
— Terminal-Bench 2.1: 86.97% (предыдущий лучший — 83.8%)
— OSWorld-Verified: 90.69% — работа мышкой/клавиатурой в реальном десктопе
— CL-Bench: 0.2301 normalized reward — накопление знаний между задачами
На SWE-bench Pro и GAIA — паритет с Claude Code и Codex.
🧬 Ключевая фишка — саморазвитие
Агент может менять свои навыки, промпты, контекст и даже логику ревью. Но каждое изменение проходит через иммунную систему: несколько LLM от разных вендоров независимо ревьюят дифф, голосуют кворумом, плюс отдельная модель с большим контекстом проверяет, не ломает ли правка проект целиком. Fail-closed — при сомнении изменение не проходит. Пользователю доступны разные режимы глубины эволюции: от ядровых компонент до навыков.
Он также умеет
— Создавать рой субагентов для сложных задач
— Проектировать навыки по запросу пользователя
— Решать задачи по расписанию (cron)
— Подключать уже созданные ранее навыки в других агентах, интегрирован магазин ClawHub, есть MCP и A2A протоколы для взаимодействия
— Анализировать и создавать презентации, дэшборды, документы, таблицы, PDF
Как продукт
— Работает в фоне, не нужно контролировать каждый шаг
— Хранит память между сессиями
— Сам создаёт и подключает навыки по необходимости
— Учится на ошибках
— Доступен через Agents Space от Cloud.ru, 4000 бонусов на старте
📄 Техрепорт на arXiv: arxiv.org/abs/2608.08311
📰 Хабр: https://habr.com/ru/companies/airi/articles/1065428/
🔗 Попробовать: https://cloud.ru/agents-space | 3 591 |
| 12 | ⚡️ Диффузионные языковые модели: что в них работает, а что вызывает вопросы
Выложили большой разбор dLLM — результат совместной работы нескольких команд: «Интерпретируемый ИИ» лаборатории FusionBrain, «Основы генеративного ИИ» Института AIRI (@Ivan_Oseledets) и «Генеративная поэзия» Сергея Маркова (@oulenspiegel_channel) SberAI.
tldr: год возились с диффузионными языковыми моделями — воспроизводили чужие методы, обучали свои, ускоряли инференс. Разобрали за вас целое поле и рассказываем, что уже стоит брать, а куда пока лучше не вкладывать время.
Для тех, кто не в теме: dLLM генерируют текст не по одному токену слева направо, а параллельно, раскрывая замаскированные позиции по всей последовательности. Отсюда обещание кратного ускорения — но на практике всё упирается в KV-кэш, который в классической диффузии нормально не работает.
Мы разобрали три подхода — и вот что у нас получилось:
Адаптация — переучить готовую LLM в диффузионную за небольшую долю стоимости исходного претрейна. Сегодня это основной путь к большим dLLM — так получают модели вплоть до сотен миллиардов параметров.
У нас DiffuGPT/DiffuLLaMA не воспроизвёлся: нашли и исправили кучу проблем в коде, прогнали на GPT-2, Qwen и GigaChat — но генерация всё равно осталась плохой. Зато ReFusion + GigaChat 3B завёлся: 2,7× ускорение по wall-clock и более чем 2× рост на GSM8K.
Обучение с нуля — дорого и почти всегда не нужно в прикладном сценарии, но без него сложно проверять методические гипотезы. Разбираем MDLM как полигон для экспериментов и Eso-LM, где ради работающего KV-кэша пожертвовали двунаправленным вниманием.
Дистилляция — ускорить уже обученную модель, сократив число шагов расшумления. Рассказываем про свой метод IDLM (ICML 2026): для MDLM число шагов сокращается с 1024 до 16.
В конце — таблица с рекомендациями: какой подход выбирать под конкретную задачу и ограничения.
👉 Хабр | 5 800 |
| 13 | Alibaba, что ты делаешь? Прекрати!
12.08 нас ждёт большой залив весов в опенсурсе. Приятно, что для простых смертных дают дистиллированную версию на 27B параметров💪 | 2 720 |
| 14 | Курс по Visual GenAI от Yandex Research и ШАД
Авторы CV Time не только пишут обзоры статей о компьютерном зрении, но и создают обучающие курсы.
Сегодня делимся курсом ШАДа «Генеративные модели в компьютерном зрении», который ведёт Дмитрий Баранчук, руководитель группы GenAI в Yandex Research, вместе с праймовой командой исследователей в этой области.
Будет полезно тем, у кого есть базовые знания по генеративкам и желание разобраться глубже:
• в теории диффузионных моделей, эффективных методах их обучения и семплирования;
• в новых гибридных моделях на основе диффузии для генерации изображений, видео и 3D.
У курса есть открытый GitHub-репозиторий, где можно найти слайды, записи лекций и семинаров, а также домашние задания.
CV Time | 2 212 |
| 15 | https://x.com/HuggingApps/status/2085283988524937463
HuggingFace еще сделали красивую визуализацию CADENA для поста в твиттере | 2 177 |
| 16 | Отличный результат для опенсурса на бенчмарке по восстановлению кода frontend’а по изображению или скриншоту💪
Сделал скрипт парсинга сайта, прошелся по страницам, заскриншотил и велкам - копия сайта уже готова:) | 2 366 |
| 17 | ⚡️CADENA: Stepwise CAD Reverse Engineering
Новое решение от Лаборатории FusionBrain, группы Пространственного интеллекта Института AIRI и команды Sber AI 🚀
Релиз в нашей линейке моделей для реверс-инжиниринга деталей!
tldr: Перешли на пошаговое предсказание — модель стала гибче, качество выросло, и чем сложнее датасет, тем больше отрыв. Плюс собрали CADENA-Bench: 3396 реальных механических деталей, разбитых по категориям ЕСКД, чтобы можно было оценивать готовность к практике для отдельных типов деталей.
Постановка задачи для тех, кто пока про нее не слышал: по скану физической детали восстановить её CAD-модель — дерево построений, которое инженер может править и по которому деталь можно произвести. Последовательность CAD-операций пишется питоновским кодом, так что фактически это mesh2code.
Наши прошлые модели предсказывали всю последовательность разом и потому наследовали статистику трейна: если операция B в обучении всегда стоит между A и C, на инференсе она встанет туда же. На сложных и редких деталях это ломалось. В CADENA мы предсказываем по одной операции за раз — модель исполняет то, что уже написала, смотрит на разницу с целью и решает, что делать дальше. Плюс новый генератор, дающий длинные последовательности операций.
Результат: заметный отрыв на всех датасетах, где мы замеряемся. На CADENA-Bench мы лучше в 5 категориях из 6 и в среднем. На BenchCAD, где свои модели меряет в том числе Claude, восстановление объёма 91% против 71% у фронтирных моделей и 75% у специализированных.
На гифке — как модель собирает деталь по операциям.
🤗 Будем очень благодарны за апвоуты на HF и звёздочки на GitHub:
Paper тут и тут
GitHub
Dataset
Model
Заапвоутить 🔥 | 1 988 |
| 18 | 没有文字... | 1 |
| 19 | Ну вот и Qwen 3.8 пожаловал💪 | 2 456 |
| 20 | Ouroboros теперь SOTA на Terminal Bench, OSWorld и CL-bench
Мой любимый агентный луп на чистом питоне доэволюционорал до состояния лучшего харнесса для кодинга! На главных бенчмарках он теперь обходит Codex, Claude code, Cursor и Hermes.
Выходит, что в рисёрче, в computer use, в работе через терминал и в задачах на кодинг — уроборос сейчас является лучшим агентом. Так что с этого момента всю разработку и исследования я веду только через уробороса.
Для полной воспроизводимости результатов. Весь код, скрипты, трейсы я выложил в открытый доступ.
Напоминаю: лицензия MIT. Так что спокойно ломайте, форкайте, проверяйте трейсы, пишите что я где наврал. И кидайте issues и PR-ы! Все постараемся с уроборосом принять😋
P.S. Кошмар какие дорогие агентные бенчи. Прогнать весь набор стоит как квартиру купить (это не шутка!!)
GitHub, Хабр, установочники | 1 905 |
