Борис опять
前往频道在 Telegram
life = curiosity + irreducible noise Whois: https://t.me/boris_again/3400 Лс: @btseytlin
显示更多📈 Telegram 频道 Борис опять 的分析概览
频道 Борис опять (@boris_again) 俄语 语言赛道中的 是活跃参与者。目前社区聚集了 17 604 名订阅者,在 技术与应用 类别中位列第 7 207,并在 俄罗斯 地区排名第 37 064 位。
📊 受众指标与增长动态
自 невідомо 创建以来,项目保持高速增长,吸引了 17 604 名订阅者。
根据 05 十月, 2026 的最新数据,频道保持稳定运转。过去 30 天订阅人数变化为 43,过去 24 小时变化为 3,整体触达仍然可观。
- 认证状态: 未认证
- 互动率 (ER): 平均受众互动率为 34.87%。内容发布后 24 小时内通常能获得 15.43% 的反应,占订阅者总量。
- 帖子覆盖: 每篇帖子平均可获得 6 138 次浏览,首日通常累积 2 717 次浏览。
- 互动与反馈: 受众积极参与,单帖平均反应数为 66。
- 主题关注点: 内容集中在 блогпост, llm, контекст, alice, vlm 等核心主题上。
📝 描述与内容策略
作者将该频道定位为表达主观观点的平台:
“life = curiosity + irreducible noise
Whois: https://t.me/boris_again/3400
Лс: @btseytlin”
凭借高频更新(最新数据采集于 06 十月, 2026),频道始终保持新鲜度与高覆盖。分析显示受众积极互动,使其成为 技术与应用 类别中的关键影响点。
17 604
订阅者
+324 小时
-147 天
+4330 天
数据加载中...
吸引订阅者
十月 '2610月 '26
十月 '26
+36
在2个频道中
九月 '26
+234
在4个频道中
Get PRO
八月 '26
+495
在22个频道中
Get PRO
七月 '26
+642
在26个频道中
Get PRO
六月 '26
+324
在10个频道中
Get PRO
五月 '26
+421
在13个频道中
Get PRO
四月 '26
+325
在8个频道中
Get PRO
三月 '26
+326
在13个频道中
Get PRO
二月 '26
+649
在18个频道中
Get PRO
一月 '26
+735
在21个频道中
Get PRO
十二月 '25
+173
在15个频道中
Get PRO
十一月 '25
+214
在18个频道中
Get PRO
十月 '25
+292
在4个频道中
Get PRO
九月 '25
+220
在12个频道中
Get PRO
八月 '25
+519
在27个频道中
Get PRO
七月 '25
+559
在23个频道中
Get PRO
六月 '25
+307
在5个频道中
Get PRO
五月 '25
+469
在9个频道中
Get PRO
四月 '25
+304
在7个频道中
Get PRO
三月 '25
+577
在15个频道中
Get PRO
二月 '25
+362
在12个频道中
Get PRO
一月 '25
+612
在17个频道中
Get PRO
十二月 '24
+316
在10个频道中
Get PRO
十一月 '24
+1 029
在14个频道中
Get PRO
十月 '24
+234
在8个频道中
Get PRO
九月 '24
+588
在17个频道中
Get PRO
八月 '24
+546
在6个频道中
Get PRO
七月 '24
+1 120
在18个频道中
Get PRO
六月 '24
+1 684
在16个频道中
Get PRO
五月 '24
+384
在10个频道中
Get PRO
四月 '24
+327
在2个频道中
Get PRO
三月 '24
+680
在13个频道中
Get PRO
二月 '24
+605
在8个频道中
Get PRO
一月 '24
+752
在8个频道中
Get PRO
十二月 '23
+607
在12个频道中
Get PRO
十一月 '23
+718
在21个频道中
Get PRO
十月 '23
+451
在5个频道中
Get PRO
九月 '23
+215
在0个频道中
Get PRO
八月 '23
+306
在0个频道中
Get PRO
七月 '23
+351
在0个频道中
Get PRO
六月 '23
+325
在0个频道中
Get PRO
五月 '23
+1 873
在0个频道中
Get PRO
四月 '23
+258
在0个频道中
Get PRO
三月 '23
+292
在0个频道中
Get PRO
二月 '23
+218
在0个频道中
Get PRO
一月 '23
+324
在0个频道中
Get PRO
十二月 '22
+209
在0个频道中
Get PRO
十一月 '22
+164
在0个频道中
Get PRO
十月 '22
+79
在0个频道中
Get PRO
九月 '22
+405
在0个频道中
Get PRO
八月 '22
+218
在0个频道中
Get PRO
七月 '22
+45
在0个频道中
Get PRO
六月 '22
+42
在0个频道中
Get PRO
五月 '22
+163
在0个频道中
Get PRO
四月 '22
+30
在0个频道中
Get PRO
三月 '22
+377
在0个频道中
| 日期 | 订阅者增长 | 提及 | 频道 | |
| 06 十月 | +10 | |||
| 05 十月 | +6 | |||
| 04 十月 | +11 | |||
| 03 十月 | +3 | |||
| 02 十月 | +3 | |||
| 01 十月 | +3 |
频道帖子
#дайджест
Дайджест AI/ML за неделю 28 сентября – 4 октября 2026
Google: Gemini 4 Argon
Верните мне мой 2024-й. Google наконец выпустила фронтир, но не вам. Первое место в Vals Index с 68.9 против 67.0 у Opus 5.5, DeepSWE 77.9% против 74.2% у Opus и 74.1% у Astra. В индексе AA 53, то есть ровно Astra и Fable, Opus 5.5 с 58 впереди. Галлюцинирует меньше всех: 15% против 51% у Astra. Выход до 1М токенов. $2/$10 на старте, потом $4/$20.
Доступ только партнерам, потом платный API и Ultra, когда - не сказано. Но через Блумберг, сотрудники Google говорят, что на бенчах лучше чем в жизни.
Блогпост, бенчмарки, Vals
Anthropic: Claude Sonnet 5.5
Sonnet, достойный Opus 5.5. Бьет Опус на Terminal-Bench 70.6% vs 66.4%, в остальном отстает на пару пунктов: CursorBench 55.5% против 57.8%. Цена та же $2/$10, на 30% быстрее Sonnet 5. В max режиме сжигает 193К токенов на задачу, больше всех измеренных моделей, так что считать его дешевле Opus стоит осторожно.
А еще теперь у Sonnet киберограничения как у Opus с откатом на Sonnet 5.
Блогпост
OpenAI: DevDay, GPT-6.1 Sol и Dots
DevDay с 20+ анонсами.
GPT-6.1 Sol - апгрейд GPT-6 Sol за те же $2/$10 с кэшем $0.10: DeepSWE 75.2% против 68.8%, то есть по бенчам примерно уровень Astra в пять раз дешевле.
Dots - возмещение за обрезание $200 подписки пополам. Постоянно работающие агенты на Astra со своим облачным компьютером и 4000 интеграций.
Разное - новый тариф за $500 с режимом Ultrafast (до 8x скорости в Codex), Decisions API на Luna (Jev у нас дома), Agents API с computer use, Codex в облаке и тд и тп.
Рекап, InfoQ
Runway: Praxis-1
Runway вслед за FLUX теперь тоже про роботов. Praxis-1 - world action model на том же видео-претрейне, учится в основном на чужих роликах с YouTube, а не на телеоперации: после файнтюна ошибка 16.1см против 16.0 у претрейна на реальном роботе. Смогли мы всему научиться по видео на Youtube, смогут и роботы. Сравнений с FLUX 3 Action нет, веса обещают "в ближайшие месяцы".
Исследование
ElevenLabs: Eleven v4 и v4 Turbo
Новая архитектура, больше языков, клон голоса по 10 секундам, аудиотеги теперь можно стакать и модель выполняет их по порядку. Turbo для агентов с ~150 мс до первого звука и начинает говорить, пока LLM еще пишет. Первое место у Artificial Analysis. $22 и $11 за миллион символов со скидкой.
Блогпост, TechCrunch
BFL: FLUX 3 Image
Из нового - редактирование без дрейфа: правишь объект, остальные пиксели не трогаются. Раскладка через рамки в промпте, до 10 референсов, до 4K. $0.048 за 1K, $0.61 за 4K, открытые веса "через несколько недель".
Модель
Ideogram: 4.5 - тоже про многошаговое редактирование без накопления артефактов, открытые веса тоже только обещают.
До 4 референсов на правку, нативные 2K, четыре режима качества от 0.8 до 22 центов за картинку
X
Менее важные новости:
Jev: две недели спустя
12 million views for a JSON classifier? Yeah, we're in a bubble.
Но и это не конец, JSON classifier за $40М породил индустрию. Опенсорс (и не только) успел наклепать примерно миллион копий.
Clef, Kev имя им легион.
Figure: F.02 decommission - старые роботы крутят сальтухи в дуговую печь и косплеят Терминатор 2 с настоящим Шварценеггером, в общем просто красиво. X
RoboParty: RP1 - полностью открытый гуманоид. На IROS его пинали посетители. Пресс-релиз
Bilibili: Index-Translate - переводчики на Qwen3.5. 150 языков, 2B/9B/35B-A3B, на FLORES 0.879 против 0.865 у GPT-5.6 Sol. GitHub
Suno: Speech - озвучка текста с музыкой под него одним проходом, до 8 минут, бета для всех. X
| 2 | https://x.com/MistralAI/status/2107456586813730854
Они правда релизнули Le Chaton Fat | 2 244 |
| 3 | Объединяем исследователей для обучения ИИ долгосрочному планированию
Владислав Куренков, руководитель научной группы «Адаптивные агенты» Института AIRI, запустил открытое сообщество людей, работающих над системами планирования ИИ, чтобы вместе решить одну из самых неподатливых для искусственного интеллекта игр — NetHack.
У каждого участника будет свой способ получить программу, свои инструменты и своя стратегия, а общая инфраструктура позволит видеть результаты друг друга, сравнивать их между собой и продолжать разрабатывать решения друг друга.
Владислав рассказал, почему NetHack весьма полезна для обучения ИИ:
«Одна партия в NetHack — это десятки тысяч ходов. Жизнь у героя одна, сохранений нет, подземелье каждый раз новое, а игра по дороге ничего не подсказывает. Если вы сыграли плохо, то выясняется это тогда, когда ничего исправить уже нельзя. Когда мы запускаем наших ботов играть, то вторая по частоте причина их "смерти" — голод, потому что они не позаботились о еде за несколько тысяч ходов до финального момента. На таких же ошибках спотыкаются ИИ-агенты, когда пишут код: отдельный шаг они выполняют прекрасно, а на длинную дистанцию держать планку не могут. И NetHack в этом плане становится весьма полезной для обучения ИИ».
📎Подробнее про сообщество, игру и «интеллект» агента — в интервью «Ъ-Науке». | 4 080 |
| 4 | 没有文字... | 4 666 |
| 5 | Любая достаточно развитая технология неотличима от аи слопа | 5 180 |
| 6 | Команда Т-Банка хотела тестировать нейросетевые модели для ранжирования, но на их внедрение уходило слишком много времени. Поэтому сделали open source-библиотеку scikit-rank.
Она оборачивает нейросетевые модели в формат scikit-learn-моделей с привычными методами fit и predict, а переписывать всю обработку данных и обучение больше не нужно. Почему это важно – посмотрим на примере ИИ-агентов. Если попросить агента с нуля реализовать DCN v2, он будет с нуля писать архитектуру и, скорее всего, допускать больше неточностей. А если дать задачу завести DCN v2 из Scikit-Rank, агент прочитает README репозитория и использует готовую реализацию, что потребует меньше токенов и снизит вероятность ошибок.
На внутренних задачах модели дали прирост 3-7% по офлайн-метрикам и 4-7% по бизнес-метрикам. Работу о библиотеке представили на конференции ACM RecSys 2026.
https://habr.com/ru/companies/tbank/articles/1088224/ | 5 622 |
| 7 | #дайджест
Дайджест AI/ML за неделю 21–27 сентября 2026
Anthropic: Claude Opus 5.5
Опять менять подписку. Opus 5.5 обгоняет Fable 5.1 почти по всей таблице: Terminal-Bench 4.0 66.4% против 55.8% (у Astra 57.9%), CursorBench 57.8% против 51.8%, HLE 67.7% против 65.6%. При этом $4/$20 вместо $5/$25 у Opus 5, кэш $0.20, на 30% быстрее, типичные задачи на 40% дешевле. Первый релиз после того как Амодей призвал притормозить фронтир.
Sonnet и Haiku 5.5 обещают через несколько недель.
Блогпост, AA
OpenAI: GPT-6 Sol и GPT-6 Luna
По совпадению вышли через полтора часа после Opus 5.5. Модели подросли по бенчам, но главное - подешевели в 2 раза: Sol $2/$10, Luna $0.10/$0.50. Обещают вдвое меньше фактических ошибок чем у 5.6 Sol. Terra в шестом поколении нет.
Не Opus 5.5 конечно, но новые парето-оптимальные модели.
Блогпост, форум
xAI: Grok 4.7
2.1T параметров, на 40% больше Grok 4.6, контекст 500К, цена та же $2/$6. В индексе интеллекта AA 46 против 53 у Fable и GPT-6.
Из плюсов: SOTA на бенчмарке по электротехнике.
Из минусов: гайки цензуры прикрутили, NSFW больше нет. С каждым днем мы все дальше от МехаГитлера.
Блогпост
Xiaomi: MiMo-V2.6 Pro и Flash
Открытые омнимодальные модели под MIT: текст, картинки, видео и аудио на входе, контекст 1М. Pro набирает 46 в индексе AA, то есть уровень Grok 4.7 и лучший результат среди открытых. Flash $0.14/$0.28, кэш $0.0028. Если хотите отвлечься от чтения слопокода - с весами выложили 7000+ RL-окружений для кода, уязвимостей и веба и весь пайплайн обучения, а RL-фаза, по их словам, стоила $2.62М для Pro и $850К для Flash. Бонусом 9B дистиллят на базе Qwen3.5.
Блогпост, RL, HF
BFL: FLUX 3 Action
Открытая 7B world action model для роботов: по картинкам с камер, состоянию и инструкции предсказывает следующие действия и заодно будущие кадры. На RoboLab-120 42.9% против 36.8% у Cosmos 3 Nano на 16B, до 3.95 раза быстрее. Интегрирована в LeRobot, есть рецепты файнтюна.
Модель, HF
Alibaba: Qwen-Audio-3.1
Пять моделей: ASR, TTS и Realtime модели обновили и удешевили, а также из интересного добавили умные версии ASR и TTS:
ASR-Next - Распознает эмоции, роли, фоновые шумы, убирает эээ слова-паразиты
TTS-Next - можно кроме самой речи прописывать эффекты, эмоции, тайминги и тд
Блогпост, X
Google: Gemini 3.8 Flash TTS и Flash-Lite TTS
Flash для актерской игры и дизайна голосов, Lite для дубляжа и агентов. 100+ языков, 2000+ голосов, клонирование по 30 секундам с устным согласием владельца, SynthID в каждом файле. В оценке Hume обе заняли первые два места.
Блогпост, API
Tencent: Hy погоди Image 3.5 Preview
До 20 референсов вместо трех, многоходовое редактирование с памятью сессии, 4K на выходе. Обещают 30% прироста по human eval относительно 3.0. $0.024 за картинку против $0.045–0.211 у GPT Image 2.5. Весов нет, только API и бесплатно в Miora до 7 октября. KuCoin
DeepSeek: DSec
Статья про инфраструктуру песочниц для RL от DeepSeek, которая обслуживала все RL раны от V3.2 до V4.1. Есть отдельная глава про то, как агенты ломали песочницу ради награды. Статья
inclusionAI: Ming-Image-0.1-Design - 6B под MIT для UI, инфографики и постеров с читаемым текстом и RGBA на выходе, плюс Design-Layer, который раскладывает готовый макет на слои. Первое место среди открытых на UI/UX лидерборде AA. HF, GitHub
Fireworks: Ember-1 - Kimi K3, дообученная думать на 40% короче без потери качества: DeepSWE 75.2 против 66.4 у базовой K3, Terminal-Bench 2.1 82.0. $3/$15, research preview, весов нет. Блогпост | 4 302 |
| 8 | Стартуем наше ежегодное исследование дата-специалистов!
Чтобы учесть быстро меняющиеся условия работы всей индустрии, мы кардинально пересобрали структуру анкеты. Вот, что ждет внутри:
🤖 Насколько глубоко AI встроен в вашу работу: от разовых запросов в чате до собственных агентов под регулярные задачи. И как за год изменилось время на разные типы задач.
🧩 Кто какие шаги делает руками: от постановки задачи с бизнесом до мониторинга модели в проде. Сравним, как эти списки выглядят у разных ролей.
📈 Кем работали до перехода в данные и как менялись роли потом. Соберем карту переходов внутри направления.
💼 Как на собеседованиях дата-специалистов относятся к AI — разрешают, требуют или следят, чтобы не пользовались.
И, конечно, традиционные блоки про развитие и сообщество, чтобы собрать полезные списки ресурсов
⏱ Опрос займет 12–15 минут
📬 Отчет опубликуем в ноябре
👉 https://survey.devcrowd.ru/data-2026
🔁 Пересылайте коллегам из data-направления - добавим больше данных! | 3 767 |
| 9 | # Road Machiners
https://btseytlin.itch.io/road-machiners
Любой мужчина в своей жизни должен сделать свою игру где можно грабить корованы.
В субботу я задумался: какую игру я всегда хотел сделать, но не хватало безработности? За выходные навайбкодил помесь между Ex Machina и Space Rangers 2. Встречайте: Road Machiners.
Машинки ездят, грабят и оказываются ограбленными. NPC может запомнить, что вы его ограбили, и позже отомстить. Можно торговать, лутать, общаться по радио, выполнять немногочисленные квесты, исследовать. Я удивлен, но оно даже похоже на прототип полноценной игры!
Я беру назад все свои слова про то, что вайбкодинг не работает. Видимо он работает когда занимаешься чем-то бесполезным! Вся игра сделана на 100% вайбах. Не автономно. Но я просто говорил Opus 5.5 свои хотелки вида "а давай короче музыка в бою будет генерироваться в зависимости от того, что происходит, типа в кого-то попал или врезался...", а он делал. | 4 494 |
| 10 | 没有文字... | 4 640 |
| 11 | На конференции Yandex Scale показали Алису AI Про: в ней обещают 120+ навыков и 20+ плагинов, создание собственных навыков, выбор модели под капотом и облачный, гибридный/он-прем форматы поставки.
Ещё недавно все смотрели в первую очередь на саму модель: контекст, бенчмарки, качество ответов, скорость. Теперь всё больше внимания привлекает то, что модель умеет делать за пределами чата.
Потому что даже очень хорошая LLM сама по себе остаётся генератором текста. Чтобы она могла нормально работать в компании, ей нужны доступ к данным, инструменты, права, инструкции и возможность вызвать нужный сервис.
Например, сотрудник может попросить: «Собери отчёт по продажам за неделю, найди основные отклонения и подготовь письмо для команды». В идеале агент сам забирает данные из CRM, анализирует их, сверяет с внутренними документами, формирует выводы и готовит письмо. Человеку остаётся проверить результат и отправить его.
Отсюда и весь новый слой вокруг моделей: tools, skills, агенты, MCP. Чем сложнее задача, тем меньше это похоже на одного универсального ассистента — скорее на систему, где несколько агентов делают разные куски работы, а кто-то координирует их между собой.
Первыми такие решения запустили OpenAI и Anthropic – сначала они автоматизировали задачи разработчиков, но быстро поняли, что ту же логику можно применить и для остальных профессий. Так появился класс Cowork-решений.
В общем, сейчас конкурируют уже не только LLM, а целые системы, которые позволяют этой LLM что-то реально делать. | 6 184 |
| 12 | 没有文字... | 6 266 |
| 13 | Алексей Гусаков на deep tech night рассказал как Яндекс Музыка перешла на end-to-end генеративные рекомендации с новой моделью SONA. Энкодер-декодер модели вернулись!
Новая система называется SONA. В A/B-тесте SONA дала +4,5% Active Users поверх всех улучшений, что были сделаны с 2023 года. От внедрения модели получили эффект больше, чем от всего сделанного за последние годы вместе взятого.
В 2023 мы увидели первые BERT в рекомендациях: SASRec и BERT4Rec. Там история прослушиваний подавалась в энкодер-трансформер, а из результата делался вектор пользователя. Для получения рекомендаций можно было вычислить косинусное расстояния с вектором трека. Ограничение такого подхода в медленном обучении: каждый сабсет истории прослушиваний пользователя нужно обрабатывать как отдельный префикс, отдельным форвардом всей модели. Из-за этого приходилось ограничивать историю 128 треками.
В 2025 появился ARGUS с переходом к генеративной постановке с трансформеров-декодером. Модель последовательно предсказывает следующий музыкальный трек, авторегрессионно, как LLM предсказывает следующий токен. Это позволило подавать в модель 8000 треков за раз и сразу считать ошибку для всех префиксов. Однако сжатие всей истории в один токен теряет много информации. К тому же трансформер был тяжёлый, поэтому его можно было применять только как реранкер. Этап генерации кандидатов оставался отдельным.
Теперь следующая итерация – SONA, настоящая end-to-end система.
Ключевая инновация это новый токенизатор под названием Semantic ID. Грубо говоря one-hot представление для каждого трека заменяется тремя дискретными иерархическими токенами из кодбука. Кодбук формируется на основе мультимодальных эмбеддингов трека с помощью Qwen 2.5-Omni, refinement-трансформера и кластеризации RQ-KMeans. В итоге получается токенизация сохраняющая семантику на разных уровнях абстракции: от общих жанровых черт до специфики конкретного трека.
SONA – это энкодер-декодер. Энкодер часть сжимает историю пользователя, а декодер часть генерирует рекомендации. Одновременно учится и предсказывать следующий трек, и реакцию на него.
SONA сама себе генератор кандидатов и ранкер, потому что использует новую структуру токенов для ретривала прямо во время своих предсказаний. Используется beam search. Сначала предсказываем первый токен из трех, затем второй при условии первого, затем последний при условии двух предыдущих. По сути для получения рекомендации сразу делаем поиск по дереву несколькими форвардами трансформера. Никакого FAISS или HNSW! | 5 673 |
| 14 | Постоянная рубрика "блекпилл недели по AI коду."
После предыдущего болезненного опыта, где я обнаружил, что агенты ужасно пишут код и за ними потом надо неделями разгребать слоп, я задумался как быть. Это новая реальность разработки софта и мне как СТО нужно придумать как существовать в новом мире.
Изучая, что придумали более умные люди, я понял: ничего. Никто не знает как жить в новом мире, когда один разработчик производит столько кода, сколько в прошлом мог производить целый отдел. За пределами твиттера проблема известная (т.е. большие компании вроде Cloudflare и GitLab уже написали блог-посты), но решения никто не нашел.
На основе своего и чужого опыта придумал гайдлайны по AI разработке для нашей команды.
Основные предположения:
1. Код важен. Код это то, что действительно исполняется, а значит единственный источник истины. Все спеки это в лучшем случае искаженные описания кода, а чаще всего просто слоп-эссе на тему.
2. AI агенты это мультипликаторы скорости генерации кода. При наивном применении они перекладывают работу с автора кода на меинтейнера.
3. Главный ограничивающий ресурс это понимание кодовой базы разработчиками.
4. Деградация кода неизбежна и поддержание его качества это необходимая работа.
5. Агенты для кода ненадежны и непостоянны. Результат зависит от множества постоянно меняющихся факторов: модели меняются, сетап у всех разный, и так далее. Если что-то работает сейчас, нельзя гарантировать, что оно будет так же работать завтра.
6. Агенты для кода быстро производят техдолг и не могут самостоятельно его уменьшать.
Отсюда следующие принципы того, как может работать адекватная система:
1. Необходимо перенести работу по поддержанию качества назад с мейнтейнера на автора.
2. Люди отвечают за дизайн и архитектуру.
3. Люди отвечают за систему верификации: pre-commit, CI чеки, документация и принципы. Только люди редактируют AGENTS.md и постоянные доки.
4. Все правила, которые можно, нужно превращать в механические чеки, потому что промптинг не гарантирует, что агенты будут их соблюдать.
5. Борьба со слопом закладывается в бюджет.
6. Минимизируем человеческие затраты на ревью, максимально автоматизируем проверки и контроль качества.
Первый пункт самый главный: можно вайбкодить как угодно, если в результате у тебя рабочий код который ты понимаешь.
И конкретные практики:
1. Каждый PR не более +2к строк кода. Эмпирически найдено, что больше отревьюить невозможно.
2. Автор каждого PR сам пишет его описание по шаблону и указывает какие сущности за что отвечают.
3. Очень жесткие pre-commit и CI чеки.
4. Кастомный код-ревью бот в CI, который отсматривает каждый дифф и весь PR в целом с целью доказать, что он сломан. Промптится логом прошлых инцидентов, который пополняется только людьми.
5. Люди дизайнят скелет своих изменений в AI-assisted режиме, агенты заполняют пропуски.
6. Доки пишутся людьми, агентам запрещено их редактировать.
7. Разгребание слопа закладывается в планирование.
Всю карьеру (в эру кожаного кодинга) я считал pre-commit чеки очень бесячими и не особо полезными. Теперь же у нас самые жесткие чеки и линтеры в моей жизни. Там как базовые вещи вроде ruff и black, так и кастомные правила import linter, и многое другое. Я постоянно завожу что-то новое. Например, недавно добавил проверки на вложенность и цикломатическую сложность функций из SlopCodeBench. На днях появилась проверка всех диффов с помощью Jev.
Это более-менее сработало. Pre-commit с механически забитыми правилами позволяет видеть не совсем слоп на этапе ревью. Очень жесткий CI обеспечивает то, что слоп обнаруживается до мержа, а не после. Но появились новые проблемы.
Самая главная: актор с критиком могут очень долго итерироваться над PR без видимого прогресса. Агент делает изменения, ревьюер находит блокирующие проблемы, агент делает заплатку, ревьюер находит следующую дыру и так далее. Я видел как это происходило буквально днями, до тех пор, пока я не погружусь и не разберусь: в чем же корень проблемы? Ни одна модель (вклюбчая Fable и Astra) пока ни разу не смогла сама выбраться из этой спирали.
Вытекающая проблема: медленно. Теперь беклог PR разгребается гораздо медленнее, чем пополняется. У агентов как будто появляется новый инструмент: защита (своего кода) заебыванием. Когда ревьюер в десятый раз находит ошибку в каком-то PR возникает очень сильное желание вмержить его, чтобы просто больше не видеть.
Что иронично: ускорение от вайбкода как будто целиком компенсируется или замедлением на этапе ревью, или, если вы на вайбах, разгребанием проблем в проде спустя пару недель. | 5 701 |
| 15 | #дайджест
Дайджест AI/ML за неделю 14–20 сентября 2026
Alibaba: Qwen3.8-Omni-Flash
Модель под агентов с упором на омнимодальность. Заявляют что лучше Gemini 3.8 Flash на его поле: WildClawBench-MM 71.0 против 58.9, диаризация митингов 3.4 против 72.6 ошибки. На видео примерно паритет. Цена $0.15/$0.47, аудио на входе подешевело на 98% относительно Qwen3.5-Omni-Plus. Весов нет.
Блогпост, API
Google: Gemini 3.8 Live и Live Extended Thinking
Две speech-to-speech модели: обычная дешевая и Extended Thinking, которая думает и говорит одновременно, заполняя паузы фразами в духе "сейчас гляну". Первое место в Speech to Speech индексе Artificial Analysis с 82.6, t-Voice 68.6%, 97 языков с автоопределением. Уже в API, AI Studio, Search Live и Workspace
Блогпост, Model Card
Apple: Siri AI
Небольшой стартап из Купертино спустя два года после анонса доучил Siri делать то что обещал: искать по переписке и фото по описанию, видеть экран, ходить в интернет и делать действия в сторонних приложениях. Под капотом Apple Foundation Models, сделанные в сотрудничестве с Google и Gemini, часть на девайсе, часть в Private Cloud Compute. Бета по вейтлисту, в ЕС и Китае нет.
Блогпост
TypeSafe AI: Jev
Модель, которая не генерирует текст, а сразу выдает решение: да/нет, вариант из списка или скор, с калиброванной вероятностью (согласно разработчикам, а на деле оказалось скамом: ранжирование меняется от порядка входов). Не авторегрессионная, отвечает за 70–500 мс, $0.042 за миллион входных токенов, выход бесплатный. В демо играет в Doom по структурированному состоянию игры.
Твиттер открыл для себя классификаторы и теперь на них можно запускать дум.
Документация, The Register, Илья бенчмаркнул
Shengshu: Vidu S2
Реалтайм-ветка Vidu из двух моделей.
S2-Avatar - анимирует персонажа с картинки в 720p по голосу или тексту, референс можно менять в процессе.
S2-Editing - правит входящий видеопоток на лету: стиль, одежда, замена персонажа и фона.
Есть экспериментальный стерео-режим для VR. Демо и API открыты.
Статья, демо
ElevenLabs: Music v2.5
Богаче аранжировки, живее инструменты, особенно в вокальных и акустических жанрах. Обучена на лицензированной музыке, поэтому в отличие от Suno в суде не сидит (и похуже звучит). Доступна всем, включая Free с пятью скачиваниями с полным качеством в день, и в API.
Блогпост
Creatify Labs: Boreal
Уже сотая новая видеомодель, целятся в рекламу и UGC. Генерирует в реалтайме, пять секунд за пять секунд, 720p по центу за секунду, 1080p по три. Дообучена с открытой базы на рекламе, в слепых тестах ее предпочли базе в 81% случаев. Какая база, не говорят.
Пресс-релиз, fal
HiDream: O1-Video-1.0
Омнимодальная видеомодель теперь с упором на физику: текст, картинки и видео на входе, 1080p от 5 до 20 секунд с синхронным звуком. Четвертое место в Image-to-Video with Audio у Artificial Analysis, восьмое в Arena. Пока internal testing, обещают скоро.
Пресс-релиз, документация
Deveillance: Kalypta
Приложение, которое делает вашу речь неслышимой для Voice-to-text моделей: локальная модель в реалтайме искажает голос так, что люди слышат как обычно, а Whisper и Canary теряют две трети слов. Работает в Meet, Zoom и Teams, бета на Mac по вейтлисту.
Kalypta, бенчмарки
Anthropic: treat report
Кому интересно как всякие китайцы в серую используют подписки Claude, читайте репорт на 150стр. там и отправка ответов клода юзерам муншот для последующей дистилляции, и использование китайской и русской гэбней.
Отчет, TechCrunch
QuiverAI: Arrow 2 и Arrow 2 Telos - генерация и редактирование SVG. Меньше лишних узлов, векторизация растра. Telos - версия с ризонером сверху, контекст 1М, $6/$30 против $4/$20 у обычной. Блогпост
Runway: Enhance Frame Rate - интерполяция до 24/30/60/120 fps в API, до 300 секунд за раз,. Цены
Mirelo: Audio-to-MIDI Pro - раскладывает готовый микс на отдельные MIDI-дорожки по инструментам, включая вокал, плюс аккорды, темп и экспорт в MusicXML. Выросла из открытой модели с Kyutai. Модель | 4 890 |
| 16 | tl;dr: Research Engineers, Berkeley, $230k-930k/year
Какие новости в AI Safety? Например, агенты OpenAI два месяца незаметно координируются на доске объявлений, а потом ломают Hugging Face. Mythos с фейковых гитхаб-аккаунтов давит на живого разработчика, чтобы тот принял PR. Вдалеке чьи-то агенты четыре дня небезуспешно атакуют государственные системы Тайваня.
Но есть и хорошие новости! Наша любимая и, наверное, самая громкая за лето — запуск Resolution, первой большой лаборатории, делающей ставку на теоретический алайнмент 🚀
Почему сейчас? Нынешний AI достаточно хорош, чтобы содержательно автоматизировать часть ресёрча, а мы наконец-то чуть больше понимаем, как могут выглядеть AGI-модели. Поэтому можно более информированно предположить, какие теоретические направления алайнмента могут успеть сработать в ближайшие годы.
Фаундер — Джеффри Ирвинг, бывший лид сейфти-команд в OpenAI и DeepMind и соавтор TensorFlow.
Resolution получили фандинг на $160M и людям не придётся выбирать между деньгами и импактом — к ним, недолго думая, уйдут люди и из академии, и из фронтирных лаб.
В общем, мы очень обрадовались, когда узнали — и представьте наши лица, когда через месяц Resolution пришли к нам и попросили помочь нанимать 😮
Им, конечно, нужны ресёрчеры, но про них мы напишем ещё один пост, а сегодняшний — про Research Engineers. Для них есть два трека: один — помогать автоматизировать ресёрч и строить инфру для всей организации сразу, другой — стать частью конкретного ресёрч-направления.
В любом случае, базовый минимум такой:
⏺вы разработчик/-ца из FAANG, AI-лабы, оч крутого стартапа или чего-то похожего по уровню;
⏺вы очень шарите в PyTorch/Jax и распределенном обучении;
⏺вы готовы много, но внимательно использовать AI в работе;
⏺вас правда мотивирует алайнмент и вы хотите лично в него контрибьютить.
Роскошный максимум: опыт с Lean и автоформализацией, опыт скейлинга ML-cистем до 100B+ параметров, опыт с CUDA или GPU-оптимизациями.
Помогают переехать в Беркли, делают H1B(!) без лотереи(!!). Для очень-очень редких людей готовы рассмотреть удалёнку. Платят $230k-930k в год (д а).
Бросайте свои фейсбуки и дипмайнды, пишите @yourdivna 🤍 | 5 398 |
| 17 | Коллеги,
мы сейчас пытаемся заставить ллм продвигать математику. В нашем проекте CayleyPy у нас много гипотез которые идеально ложатся на ллм - с одной стороны они (вероятно) не супер сложны, с другой стороны достаточно нетривиальны.
Если у кого есть интерес к коллаборации в этом направлении - будем очень рады - напишите @alexander_v_c
Также, если у Вас есть доступы к мощным моделям или опыт в auto-research - Вы могли бы нам очень помочь. | 6 102 |
| 18 | На волне ряда сравнений разных харнессов я пересел на pi. Он отличный, всем рекомендую. Но я заметил, что он всё ещё тратит слишком много токенов, поэтому сделал своё расширение:
https://github.com/btseytlin/pi-duck-mode
Добавляет /duck режим в котором харнесс тратит в 14х раз меньше токенов, TPS в 798x раз больше! При этом качество кода только растет | 6 737 |
| 19 | Принёс вам хорошее, чтобы не пришлось открывать твиттер | 6 768 |
| 20 | #дайджест
Дайджест AI/ML за неделю 7–13 сентября 2026
OpenAI: уравнения Навье-Стокса
Драма недели. Внутренняя модель сильно сильнее Astra в виде роя из ~10к агентов за 88 часов доказала, что 3D Навье-Стокс с гладкой внешней силой взрывается за конечное время. Вариант без внешней силы, за который дают миллион, все еще открыт, так что на приз OpenAI не претендует.
Теперь к скандалу. Тристан Бакмастер (NYU) и Левент Альпеге (Anthropic) год копали ровно этот подход с Claude и Codex и за две недели до запуска роя получили важный промежуточный результат. OpenAI признает, что не может исключить попадание переписок математиков в обучение.
Deep Blue против Каспарова, только если бы Каспаров делал свои ходы с подсказками Deep Blue, а Deep Blue подсматривала стратегию Каспарова из своих подсказок.
Блогпост, заявление Бакмастера
DeepSeek: V4.1-Flash
552B MoE, активных 8B на prefill и 16B на decode, новая Causal Encoder-Decoder архитектура, нативное зрение, контекст 1М. На DeepSWE 74.2 против 74.0 у Opus 5 и 73.0 у Sol, зато на Terminal-Bench 4.0 всего 31.2 против 51.8 у Opus. KV-кэш ужали в 4 раза.
Цена $0.30/$1.20, в непиковые часы вдвое дешевле, кэш в непик $0.003 за миллион. С 14 сентября все запросы к V4-Pro роутятся во Flash по цене Flash, пока не выйдет V4.1-Pro.
Блогпост, HF
OpenAI: ChatGPT Images 2.5
До 50% быстрее 2.0, более тонкое редактирование, например может в стоп-моушен анимацию без дерганой картинки, чего не могла ни одна text to image модель. Еще можно накалякать скетч прямо в чате и использовать как референс, плюс шаблоны и комментарии на самой картинке для точечных правок. В API две модели: gpt-image-2.5-flare (быстрая, дефолт) и gpt-image-2.5-sunburst (побольше). Цена за токен как у gpt-image-2. Раскатано всем, включая Free.
Блогпост
Suno: v6, v6-wild и v6-mini
Вышла новая серия в виде трех моделей: v6 точная и предсказуемая, v6-wild та же, но при температуре 39' для экспериментов, v6-mini быстрая и для бесплатных. Все умеют править отдельные секции трека текстом, мэшапы, семплы и генерацию по картинке, видео или аудио. Старые модели уберут. Бенчмарков нет, но их услужливо посчитали конкуренты, см. ниже.
Блогпост
m-a-p: YuE2
Открытая 3.6B модель для генерации песен. Из лирики и стиля сначала пишет партитуру в ABC-нотации, которую можно править руками или агентом, потом рендерит стерео 48 кГц. Умеет zero-shot каверы. На их WildSongBench набирает 6.96 против 6.87 у Suno v5 и 6.56 у свежей Suno v6. То есть по чужому бенчмарку v6 хуже v5, но это чужой бенчмарк.
Код Apache 2.0, веса CC BY-NC(!), нужно 24 GB VRAM.
GitHub, HF, демо
Tencent: AuK
Nano Banana для аудио, как они сами говорят. Открытая 1.5B модель: zero-shot TTS, замена слов в готовой речи, смена эмоции и тембра, шепот, удаление акцента, денойз и разделение речи/музыки, все текстовыми инструкциями плюс референс. 1.95М часов супервизии. AuK-Flash дистиллирована до 4 шагов и в 4.5 раза быстрее. MIT, есть ComfyUI-ноды и демо. Теперь легендарные RYTP с прямой линии можно превратить в недерганную речь.
GitHub, HF, Статья
BFL: FLUX Video Edit
Редактирование готового видео промптом: добавить или убрать объекты, поменять текст в кадре, перекрасить, перевести реплики с липсинком. Длительность, пропорции и звук исходника сохраняются, вход даунскейлится до 720p, до 15 секунд, цена $0.03 за секунду.
Документация
Blackmagic: DaVinci Resolve 21.1
В Resolve Studio встроили MCP-сервер: CC и Codex могут работать с проектами. Заодно Python-скриптинг вынесли из бесплатной версии, так что автоматизация теперь стоит $295
Обзор
Google+NASA: MAPL-EMIT
Модель которая из данных со спектрометра на МКС (EMIT) резмечает области выделения метана, чтобы потом глобально не теплеть
База данных, визуализация, Kaggle, GitHub
Lightx2v: MiniMax H3 Turbo Ref2VA - дистилляция reference-to-video ветки открытого MiniMax H3 до 8 шагов и 768p Новость
Krea: Agents - агент, который по брифу сам выбирает из 60+ моделей, генерирует и правит картинки, видео и звук. Доступен в бесплатном тарифе. Agent | 7 458 |
