Борис опять
life = curiosity + irreducible noise Whois: https://t.me/boris_again/3400 Лс: @btseytlin
Показати більше📈 Аналітичний огляд Telegram-каналу Борис опять
Канал Борис опять (@boris_again) у мовному сегменті Російська є активним учасником. На даний момент спільнота об'єднує 17 605 підписників, посідаючи 7 207 місце в категорії Технології та додатки та 37 005 місце у регіоні Росія.
📊 Показники аудиторії та динаміка
З моменту свого створення невідомо, проект продемонстрував стрімке зростання, зібравши аудиторію у 17 605 підписників.
За останніми даними від 04 жовтня, 2026, канал демонструє стабільну активність. Хоча за останні 30 днів спостерігається зміна кількості учасників на 35, а за останні 24 години на 4, загальне охоплення залишається високим.
- Статус верифікації: Не верифікований
- Рівень залученості (ER): Середній показник залученості аудиторії становить 34.71%. Протягом перших 24 годин після публікації контент зазвичай збирає 15.67% реакцій від загальної кількості підписників.
- Охоплення публікацій: В середньому кожен допис отримує 6 110 переглядів. Протягом першої доби публікація в середньому набирає 2 759 переглядів.
- Реакції та взаємодія: Аудиторія активно підтримує контент: середня кількість реакцій на один пост – 66.
- Тематичні інтереси: Контент зосереджений навколо ключових тем, таких як блогпост, llm, контекст, alice, vlm.
📝 Опис та контентна політика
Автор описує ресурс як майданчик для висловлення суб'єктивної думки:
“life = curiosity + irreducible noise
Whois: https://t.me/boris_again/3400
Лс: @btseytlin”
Завдяки високій частоті оновлень (останні дані отримано 05 жовтня, 2026), канал підтримує актуальність та високий рівень охоплення публікацій. Аналітика показує, що аудиторія активно взаємодіє з контентом, що робить його важливою точкою впливу в категорії Технології та додатки.
Триває завантаження даних...
| Дата | Залучення підписників | Згадування | Канали | |
| 06 жовтня | +2 | |||
| 05 жовтня | +6 | |||
| 04 жовтня | +11 | |||
| 03 жовтня | +3 | |||
| 02 жовтня | +3 | |||
| 01 жовтня | +3 |
«Одна партия в NetHack — это десятки тысяч ходов. Жизнь у героя одна, сохранений нет, подземелье каждый раз новое, а игра по дороге ничего не подсказывает. Если вы сыграли плохо, то выясняется это тогда, когда ничего исправить уже нельзя. Когда мы запускаем наших ботов играть, то вторая по частоте причина их "смерти" — голод, потому что они не позаботились о еде за несколько тысяч ходов до финального момента. На таких же ошибках спотыкаются ИИ-агенты, когда пишут код: отдельный шаг они выполняют прекрасно, а на длинную дистанцию держать планку не могут. И NetHack в этом плане становится весьма полезной для обучения ИИ».📎Подробнее про сообщество, игру и «интеллект» агента — в интервью «Ъ-Науке».
| 2 | Немає тексту... | 3 660 |
| 3 | Любая достаточно развитая технология неотличима от аи слопа | 4 344 |
| 4 | Команда Т-Банка хотела тестировать нейросетевые модели для ранжирования, но на их внедрение уходило слишком много времени. Поэтому сделали open source-библиотеку scikit-rank.
Она оборачивает нейросетевые модели в формат scikit-learn-моделей с привычными методами fit и predict, а переписывать всю обработку данных и обучение больше не нужно. Почему это важно – посмотрим на примере ИИ-агентов. Если попросить агента с нуля реализовать DCN v2, он будет с нуля писать архитектуру и, скорее всего, допускать больше неточностей. А если дать задачу завести DCN v2 из Scikit-Rank, агент прочитает README репозитория и использует готовую реализацию, что потребует меньше токенов и снизит вероятность ошибок.
На внутренних задачах модели дали прирост 3-7% по офлайн-метрикам и 4-7% по бизнес-метрикам. Работу о библиотеке представили на конференции ACM RecSys 2026.
https://habr.com/ru/companies/tbank/articles/1088224/ | 4 820 |
| 5 | #дайджест
Дайджест AI/ML за неделю 21–27 сентября 2026
Anthropic: Claude Opus 5.5
Опять менять подписку. Opus 5.5 обгоняет Fable 5.1 почти по всей таблице: Terminal-Bench 4.0 66.4% против 55.8% (у Astra 57.9%), CursorBench 57.8% против 51.8%, HLE 67.7% против 65.6%. При этом $4/$20 вместо $5/$25 у Opus 5, кэш $0.20, на 30% быстрее, типичные задачи на 40% дешевле. Первый релиз после того как Амодей призвал притормозить фронтир.
Sonnet и Haiku 5.5 обещают через несколько недель.
Блогпост, AA
OpenAI: GPT-6 Sol и GPT-6 Luna
По совпадению вышли через полтора часа после Opus 5.5. Модели подросли по бенчам, но главное - подешевели в 2 раза: Sol $2/$10, Luna $0.10/$0.50. Обещают вдвое меньше фактических ошибок чем у 5.6 Sol. Terra в шестом поколении нет.
Не Opus 5.5 конечно, но новые парето-оптимальные модели.
Блогпост, форум
xAI: Grok 4.7
2.1T параметров, на 40% больше Grok 4.6, контекст 500К, цена та же $2/$6. В индексе интеллекта AA 46 против 53 у Fable и GPT-6.
Из плюсов: SOTA на бенчмарке по электротехнике.
Из минусов: гайки цензуры прикрутили, NSFW больше нет. С каждым днем мы все дальше от МехаГитлера.
Блогпост
Xiaomi: MiMo-V2.6 Pro и Flash
Открытые омнимодальные модели под MIT: текст, картинки, видео и аудио на входе, контекст 1М. Pro набирает 46 в индексе AA, то есть уровень Grok 4.7 и лучший результат среди открытых. Flash $0.14/$0.28, кэш $0.0028. Если хотите отвлечься от чтения слопокода - с весами выложили 7000+ RL-окружений для кода, уязвимостей и веба и весь пайплайн обучения, а RL-фаза, по их словам, стоила $2.62М для Pro и $850К для Flash. Бонусом 9B дистиллят на базе Qwen3.5.
Блогпост, RL, HF
BFL: FLUX 3 Action
Открытая 7B world action model для роботов: по картинкам с камер, состоянию и инструкции предсказывает следующие действия и заодно будущие кадры. На RoboLab-120 42.9% против 36.8% у Cosmos 3 Nano на 16B, до 3.95 раза быстрее. Интегрирована в LeRobot, есть рецепты файнтюна.
Модель, HF
Alibaba: Qwen-Audio-3.1
Пять моделей: ASR, TTS и Realtime модели обновили и удешевили, а также из интересного добавили умные версии ASR и TTS:
ASR-Next - Распознает эмоции, роли, фоновые шумы, убирает эээ слова-паразиты
TTS-Next - можно кроме самой речи прописывать эффекты, эмоции, тайминги и тд
Блогпост, X
Google: Gemini 3.8 Flash TTS и Flash-Lite TTS
Flash для актерской игры и дизайна голосов, Lite для дубляжа и агентов. 100+ языков, 2000+ голосов, клонирование по 30 секундам с устным согласием владельца, SynthID в каждом файле. В оценке Hume обе заняли первые два места.
Блогпост, API
Tencent: Hy погоди Image 3.5 Preview
До 20 референсов вместо трех, многоходовое редактирование с памятью сессии, 4K на выходе. Обещают 30% прироста по human eval относительно 3.0. $0.024 за картинку против $0.045–0.211 у GPT Image 2.5. Весов нет, только API и бесплатно в Miora до 7 октября. KuCoin
DeepSeek: DSec
Статья про инфраструктуру песочниц для RL от DeepSeek, которая обслуживала все RL раны от V3.2 до V4.1. Есть отдельная глава про то, как агенты ломали песочницу ради награды. Статья
inclusionAI: Ming-Image-0.1-Design - 6B под MIT для UI, инфографики и постеров с читаемым текстом и RGBA на выходе, плюс Design-Layer, который раскладывает готовый макет на слои. Первое место среди открытых на UI/UX лидерборде AA. HF, GitHub
Fireworks: Ember-1 - Kimi K3, дообученная думать на 40% короче без потери качества: DeepSWE 75.2 против 66.4 у базовой K3, Terminal-Bench 2.1 82.0. $3/$15, research preview, весов нет. Блогпост | 4 045 |
| 6 | Стартуем наше ежегодное исследование дата-специалистов!
Чтобы учесть быстро меняющиеся условия работы всей индустрии, мы кардинально пересобрали структуру анкеты. Вот, что ждет внутри:
🤖 Насколько глубоко AI встроен в вашу работу: от разовых запросов в чате до собственных агентов под регулярные задачи. И как за год изменилось время на разные типы задач.
🧩 Кто какие шаги делает руками: от постановки задачи с бизнесом до мониторинга модели в проде. Сравним, как эти списки выглядят у разных ролей.
📈 Кем работали до перехода в данные и как менялись роли потом. Соберем карту переходов внутри направления.
💼 Как на собеседованиях дата-специалистов относятся к AI — разрешают, требуют или следят, чтобы не пользовались.
И, конечно, традиционные блоки про развитие и сообщество, чтобы собрать полезные списки ресурсов
⏱ Опрос займет 12–15 минут
📬 Отчет опубликуем в ноябре
👉 https://survey.devcrowd.ru/data-2026
🔁 Пересылайте коллегам из data-направления - добавим больше данных! | 3 694 |
| 7 | # Road Machiners
https://btseytlin.itch.io/road-machiners
Любой мужчина в своей жизни должен сделать свою игру где можно грабить корованы.
В субботу я задумался: какую игру я всегда хотел сделать, но не хватало безработности? За выходные навайбкодил помесь между Ex Machina и Space Rangers 2. Встречайте: Road Machiners.
Машинки ездят, грабят и оказываются ограбленными. NPC может запомнить, что вы его ограбили, и позже отомстить. Можно торговать, лутать, общаться по радио, выполнять немногочисленные квесты, исследовать. Я удивлен, но оно даже похоже на прототип полноценной игры!
Я беру назад все свои слова про то, что вайбкодинг не работает. Видимо он работает когда занимаешься чем-то бесполезным! Вся игра сделана на 100% вайбах. Не автономно. Но я просто говорил Opus 5.5 свои хотелки вида "а давай короче музыка в бою будет генерироваться в зависимости от того, что происходит, типа в кого-то попал или врезался...", а он делал. | 4 333 |
| 8 | Немає тексту... | 4 640 |
| 9 | На конференции Yandex Scale показали Алису AI Про: в ней обещают 120+ навыков и 20+ плагинов, создание собственных навыков, выбор модели под капотом и облачный, гибридный/он-прем форматы поставки.
Ещё недавно все смотрели в первую очередь на саму модель: контекст, бенчмарки, качество ответов, скорость. Теперь всё больше внимания привлекает то, что модель умеет делать за пределами чата.
Потому что даже очень хорошая LLM сама по себе остаётся генератором текста. Чтобы она могла нормально работать в компании, ей нужны доступ к данным, инструменты, права, инструкции и возможность вызвать нужный сервис.
Например, сотрудник может попросить: «Собери отчёт по продажам за неделю, найди основные отклонения и подготовь письмо для команды». В идеале агент сам забирает данные из CRM, анализирует их, сверяет с внутренними документами, формирует выводы и готовит письмо. Человеку остаётся проверить результат и отправить его.
Отсюда и весь новый слой вокруг моделей: tools, skills, агенты, MCP. Чем сложнее задача, тем меньше это похоже на одного универсального ассистента — скорее на систему, где несколько агентов делают разные куски работы, а кто-то координирует их между собой.
Первыми такие решения запустили OpenAI и Anthropic – сначала они автоматизировали задачи разработчиков, но быстро поняли, что ту же логику можно применить и для остальных профессий. Так появился класс Cowork-решений.
В общем, сейчас конкурируют уже не только LLM, а целые системы, которые позволяют этой LLM что-то реально делать. | 6 125 |
| 10 | Немає тексту... | 6 235 |
| 11 | Алексей Гусаков на deep tech night рассказал как Яндекс Музыка перешла на end-to-end генеративные рекомендации с новой моделью SONA. Энкодер-декодер модели вернулись!
Новая система называется SONA. В A/B-тесте SONA дала +4,5% Active Users поверх всех улучшений, что были сделаны с 2023 года. От внедрения модели получили эффект больше, чем от всего сделанного за последние годы вместе взятого.
В 2023 мы увидели первые BERT в рекомендациях: SASRec и BERT4Rec. Там история прослушиваний подавалась в энкодер-трансформер, а из результата делался вектор пользователя. Для получения рекомендаций можно было вычислить косинусное расстояния с вектором трека. Ограничение такого подхода в медленном обучении: каждый сабсет истории прослушиваний пользователя нужно обрабатывать как отдельный префикс, отдельным форвардом всей модели. Из-за этого приходилось ограничивать историю 128 треками.
В 2025 появился ARGUS с переходом к генеративной постановке с трансформеров-декодером. Модель последовательно предсказывает следующий музыкальный трек, авторегрессионно, как LLM предсказывает следующий токен. Это позволило подавать в модель 8000 треков за раз и сразу считать ошибку для всех префиксов. Однако сжатие всей истории в один токен теряет много информации. К тому же трансформер был тяжёлый, поэтому его можно было применять только как реранкер. Этап генерации кандидатов оставался отдельным.
Теперь следующая итерация – SONA, настоящая end-to-end система.
Ключевая инновация это новый токенизатор под названием Semantic ID. Грубо говоря one-hot представление для каждого трека заменяется тремя дискретными иерархическими токенами из кодбука. Кодбук формируется на основе мультимодальных эмбеддингов трека с помощью Qwen 2.5-Omni, refinement-трансформера и кластеризации RQ-KMeans. В итоге получается токенизация сохраняющая семантику на разных уровнях абстракции: от общих жанровых черт до специфики конкретного трека.
SONA – это энкодер-декодер. Энкодер часть сжимает историю пользователя, а декодер часть генерирует рекомендации. Одновременно учится и предсказывать следующий трек, и реакцию на него.
SONA сама себе генератор кандидатов и ранкер, потому что использует новую структуру токенов для ретривала прямо во время своих предсказаний. Используется beam search. Сначала предсказываем первый токен из трех, затем второй при условии первого, затем последний при условии двух предыдущих. По сути для получения рекомендации сразу делаем поиск по дереву несколькими форвардами трансформера. Никакого FAISS или HNSW! | 5 652 |
| 12 | Постоянная рубрика "блекпилл недели по AI коду."
После предыдущего болезненного опыта, где я обнаружил, что агенты ужасно пишут код и за ними потом надо неделями разгребать слоп, я задумался как быть. Это новая реальность разработки софта и мне как СТО нужно придумать как существовать в новом мире.
Изучая, что придумали более умные люди, я понял: ничего. Никто не знает как жить в новом мире, когда один разработчик производит столько кода, сколько в прошлом мог производить целый отдел. За пределами твиттера проблема известная (т.е. большие компании вроде Cloudflare и GitLab уже написали блог-посты), но решения никто не нашел.
На основе своего и чужого опыта придумал гайдлайны по AI разработке для нашей команды.
Основные предположения:
1. Код важен. Код это то, что действительно исполняется, а значит единственный источник истины. Все спеки это в лучшем случае искаженные описания кода, а чаще всего просто слоп-эссе на тему.
2. AI агенты это мультипликаторы скорости генерации кода. При наивном применении они перекладывают работу с автора кода на меинтейнера.
3. Главный ограничивающий ресурс это понимание кодовой базы разработчиками.
4. Деградация кода неизбежна и поддержание его качества это необходимая работа.
5. Агенты для кода ненадежны и непостоянны. Результат зависит от множества постоянно меняющихся факторов: модели меняются, сетап у всех разный, и так далее. Если что-то работает сейчас, нельзя гарантировать, что оно будет так же работать завтра.
6. Агенты для кода быстро производят техдолг и не могут самостоятельно его уменьшать.
Отсюда следующие принципы того, как может работать адекватная система:
1. Необходимо перенести работу по поддержанию качества назад с мейнтейнера на автора.
2. Люди отвечают за дизайн и архитектуру.
3. Люди отвечают за систему верификации: pre-commit, CI чеки, документация и принципы. Только люди редактируют AGENTS.md и постоянные доки.
4. Все правила, которые можно, нужно превращать в механические чеки, потому что промптинг не гарантирует, что агенты будут их соблюдать.
5. Борьба со слопом закладывается в бюджет.
6. Минимизируем человеческие затраты на ревью, максимально автоматизируем проверки и контроль качества.
Первый пункт самый главный: можно вайбкодить как угодно, если в результате у тебя рабочий код который ты понимаешь.
И конкретные практики:
1. Каждый PR не более +2к строк кода. Эмпирически найдено, что больше отревьюить невозможно.
2. Автор каждого PR сам пишет его описание по шаблону и указывает какие сущности за что отвечают.
3. Очень жесткие pre-commit и CI чеки.
4. Кастомный код-ревью бот в CI, который отсматривает каждый дифф и весь PR в целом с целью доказать, что он сломан. Промптится логом прошлых инцидентов, который пополняется только людьми.
5. Люди дизайнят скелет своих изменений в AI-assisted режиме, агенты заполняют пропуски.
6. Доки пишутся людьми, агентам запрещено их редактировать.
7. Разгребание слопа закладывается в планирование.
Всю карьеру (в эру кожаного кодинга) я считал pre-commit чеки очень бесячими и не особо полезными. Теперь же у нас самые жесткие чеки и линтеры в моей жизни. Там как базовые вещи вроде ruff и black, так и кастомные правила import linter, и многое другое. Я постоянно завожу что-то новое. Например, недавно добавил проверки на вложенность и цикломатическую сложность функций из SlopCodeBench. На днях появилась проверка всех диффов с помощью Jev.
Это более-менее сработало. Pre-commit с механически забитыми правилами позволяет видеть не совсем слоп на этапе ревью. Очень жесткий CI обеспечивает то, что слоп обнаруживается до мержа, а не после. Но появились новые проблемы.
Самая главная: актор с критиком могут очень долго итерироваться над PR без видимого прогресса. Агент делает изменения, ревьюер находит блокирующие проблемы, агент делает заплатку, ревьюер находит следующую дыру и так далее. Я видел как это происходило буквально днями, до тех пор, пока я не погружусь и не разберусь: в чем же корень проблемы? Ни одна модель (вклюбчая Fable и Astra) пока ни разу не смогла сама выбраться из этой спирали.
Вытекающая проблема: медленно. Теперь беклог PR разгребается гораздо медленнее, чем пополняется. У агентов как будто появляется новый инструмент: защита (своего кода) заебыванием. Когда ревьюер в десятый раз находит ошибку в каком-то PR возникает очень сильное желание вмержить его, чтобы просто больше не видеть.
Что иронично: ускорение от вайбкода как будто целиком компенсируется или замедлением на этапе ревью, или, если вы на вайбах, разгребанием проблем в проде спустя пару недель. | 5 386 |
| 13 | #дайджест
Дайджест AI/ML за неделю 14–20 сентября 2026
Alibaba: Qwen3.8-Omni-Flash
Модель под агентов с упором на омнимодальность. Заявляют что лучше Gemini 3.8 Flash на его поле: WildClawBench-MM 71.0 против 58.9, диаризация митингов 3.4 против 72.6 ошибки. На видео примерно паритет. Цена $0.15/$0.47, аудио на входе подешевело на 98% относительно Qwen3.5-Omni-Plus. Весов нет.
Блогпост, API
Google: Gemini 3.8 Live и Live Extended Thinking
Две speech-to-speech модели: обычная дешевая и Extended Thinking, которая думает и говорит одновременно, заполняя паузы фразами в духе "сейчас гляну". Первое место в Speech to Speech индексе Artificial Analysis с 82.6, t-Voice 68.6%, 97 языков с автоопределением. Уже в API, AI Studio, Search Live и Workspace
Блогпост, Model Card
Apple: Siri AI
Небольшой стартап из Купертино спустя два года после анонса доучил Siri делать то что обещал: искать по переписке и фото по описанию, видеть экран, ходить в интернет и делать действия в сторонних приложениях. Под капотом Apple Foundation Models, сделанные в сотрудничестве с Google и Gemini, часть на девайсе, часть в Private Cloud Compute. Бета по вейтлисту, в ЕС и Китае нет.
Блогпост
TypeSafe AI: Jev
Модель, которая не генерирует текст, а сразу выдает решение: да/нет, вариант из списка или скор, с калиброванной вероятностью (согласно разработчикам, а на деле оказалось скамом: ранжирование меняется от порядка входов). Не авторегрессионная, отвечает за 70–500 мс, $0.042 за миллион входных токенов, выход бесплатный. В демо играет в Doom по структурированному состоянию игры.
Твиттер открыл для себя классификаторы и теперь на них можно запускать дум.
Документация, The Register, Илья бенчмаркнул
Shengshu: Vidu S2
Реалтайм-ветка Vidu из двух моделей.
S2-Avatar - анимирует персонажа с картинки в 720p по голосу или тексту, референс можно менять в процессе.
S2-Editing - правит входящий видеопоток на лету: стиль, одежда, замена персонажа и фона.
Есть экспериментальный стерео-режим для VR. Демо и API открыты.
Статья, демо
ElevenLabs: Music v2.5
Богаче аранжировки, живее инструменты, особенно в вокальных и акустических жанрах. Обучена на лицензированной музыке, поэтому в отличие от Suno в суде не сидит (и похуже звучит). Доступна всем, включая Free с пятью скачиваниями с полным качеством в день, и в API.
Блогпост
Creatify Labs: Boreal
Уже сотая новая видеомодель, целятся в рекламу и UGC. Генерирует в реалтайме, пять секунд за пять секунд, 720p по центу за секунду, 1080p по три. Дообучена с открытой базы на рекламе, в слепых тестах ее предпочли базе в 81% случаев. Какая база, не говорят.
Пресс-релиз, fal
HiDream: O1-Video-1.0
Омнимодальная видеомодель теперь с упором на физику: текст, картинки и видео на входе, 1080p от 5 до 20 секунд с синхронным звуком. Четвертое место в Image-to-Video with Audio у Artificial Analysis, восьмое в Arena. Пока internal testing, обещают скоро.
Пресс-релиз, документация
Deveillance: Kalypta
Приложение, которое делает вашу речь неслышимой для Voice-to-text моделей: локальная модель в реалтайме искажает голос так, что люди слышат как обычно, а Whisper и Canary теряют две трети слов. Работает в Meet, Zoom и Teams, бета на Mac по вейтлисту.
Kalypta, бенчмарки
Anthropic: treat report
Кому интересно как всякие китайцы в серую используют подписки Claude, читайте репорт на 150стр. там и отправка ответов клода юзерам муншот для последующей дистилляции, и использование китайской и русской гэбней.
Отчет, TechCrunch
QuiverAI: Arrow 2 и Arrow 2 Telos - генерация и редактирование SVG. Меньше лишних узлов, векторизация растра. Telos - версия с ризонером сверху, контекст 1М, $6/$30 против $4/$20 у обычной. Блогпост
Runway: Enhance Frame Rate - интерполяция до 24/30/60/120 fps в API, до 300 секунд за раз,. Цены
Mirelo: Audio-to-MIDI Pro - раскладывает готовый микс на отдельные MIDI-дорожки по инструментам, включая вокал, плюс аккорды, темп и экспорт в MusicXML. Выросла из открытой модели с Kyutai. Модель | 4 857 |
| 14 | tl;dr: Research Engineers, Berkeley, $230k-930k/year
Какие новости в AI Safety? Например, агенты OpenAI два месяца незаметно координируются на доске объявлений, а потом ломают Hugging Face. Mythos с фейковых гитхаб-аккаунтов давит на живого разработчика, чтобы тот принял PR. Вдалеке чьи-то агенты четыре дня небезуспешно атакуют государственные системы Тайваня.
Но есть и хорошие новости! Наша любимая и, наверное, самая громкая за лето — запуск Resolution, первой большой лаборатории, делающей ставку на теоретический алайнмент 🚀
Почему сейчас? Нынешний AI достаточно хорош, чтобы содержательно автоматизировать часть ресёрча, а мы наконец-то чуть больше понимаем, как могут выглядеть AGI-модели. Поэтому можно более информированно предположить, какие теоретические направления алайнмента могут успеть сработать в ближайшие годы.
Фаундер — Джеффри Ирвинг, бывший лид сейфти-команд в OpenAI и DeepMind и соавтор TensorFlow.
Resolution получили фандинг на $160M и людям не придётся выбирать между деньгами и импактом — к ним, недолго думая, уйдут люди и из академии, и из фронтирных лаб.
В общем, мы очень обрадовались, когда узнали — и представьте наши лица, когда через месяц Resolution пришли к нам и попросили помочь нанимать 😮
Им, конечно, нужны ресёрчеры, но про них мы напишем ещё один пост, а сегодняшний — про Research Engineers. Для них есть два трека: один — помогать автоматизировать ресёрч и строить инфру для всей организации сразу, другой — стать частью конкретного ресёрч-направления.
В любом случае, базовый минимум такой:
⏺вы разработчик/-ца из FAANG, AI-лабы, оч крутого стартапа или чего-то похожего по уровню;
⏺вы очень шарите в PyTorch/Jax и распределенном обучении;
⏺вы готовы много, но внимательно использовать AI в работе;
⏺вас правда мотивирует алайнмент и вы хотите лично в него контрибьютить.
Роскошный максимум: опыт с Lean и автоформализацией, опыт скейлинга ML-cистем до 100B+ параметров, опыт с CUDA или GPU-оптимизациями.
Помогают переехать в Беркли, делают H1B(!) без лотереи(!!). Для очень-очень редких людей готовы рассмотреть удалёнку. Платят $230k-930k в год (д а).
Бросайте свои фейсбуки и дипмайнды, пишите @yourdivna 🤍 | 5 377 |
| 15 | Коллеги,
мы сейчас пытаемся заставить ллм продвигать математику. В нашем проекте CayleyPy у нас много гипотез которые идеально ложатся на ллм - с одной стороны они (вероятно) не супер сложны, с другой стороны достаточно нетривиальны.
Если у кого есть интерес к коллаборации в этом направлении - будем очень рады - напишите @alexander_v_c
Также, если у Вас есть доступы к мощным моделям или опыт в auto-research - Вы могли бы нам очень помочь. | 6 088 |
| 16 | На волне ряда сравнений разных харнессов я пересел на pi. Он отличный, всем рекомендую. Но я заметил, что он всё ещё тратит слишком много токенов, поэтому сделал своё расширение:
https://github.com/btseytlin/pi-duck-mode
Добавляет /duck режим в котором харнесс тратит в 14х раз меньше токенов, TPS в 798x раз больше! При этом качество кода только растет | 6 721 |
| 17 | Принёс вам хорошее, чтобы не пришлось открывать твиттер | 6 728 |
| 18 | #дайджест
Дайджест AI/ML за неделю 7–13 сентября 2026
OpenAI: уравнения Навье-Стокса
Драма недели. Внутренняя модель сильно сильнее Astra в виде роя из ~10к агентов за 88 часов доказала, что 3D Навье-Стокс с гладкой внешней силой взрывается за конечное время. Вариант без внешней силы, за который дают миллион, все еще открыт, так что на приз OpenAI не претендует.
Теперь к скандалу. Тристан Бакмастер (NYU) и Левент Альпеге (Anthropic) год копали ровно этот подход с Claude и Codex и за две недели до запуска роя получили важный промежуточный результат. OpenAI признает, что не может исключить попадание переписок математиков в обучение.
Deep Blue против Каспарова, только если бы Каспаров делал свои ходы с подсказками Deep Blue, а Deep Blue подсматривала стратегию Каспарова из своих подсказок.
Блогпост, заявление Бакмастера
DeepSeek: V4.1-Flash
552B MoE, активных 8B на prefill и 16B на decode, новая Causal Encoder-Decoder архитектура, нативное зрение, контекст 1М. На DeepSWE 74.2 против 74.0 у Opus 5 и 73.0 у Sol, зато на Terminal-Bench 4.0 всего 31.2 против 51.8 у Opus. KV-кэш ужали в 4 раза.
Цена $0.30/$1.20, в непиковые часы вдвое дешевле, кэш в непик $0.003 за миллион. С 14 сентября все запросы к V4-Pro роутятся во Flash по цене Flash, пока не выйдет V4.1-Pro.
Блогпост, HF
OpenAI: ChatGPT Images 2.5
До 50% быстрее 2.0, более тонкое редактирование, например может в стоп-моушен анимацию без дерганой картинки, чего не могла ни одна text to image модель. Еще можно накалякать скетч прямо в чате и использовать как референс, плюс шаблоны и комментарии на самой картинке для точечных правок. В API две модели: gpt-image-2.5-flare (быстрая, дефолт) и gpt-image-2.5-sunburst (побольше). Цена за токен как у gpt-image-2. Раскатано всем, включая Free.
Блогпост
Suno: v6, v6-wild и v6-mini
Вышла новая серия в виде трех моделей: v6 точная и предсказуемая, v6-wild та же, но при температуре 39' для экспериментов, v6-mini быстрая и для бесплатных. Все умеют править отдельные секции трека текстом, мэшапы, семплы и генерацию по картинке, видео или аудио. Старые модели уберут. Бенчмарков нет, но их услужливо посчитали конкуренты, см. ниже.
Блогпост
m-a-p: YuE2
Открытая 3.6B модель для генерации песен. Из лирики и стиля сначала пишет партитуру в ABC-нотации, которую можно править руками или агентом, потом рендерит стерео 48 кГц. Умеет zero-shot каверы. На их WildSongBench набирает 6.96 против 6.87 у Suno v5 и 6.56 у свежей Suno v6. То есть по чужому бенчмарку v6 хуже v5, но это чужой бенчмарк.
Код Apache 2.0, веса CC BY-NC(!), нужно 24 GB VRAM.
GitHub, HF, демо
Tencent: AuK
Nano Banana для аудио, как они сами говорят. Открытая 1.5B модель: zero-shot TTS, замена слов в готовой речи, смена эмоции и тембра, шепот, удаление акцента, денойз и разделение речи/музыки, все текстовыми инструкциями плюс референс. 1.95М часов супервизии. AuK-Flash дистиллирована до 4 шагов и в 4.5 раза быстрее. MIT, есть ComfyUI-ноды и демо. Теперь легендарные RYTP с прямой линии можно превратить в недерганную речь.
GitHub, HF, Статья
BFL: FLUX Video Edit
Редактирование готового видео промптом: добавить или убрать объекты, поменять текст в кадре, перекрасить, перевести реплики с липсинком. Длительность, пропорции и звук исходника сохраняются, вход даунскейлится до 720p, до 15 секунд, цена $0.03 за секунду.
Документация
Blackmagic: DaVinci Resolve 21.1
В Resolve Studio встроили MCP-сервер: CC и Codex могут работать с проектами. Заодно Python-скриптинг вынесли из бесплатной версии, так что автоматизация теперь стоит $295
Обзор
Google+NASA: MAPL-EMIT
Модель которая из данных со спектрометра на МКС (EMIT) резмечает области выделения метана, чтобы потом глобально не теплеть
База данных, визуализация, Kaggle, GitHub
Lightx2v: MiniMax H3 Turbo Ref2VA - дистилляция reference-to-video ветки открытого MiniMax H3 до 8 шагов и 768p Новость
Krea: Agents - агент, который по брифу сам выбирает из 60+ моделей, генерирует и правит картинки, видео и звук. Доступен в бесплатном тарифе. Agent | 7 447 |
| 19 | Вышел подробный туториал по Perseus – фреймворку от команды Т-Технологий для обучения моделей персонализации на основе гетерогенных событий.
На датасете T‑ECD разобрали сразу четыре сценария: кандидатогенерацию, ранжирование, классификацию и регрессию. В туториале рассказали, как создать единое хранилище событий, подготовить данные, настроить YAML-конфиг, обучить модель и запустить инференс, а еще сравнили сами модели с бейзлайнами. Особенно интересно было почитать про то, как можно добавлять новые фичи или подключать события из соседних доменов, не переписывая код с нуля.
Сам туториал опубликован на Хабре, код доступен на GitHub | 6 770 |
| 20 | 🎉Это снова происходит
У нас открылась регистрация на осенний семестр 🎆. Мы запускаем все классические DLS потоки, а также долгожданную третью часть курса по фундаментальным моделям 😎
Заходите, оставляйте заявки на учебу и ждите! Классические потоки стартуют уже 19 сентября, часть 3 — 26 сентября.
Форма регистрации👇
🔵 DLS: часть 1: https://talent.kruzhok.org/events/12596
🔵 DLS: часть 2: https://talent.kruzhok.org/events/12597
💥 DLS: часть 3: https://talent.kruzhok.org/events/12598
🔵 DLS: Speech: https://talent.kruzhok.org/events/12599
❗️Ее обязательно нужно заполнить для получения дипломов! Обратите внимание – теперь для разных частей курса отдельные регистрации на таланте!
Так же прикладываем ссылки на курсы на платформе Stepik:
🔵 Курс DLS: часть 1
🔵 Курс DLS: часть 2
💣 Курс DLS: часть 3
🔵 Курс DLS: Speech
Дальнейшие подробности и анонсы будут в этом канале. Следите за обновлениями! | 6 346 |
