2 484
订阅者
-124 小时
-47 天
+1330 天
帖子存档
2 485
Вакансии для тех, кто хочет развивать рекомендательные системы и работать с большими моделями.
Старший ML-разработчик в VK Видео, Москва
Ищем разработчика в команду развития рекомендательной системы VK Видео. Нужно формулировать и проверять гипотезы, развивать мэтчинг и дедупликацию контента, обучать модели, обеспечивать стабильную работу рантайма, проводить A/B-эксперименты и развивать систему метрик.Старший DL-инженер в AI VK, Москва
В LLM-команду отдела экспериментальных технологий нужен специалист с опытом внедрения DL-моделей в продакшен, развития RAG-сценариев, оптимизации инференса моделей и работы с пайплайнами разметки. Нужна крепкая теоретическая база (DL, линейная алгебра, статистика) и умение быстро ставить эксперименты; плюсом будет опыт настройки (алаймента) LLM (SFT, DPO/RLHF).Старший DL-инженер в AI VK, Москва
Группа мультимодальных контентных моделей ищет инженера для разработки эмбеддинг-моделей и классификаторов текстов, видео, речи и музыки для рекомендаций ВКонтакте. Требуется опыт разработки и внедрения DL-моделей, знание теории ML/DL и умение проектировать эксперименты. Плюсом будет опыт работы с эмбеддинг-моделями, метрическим, контрастным и распределённым обучением.Откликайтесь на сайте или пишите @sasha_ocheretova #AIVK #aivkhub #вакансии
2 485
📱 Рекомендательные системы видео, клипов и постов работали раньше независимо: сигналы от пользователя в одном сервисе не влияли на рекомендации в других.
В AI VK разработали новую технологию — нейропрофиль. Она объединила историю действий пользователя ВКонтакте, в VK Видео и VK Клипах в единую последовательность событий и повышает точность рекомендаций во всех трёх сервисах.
➡️Коротко о работе нейропрофиля — в ролике.
#aivkhub #video #discovery #нейропрофиль
2 485
+9
Alignment: от ручной разметки к проверяемым наградам
За аббревиатурами SFT, RLHF, PPO и GRPO стоит задача научить LLM вести себя так, как ожидает человек. Алгоритмы оптимизации за последние годы сменились несколько раз. Изменился и тот, кто ставит оценку. В карточках разбираем эволюцию способов оценки и методов оптимизации политики.
#aivkhub #alignment #llm
2 485
+8
На прошедших выходных прошла вторая встреча AI VK & Pro — место, где лиды ML и RecSys из бигтеха могут обсудить актуальные тренды, рабочие подходы, инженерные задачи и обменяться опытом в узком кругу.
В этом году AI VK & Pro прошла в гольф-клубе. Там лиды AI VK поделились свежими апдейтами Discovery-платформы и презентовали технологии Discovery.
Коротко о главном:
🟣сегодня Discovery-платформа обрабатывает больше 1,5 млн событий в секунду
🟣на базе платформы работают технологии Discovery: нейропоиск Discovery AI, нейросетевое ранжирование и нейропрофиль пользователя, который объединяет сигналы об интересах из разных продуктов VK
🟣инфраструктуру нового рекомендера можно поднять за 2 часа
🟣80% факторов ранжирования конфигурируются no-code
🟣благодаря более точному пониманию интересов пользователей алгоритмы быстрее находят подходящую аудиторию для авторов
🟣VK Реклама на 50% перешла на инфраструктуру единой Discovery-платформы
📷 Как это было — собрали в фоторепортаже.
#aivkhub #discovery #митап #репортаж
2 485
📢 Как мы увеличили время в ленте ВКонтакте на 11%
Рекомендательная система ВКонтакте — зрелый пайплайн, но и в нём есть точки роста. В этом году команда AI VK улучшила несколько этапов: заменила классический мультитаргет ранкера на композитный, стохастику в блендере — на детерминированный алгоритм Брезенхема, эвристики в ALS — на вероятностную оценку.
🔥 Результат: +11% времени в ленте, CTR лайка вырос на 30%, CTR скрытия поста снизился на 10%.
➡️ Подробности в статье на Хабре
2 485
🟣KDD 2026
9–13 августа команда AI VK Research участвовала в KDD 2026 — ключевой мировой ML-конференции. Наши ребята представили результаты своих исследований, посвящённых развитию RecSys. Репортаж с конференции и ссылки на исследования — в посте.
🟣Нейропрофиль пользователя: новая модель для рекомендаций в продуктах VK
10 августа инженеры AI VK запустили единую модель для анализа взаимодействий с контентом внутри разных продуктов. Она формирует нейропрофиль — представление об интересах человека — в VK Видео, VK Клипах и других продуктах экосистемы. Объединение этих данных в один поток дало реальный буст на проде. Подробнее мы писали на Хабре.
🟣NVIDIA: роутинг вместо одной большой модели
11 августа NVIDIA выпустила Nemotron 3.5 Lightning и NeMo Switchyard: открытую MoE на 30B для массовых коротких операций внутри агентных систем и роутинг-библиотеку, выбирающую модель под конкретный вызов. В тесте LangChain на 145 агентных задачах к frontier-модели уходило 7% вызовов: стоимость снизилась на 74% при потере ~6% качества.
🟣Upstage: модель, доводящая работу до результата
11 августа южнокорейская Upstage выпустила Solar Pro 4: контекст 512K токенов, до 128K выходных и регулируемый reasoning. Модель рассчитана на многошаговые офисные задачи: на Terminal-Bench 2.1 она получила 57.0 против 43.2 у Solar Open 2. Отдельный акцент модели — это groundedness, утверждения без опоры в документах помечаются как неподтверждённые.
🟣SpaceXAI (xAI): Grok 4.6 для длинных агентных траекторий
12 августа SpaceXAI (xAI) выпустила Grok 4.6 с фокусом на длинные сессии агента. Intelligence Index — 61 балл, что на уровне GPT-5.6 Sol и чуть ниже Fable 5 Max с 62. Лидером по кодинг-бенчмаркам модель не стала: на Terminal-Bench 3.0 набирает 26% против 34.6% у GPT-5.6 Sol.
🟣Google DeepMind: Flash с управляемым рассуждением
13 августа Google DeepMind выпустила Gemini 3.7 Flash: контекст 1M токенов, на вход принимает текст, изображения, аудио и видео. Модель получила управляемый бюджет на рассуждения, позволяющий выбирать компромисс между качеством, стоимостью и задержкой, и агентский video understanding — использование видео в reasoning-процессе. Это итерация поверх Gemini 3.6 Flash.
🟣Alibaba: открытая 27B и preview архитектуры Qwen4
14 августа Alibaba открыла веса Qwen3.8-27B — dense-модели с нативной обработкой изображений и видео. 26 августа вышла Qwen3.8-Flash-Next: MoE на 125B параметров плюс 51B N-gram-эмбеддингов, ~6B активных на токен и гибрид Gated DeltaNet + Qwen Sparse Attention. По данным Alibaba, обучение обошлось в 9 раз дешевле Qwen3.7-Plus.
🟣Z.ai: большая модель и быстрый Flash
14 августа Z.ai выпустила GLM-5.3 — MoE на 743B параметров с ~39B активных. 26 августа к ней добавилась GLM-5.3-Flash, до релиза известная как Ox Alpha: 320B параметров, 18B активных, нативная мультимодальность и контекст 1M токенов. GLM-5.3-Flash требует втрое меньше вычислений и в 4,4 раза меньше памяти под KV-кеш, чем GLM-5.3, и превосходит GLM-5.2 на агентных бенчмарках.
🟣DeepSeek: Flash получает зрение
21 августа DeepSeek выпустила DeepSeek-V4-Flash-Vision-Exp и мультимодальный API. Текстовые возможности остаются на уровне V4-Flash, а в мультимодальных агентных задачах модель приближается к Opus 4.8. Появился Files API для повторного использования загруженных изображений.
🟣Agnes AI: reasoning за центы
26 августа сингапурская Agnes AI выпустила Agnes 2.5 Pro Beta — по $0,10 / $0,30 за 1M токенов. Intelligence Index вырос с 40 (июльская Alpha) до 49, а Agentic Index — с 25 до 44. При этом доля галлюцинаций снизилась с 88% до 33% за счёт более осторожного поведения модели.
🟣Обзор движков для инференса LLM
Сделали подробный разбор TensorRT-LLM, LMDeploy, vLLM, SGLang и llama.cpp. Подробнее в карточках.
➡️ Самые интересные статьи от AI VK на Хабре
🟣Обучение с подкреплением в рекомендациях: оптимизируем удовлетворённость пользователя за всю сессию
🟣Нейроранжирование: отказ от бустинга в пользу нейросетей
🟣Как устроен нейропрофиль пользователя в рекомендациях VK
#aivkhub #дайджест
2 485
Устаревание контента в рекомендациях: возраст почти ни при чём
Вчерашняя новость может быть опровергнута, старый гайд остаётся полезным годами, а свежий айтем не нужен конкретному пользователю. Правило «старше N дней значит удалить» здесь слишком грубое, поскольку устаревание (staleness) — это не возраст, а вероятность, что айтем сохраняет достаточную полезность для пользователя и контекста.
Свежесть не равна полезности
Свежесть говорит, когда айтем был опубликован, новизна — насколько он незнаком пользователю, а релевантность — насколько отвечает запросу. Исторический документ может быть идеальным ответом на вопрос «что было известно о событии в 2019 году», а свежий айтем может быть знаком пользователю, который уже видел его в ленте.
Устаревать может и сама система, когда эмбеддинги и профиль пользователя перестают отражать реальность.
Почему TTL ломается
Жёсткий порог по дате предполагает, что полезность всех айтемов монотонно падает с возрастом и с одинаковой скоростью. В реальности же срочная новость устаревает за минуты, журналистское расследование живёт месяцами, а сезонный материал снова оживает через год.
Два механизма
В статье Decomposing Staleness in Recommender Systems устаревание разделено на два независимых механизма:
🟣Supersession (замещение) — айтем устарел, потому что появился более новый, который меняет статус той же темы. Сообщение «Елизавета II находится под медицинским наблюдением» устаревает в момент объявления о смерти. Это направленная связь между парой айтемов, поэтому возраст тут — недостаточный сигнал.
🟣Decay (затухание) — полезность падает сама по себе, без замены. Прогноз погоды, расписание, короткая акция. Это похоже на постановку задачи анализа выживаемости: предсказать вероятность, что айтем сохранит полезность на горизонте.
Архитектура
Supersession-модель — это классификатор, который получает связанные айтемы и решает, отменяется ли старый айтем новым. Разметку генерирует большая языковая модель, затем её знания дистиллируются в компактную.
Decay-модель предсказывает по содержимому айтема, какая доля интереса к нему уже исчерпана, и убирает его из набора кандидатов при потере значительной доли.
Оба фильтра срабатывают перед ранжированием, ответы кешируются заранее, поэтому ранкер перестаёт считать заведомо устаревших кандидатов, что экономит вычисления.
В онлайн-эксперименте бейзлайн с TTL почти не изменил долю устаревших показов, а пара обученных фильтров снизила эту долю примерно на 7%. За два года эксплуатации жалобы на устаревший контент упали почти наполовину.
Границы подхода
Оба фильтра работают на уровне айтема и не учитывают сигнал пользователя. Часть оставшихся жалоб относится к контенту, который человек уже видел, поскольку модель затухания (decay) пропускает длинный хвост медленно устаревающих айтемов.
Такой отдельный слой нужен далеко не всегда. Например, в RAG актуальность должна учитываться внутри отбора кандидатов. На корпусе NVD CVE свежий релевантный документ попадал в топ-50 лишь в одном запросе из пяти. Позднее ранжирование не вернёт айтем, потерянный на этапе отбора.
В Re3 адаптивное объединение семантической и временной оценок обошло жёсткие бейзлайны без использования бинарного фильтра. Одновременное попадание в контекст устаревших и актуальных документов снижает качество ответов даже при наличии правильного.
TTL остаётся дешёвым резервным механизмом для холодного старта и аварийного контроля. Задача зрелой системы в другом: предсказывать продолжение полезности, отличать замещение от затухания, а высокоуверенные проверки ставить до дорогого персонализированного ранжирования.
#aivkhub #recsys
2 485
📢 Инженеры AI VK начали использовать единую нейросетевую архитектуру для финального ранжирования контента в рекомендациях.
В новой статье рассказываем, почему отказались от классического бустинга, как построили многозадачный нейроранкер и научили его одновременно предсказывать вероятность лайка и дизлайка, а также прогнозировать время вовлеченного просмотра.
➡️Подробнее читайте на Хабре
#aivkhub #discovery #нейроранжирование #recsys
2 485
+9
Обзор движков для инференса LLM
LLM-движок размещает веса и KV cache, собирает запросы в батчи, выбирает ядра и держит SLO по TTFT и TPOT. Выход длиной T токенов требует T последовательных decode-итераций, поэтому на каждом шаге движок решает, кого обработать следующим.
TensorRT-LLM, LMDeploy, vLLM, SGLang и llama.cpp решают задачу с разными приоритетами. Как это происходит, рассказываем в карточках.
#aivkhub #llm #обзор
2 485
Репортаж с KDD 2026 ⬆️
На прошлой неделе команда AI VK Research участвовала в KDD 2026 — одной из ключевых мировых ML-конференций. Наши ребята представили результаты двух своих исследований, посвящённых развитию рекомендательных систем.
Что обсуждали на KDD, какие тренды появились и как прошла презентация работ команды, рассказывает старший исследователь AI VK Research Артём Матвеев 🎬
Подробнее об исследованиях
➡️ Session-Level Optimization for Large-Scale Retrieval using REINFORCE with Multi-Step Off-Policy Correction
🟣Обзор статьи
➡️ Planning over Matrix-Factorization MDPs for Candidate Generation
🟣 Обзор статьи
#aivkhub #конференция #kdd #recsys #репортаж
2 485
Expressiveness-Efficiency Trade-off: длина кода SID против стоимости генерации
В авторегрессивных декодерах каждый дополнительный токен Semantic ID (SID) требует отдельного шага генерации. Чем длиннее код, тем точнее он различает айтемы, но и тем выше задержка. Это третья из фундаментальных проблем генеративных рекомендаций.
Часть 1
Часть 2
Часть 3
Стороны компромисса
Кодовое пространство SID содержит
K ** L кодов, где K — размер кодбука, а L — число уровней. Длинные SID уменьшают коллизии и лучше различают тонкие атрибуты, позволяя эффективнее использовать сильные энкодеры. В экспериментах RPG увеличение длины с 4 до 16–64 токенов примерно удвоило NDCG@10.
С другой стороны, так как декодер генерирует SID токен за токеном, то число прямых проходов пропорционально произведению ширины beam на длину SID. Например, TIGER ограничивается 4 уровнями с кодбуком 256, и при длине SID 32 и более beam search становится неприемлемым. Короткие SID порождают обратную проблему: рост коллизий и усложнение разрешения айтема.
Проблема в архитектуре, а не в длине
Ключевой вывод: компромисс верен для TIGER-подобных архитектур, но не фундаментален. Его причина в последовательной зависимости residual quantization и авторегрессивного декодирования.
RQ квантует остатки последовательно: каждый токен уточняет предыдущий, создавая иерархию от грубых категорий к тонким атрибутам, но требуя L шагов декодера. Авторегрессивный декодер усиливает это ограничение: каждый шаг зависит от предыдущего, ошибки накапливаются, а beam search умножает стоимость на ширину поиска.
Подходы к решению проблемы
1️⃣Параллельная генерация длинных SID
RPG заменяет residual quantization на Optimized Product Quantization: токены независимы, так как каждый кодирует ортогональное подпространство эмбеддинга. Модель предсказывает все токены одновременно через multi-token prediction.
Поиск валидных SID ведётся через граф семантически близких кодов, сложность которого не зависит от числа айтемов. Это позволяет использовать SID длиной до 64 токенов без пропорционального роста задержки.
2️⃣Адаптивное сжатие длинного кода
Например, ACERec сохраняет длинный 32-токенный SID, но до подачи в последовательную модель сжимает его через cross-attention в малое число латентных токенов. Декодер работает на компактном представлении, а скоринг сводится к параллельному вычислению логитов по кодбукам и суммированию для каждого айтема.
Таким образом, стоимость определяется числом латентных токенов, а не длиной SID.
3️⃣Кластерные SID в гибридном пайплайне
Промышленные системы отходят от требования «один айтем, один SID». GLIDE использует 4-уровневый SID с кодбуком 256, а коллизии внутри групп разрешаются выбором популярнейшего эпизода.
CQ-SID трактует SID как cluster ID: трёхуровневый кластерный код с крупными кодбуками позволяет сократить beam вдвое при том же качестве. Генеративный канал работает как источник кандидатов, а финальный ранкер обеспечивает точную идентичность.
4️⃣Коллизии как часть дизайна
Google в задаче ранжирования видео показал, что семантические коллизии полезнее случайных: близкие айтемы делят статистическую силу, что улучшает обобщение и холодный старт. Но для доменов, где точная идентичность важнее семантической близости, разрешение коллизий на основе популярности может систематически вытеснять длинный хвост.
Итог
Компромисс выразительности и эффективности снимается переходом к параллельной или гибридной генерации. Оптимум определяется не длиной SID, а совместным выбором кодбука, декодера, ограничением поиска и слоя разрешения.
#aivkhub #genrecsys #recsys2 485
Weak Semantic Reasoning: проблема понимания Semantic ID
Даже согласованный токенизатор не отвечает на главный вопрос: понимает ли LLM структуру каталога или просто запоминает популярные переходы? Это вторая из трёх фундаментальных проблем генеративных рекомендаций: разрыв между заложенным в Semantic ID (SID) смыслом и тем, что модель фактически выучила.
➡️ Часть 1
➡️ Часть 2
Рассуждения в стиле «LLM не видела SID на претрейне» логически ошибочны. Отсутствие кода в обучающих данных не исключает, что модель выучит его роль после адаптации. Эксперименты с произвольными символьными метками подтверждают: трансформер осваивает искусственные знаковые системы при достаточном объёме адаптационных данных.
Четыре рассогласованных пространства
SID создают 4 потенциально несовместимых геометрии:
🟣Item geometry: непрерывные эмбеддинги айтемов
🟣SID geometry: дискретные кодовые последовательности
🟣LLM representation: скрытые состояния и эмбеддинги токенов внутри модели
🟣Autoregressive likelihood: условные вероятности последующих токенов
Нет причин ожидать, что эти пространства изоморфны
Общий префикс в SID может отражать устройство токенизации, а не понятие, которое модель интерпретирует как категорию. Так, иерархия RQ-VAE остаётся свойством кодировщика: первый код грубо приближает эмбеддинг, последующие корректируют остатки. Каузальное внимание не знает, что первая позиция соответствует родительскому кластеру, а четвёртая — листовому узлу: позиционные эмбеддинги кодируют порядок, но не роль в онтологии.
Три уровня понимания
🟣Token recognition: модель генерирует и валидно декодирует SID
🟣Structural understanding: модель использует префикс как иерархию
🟣Semantic reasoning: модель выводит корректные отношения для незнакомых комбинаций атрибутов и доменов
Рост метрик ранжирования после SID-aware обучения не доказывает структурного понимания. Если большинство пользователей после айтема
A выбирают B, модель предсказывает SID(B) без знания о том, что A и B из одной категории. Recall@K и NDCG не различают зазубривание, интерполяцию и рассуждение.
Три направления решения
1️⃣ Совместная оптимизация токенизатора и рекомендателя. Например, DIGER делает квантование дифференцируемым через Gumbel exploration: градиент от рекомендательного лосса пробрасывается в токенизатор, и кодбук корректируется под итоговую задачу
2️⃣ SID-языковое выравнивание. Так, SIDReasoner строит двунаправленную связь между кодами и естественным языком, переводя SID в заголовок и обратно, а PLUM расширяет словарь SID-токенами и проводит continued pre-training на доменных данных до fine-tuning
3️⃣ Семантико-коллаборативное выравнивание. Например, DAS объединяет квантование контентных признаков с коллаборативным сигналом, очищенным от популярностного смещения. Такой подход особенно полезен в сценариях холодного старта, где контентные признаки покрывают новые айтемы, а коллаборативные фильтруют поведенческий шум.
Методологический пробел
Бенчмарка для оценки рассуждения над SID не существует. Для проверки нужны:
🟣Prefix intervention: заменить префикс, сохранив суффикс, и измерить эффект
🟣Random-SID control: переставить SID между айтемами, сохранив частоты
🟣Held-out composition split: исключить комбинации пар атрибутов и проверить обобщение
🟣Faithfulness test: изменить промежуточный reasoning trace и проверить, меняется ли рекомендация
Без этих тестов улучшение NDCG остаётся инженерным результатом, но не доказательством семантического рассуждения.
#aivkhub #genrecsys #recsys2 485
📢 Исследователи AI VK Research научили двухбашенный трансформер над историей оптимизировать удовлетворённость пользователя за всю сессию. Работа принята на воркшоп конференции KDD 2026, которая проходит сейчас в Южной Корее.
Большинство современных рекомендательных моделей решает локальную задачу — предсказать следующее взаимодействие или следующий положительный фидбэк. Мы сформулировали задачу как RL на уровне сессии и обучили кандидатогенератор через off-policy REINFORCE на логах.
На индустриальных данных такая модель выигрывает у next-item и next-positive prediction по всем оценкам награды за сессию, сохраняя качество кандидатогенерации по recall-метрикам.
➡️ Подробнее в статье на Хабре.
#aivkhub #ml #recsys
2 485
Продолжаем разбирать, как работают генеративные рекомендательные системы и какие задачи в этом направлении сейчас решают ведущие AI-команды мира.
➡️ Здесь начало статьи.
Tokenizer Dissociation: разрыв оптимизации
Токенизатор обучается отдельно от рекомендательной модели. После заморозки кодбука Semantic ID градиенты целевой задачи перестают поступать в токенизатор. Это первая из трёх фундаментальных проблем генеративных рекомендаций, обозначенных в прошлом посте.
Стандартный пайплайн
Из контентных и коллаборативных признаков энкодер строит непрерывные эмбеддинги айтемов, далее их превращают в дискретные Semantic ID через иерархическую кластеризацию или векторное квантование. Получившийся кодбук замораживается, рекомендательная модель учится на фиксированных токенах: предсказывает следующий Semantic ID или сразу ранжированный список Semantic ID. На инференсе сгенерированные токены сопоставляются с айтемами через кодбук.
Где возникает разрыв
Токенизатор оптимизирует компактность кодового пространства, а рекомендательная модель минимизирует проксирующий лосс для Recall@K и NDCG. После заморозки кодбук изолируется от градиентов рекомендательной функции потерь.
Дрейф и деградация
Токенизатор группирует айтемы на основе близости их исходных эмбеддингов, стремясь минимизировать ошибку квантования кодового пространства. Рекомендательная же модель перестраивает это пространство под задачу ранжирования. Эти две геометрии неизбежно расходятся, так как компактное представление кодов конфликтует с оптимальным ранжированием.
В процессе обучения модель удаляется от исходного распределения и статическая дискретизация теряет свою дискриминативную силу, переставая быть оптимальной для финальной задачи ранжирования.
Из-за недифференцируемости операции дискретного выбора градиенты не могут пройти сквозь слой квантования и модель теряет способность корректировать границы токенов. В результате система не может адаптироваться к новым айтемам или изменившимся поведенческим паттернам.
Направления решений
1️⃣ ETEGRec (SIGIR 2025) объединяет токенизатор и рекомендатель в единую архитектуру. Градиенты от ранжирующего лосса проходят в токенизатор через sequence-item alignment и preference-semantic alignment. Попеременная EM-like оптимизация стабилизирует совместное обучение. Это самый прямой подход к проблеме, но и самый сложный в стабилизации
2️⃣ OneRec (2025) подмешивает коллаборативный сигнал к контентным признакам ещё до квантования, формируя Semantic ID на основе совместных просмотров товаров пользователями. PLUM (2025) развивает эту логику, внедряя многоэтапную схему с непрерывным предобучением на логах взаимодействий. COSETTE (2025) насыщает токенизатор сигналом непосредственно на этапе построения, заставляя токены одновременно реконструировать контент и максимизировать релевантность для рекомендации через контрастивную цель. Во всех случаях двухэтапный пайплайн сохраняется, но кодбук перестаёт быть слепым к задаче ранжирования
3️⃣ DAS (CIKM 2025) объединяет квантование и выравнивание в единый сквозной этап обучения. Contrastive alignment и dual learning синхронизируют квантованные представления пользователей и айтемов
4️⃣ Инженеры AI VK под руководством Владимира Байкалова совместно с ИТМО решали смежную задачу: пересчёт Semantic ID на свежих логах ломает совместимость с уже обученным ретривером. Предложенный метод выравнивает новые токены под старое пространство через биективный матчинг, после чего ретривер дообучается без полного переобучения
Полностью совместная, стабильная при масштабе обучающая процедура пока не продемонстрирована. Продакшен-системы сохраняют гибридный дизайн: замороженный кодбук с alignment-слоями.
#aivkhub #genrecsys #recsys
2 485
📢 Инженеры AI VK запустили единую ИИ-модель для анализа всех типов взаимодействий с контентом внутри разных продуктов. Она формирует нейропрофиль — представление об интересах человека.
Нейропрофиль решает главную проблему больших экосистем — изоляцию данных между разными сервисами. Вместо того, чтобы копить историю пользователя по кусочкам, трансформер объединяет все его действия в один поток.
Что это дало:
🟣Связь между разными форматами контента
🟣Масштабирование для новых продуктов
🟣Реальный буст на проде
Подробнее в статье на Хабре.
2 485
Легковесная full-band модель для шумоподавления и дереверберации
Большинство моделей speech enhancement решают только шумоподавление и работают с аудио 16 кГц. Исследователи НИУ ВШЭ и VK адаптировали архитектуру FSPEN для одновременного шумоподавления и дереверберации full-band аудио (48 кГц) — 95 тыс. параметров, RTF 0.11, качество шумоподавления на уровне ground truth.
В карточках кратко разбираем, что изменили в архитектуре, на каких данных обучали модель и каких результатов добились. Подробную статью читайте на Хабре.
#aivkhub #ml #звук
2 485
🟣Alibaba: 3 релиза за 2 недели
3 августа компания анонсировала флагманскую Qwen3.8-Max, MoE на 2.4 трлн параметров (~95 млрд активных), контекст 1M токенов, модель позиционируют как «вторую после Fable 5». 27 июля тихо, без техотчёта и бенчмарков, вышла бюджетная vision-language Qwen3.7 Flash ($ 0,03 — $ 0,13 за 1M токенов, контекст 1M). 21 июля представили Qwen-Image-3.0, генерация изображений с промптом до 4 500 токенов и рендером текста от 10px, но впервые в линейке без открытых весов, бенчмарков и техотчёта.
🟣DeepSeek: Flash выходит из preview
31 июля DeepSeek перевёл DeepSeek-V4-Flash из preview в стабильную версию (билд 0731), архитектура не менялась, пересобран только пост-трейнинг — заметный рост на агентных бенчмарках (Terminal-Bench 2.1: 82.7, DeepSWE: 54.4), нативная поддержка Responses API и Codex. Цены и название в API прежние.
🟣Thinking Machines Lab: младшая модель обгоняет старшую
30 июля Thinking Machines Lab выпустила Inkling-Small — открытую MoE на 276B параметров (12B активных), которая по эффективности и части reasoning/agentic бенчмарков обгоняет старшую Inkling (975B/41B, релиз 15 июля). Обе модели доступны на Hugging Face.
🟣Agnes AI: бюджетный reasoning с сильным кодингом
24 июля сингапурская Agnes AI представила Agnes 2.5 Pro Alpha — бюджетную reasoning-модель (39 баллов по Artificial Analysis Intelligence Index, контекст 1M, $ 0,45 — $ 0,90 за 1M токенов) с неожиданно сильным coding-скором (58,8) при скромном расходе токенов на рассуждения.
🟣Anthropic: Opus 5 приближается к Fable 5
24 июля Anthropic выпустила Claude Opus 5 — по цене и скорости на уровне Opus 4.8, но по интеллектуальным бенчмаркам (Frontier-Bench, ARC-AGI 3, OSWorld 2.0) приближается к Fable 5, по внутренним оценкам — самая согласованная (aligned) модель компании на сегодня.
🟣Black Forest Labs: единая модель для видео, изображений и звука
23 июля Black Forest Labs анонсировала FLUX 3 (Early Access) — мультимодальную flow-модель, обучаемую совместно на видео, изображениях и аудио в единой архитектуре. Поддерживает генерацию видео с нативным звуком до 20 секунд и первые эксперименты с action-prediction для робототехники.
🟣Google: три Gemini для агентных сценариев
21 июля Google выпустила три модели линейки Gemini: 3.6 Flash (на 17% эффективнее по токенам, чем 3.5 Flash, $ 1,50 — $ 7,50 за 1M), сверхбыстрый 3.5 Flash-Lite (350 ток/с, $ 0,3 — $ 2,5) и специализированный 3.5 Flash Cyber для поиска и патчинга уязвимостей в связке с автономным агентом CodeMender, доступ ограничен госорганизациями и партнёрами.
🟣Poolside: компактная модель против гигантов
21 июля Poolside выпустила Laguna S 2.1 — компактную MoE (118B/8B активных), обученную менее чем за 9 недель, которая на Terminal-Bench 2.1 (70,2) и других long-horizon coding-бенчмарках конкурирует с моделями на порядок крупнее. Веса открыты на Hugging Face.
🟣Moonshot AI: первая открытая модель класса 3T
16 июля Moonshot AI представила Kimi K3 — первую открытую модель класса 3T (2,8 трлн параметров) на архитектуре Kimi Delta Attention, с нативным зрением и контекстом 1M токенов. По собственным данным компании, модель уступает только Claude Fable 5 и GPT-5.6 Sol.
Новые статьи от AI VK на Хабре
🟣Как создавали нейропоиск Discovery AI — технологию для крупнейшей контентной базы в РФ
🟣Как мы подружили LLM с А/Б‑тестами: от сломанного BI до HTML‑отчётов с ИИ‑аналитиком внутри
🟣LLM и психолингвистика: HELPER
🟣Как мы ускорили разметку видеопоиска в десятки раз и не потеряли качество: опыт внедрения VLM-асессора
#aivkhub #дайджест
