2 478
订阅者
+124 小时
+47 天
+7630 天
数据加载中...
相似频道
标签云
进出提及
---
---
---
---
---
---
吸引订阅者
九月 '26
九月 '26
+8
在1个频道中
八月 '26
+114
在12个频道中
Get PRO
七月 '26
+60
在7个频道中
Get PRO
六月 '26
+59
在8个频道中
Get PRO
五月 '26
+45
在1个频道中
Get PRO
四月 '26
+104
在5个频道中
Get PRO
三月 '26
+90
在9个频道中
Get PRO
二月 '26
+57
在1个频道中
Get PRO
一月 '26
+66
在3个频道中
Get PRO
十二月 '25
+76
在3个频道中
Get PRO
十一月 '25
+85
在4个频道中
Get PRO
十月 '25
+102
在9个频道中
Get PRO
九月 '25
+574
在12个频道中
Get PRO
八月 '250
在12个频道中
Get PRO
七月 '250
在17个频道中
Get PRO
六月 '250
在0个频道中
Get PRO
五月 '250
在0个频道中
Get PRO
四月 '25
+7
在0个频道中
Get PRO
三月 '25
+19
在0个频道中
Get PRO
二月 '25
+20
在0个频道中
Get PRO
一月 '25
+36
在1个频道中
Get PRO
十二月 '24
+86
在2个频道中
Get PRO
十一月 '24
+114
在0个频道中
Get PRO
十月 '24
+144
在0个频道中
Get PRO
九月 '24
+70
在1个频道中
Get PRO
八月 '24
+994
在25个频道中
| 日期 | 订阅者增长 | 提及 | 频道 | |
| 05 九月 | 0 | |||
| 04 九月 | +3 | |||
| 03 九月 | +3 | |||
| 02 九月 | +2 | |||
| 01 九月 | 0 |
频道帖子
📢 Как мы увеличили время в ленте ВКонтакте на 11%
Рекомендательная система ВКонтакте — зрелый пайплайн, но и в нём есть точки роста. В этом году команда AI VK улучшила несколько этапов: заменила классический мультитаргет ранкера на композитный, стохастику в блендере — на детерминированный алгоритм Брезенхема, эвристики в ALS — на вероятностную оценку.
🔥 Результат: +11% времени в ленте, CTR лайка вырос на 30%, CTR скрытия поста снизился на 10%.
➡️ Подробности в статье на Хабре
| 2 | 🟣KDD 2026
9–13 августа команда AI VK Research участвовала в KDD 2026 — ключевой мировой ML-конференции. Наши ребята представили результаты своих исследований, посвящённых развитию RecSys. Репортаж с конференции и ссылки на исследования — в посте.
🟣Нейропрофиль пользователя: новая модель для рекомендаций в продуктах VK
10 августа инженеры AI VK запустили единую модель для анализа взаимодействий с контентом внутри разных продуктов. Она формирует нейропрофиль — представление об интересах человека — в VK Видео, VK Клипах и других продуктах экосистемы. Объединение этих данных в один поток дало реальный буст на проде. Подробнее мы писали на Хабре.
🟣NVIDIA: роутинг вместо одной большой модели
11 августа NVIDIA выпустила Nemotron 3.5 Lightning и NeMo Switchyard: открытую MoE на 30B для массовых коротких операций внутри агентных систем и роутинг-библиотеку, выбирающую модель под конкретный вызов. В тесте LangChain на 145 агентных задачах к frontier-модели уходило 7% вызовов: стоимость снизилась на 74% при потере ~6% качества.
🟣Upstage: модель, доводящая работу до результата
11 августа южнокорейская Upstage выпустила Solar Pro 4: контекст 512K токенов, до 128K выходных и регулируемый reasoning. Модель рассчитана на многошаговые офисные задачи: на Terminal-Bench 2.1 она получила 57.0 против 43.2 у Solar Open 2. Отдельный акцент модели — это groundedness, утверждения без опоры в документах помечаются как неподтверждённые.
🟣SpaceXAI (xAI): Grok 4.6 для длинных агентных траекторий
12 августа SpaceXAI (xAI) выпустила Grok 4.6 с фокусом на длинные сессии агента. Intelligence Index — 61 балл, что на уровне GPT-5.6 Sol и чуть ниже Fable 5 Max с 62. Лидером по кодинг-бенчмаркам модель не стала: на Terminal-Bench 3.0 набирает 26% против 34.6% у GPT-5.6 Sol.
🟣Google DeepMind: Flash с управляемым рассуждением
13 августа Google DeepMind выпустила Gemini 3.7 Flash: контекст 1M токенов, на вход принимает текст, изображения, аудио и видео. Модель получила управляемый бюджет на рассуждения, позволяющий выбирать компромисс между качеством, стоимостью и задержкой, и агентский video understanding — использование видео в reasoning-процессе. Это итерация поверх Gemini 3.6 Flash.
🟣Alibaba: открытая 27B и preview архитектуры Qwen4
14 августа Alibaba открыла веса Qwen3.8-27B — dense-модели с нативной обработкой изображений и видео. 26 августа вышла Qwen3.8-Flash-Next: MoE на 125B параметров плюс 51B N-gram-эмбеддингов, ~6B активных на токен и гибрид Gated DeltaNet + Qwen Sparse Attention. По данным Alibaba, обучение обошлось в 9 раз дешевле Qwen3.7-Plus.
🟣Z.ai: большая модель и быстрый Flash
14 августа Z.ai выпустила GLM-5.3 — MoE на 743B параметров с ~39B активных. 26 августа к ней добавилась GLM-5.3-Flash, до релиза известная как Ox Alpha: 320B параметров, 18B активных, нативная мультимодальность и контекст 1M токенов. GLM-5.3-Flash требует втрое меньше вычислений и в 4,4 раза меньше памяти под KV-кеш, чем GLM-5.3, и превосходит GLM-5.2 на агентных бенчмарках.
🟣DeepSeek: Flash получает зрение
21 августа DeepSeek выпустила DeepSeek-V4-Flash-Vision-Exp и мультимодальный API. Текстовые возможности остаются на уровне V4-Flash, а в мультимодальных агентных задачах модель приближается к Opus 4.8. Появился Files API для повторного использования загруженных изображений.
🟣Agnes AI: reasoning за центы
26 августа сингапурская Agnes AI выпустила Agnes 2.5 Pro Beta — по $0,10 / $0,30 за 1M токенов. Intelligence Index вырос с 40 (июльская Alpha) до 49, а Agentic Index — с 25 до 44. При этом доля галлюцинаций снизилась с 88% до 33% за счёт более осторожного поведения модели.
🟣Обзор движков для инференса LLM
Сделали подробный разбор TensorRT-LLM, LMDeploy, vLLM, SGLang и llama.cpp. Подробнее в карточках.
➡️ Самые интересные статьи от AI VK на Хабре
🟣Обучение с подкреплением в рекомендациях: оптимизируем удовлетворённость пользователя за всю сессию
🟣Нейроранжирование: отказ от бустинга в пользу нейросетей
🟣Как устроен нейропрофиль пользователя в рекомендациях VK
#aivkhub #дайджест | 410 |
| 3 | Устаревание контента в рекомендациях: возраст почти ни при чём
Вчерашняя новость может быть опровергнута, старый гайд остаётся полезным годами, а свежий айтем не нужен конкретному пользователю. Правило «старше N дней значит удалить» здесь слишком грубое, поскольку устаревание (staleness) — это не возраст, а вероятность, что айтем сохраняет достаточную полезность для пользователя и контекста.
Свежесть не равна полезности
Свежесть говорит, когда айтем был опубликован, новизна — насколько он незнаком пользователю, а релевантность — насколько отвечает запросу. Исторический документ может быть идеальным ответом на вопрос «что было известно о событии в 2019 году», а свежий айтем может быть знаком пользователю, который уже видел его в ленте.
Устаревать может и сама система, когда эмбеддинги и профиль пользователя перестают отражать реальность.
Почему TTL ломается
Жёсткий порог по дате предполагает, что полезность всех айтемов монотонно падает с возрастом и с одинаковой скоростью. В реальности же срочная новость устаревает за минуты, журналистское расследование живёт месяцами, а сезонный материал снова оживает через год.
Два механизма
В статье Decomposing Staleness in Recommender Systems устаревание разделено на два независимых механизма:
🟣Supersession (замещение) — айтем устарел, потому что появился более новый, который меняет статус той же темы. Сообщение «Елизавета II находится под медицинским наблюдением» устаревает в момент объявления о смерти. Это направленная связь между парой айтемов, поэтому возраст тут — недостаточный сигнал.
🟣Decay (затухание) — полезность падает сама по себе, без замены. Прогноз погоды, расписание, короткая акция. Это похоже на постановку задачи анализа выживаемости: предсказать вероятность, что айтем сохранит полезность на горизонте.
Архитектура
Supersession-модель — это классификатор, который получает связанные айтемы и решает, отменяется ли старый айтем новым. Разметку генерирует большая языковая модель, затем её знания дистиллируются в компактную.
Decay-модель предсказывает по содержимому айтема, какая доля интереса к нему уже исчерпана, и убирает его из набора кандидатов при потере значительной доли.
Оба фильтра срабатывают перед ранжированием, ответы кешируются заранее, поэтому ранкер перестаёт считать заведомо устаревших кандидатов, что экономит вычисления.
В онлайн-эксперименте бейзлайн с TTL почти не изменил долю устаревших показов, а пара обученных фильтров снизила эту долю примерно на 7%. За два года эксплуатации жалобы на устаревший контент упали почти наполовину.
Границы подхода
Оба фильтра работают на уровне айтема и не учитывают сигнал пользователя. Часть оставшихся жалоб относится к контенту, который человек уже видел, поскольку модель затухания (decay) пропускает длинный хвост медленно устаревающих айтемов.
Такой отдельный слой нужен далеко не всегда. Например, в RAG актуальность должна учитываться внутри отбора кандидатов. На корпусе NVD CVE свежий релевантный документ попадал в топ-50 лишь в одном запросе из пяти. Позднее ранжирование не вернёт айтем, потерянный на этапе отбора.
В Re3 адаптивное объединение семантической и временной оценок обошло жёсткие бейзлайны без использования бинарного фильтра. Одновременное попадание в контекст устаревших и актуальных документов снижает качество ответов даже при наличии правильного.
TTL остаётся дешёвым резервным механизмом для холодного старта и аварийного контроля. Задача зрелой системы в другом: предсказывать продолжение полезности, отличать замещение от затухания, а высокоуверенные проверки ставить до дорогого персонализированного ранжирования.
#aivkhub #recsys | 509 |
| 4 | 📢 Инженеры AI VK начали использовать единую нейросетевую архитектуру для финального ранжирования контента в рекомендациях.
В новой статье рассказываем, почему отказались от классического бустинга, как построили многозадачный нейроранкер и научили его одновременно предсказывать вероятность лайка и дизлайка, а также прогнозировать время вовлеченного просмотра.
➡️Подробнее читайте на Хабре
#aivkhub #discovery #нейроранжирование #recsys | 894 |
| 5 | Обзор движков для инференса LLM
LLM-движок размещает веса и KV cache, собирает запросы в батчи, выбирает ядра и держит SLO по TTFT и TPOT. Выход длиной T токенов требует T последовательных decode-итераций, поэтому на каждом шаге движок решает, кого обработать следующим.
TensorRT-LLM, LMDeploy, vLLM, SGLang и llama.cpp решают задачу с разными приоритетами. Как это происходит, рассказываем в карточках.
#aivkhub #llm #обзор | 1 231 |
| 6 | Репортаж с KDD 2026 ⬆️
На прошлой неделе команда AI VK Research участвовала в KDD 2026 — одной из ключевых мировых ML-конференций. Наши ребята представили результаты двух своих исследований, посвящённых развитию рекомендательных систем.
Что обсуждали на KDD, какие тренды появились и как прошла презентация работ команды, рассказывает старший исследователь AI VK Research Артём Матвеев 🎬
Подробнее об исследованиях
➡️ Session-Level Optimization for Large-Scale Retrieval using REINFORCE with Multi-Step Off-Policy Correction
🟣Обзор статьи
➡️ Planning over Matrix-Factorization MDPs for Candidate Generation
🟣 Обзор статьи
#aivkhub #конференция #kdd #recsys #репортаж | 107 240 |
| 7 | Expressiveness-Efficiency Trade-off: длина кода SID против стоимости генерации
В авторегрессивных декодерах каждый дополнительный токен Semantic ID (SID) требует отдельного шага генерации. Чем длиннее код, тем точнее он различает айтемы, но и тем выше задержка. Это третья из фундаментальных проблем генеративных рекомендаций.
Часть 1
Часть 2
Часть 3
Стороны компромисса
Кодовое пространство SID содержит K ** L кодов, где K — размер кодбука, а L — число уровней. Длинные SID уменьшают коллизии и лучше различают тонкие атрибуты, позволяя эффективнее использовать сильные энкодеры. В экспериментах RPG увеличение длины с 4 до 16–64 токенов примерно удвоило NDCG@10.
С другой стороны, так как декодер генерирует SID токен за токеном, то число прямых проходов пропорционально произведению ширины beam на длину SID. Например, TIGER ограничивается 4 уровнями с кодбуком 256, и при длине SID 32 и более beam search становится неприемлемым. Короткие SID порождают обратную проблему: рост коллизий и усложнение разрешения айтема.
Проблема в архитектуре, а не в длине
Ключевой вывод: компромисс верен для TIGER-подобных архитектур, но не фундаментален. Его причина в последовательной зависимости residual quantization и авторегрессивного декодирования.
RQ квантует остатки последовательно: каждый токен уточняет предыдущий, создавая иерархию от грубых категорий к тонким атрибутам, но требуя L шагов декодера. Авторегрессивный декодер усиливает это ограничение: каждый шаг зависит от предыдущего, ошибки накапливаются, а beam search умножает стоимость на ширину поиска.
Подходы к решению проблемы
1️⃣Параллельная генерация длинных SID
RPG заменяет residual quantization на Optimized Product Quantization: токены независимы, так как каждый кодирует ортогональное подпространство эмбеддинга. Модель предсказывает все токены одновременно через multi-token prediction.
Поиск валидных SID ведётся через граф семантически близких кодов, сложность которого не зависит от числа айтемов. Это позволяет использовать SID длиной до 64 токенов без пропорционального роста задержки.
2️⃣Адаптивное сжатие длинного кода
Например, ACERec сохраняет длинный 32-токенный SID, но до подачи в последовательную модель сжимает его через cross-attention в малое число латентных токенов. Декодер работает на компактном представлении, а скоринг сводится к параллельному вычислению логитов по кодбукам и суммированию для каждого айтема.
Таким образом, стоимость определяется числом латентных токенов, а не длиной SID.
3️⃣Кластерные SID в гибридном пайплайне
Промышленные системы отходят от требования «один айтем, один SID». GLIDE использует 4-уровневый SID с кодбуком 256, а коллизии внутри групп разрешаются выбором популярнейшего эпизода.
CQ-SID трактует SID как cluster ID: трёхуровневый кластерный код с крупными кодбуками позволяет сократить beam вдвое при том же качестве. Генеративный канал работает как источник кандидатов, а финальный ранкер обеспечивает точную идентичность.
4️⃣Коллизии как часть дизайна
Google в задаче ранжирования видео показал, что семантические коллизии полезнее случайных: близкие айтемы делят статистическую силу, что улучшает обобщение и холодный старт. Но для доменов, где точная идентичность важнее семантической близости, разрешение коллизий на основе популярности может систематически вытеснять длинный хвост.
Итог
Компромисс выразительности и эффективности снимается переходом к параллельной или гибридной генерации. Оптимум определяется не длиной SID, а совместным выбором кодбука, декодера, ограничением поиска и слоя разрешения.
#aivkhub #genrecsys #recsys | 842 |
| 8 | Weak Semantic Reasoning: проблема понимания Semantic ID
Даже согласованный токенизатор не отвечает на главный вопрос: понимает ли LLM структуру каталога или просто запоминает популярные переходы? Это вторая из трёх фундаментальных проблем генеративных рекомендаций: разрыв между заложенным в Semantic ID (SID) смыслом и тем, что модель фактически выучила.
➡️ Часть 1
➡️ Часть 2
Рассуждения в стиле «LLM не видела SID на претрейне» логически ошибочны. Отсутствие кода в обучающих данных не исключает, что модель выучит его роль после адаптации. Эксперименты с произвольными символьными метками подтверждают: трансформер осваивает искусственные знаковые системы при достаточном объёме адаптационных данных.
Четыре рассогласованных пространства
SID создают 4 потенциально несовместимых геометрии:
🟣Item geometry: непрерывные эмбеддинги айтемов
🟣SID geometry: дискретные кодовые последовательности
🟣LLM representation: скрытые состояния и эмбеддинги токенов внутри модели
🟣Autoregressive likelihood: условные вероятности последующих токенов
Нет причин ожидать, что эти пространства изоморфны
Общий префикс в SID может отражать устройство токенизации, а не понятие, которое модель интерпретирует как категорию. Так, иерархия RQ-VAE остаётся свойством кодировщика: первый код грубо приближает эмбеддинг, последующие корректируют остатки. Каузальное внимание не знает, что первая позиция соответствует родительскому кластеру, а четвёртая — листовому узлу: позиционные эмбеддинги кодируют порядок, но не роль в онтологии.
Три уровня понимания
🟣Token recognition: модель генерирует и валидно декодирует SID
🟣Structural understanding: модель использует префикс как иерархию
🟣Semantic reasoning: модель выводит корректные отношения для незнакомых комбинаций атрибутов и доменов
Рост метрик ранжирования после SID-aware обучения не доказывает структурного понимания. Если большинство пользователей после айтема A выбирают B, модель предсказывает SID(B) без знания о том, что A и B из одной категории. Recall@K и NDCG не различают зазубривание, интерполяцию и рассуждение.
Три направления решения
1️⃣ Совместная оптимизация токенизатора и рекомендателя. Например, DIGER делает квантование дифференцируемым через Gumbel exploration: градиент от рекомендательного лосса пробрасывается в токенизатор, и кодбук корректируется под итоговую задачу
2️⃣ SID-языковое выравнивание. Так, SIDReasoner строит двунаправленную связь между кодами и естественным языком, переводя SID в заголовок и обратно, а PLUM расширяет словарь SID-токенами и проводит continued pre-training на доменных данных до fine-tuning
3️⃣ Семантико-коллаборативное выравнивание. Например, DAS объединяет квантование контентных признаков с коллаборативным сигналом, очищенным от популярностного смещения. Такой подход особенно полезен в сценариях холодного старта, где контентные признаки покрывают новые айтемы, а коллаборативные фильтруют поведенческий шум.
Методологический пробел
Бенчмарка для оценки рассуждения над SID не существует. Для проверки нужны:
🟣Prefix intervention: заменить префикс, сохранив суффикс, и измерить эффект
🟣Random-SID control: переставить SID между айтемами, сохранив частоты
🟣Held-out composition split: исключить комбинации пар атрибутов и проверить обобщение
🟣Faithfulness test: изменить промежуточный reasoning trace и проверить, меняется ли рекомендация
Без этих тестов улучшение NDCG остаётся инженерным результатом, но не доказательством семантического рассуждения.
#aivkhub #genrecsys #recsys | 871 |
| 9 | 📢 Исследователи AI VK Research научили двухбашенный трансформер над историей оптимизировать удовлетворённость пользователя за всю сессию. Работа принята на воркшоп конференции KDD 2026, которая проходит сейчас в Южной Корее.
Большинство современных рекомендательных моделей решает локальную задачу — предсказать следующее взаимодействие или следующий положительный фидбэк. Мы сформулировали задачу как RL на уровне сессии и обучили кандидатогенератор через off-policy REINFORCE на логах.
На индустриальных данных такая модель выигрывает у next-item и next-positive prediction по всем оценкам награды за сессию, сохраняя качество кандидатогенерации по recall-метрикам.
➡️ Подробнее в статье на Хабре.
#aivkhub #ml #recsys | 6 633 |
| 10 | Продолжаем разбирать, как работают генеративные рекомендательные системы и какие задачи в этом направлении сейчас решают ведущие AI-команды мира.
➡️ Здесь начало статьи.
Tokenizer Dissociation: разрыв оптимизации
Токенизатор обучается отдельно от рекомендательной модели. После заморозки кодбука Semantic ID градиенты целевой задачи перестают поступать в токенизатор. Это первая из трёх фундаментальных проблем генеративных рекомендаций, обозначенных в прошлом посте.
Стандартный пайплайн
Из контентных и коллаборативных признаков энкодер строит непрерывные эмбеддинги айтемов, далее их превращают в дискретные Semantic ID через иерархическую кластеризацию или векторное квантование. Получившийся кодбук замораживается, рекомендательная модель учится на фиксированных токенах: предсказывает следующий Semantic ID или сразу ранжированный список Semantic ID. На инференсе сгенерированные токены сопоставляются с айтемами через кодбук.
Где возникает разрыв
Токенизатор оптимизирует компактность кодового пространства, а рекомендательная модель минимизирует проксирующий лосс для Recall@K и NDCG. После заморозки кодбук изолируется от градиентов рекомендательной функции потерь.
Дрейф и деградация
Токенизатор группирует айтемы на основе близости их исходных эмбеддингов, стремясь минимизировать ошибку квантования кодового пространства. Рекомендательная же модель перестраивает это пространство под задачу ранжирования. Эти две геометрии неизбежно расходятся, так как компактное представление кодов конфликтует с оптимальным ранжированием.
В процессе обучения модель удаляется от исходного распределения и статическая дискретизация теряет свою дискриминативную силу, переставая быть оптимальной для финальной задачи ранжирования.
Из-за недифференцируемости операции дискретного выбора градиенты не могут пройти сквозь слой квантования и модель теряет способность корректировать границы токенов. В результате система не может адаптироваться к новым айтемам или изменившимся поведенческим паттернам.
Направления решений
1️⃣ ETEGRec (SIGIR 2025) объединяет токенизатор и рекомендатель в единую архитектуру. Градиенты от ранжирующего лосса проходят в токенизатор через sequence-item alignment и preference-semantic alignment. Попеременная EM-like оптимизация стабилизирует совместное обучение. Это самый прямой подход к проблеме, но и самый сложный в стабилизации
2️⃣ OneRec (2025) подмешивает коллаборативный сигнал к контентным признакам ещё до квантования, формируя Semantic ID на основе совместных просмотров товаров пользователями. PLUM (2025) развивает эту логику, внедряя многоэтапную схему с непрерывным предобучением на логах взаимодействий. COSETTE (2025) насыщает токенизатор сигналом непосредственно на этапе построения, заставляя токены одновременно реконструировать контент и максимизировать релевантность для рекомендации через контрастивную цель. Во всех случаях двухэтапный пайплайн сохраняется, но кодбук перестаёт быть слепым к задаче ранжирования
3️⃣ DAS (CIKM 2025) объединяет квантование и выравнивание в единый сквозной этап обучения. Contrastive alignment и dual learning синхронизируют квантованные представления пользователей и айтемов
4️⃣ Инженеры AI VK под руководством Владимира Байкалова совместно с ИТМО решали смежную задачу: пересчёт Semantic ID на свежих логах ломает совместимость с уже обученным ретривером. Предложенный метод выравнивает новые токены под старое пространство через биективный матчинг, после чего ретривер дообучается без полного переобучения
Полностью совместная, стабильная при масштабе обучающая процедура пока не продемонстрирована. Продакшен-системы сохраняют гибридный дизайн: замороженный кодбук с alignment-слоями.
#aivkhub #genrecsys #recsys | 760 |
| 11 | 📢 Инженеры AI VK запустили единую ИИ-модель для анализа всех типов взаимодействий с контентом внутри разных продуктов. Она формирует нейропрофиль — представление об интересах человека.
Нейропрофиль решает главную проблему больших экосистем — изоляцию данных между разными сервисами. Вместо того, чтобы копить историю пользователя по кусочкам, трансформер объединяет все его действия в один поток.
Что это дало:
🟣Связь между разными форматами контента
🟣Масштабирование для новых продуктов
🟣Реальный буст на проде
Подробнее в статье на Хабре. | 742 |
| 12 | Легковесная full-band модель для шумоподавления и дереверберации
Большинство моделей speech enhancement решают только шумоподавление и работают с аудио 16 кГц. Исследователи НИУ ВШЭ и VK адаптировали архитектуру FSPEN для одновременного шумоподавления и дереверберации full-band аудио (48 кГц) — 95 тыс. параметров, RTF 0.11, качество шумоподавления на уровне ground truth.
В карточках кратко разбираем, что изменили в архитектуре, на каких данных обучали модель и каких результатов добились. Подробную статью читайте на Хабре.
#aivkhub #ml #звук | 1 087 |
| 13 | 🟣Alibaba: 3 релиза за 2 недели
3 августа компания анонсировала флагманскую Qwen3.8-Max, MoE на 2.4 трлн параметров (~95 млрд активных), контекст 1M токенов, модель позиционируют как «вторую после Fable 5». 27 июля тихо, без техотчёта и бенчмарков, вышла бюджетная vision-language Qwen3.7 Flash ($ 0,03 — $ 0,13 за 1M токенов, контекст 1M). 21 июля представили Qwen-Image-3.0, генерация изображений с промптом до 4 500 токенов и рендером текста от 10px, но впервые в линейке без открытых весов, бенчмарков и техотчёта.
🟣DeepSeek: Flash выходит из preview
31 июля DeepSeek перевёл DeepSeek-V4-Flash из preview в стабильную версию (билд 0731), архитектура не менялась, пересобран только пост-трейнинг — заметный рост на агентных бенчмарках (Terminal-Bench 2.1: 82.7, DeepSWE: 54.4), нативная поддержка Responses API и Codex. Цены и название в API прежние.
🟣Thinking Machines Lab: младшая модель обгоняет старшую
30 июля Thinking Machines Lab выпустила Inkling-Small — открытую MoE на 276B параметров (12B активных), которая по эффективности и части reasoning/agentic бенчмарков обгоняет старшую Inkling (975B/41B, релиз 15 июля). Обе модели доступны на Hugging Face.
🟣Agnes AI: бюджетный reasoning с сильным кодингом
24 июля сингапурская Agnes AI представила Agnes 2.5 Pro Alpha — бюджетную reasoning-модель (39 баллов по Artificial Analysis Intelligence Index, контекст 1M, $ 0,45 — $ 0,90 за 1M токенов) с неожиданно сильным coding-скором (58,8) при скромном расходе токенов на рассуждения.
🟣Anthropic: Opus 5 приближается к Fable 5
24 июля Anthropic выпустила Claude Opus 5 — по цене и скорости на уровне Opus 4.8, но по интеллектуальным бенчмаркам (Frontier-Bench, ARC-AGI 3, OSWorld 2.0) приближается к Fable 5, по внутренним оценкам — самая согласованная (aligned) модель компании на сегодня.
🟣Black Forest Labs: единая модель для видео, изображений и звука
23 июля Black Forest Labs анонсировала FLUX 3 (Early Access) — мультимодальную flow-модель, обучаемую совместно на видео, изображениях и аудио в единой архитектуре. Поддерживает генерацию видео с нативным звуком до 20 секунд и первые эксперименты с action-prediction для робототехники.
🟣Google: три Gemini для агентных сценариев
21 июля Google выпустила три модели линейки Gemini: 3.6 Flash (на 17% эффективнее по токенам, чем 3.5 Flash, $ 1,50 — $ 7,50 за 1M), сверхбыстрый 3.5 Flash-Lite (350 ток/с, $ 0,3 — $ 2,5) и специализированный 3.5 Flash Cyber для поиска и патчинга уязвимостей в связке с автономным агентом CodeMender, доступ ограничен госорганизациями и партнёрами.
🟣Poolside: компактная модель против гигантов
21 июля Poolside выпустила Laguna S 2.1 — компактную MoE (118B/8B активных), обученную менее чем за 9 недель, которая на Terminal-Bench 2.1 (70,2) и других long-horizon coding-бенчмарках конкурирует с моделями на порядок крупнее. Веса открыты на Hugging Face.
🟣Moonshot AI: первая открытая модель класса 3T
16 июля Moonshot AI представила Kimi K3 — первую открытую модель класса 3T (2,8 трлн параметров) на архитектуре Kimi Delta Attention, с нативным зрением и контекстом 1M токенов. По собственным данным компании, модель уступает только Claude Fable 5 и GPT-5.6 Sol.
Новые статьи от AI VK на Хабре
🟣Как создавали нейропоиск Discovery AI — технологию для крупнейшей контентной базы в РФ
🟣Как мы подружили LLM с А/Б‑тестами: от сломанного BI до HTML‑отчётов с ИИ‑аналитиком внутри
🟣LLM и психолингвистика: HELPER
🟣Как мы ускорили разметку видеопоиска в десятки раз и не потеряли качество: опыт внедрения VLM-асессора
#aivkhub #дайджест | 849 |
| 14 | Наш коллега, ведущий исследователь AI VK Research Владимир Байкалов, вернулся из Мельбурна с конференции SIGIR 2026 и подготовил обзор интересных работ, по которым виден главный тренд 2026 года: генеративные end-to-end модели не отменили каскадные пайплайны, а нашли своё место на стадии отбора. Ранжирование всё ещё делает отдельная модель. Помимо этого, видны ещё три тенденции: рекомендательные системы уходят в мультимодальные сценарии и учатся обдумывать свой ответ. Также исследователи начинают использовать в ранжирующей модели раннее связывание с историей пользователя.
OxygenREC: An Instruction-Following Generative Framework for E-commerce Recommendation
OxygenREC построена по принципу Fast-Slow Thinking, при котором ресурсоёмкий анализ интересов пользователя и быстрый онлайн-инференс разделены на два контура:
🟣 Slow: LLM в фоновом процессе анализирует историю поведения, контекст и недавние запросы пользователя, после чего формирует инструкции, которые описывают его текущие интересы
🟣 Fast: во время онлайн-обработки запроса encoder-decoder модель использует подготовленную инструкцию с историей пользователя и генерирует рекомендуемые товары с помощью Semantic ID
Это близко к test-time scaling, но реализовано асинхронно: дополнительные вычисления расходуются не во время конкретного запроса, а фоном. Полученные инструкции модель использует без вызова LLM.
M²GR: Generative User Interest Modeling via Multi-Granularity Multi-Objective CoT for Industrial Recommendation
В этом исследовании модель учится предсказывать будущие интересы пользователя по истории взаимодействий. Вместо одного прямого прогноза она сначала определяет главные характеристики следующего объекта (категорию, бренд, цену и ключевые слова). Затем модель предсказывает, например, товар, по которому пользователь, вероятнее всего, кликнет, и на основе этого решения показывает товар, который пользователь может заказать.
Получается своеобразная цепочка рассуждений, но без перехода к текстовым объяснениям: промежуточными шагами служат атрибуты товаров и прогнозы действий пользователя. Авторы называют свой подход implicit reasoning: модель выполняет промежуточные рассуждения во внутреннем пространстве представлений. При этом в M²GR каждому шагу заранее задан понятный смысл, поэтому такая цепочка остаётся вполне управляемой и интерпретируемой.
Во время выдачи модель строит несколько возможных цепочек интересов пользователя, а их соответствие товарам-кандидатам передаётся основной модели ранжирования как дополнительный сигнал.
Pin-SCALE: Semantic Cascading and Alignment Learning for Engagement-Aware IDs in Cold-Start Recommendations
Интересной оказалась работа Pinterest об использовании Semantic ID для рекомендаций новых объектов. Здесь они применяются не для авторегрессивной генерации, а внутри классической двухбашенной модели поиска кандидатов. Поскольку отдельные Semantic ID разделяются между множеством похожих объектов, новый пин может получить часть поведенческого сигнала от уже известных системе объектов.
Авторы предлагают последовательно объединять SID-токены от более общих к более точным, учитывать при их построении не только содержание объектов, но и пользовательские взаимодействия, а также дополнительно сближать представления в башнях запроса и кандидата.
#aivkhub #recsys #конференция #sigir | 809 |
| 15 | Исследователи AI VK Research представили большой датасет VK-LSVD на The Web Conference 2026 — одной из ключевых международных конференций в сфере web science. О датасете можно почитать подробнее в нашем канале и на Хабре.
Мы подготовили обзор нескольких интересных статей, отмеченных программным комитетом конференции.
🏆 Best paper award
From Retrieval to Generation: Unifying External and Parametric Knowledge for Medical Question Answering
Работа посвящена медицинским вопросно-ответным системам на базе LLM.
В стандартном Retrieval-Augmented Generation (RAG) ответ строится с опорой на найденные в корпусе документы, тогда как Generation-Augmented Generation (GAG) использует сгенерированные LLM контекстные документы. Авторы предлагают многостадийный метод MedRGAG, который объединяет внешние и сгенерированные знания: после информационного поиска сжать его результат, определить недостающие знания, заполнить пробелы — сгенерировать соответствующие документы, выбрать из найденных и сгенерированных документов мини-корпус для контекста LLM для генерации ответа.
Авторы продемонстрировали преимущество подхода в медицинском домене, но метод очень дорогой и при замене вспомогательной языковой модели GPT-4o-mini на меньшие качество падает.
🏆 Best Short Paper Award
DualGR: Generative Retrieval with Long and Short-Term Interests Modeling
Авторы усовершенствовали генеративный retrieval для рекомендаций коротких видео и предложили три модификации стандартного генеративного пайплайна.
🟣Dual Branch Router. История пользователя делится на два окна: длинное хранит устойчивые интересы, короткое окно ловит новые. При обучении модель выбирает окно, которое точнее совпадает с coarse semantic ID целевого видео. При инференсе кандидаты генерируются сразу по обеим ветвям и объединяются в список.
🟣Search based SID Decoding. После генерации первого (грубого) semantic ID модель фильтрует историю: оставляет только действия с таким же первым ID. Например, чтобы рекомендовать видео о спорте, анализируется история просмотров только спортивных роликов, и остальная история не мешает.
🟣Exposure aware NTP Loss. Модель штрафуется за высокую вероятность первого semantic ID у показанных, но непрокликнутых видео. Штраф вводится только на первом грубом уровне: неактуальные интересы затухают быстрее, а точные semantic ID не перекрываются лишними отрицательными метками.
🏆 Seoul Test of Time Award
LINE: Large-scale information network embedding
В этой работе исследователи предложили строить embedding для вершин больших графов по методу LINE. Метод хорошо масштабируется и учитывает два типа близости: первого порядка (по рёбрам графа) и второго порядка (по схожести соседей). Оба представления обучаются отдельно и конкатенируются. Есть инженерные приёмы реализации negative sampling и edge sampling — ребро выбирается с вероятностью, пропорциональной его весу, после чего обрабатывается как бинарное.
Награда Seoul Test of Time Award особенная: её вручают за статьи, значимость которых со временем подтвердилась.
Обзор подготовил руководитель AI VK Research Александр Дьяконов.
#aivkhub #обзор #конференция | 1 039 |
| 16 | ⚡️ AI VK Research на SIGIR
Прямо сейчас в Мельбурне проходит SIGIR 2026 — одна из ключевых конференций в области информационного поиска, ML и RecSys.
Ведущий исследователь AI VK Владимир Байкалов вместе с коллегами из ИТМО представляет работу Mitigating Collaborative Semantic ID Staleness in Generative Retrieval. Подробнее о статье — здесь.
Скоро мы разберем самые интересные исследования с SIGIR 2026.
#aivkhub #recsys #конференция | 1 549 |
| 17 | Generative Recommender Systems
Классические рекомендательные системы работают по двухстадийной схеме: retrieval сужает множество кандидатов, ranking ранжирует их по релевантности. Генеративные рекомендательные системы (Generative RecSys) переосмысливают эту задачу: вместо скоринга готовых кандидатов модель генерирует представление следующего релевантного объекта.
Semantic ID — основа подхода
Обычно идентификаторы айтемов — это произвольные числа, которые не несут смысла, но в генеративном подходе их заменяют на Semantic ID — иерархические дискретные коды, полученные из кластеризации контентного и коллаборативного представлений. Семантически близкие айтемы разделяют префиксы: похожие коды отражают похожие айтемы, что позволяет переносить знания на длинный хвост и помогает при холодном старте.
Например:
03.11.22.01.85.60.01.10 — стиральная машина, фронтальная загрузка, 8 кг, 1 200 об/мин, белая
03.11.22.01.10.65.02.15 — стиральная машина, фронтальная загрузка, 10 кг, 1 400 об/мин, серебристая
03.45.10.12.00.45.01.00 — микроволновая печь, объём 20 л, мощность 800 Вт, чёрная
Как рекомендация становится генерацией
GenRecSys решают задачу рекомендаций как задачу генерации последовательностей. Существует 3 основные постановки:
🟣 Next-item prediction — модель предсказывает следующий Semantic ID из истории взаимодействий
🟣 Slate generation — модель генерирует упорядоченный список рекомендаций одной выдачей, учитывая взаимное влияние айтемов в списке
🟣 Explanation generation — модель генерирует текстовое объяснение рекомендации
Генеративный retrieval как ключевой механизм
Декодер последовательно генерирует токены Semantic ID, полученный код разрешается через ANN (Approximate Nearest Neighbor) или trie-индекс в конкретный айтем или кластер кандидатов. Sequence-to-sequence рекомендации трактуют историю пользователя как входную последовательность токенов и предсказывают следующий токен. Трансформеры здесь стали архитектурой по умолчанию: self-attention обрабатывает дальние зависимости и гетерогенные токены, декодер совмещает next-item prediction, классификацию интента и генерацию объяснений в одном backbone.
Но есть и сложности. Генерация требует гибкости, retrieval требует детерминизма и покрытия. Коллизии токенизации и ошибки декодирования резко снижают recall. Exposure bias и накапливающаяся ошибка при авторегрессивном декодировании приводят к расхождению между офлайн-метриками и реальным поведением.
Гибридный паттерн в продакшене
В промышленных системах генеративные компоненты встраиваются в существующие пайплайны как дополнительный слой. Retrieval сужает кандидатов, генеративная модель уточняет интент или переранжирует, классический ранкер обеспечивает скорость и стабильность. Чистая end-to-end генерация проигрывает обученному ранкеру на доменах с плотными историческими данными, она дороже в обслуживании и подвержена галлюцинациям.
Три фундаментальные проблемы
Полностью генеративные рекомендательные системы упираются в три открытые задачи:
1️⃣ Двухэтапный процесс оптимизации, при котором генерация Semantic ID и обучение рекомендательной модели разнесены во времени, приводит к семантическому рассинхрону между идентификаторами и финальными эмбеддингами
2️⃣ Semantic IDs отсутствуют в обучающей выборке языковых моделей на этапе претрейна, поэтому модели хуже улавливают заложенную в них семантику, что ухудшает способность к рассуждению над кодами, ограничивает обобщение и кросс-доменный перенос
3️⃣ Существует фундаментальный компромисс между экспрессивностью Semantic ID и вычислительной сложностью генерации: недостаточная длина снижает специфичность репрезентации, в то время как избыточная длина негативно влияет на стабильность декодирования и скорость инференса
Эти фундаментальные проблемы рассмотрим подробнее в следующих постах.
#aivkhub #recsys #genrecsys | 1 020 |
| 18 | Несмотря на взрывной рост рекомендательных трансформеров, генеративных рекомендаций и так далее, классические методы на основе матричных факторизаций всё ещё применяются в рекомендательных системах.
Преимущество современных подходов в том, что они позволяют работать с пользователем в долгосрочной перспективе и учитывать её при построении рекомендаций. Так делают, например, PinnerFormer, OneRec. При этом матричные факторизации обычно работают жадно: набираем top-K по похожести между эмбеддингами в данный момент времени.
Исследователи AI VK Михаил Трапезников и Максим Утушкин предложили подход, который снимает это ограничение и позволяет рекомендательным системам учитывать будущие изменения состояния пользователя.
Решение подробно изложено в статье Planning over Matrix-Factorization MDPs for Candidate Generation. Статья принята на воркшоп по Customer Journey на KDD 2026.
Подход
Исследователи работали с популярной моделью матричных факторизаций ALS (Alternating Least Squares), ориентируясь на механику обновления профилей в сервисе Profile Stream в VK. В нём эмбеддинг пользователя не просто фиксируется после обучения, а обновляется по явной формуле после каждого батча новых пользовательских взаимодействий.
Исследователи применили технику MCTS (Monte Carlo Tree Search) — представили возможные последовательности рекомендаций в виде дерева, чтобы найти путь в дереве, соответствующий оптимальной последовательности рекомендаций. Для офлайн-экспериментов при построении дерева рассматривались набор действий из top-K по близости эмбеддингов и оптимистичная среда.
Вершина дерева — текущее состояние, ветви из вершины — k возможных рекомендаций. При переходе по ветви считаем, что пользователю понравилась рекомендация (оптимистичный сценарий), попадаем в новое состояние — и там всё повторяется.
Процесс
Можно представить процесс в виде RL-среды:
🔸 Состояние — текущее эмбеддинговое представление пользователя
🔸 Действие — показ айтема пользователю
🔸 Награда — сумма близостей к понравившимся айтемам
🔸 Обновление состояния происходит согласно формулам обновления в ALS
Такое представление открывает возможность применения различных RL-подходов, которые позволяют не просто работать с сиюминутными наградами, но и планировать на несколько шагов вперёд.
В работе рассматривались датасеты MovieLens-1M, KuaiRec, Yambda и VK-LSVD. Сравнения производились под протоколами Leave-last-n и Global time split. Первый откладывает последние взаимодействия каждого пользователя, второй режет данные по глобальной временной отсечке — это ближе к проду.
Результат
➡️ На Leave-last-n планирование обходит обычный статический top-K на всех датасетах. В частности, на срезах VK-LSVD Recall@10 растёт примерно в полтора раза
➡️ На Global time split выигрыш сохраняется на MovieLens-1M и VK-LSVD
Главное, что доказало исследование — использование обучения с подкреплением поверх относительно легковесной ALS возможно. В дальнейшем планируются исследования стохастической динамики среды из логов и дистилляции агента в быструю политику в духе MuZero.
#aivkhub #rl #mcts #als | 1 565 |
| 19 | ➡️ Смотрим, как прошёл RecSys Meetup.
🟣Рассказали об исследованиях и научных разработках
🟣Представили широкой аудитории команду AI VK Research
🟣Рассказали, как работает рекомендательная платформа Discovery AI
📹 Подробности и атмосфера мероприятия — в репортаже.
Включите уведомления, чтобы не пропустить анонсы следующих митапов🤘
#aivkhub #recsys #meetup | 800 |
| 20 | ICML 2026: как бигтех переосмысливает рекомендательные системы
Продолжаем обзор конференции ICML 2026, на которой исследователь Александр Тараканов (AI VK) и коллеги из НИУ ВШЭ представили фреймворк PIEFS. Мы подробно писали об этой работе.
Мы уже рассказывали об общем тренде в развитии AI-систем, заметном по основному пулу презентаций на ICML 2026. Сегодня на примере трёх работ исследователей из Kuaishou, Meta* и Huawei рассмотрим, в каких направлениях идёт развитие RecSys.
➡️ От многоступенчатого каскада к генеративной системе
Промышленные поисковые и рекомендательные системы работают поэтапно: retrieval отбирает кандидатов, pre-ranking сокращает их число, а ranking формирует итоговый список. Каждый компонент можно настроить отдельно, но весь каскад будет сложным в разработке и эксплуатации.
В бигтехе ищут способы упростить и оптимизировать промышленный пайплайн, поэтому кейс с внедрением генеративной системы OneSearch в поисковые сценарии Kuaishou вызвал огромный интерес.
Команда проекта предложила строить иерархические Semantic ID, сочетая RQ-Kmeans для общей семантики айтема и OPQ-кодирование его отличительных признаков, при этом учитывая историю пользователя. О том, как работает Semantic ID в генеративных рекомендациях, мы уже рассказывали в посте об исследовании Владимира Байкалова (AI VK). OneSearch показывает, как этот подход переносится в промышленную систему. После внедрения продуктовые метрики улучшились, а операционные затраты сократились на 75,4%.
➡️ От увеличения модели к проектированию данных
В работе Meta* Principled Synthetic Data Enables the First Scaling Laws for LLMs in Recommendation исследователи доказали, что масштабирование RecSys зависит не только от размера модели и объёма вычислений, но и от структуры обучающих данных.
Вместо сырых пользовательских логов LLM формируют структурированный синтетический curriculum — программу обучения, которая последовательно знакомит модель с содержанием объектов, коллаборативными связями между ними и последовательностями взаимодействий пользователей.
Синтетические истории создаются на графе связей между объектами, поэтому меньше зависят от прежней политики показа, позиционных эффектов и других артефактов. На таких данных исследователи обнаружили устойчивые scaling laws для моделей размером от 0,6 до 8 млрд параметров, обученных на объёме до 163 млрд токенов.
➡️ Может ли рекомендательная система обучать сама себя?
В работе от Huawei и USTC Can Recommender Systems Teach Themselves? A Recursive Self-Improving Framework with Fidelity Control исследователи сосредоточились на RSIR — замкнутом цикле самоулучшения рекомендательной системы.
RSIR использует обычную sequential recommendation model как авторегрессионный генератор. По реальному началу пользовательской истории модель последовательно предсказывает новые объекты и формирует дополнительные синтетические траектории взаимодействий.
Затем механизм fidelity control оставляет только те траектории, которые не противоречат известному поведению пользователя: после добавления синтетических объектов модель должна по-прежнему хорошо предсказывать реальные элементы из продолжения истории пользователя. Отфильтрованные последовательности добавляются к исходным данным, и на расширенном датасете обучается следующая версия модели.
Абляционные эксперименты показывают, что fidelity control — ключевой элемент RSIR. Без фильтрации синтетических историй модель на следующих итерациях накапливает собственные ошибки и теряет качество. Но с контролем согласованности рекурсивное обучение стабильно улучшает работу системы, а именно метрики NDCG и Recall.
Итог
ICML 2026 показывает, что исследователей RecSys интересуют не только отдельные ранжирующие модели.
Проекты сосредоточены на дизайне архитектуры, которая будет эффективно обучаться и масштабироваться, не накапливая ошибок. Исследователи объединяют компоненты промышленного пайплайна, проектируют данные для масштабирования и используют предсказания уже обученной модели как дополнительный обучающий сигнал.
* Организация Meta признана экстремистской на территории РФ | 1 311 |
