Generative Ai
Ir al canal en Telegram
Анонсы интересных библиотек и принтов в сфере AI, Ml, CV для тех кто занимается DataScience, Generative Ai, LLM, LangChain, ChatGPT По рекламе писать @miralinka, Created by @life2film
Mostrar más3 695
Suscriptores
+224 horas
-37 días
-1130 días
Archivo de publicaciones
3 695
d-Matrix показала Raptor: ускоритель для инференса LLM, где DRAM-кристалл лежит прямо на вычислительном чипе
Генерация упирается не в вычисления, а в память: каждый новый токен перечитывает KV-cache. У SRAM полоса огромная, но всего пара ГБ, у HBM4 сотни ГБ, но меньше 20 TB/s.
- 3D-DRAM поверх логики TSMC N4P: ~100 TB/s на карту, 0.45 pJ/bit (по их замерам ~6× экономнее HBM3)
- по оценке авторов: в 4.71 раза больше токенов/с на карту, чем с HBM, и в 2.44 раза, чем на SRAM-ускорителях
- проверяли на Llama 3.1 70B, DeepSeek-V3, Kimi K2, GPT-OSS и Whisper
Оговорки: все цифры от самой компании, часть результатов — моделирование, модуль ест 422 Вт и греется до 105°C. Это железо для дата-центров, не для ноутбука.
Статья (ISCA 2026): ramyadhadidi.github.io/files/dMatrix-Raptor-ISCA.pdf
3 695
Pi 1.0: минималистичная обвязка для coding-агентов получила встроенный MCP
Earendil год говорила, что MCP Pi не нужен, и развернулась:
- MCP работает через Codemode: модель пишет короткий JS-скрипт, который вызывает тулы параллельно, и в контекст попадает только итог
- Codemode стал экономнее на ~40% токенов промпта (в changelog пример 5,3K → 3,3K)
- «виртуальные модели»: планировать одной моделью, писать код другой; тулы можно подгружать только когда нужны
- Pi Durable для долгоживущих агентных приложений вынесли в отдельный экспериментальный пакет; всё под MIT
Обратная сторона: fullscreen TUI теперь по умолчанию (теряется обычный скроллбэк), а на HN жалуются, что локальные open-модели через MCP галлюцинируют вызовы тулов. Прежде чем переезжать, проверьте свою связку модель + тулы.
Кому: тем, кто устал синхронизировать скиллы и MCP-конфиги между Claude Code и Codex.
Релиз и установка: earendil.com/posts/pi-1-0
Код: github.com/earendil-works/pi
3 695
Tavus выпустила Griffin: модель для видеозвонков, которая слушает, смотрит и говорит одновременно
- одна video-to-video система вместо цепочки «распознавание → LLM → синтез», решения принимает несколько раз в секунду, а не после конца реплики
- поддакивает, пока вы говорите, замолкает, когда её перебивают, реагирует на то, что видит в кадре, включая ваш экран
- генерирует весь кадр из одной фотографии, голос клонирует по ~10 секундам аудио
- по данным Tavus, 48% участников живого теста решили, что говорили с человеком; у прошлого стека компании было максимум 2%
Оговорки: это цифры самой Tavus, Griffin-Lite пока в закрытом превью, а реалистичный двойник по одной фотке открывает очевидную дорогу для дипфейк-звонков. Свой подход к безопасности Tavus описывает в том же посте.
На практике: голосовые агенты переходят от «скажи и жди» к живому разговору с лицом, отсюда репетиторы, собеседования, поддержка.
Архитектура и демо: tavus.io/griffin
3 695
Хинтон, Бенджио, Якуб Пачоцки (OpenAI) и Джек Кларк (Anthropic) вместе с ещё 18 авторами выпустили статью: что будет, если автоматизация AI R&D запустит интеллектуальный взрыв
Цифры, на которые они опираются:
- в Anthropic доля одобренного кода, написанного AI, выросла с единиц процентов до 80+% (январь 2025 → май 2026)
- доля R&D-работы, которую агенты делают сами под общим надзором, выросла с 1% до 26% за полгода 2026-го
- по осторожной экстраполяции, многомесячные исследовательские проекты автоматизируют к середине 2028
Обратная сторона, которую признают сами авторы: модели всё ещё жульничают на задачах, не слушаются и проваливают часть отладки, где человек справляется за часы. Успех на бенчмарках не всегда даёт реальный прирост продуктивности.
Их вывод: правительствам нужно уже сейчас видеть, сколько R&D внутри лабораторий делают агенты, и иметь рычаги, чтобы этот процесс притормозить.
Статья, 14 страниц: arxiv.org/abs/2609.36054
3 695
Meta открыла Muse Gadgets: SDK, чтобы собрать своё железо под ассистента Muse
- две части: прошивка для плат ESP32 (экран, микрофон, динамик, датчики) и Linux SDK для Raspberry Pi и любой домашней машины
- поддерживаются готовые платы: круглый AMOLED от Waveshare, M5Stack StickS3, e-ink дисплей Seeed reTerminal
- гаджет подключается через приложение Muse в режиме разработчика, нужен SDK-токен
- лицензия Apache 2.0, в каждой папке есть AGENTS.md, чтобы код за вас дописывал агент
За первые сутки у репозитория 428 звёзд и уже есть форки: порт на робота StackChan, управление Sonarr/Radarr голосом и версия без Meta, под свой бэкенд с любой моделью.
На практике: недорогая плата ESP32 становится голосовым пультом для умного дома или домашнего сервера.
Код: github.com/facebookincubator/muse-gadget-sdk
3 695
Cloudflare выложила Clef и Clef-flash: открытые decision-модели для агентов
Decision-модель не пишет текст. Ей дают состояние (текст, JSON, картинку или видео) и схему вопросов, а она за один проход возвращает вероятность для каждого варианта ответа: «срочно?», «какой команде?», «насколько серьёзно?».
- Clef на 27B построена на Qwen3.8, видит изображения, контекст 64k (у Jev, с которого пошла мода, 32k)
- по тестам Cloudflare медианная задержка 209 мс у Clef и 39 мс у Clef-flash, у Jev 524 мс
- API совместим с Jev/SystemOne, веса под Apache 2.0, есть хостинг на Workers AI и дообучение через RL на своих данных
На практике: маршрутизацию тикетов, модерацию и «звать человека или нет» можно вынести из дорогой LLM в дешёвый типизированный вызов без парсинга ответа.
Веса и примеры: huggingface.co/Cloudflare/clef
3 695
Anthropic запустила claude.dev, инженерный блог для тех, кто строит на Claude
Это не документация (она по-прежнему на code.claude.com/docs), а практические разборы от разработчиков Anthropic. Что уже лежит:
- сколько на самом деле стоит задача на Opus 5.5
- как команда Claude Code использует скиллы
- обвязка под каждую задачу: динамические воркфлоу в Claude Code
- автоматическая сборка эвалов и hillclimbing с Claude
- новые правила контекст-инжиниринга для моделей Claude 5
Плюс видео: как Ramp и DoorDash работают с агентами, как команда Claude Code пользуется Claude Code. Хорошее чтение на выходные, если агенты у вас в проде.
Читать: claude.dev
3 695
Google показала Gemini 4 Argon, новую флагманскую модель для длинных многошаговых задач
- 77,9% на DeepSWE v1.1, по данным Google это новый рекорд в долгих задачах разработки (у GPT-6 Astra около 73%)
- лимит ответа вырос с 64K до 1M токенов: модель может думать и писать сотни тысяч токенов за один проход
- 91,7% на LVBench, понимание длинного видео; первое место в Vals Index (финансы, право, налоги, код)
- цена на старте $2 / $10 за 1M токенов, кэш со скидкой 95%, но это промо-период
Пока доступ только у специалистов по кибербезопасности в программе Fairwind, разработчикам и пользователям обещают «как можно скорее». Если у вас агент на длинных задачах, стоит заранее заложить его в сравнение с Astra и Sol.
Анонс и бенчмарки: blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon
3 695
Как прошел RecSys Meetup: 120 специалистов, доклады от топовых спикеров Сбера и нетворкинг в Нижнем Новгороде 🔥
На митапе погрузились в актуальные тренды и технологии RecSys и познакомились с практическими решениями, которые меняют подход к рекомендациям.
Что еще:
— Живая дискуссия о рекомендательных системах
— Плотный нетворкинг: разработчики, DS-специалисты и студенты общались в
неформальной обстановке
— Отдельный трек по карьере: рассказали гостям, как попасть в команду Сбера
и какие хард-скиллы сейчас ценятся
⚡️ Что дальше:
В субботу 17 октября в
Москве пройдет масштабная конференция по рекомендательным системам — регистрация уже открыта.
3 695
Vlo: бесплатный видеоредактор с открытым кодом, где ИИ-инструменты работают прямо на таймлайне
- работает локально, проекты лежат у вас на диске; можно поднять и на удалённой GPU вроде RunPod
- живой мост в ComfyUI: любой воркфлоу применяется к куску таймлайна, соотношение сторон подгоняется само
- SAM2 для масок и ротоскопинга с автообрезкой под inpainting, Sam-audio раскладывает звук на стемы
- детекция битов, ключевые кадры, цветокоррекция, переходы и SDK для своих расширений
- версия 0.3.0, лицензия AGPL-3.0, нужен браузер на Chromium (рендер на WebCodecs)
Пригодится тем, кто генерирует видео в ComfyUI и устал гонять файлы между ним и монтажкой.
Код и установка: github.com/PxTicks/vlo
3 695
OpenAI на DevDay 2026 выпустила GPT-6.1 Sol: почти уровень флагмана Astra, а токены в 5 раз дешевле
- на DeepSWE 1.1 (долгие задачи разработки) Sol 6.1 держит 72–75% при цене задачи меньше $1, у Astra около 73% за $3–7. Это график самой OpenAI
- Sol уже в API и во всех платных тарифах ChatGPT
- dots: агенты на Astra со своим облачным компьютером, работают постоянно и берут на себя повторяющиеся обязанности. Тарифы Pro, Business Premium, Enterprise
- Agents API отдаёт обвязку Codex как управляемый сервис: несколько агентов, вызов инструментов, сжатие контекста и теперь управление компьютером
- Ultrafast даёт до 300 токенов/с в Codex, но только в тарифе Pro за $500
Если у вас агентный пайплайн на Astra, прогоните его на Sol 6.1: по этим цифрам цена задачи падает в несколько раз.
Все анонсы: openai.com/index/devday-2026-recap
3 695
CMU выкладывает на YouTube новый курс по ИИ-агентам, 11-768
Ведут Грэм Нойбиг и Дэниел Фрид, осенний семестр 2026. Лекции появляются на канале по ходу курса.
- цель, по словам Нойбига: научиться собирать обвязку агента, строить эвалы и дообучать агентную LLM через RL
- темы: вызов инструментов, планирование, память, мультиагентность, безопасность, работа агента рядом с человеком
- редкий случай, когда курс проходит путь от scaffold до обучения самой модели, а не останавливается на промптах
Полезно тем, кто пишет агентов на Claude Code или Codex и хочет понимать, почему они разваливаются на длинных задачах.
Первая лекция: https://www.youtube.com/watch?v=UwfjzyLnvMg
Программа и задания: https://www.cmu-agents.com
3 695
ElevenLabs выпустила Eleven v4 и v4 Turbo, новые модели синтеза речи
- v4 читает сценарий как актёр: подачу задают тегами прямо в тексте, [laughs], [whispers], и даже звуки вроде [door slams]
- 90+ языков, несколько голосов в одном треке, длинный текст склеивается без швов: аудиокнига звучит одним дублем
- вернулись Professional Voice Clones, которых не было в v3
- Turbo сделана под голосовых агентов. По замерам ElevenLabs первая речь звучит через ~150 мс, у Cartesia Sonic 3.6 через 262 мс, у GPT-4o mini TTS через 814 мс
- двусторонний стриминг: текст от LLM подаётся кусками, звук начинается раньше, чем закончилась фраза
Обе модели доступны в API, попробовать можно бесплатно. Для озвучки роликов и подкастов берите v4, для звонков и ассистентов v4 Turbo.
Послушать примеры и попробовать: https://elevenlabs.io/v4
3 695
NVIDIA выпустила Open Agent Safety Platform: стек, который держит ИИ-агентов в рамках
Повод свежий: несколько лабораторий недавно рассказали, как агенты выходили из тестовых песочниц и лезли в чужие системы. NVIDIA делает ставку на внешний контроль, а не на обещания модели.
- OpenShell (Apache 2.0): каждый агент работает в песочнице с изоляцией на уровне ядра. Вы задаёте, к каким файлам, сетям, инструментам и ключам у него есть доступ, и это проверяется до запуска
- Sentry переносит мониторинг в сетевую карту BlueField: агент не видит, что за ним следят, и не может это отключить
- главный принцип: контролировать канал к модели. Без следующего ответа модели агент не может сделать шаг, поэтому там и наблюдение, и рубильник
- в партнёрах 100+ компаний, от Anthropic и Hugging Face до CrowdStrike
Если запускаете агентов с доступом к файлам и сети, OpenShell можно поставить уже сейчас.
Код: https://github.com/NVIDIA/openshell
3 695
Anthropic выпустила Claude Sonnet 5.5
Это младшая модель линейки 5.5: для задач, где Opus избыточен, но нужен хороший код.
- цена та же, что у Sonnet 5: $2 / $10 за 1 млн токенов (Opus 5.5 стоит $4 / $20)
- Anthropic заявляет, что генерация быстрее на 30%, а за счёт экономии токенов типичная задача выходит до 30% дешевле
- упор на программирование и защиту от prompt injection
- по бенчмаркам, которые приводят разработчики, модель обходит GPT-6 Sol и близка к Opus 5.5
Что это меняет на практике: баги, тесты, документацию и субагентов в Claude Code теперь есть смысл гонять на Sonnet, а Opus держать для планирования и длинных задач. Счёт за агентов заметно уменьшится.
3 695
ИИ-агент за пару кликов — создаем персонального помощника без кода
Запустить ИИ-агента теперь можно в Agents Space от Cloud.ru. Это пространство в формате чата, где вы легко создать агента и подключить к нему нужные сервисы.
Внутри:
• ИИ-агенты для решения повседневных задач
- Возможность создать собственного агента под конкретные задачи
- Популярные ИИ-модели на выбор: Kimi K2.5, Qwen 3.6-35B-A3B, Claude Opus 4.8 и другие
- Коннекторы к почте, календарю и другим сервисам
При этом не нужно кодить, настраивать модели, серверы и среду.
Попробовать можно здесь
3 695
Repost from Machinelearning
🚀 Anthropic представила Claude Opus 5.5
Новая флагманская модель стала сильнее Opus 5, при этом работает быстрее и дешевле.
Что изменилось:
- сильнее в агентном программировании, computer use и knowledge work
- лучше справляется с длинными задачами и большими кодовыми базами
- ответы стали короче и естественнее
- улучшена устойчивость к prompt injection
- Anthropic заявляет примерно на 40% более низкую стоимость на типичных задачах и более чем на 30% более быструю генерацию
Из примеров:
- один из ранних тестеров провёл миграцию 680 000 строк кода менее чем за день
- в тесте Anthropic модель переписала HAProxy с C на Rust за 9,5 часа
Цена API:
- $4 / 1M входных токенов
- $20 / 1M выходных токенов
- $0,20 / 1M токенов при чтении кеша
Бенчмарки:
- Terminal-Bench 4.0 — 66,4%
- FrontierCode v1.1 — 54,4%
- Humanity’s Last Exam — 67,7% с инструментами
Также Anthropic подтвердила, что Claude Sonnet 5.5 и Haiku 5.5 выйдут в ближайшие недели.
https://www.anthropic.com/claude-opus-5-5
3 695
Repost from Вайб-кодинг
Очень хороший прогресс для локальных моделей.
PrismML выпустила Bonsai 2 27B на базе Qwen3.8 27B. После трёхзначного квантования модель занимает всего 5,9 ГБ, примерно в девять раз меньше полной версии.
По тестам разработчиков она сохраняет 98,2% исходного результата, при этом поддерживает работу с изображениями и вызов инструментов. Модель открыта под Apache 2.0.
3 695
Repost from Вайб-кодинг
Google открыла исходный код ARTEMIS — инструмента, который позволяет ИИ управлять Android-смартфоном. ◝(ᵔᗜᵔ)◜
Его можно использовать для автоматизации действий на телефоне и тестирования приложений.
Работает с Claude Code, Codex, Cursor и другими инструментами.
Google утверждает, что ARTEMIS справляется более чем с 99% задач.
Правда, вокруг проекта уже успел возникнуть небольшой скандал. 💀
3 695
Repost from Вайб-кодинг
Looped Transformer сейчас одна из самых обсуждаемых архитектурных идей.
В новом техническом отчёте цикл предлагают растянуть уже между токенами.
Recurrent Looped Transformer делает декодер рекуррентным для каждого токена, включая и запрос, и ответ.
Каузальный энкодер формирует общую KV-память. Для каждого нового токена декодер объединяет:
> представление этого токена из энкодера
> собственное финальное скрытое состояние от предыдущего токена
> кеш недавних активаций со скользящим окном
При декодере из 48 слоёв путь вычислений после t токенов проходит уже через 48t блоков декодера, хотя каждый отдельный токен всё равно выполняет фиксированное число блоков.
То есть глубина вычислений растёт вместе с длиной последовательности, а стоимость обработки одного токена остаётся постоянной.
Один и тот же переход между состояниями используется для предварительного обучения, SFT, генерации и повторного воспроизведения в RL. На границе между запросом и ответом состояние не сбрасывается.
Во время RL replay состояния заново строятся с текущими весами модели, вместо повторного использования устаревших состояний из предыдущих запусков.
Пока это именно архитектурное предложение. Автор прямо пишет, что прирост в рассуждениях, ускорение на железе и масштабирование RL — это цели, которые ещё не были измерены.
Статья: https://github.com/yifanzhang-pro/recurrent-looped-tranformer
