fa
Feedback
Generative Ai

Generative Ai

رفتن به کانال در Telegram

Анонсы интересных библиотек и принтов в сфере AI, Ml, CV для тех кто занимается DataScience, Generative Ai, LLM, LangChain, ChatGPT По рекламе писать @miralinka, Created by @life2film

نمایش بیشتر
3 695
مشترکین
+224 ساعت
-37 روز
-1130 روز
آرشیو پست ها
d-Matrix показала Raptor: ускоритель для инференса LLM, где DRAM-кристалл лежит прямо на вычислительном чипе Генерация упирае
d-Matrix показала Raptor: ускоритель для инференса LLM, где DRAM-кристалл лежит прямо на вычислительном чипе Генерация упирается не в вычисления, а в память: каждый новый токен перечитывает KV-cache. У SRAM полоса огромная, но всего пара ГБ, у HBM4 сотни ГБ, но меньше 20 TB/s. - 3D-DRAM поверх логики TSMC N4P: ~100 TB/s на карту, 0.45 pJ/bit (по их замерам ~6× экономнее HBM3) - по оценке авторов: в 4.71 раза больше токенов/с на карту, чем с HBM, и в 2.44 раза, чем на SRAM-ускорителях - проверяли на Llama 3.1 70B, DeepSeek-V3, Kimi K2, GPT-OSS и Whisper Оговорки: все цифры от самой компании, часть результатов — моделирование, модуль ест 422 Вт и греется до 105°C. Это железо для дата-центров, не для ноутбука. Статья (ISCA 2026): ramyadhadidi.github.io/files/dMatrix-Raptor-ISCA.pdf

Pi 1.0: минималистичная обвязка для coding-агентов получила встроенный MCP Earendil год говорила, что MCP Pi не нужен, и разв
Pi 1.0: минималистичная обвязка для coding-агентов получила встроенный MCP Earendil год говорила, что MCP Pi не нужен, и развернулась: - MCP работает через Codemode: модель пишет короткий JS-скрипт, который вызывает тулы параллельно, и в контекст попадает только итог - Codemode стал экономнее на ~40% токенов промпта (в changelog пример 5,3K → 3,3K) - «виртуальные модели»: планировать одной моделью, писать код другой; тулы можно подгружать только когда нужны - Pi Durable для долгоживущих агентных приложений вынесли в отдельный экспериментальный пакет; всё под MIT Обратная сторона: fullscreen TUI теперь по умолчанию (теряется обычный скроллбэк), а на HN жалуются, что локальные open-модели через MCP галлюцинируют вызовы тулов. Прежде чем переезжать, проверьте свою связку модель + тулы. Кому: тем, кто устал синхронизировать скиллы и MCP-конфиги между Claude Code и Codex. Релиз и установка: earendil.com/posts/pi-1-0 Код: github.com/earendil-works/pi

Tavus выпустила Griffin: модель для видеозвонков, которая слушает, смотрит и говорит одновременно - одна video-to-video систе
Tavus выпустила Griffin: модель для видеозвонков, которая слушает, смотрит и говорит одновременно - одна video-to-video система вместо цепочки «распознавание → LLM → синтез», решения принимает несколько раз в секунду, а не после конца реплики - поддакивает, пока вы говорите, замолкает, когда её перебивают, реагирует на то, что видит в кадре, включая ваш экран - генерирует весь кадр из одной фотографии, голос клонирует по ~10 секундам аудио - по данным Tavus, 48% участников живого теста решили, что говорили с человеком; у прошлого стека компании было максимум 2% Оговорки: это цифры самой Tavus, Griffin-Lite пока в закрытом превью, а реалистичный двойник по одной фотке открывает очевидную дорогу для дипфейк-звонков. Свой подход к безопасности Tavus описывает в том же посте. На практике: голосовые агенты переходят от «скажи и жди» к живому разговору с лицом, отсюда репетиторы, собеседования, поддержка. Архитектура и демо: tavus.io/griffin

Хинтон, Бенджио, Якуб Пачоцки (OpenAI) и Джек Кларк (Anthropic) вместе с ещё 18 авторами выпустили статью: что будет, если ав
Хинтон, Бенджио, Якуб Пачоцки (OpenAI) и Джек Кларк (Anthropic) вместе с ещё 18 авторами выпустили статью: что будет, если автоматизация AI R&D запустит интеллектуальный взрыв Цифры, на которые они опираются: - в Anthropic доля одобренного кода, написанного AI, выросла с единиц процентов до 80+% (январь 2025 → май 2026) - доля R&D-работы, которую агенты делают сами под общим надзором, выросла с 1% до 26% за полгода 2026-го - по осторожной экстраполяции, многомесячные исследовательские проекты автоматизируют к середине 2028 Обратная сторона, которую признают сами авторы: модели всё ещё жульничают на задачах, не слушаются и проваливают часть отладки, где человек справляется за часы. Успех на бенчмарках не всегда даёт реальный прирост продуктивности. Их вывод: правительствам нужно уже сейчас видеть, сколько R&D внутри лабораторий делают агенты, и иметь рычаги, чтобы этот процесс притормозить. Статья, 14 страниц: arxiv.org/abs/2609.36054

Meta открыла Muse Gadgets: SDK, чтобы собрать своё железо под ассистента Muse - две части: прошивка для плат ESP32 (экран, ми
Meta открыла Muse Gadgets: SDK, чтобы собрать своё железо под ассистента Muse - две части: прошивка для плат ESP32 (экран, микрофон, динамик, датчики) и Linux SDK для Raspberry Pi и любой домашней машины - поддерживаются готовые платы: круглый AMOLED от Waveshare, M5Stack StickS3, e-ink дисплей Seeed reTerminal - гаджет подключается через приложение Muse в режиме разработчика, нужен SDK-токен - лицензия Apache 2.0, в каждой папке есть AGENTS.md, чтобы код за вас дописывал агент За первые сутки у репозитория 428 звёзд и уже есть форки: порт на робота StackChan, управление Sonarr/Radarr голосом и версия без Meta, под свой бэкенд с любой моделью. На практике: недорогая плата ESP32 становится голосовым пультом для умного дома или домашнего сервера. Код: github.com/facebookincubator/muse-gadget-sdk

Cloudflare выложила Clef и Clef-flash: открытые decision-модели для агентов Decision-модель не пишет текст. Ей дают состояние (текст, JSON, картинку или видео) и схему вопросов, а она за один проход возвращает вероятность для каждого варианта ответа: «срочно?», «какой команде?», «насколько серьёзно?». - Clef на 27B построена на Qwen3.8, видит изображения, контекст 64k (у Jev, с которого пошла мода, 32k) - по тестам Cloudflare медианная задержка 209 мс у Clef и 39 мс у Clef-flash, у Jev 524 мс - API совместим с Jev/SystemOne, веса под Apache 2.0, есть хостинг на Workers AI и дообучение через RL на своих данных На практике: маршрутизацию тикетов, модерацию и «звать человека или нет» можно вынести из дорогой LLM в дешёвый типизированный вызов без парсинга ответа. Веса и примеры: huggingface.co/Cloudflare/clef

Anthropic запустила claude.dev, инженерный блог для тех, кто строит на Claude Это не документация (она по-прежнему на code.cl
Anthropic запустила claude.dev, инженерный блог для тех, кто строит на Claude Это не документация (она по-прежнему на code.claude.com/docs), а практические разборы от разработчиков Anthropic. Что уже лежит: - сколько на самом деле стоит задача на Opus 5.5 - как команда Claude Code использует скиллы - обвязка под каждую задачу: динамические воркфлоу в Claude Code - автоматическая сборка эвалов и hillclimbing с Claude - новые правила контекст-инжиниринга для моделей Claude 5 Плюс видео: как Ramp и DoorDash работают с агентами, как команда Claude Code пользуется Claude Code. Хорошее чтение на выходные, если агенты у вас в проде. Читать: claude.dev

Google показала Gemini 4 Argon, новую флагманскую модель для длинных многошаговых задач - 77,9% на DeepSWE v1.1, по данным Go
Google показала Gemini 4 Argon, новую флагманскую модель для длинных многошаговых задач - 77,9% на DeepSWE v1.1, по данным Google это новый рекорд в долгих задачах разработки (у GPT-6 Astra около 73%) - лимит ответа вырос с 64K до 1M токенов: модель может думать и писать сотни тысяч токенов за один проход - 91,7% на LVBench, понимание длинного видео; первое место в Vals Index (финансы, право, налоги, код) - цена на старте $2 / $10 за 1M токенов, кэш со скидкой 95%, но это промо-период Пока доступ только у специалистов по кибербезопасности в программе Fairwind, разработчикам и пользователям обещают «как можно скорее». Если у вас агент на длинных задачах, стоит заранее заложить его в сравнение с Astra и Sol. Анонс и бенчмарки: blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon

Как прошел RecSys Meetup: 120 специалистов, доклады от топовых спикеров Сбера и нетворкинг в Нижнем Новгороде 🔥 На митапе погрузились в актуальные тренды и технологии RecSys и познакомились с практическими решениями, которые меняют подход к рекомендациям. Что еще: — Живая дискуссия о рекомендательных системах — Плотный нетворкинг: разработчики, DS-специалисты и студенты общались в неформальной обстановке — Отдельный трек по карьере: рассказали гостям, как попасть в команду Сбера и какие хард-скиллы сейчас ценятся ⚡️ Что дальше: В субботу 17 октября в Москве пройдет масштабная конференция по рекомендательным системам — регистрация уже открыта.

Vlo: бесплатный видеоредактор с открытым кодом, где ИИ-инструменты работают прямо на таймлайне - работает локально, проекты л
Vlo: бесплатный видеоредактор с открытым кодом, где ИИ-инструменты работают прямо на таймлайне - работает локально, проекты лежат у вас на диске; можно поднять и на удалённой GPU вроде RunPod - живой мост в ComfyUI: любой воркфлоу применяется к куску таймлайна, соотношение сторон подгоняется само - SAM2 для масок и ротоскопинга с автообрезкой под inpainting, Sam-audio раскладывает звук на стемы - детекция битов, ключевые кадры, цветокоррекция, переходы и SDK для своих расширений - версия 0.3.0, лицензия AGPL-3.0, нужен браузер на Chromium (рендер на WebCodecs) Пригодится тем, кто генерирует видео в ComfyUI и устал гонять файлы между ним и монтажкой. Код и установка: github.com/PxTicks/vlo

OpenAI на DevDay 2026 выпустила GPT-6.1 Sol: почти уровень флагмана Astra, а токены в 5 раз дешевле - на DeepSWE 1.1 (долгие
OpenAI на DevDay 2026 выпустила GPT-6.1 Sol: почти уровень флагмана Astra, а токены в 5 раз дешевле - на DeepSWE 1.1 (долгие задачи разработки) Sol 6.1 держит 72–75% при цене задачи меньше $1, у Astra около 73% за $3–7. Это график самой OpenAI - Sol уже в API и во всех платных тарифах ChatGPT - dots: агенты на Astra со своим облачным компьютером, работают постоянно и берут на себя повторяющиеся обязанности. Тарифы Pro, Business Premium, Enterprise - Agents API отдаёт обвязку Codex как управляемый сервис: несколько агентов, вызов инструментов, сжатие контекста и теперь управление компьютером - Ultrafast даёт до 300 токенов/с в Codex, но только в тарифе Pro за $500 Если у вас агентный пайплайн на Astra, прогоните его на Sol 6.1: по этим цифрам цена задачи падает в несколько раз. Все анонсы: openai.com/index/devday-2026-recap

CMU выкладывает на YouTube новый курс по ИИ-агентам, 11-768 Ведут Грэм Нойбиг и Дэниел Фрид, осенний семестр 2026. Лекции поя
CMU выкладывает на YouTube новый курс по ИИ-агентам, 11-768 Ведут Грэм Нойбиг и Дэниел Фрид, осенний семестр 2026. Лекции появляются на канале по ходу курса. - цель, по словам Нойбига: научиться собирать обвязку агента, строить эвалы и дообучать агентную LLM через RL - темы: вызов инструментов, планирование, память, мультиагентность, безопасность, работа агента рядом с человеком - редкий случай, когда курс проходит путь от scaffold до обучения самой модели, а не останавливается на промптах Полезно тем, кто пишет агентов на Claude Code или Codex и хочет понимать, почему они разваливаются на длинных задачах. Первая лекция: https://www.youtube.com/watch?v=UwfjzyLnvMg Программа и задания: https://www.cmu-agents.com

ElevenLabs выпустила Eleven v4 и v4 Turbo, новые модели синтеза речи - v4 читает сценарий как актёр: подачу задают тегами пря
ElevenLabs выпустила Eleven v4 и v4 Turbo, новые модели синтеза речи - v4 читает сценарий как актёр: подачу задают тегами прямо в тексте, [laughs], [whispers], и даже звуки вроде [door slams] - 90+ языков, несколько голосов в одном треке, длинный текст склеивается без швов: аудиокнига звучит одним дублем - вернулись Professional Voice Clones, которых не было в v3 - Turbo сделана под голосовых агентов. По замерам ElevenLabs первая речь звучит через ~150 мс, у Cartesia Sonic 3.6 через 262 мс, у GPT-4o mini TTS через 814 мс - двусторонний стриминг: текст от LLM подаётся кусками, звук начинается раньше, чем закончилась фраза Обе модели доступны в API, попробовать можно бесплатно. Для озвучки роликов и подкастов берите v4, для звонков и ассистентов v4 Turbo. Послушать примеры и попробовать: https://elevenlabs.io/v4

NVIDIA выпустила Open Agent Safety Platform: стек, который держит ИИ-агентов в рамках Повод свежий: несколько лабораторий нед
NVIDIA выпустила Open Agent Safety Platform: стек, который держит ИИ-агентов в рамках Повод свежий: несколько лабораторий недавно рассказали, как агенты выходили из тестовых песочниц и лезли в чужие системы. NVIDIA делает ставку на внешний контроль, а не на обещания модели. - OpenShell (Apache 2.0): каждый агент работает в песочнице с изоляцией на уровне ядра. Вы задаёте, к каким файлам, сетям, инструментам и ключам у него есть доступ, и это проверяется до запуска - Sentry переносит мониторинг в сетевую карту BlueField: агент не видит, что за ним следят, и не может это отключить - главный принцип: контролировать канал к модели. Без следующего ответа модели агент не может сделать шаг, поэтому там и наблюдение, и рубильник - в партнёрах 100+ компаний, от Anthropic и Hugging Face до CrowdStrike Если запускаете агентов с доступом к файлам и сети, OpenShell можно поставить уже сейчас. Код: https://github.com/NVIDIA/openshell

Anthropic выпустила Claude Sonnet 5.5 Это младшая модель линейки 5.5: для задач, где Opus избыточен, но нужен хороший код. - цена та же, что у Sonnet 5: $2 / $10 за 1 млн токенов (Opus 5.5 стоит $4 / $20) - Anthropic заявляет, что генерация быстрее на 30%, а за счёт экономии токенов типичная задача выходит до 30% дешевле - упор на программирование и защиту от prompt injection - по бенчмаркам, которые приводят разработчики, модель обходит GPT-6 Sol и близка к Opus 5.5 Что это меняет на практике: баги, тесты, документацию и субагентов в Claude Code теперь есть смысл гонять на Sonnet, а Opus держать для планирования и длинных задач. Счёт за агентов заметно уменьшится.

ИИ-агент за пару кликов — создаем персонального помощника без кода Запустить ИИ-агента теперь можно в Agents Space от Cloud.r
+3
ИИ-агент за пару кликов — создаем персонального помощника без кода Запустить ИИ-агента теперь можно в Agents Space от Cloud.ru. Это пространство в формате чата, где вы легко создать агента и подключить к нему нужные сервисы. Внутри: • ИИ-агенты для решения повседневных задач - Возможность создать собственного агента под конкретные задачи - Популярные ИИ-модели на выбор: Kimi K2.5, Qwen 3.6-35B-A3B, Claude Opus 4.8 и другие - Коннекторы к почте, календарю и другим сервисам При этом не нужно кодить, настраивать модели, серверы и среду. Попробовать можно здесь

Repost from Machinelearning
🚀 Anthropic представила Claude Opus 5.5 Новая флагманская модель стала сильнее Opus 5, при этом работает быстрее и дешевле.
🚀 Anthropic представила Claude Opus 5.5 Новая флагманская модель стала сильнее Opus 5, при этом работает быстрее и дешевле. Что изменилось: - сильнее в агентном программировании, computer use и knowledge work - лучше справляется с длинными задачами и большими кодовыми базами - ответы стали короче и естественнее - улучшена устойчивость к prompt injection - Anthropic заявляет примерно на 40% более низкую стоимость на типичных задачах и более чем на 30% более быструю генерацию Из примеров: - один из ранних тестеров провёл миграцию 680 000 строк кода менее чем за день - в тесте Anthropic модель переписала HAProxy с C на Rust за 9,5 часа Цена API: - $4 / 1M входных токенов - $20 / 1M выходных токенов - $0,20 / 1M токенов при чтении кеша Бенчмарки: - Terminal-Bench 4.0 — 66,4% - FrontierCode v1.1 — 54,4% - Humanity’s Last Exam — 67,7% с инструментами Также Anthropic подтвердила, что Claude Sonnet 5.5 и Haiku 5.5 выйдут в ближайшие недели. https://www.anthropic.com/claude-opus-5-5

Очень хороший прогресс для локальных моделей. PrismML выпустила Bonsai 2 27B на базе Qwen3.8 27B. После трёхзначного квантова
Очень хороший прогресс для локальных моделей. PrismML выпустила Bonsai 2 27B на базе Qwen3.8 27B. После трёхзначного квантования модель занимает всего 5,9 ГБ, примерно в девять раз меньше полной версии. По тестам разработчиков она сохраняет 98,2% исходного результата, при этом поддерживает работу с изображениями и вызов инструментов. Модель открыта под Apache 2.0.

Google открыла исходный код ARTEMIS — инструмента, который позволяет ИИ управлять Android-смартфоном. ◝(ᵔᗜᵔ)◜ Его можно использовать для автоматизации действий на телефоне и тестирования приложений. Работает с Claude Code, Codex, Cursor и другими инструментами. Google утверждает, что ARTEMIS справляется более чем с 99% задач. Правда, вокруг проекта уже успел возникнуть небольшой скандал. 💀

Looped Transformer сейчас одна из самых обсуждаемых архитектурных идей. В новом техническом отчёте цикл предлагают растянуть
Looped Transformer сейчас одна из самых обсуждаемых архитектурных идей. В новом техническом отчёте цикл предлагают растянуть уже между токенами. Recurrent Looped Transformer делает декодер рекуррентным для каждого токена, включая и запрос, и ответ. Каузальный энкодер формирует общую KV-память. Для каждого нового токена декодер объединяет: > представление этого токена из энкодера > собственное финальное скрытое состояние от предыдущего токена > кеш недавних активаций со скользящим окном При декодере из 48 слоёв путь вычислений после t токенов проходит уже через 48t блоков декодера, хотя каждый отдельный токен всё равно выполняет фиксированное число блоков. То есть глубина вычислений растёт вместе с длиной последовательности, а стоимость обработки одного токена остаётся постоянной. Один и тот же переход между состояниями используется для предварительного обучения, SFT, генерации и повторного воспроизведения в RL. На границе между запросом и ответом состояние не сбрасывается. Во время RL replay состояния заново строятся с текущими весами модели, вместо повторного использования устаревших состояний из предыдущих запусков. Пока это именно архитектурное предложение. Автор прямо пишет, что прирост в рассуждениях, ускорение на железе и масштабирование RL — это цели, которые ещё не были измерены. Статья: https://github.com/yifanzhang-pro/recurrent-looped-tranformer