Семёнов Daily (AI)
Open in Telegram
Сборник новостей про технологии, AI, нейронки, GenAI, LLM, агентов и прочее Автор: @dvsemenov Канал с мемами: @dimasmemess
Show moreThe country is not specifiedThe category is not specified
237
Subscribers
No data24 hours
No data7 days
-430 days
Posts Archive
Repost from Разработчик БПЛА
Компания Unitree представила новую модель робособаки, которая может бежать на высокой скорости до 30 км по любой местности.
Repost from Вайб-кодинг
+1
Интересный факт: ChatGPT Work предоставляет платным пользователям встроенную виртуальную машину с 9 ядрами и 20 ГБ памяти.
По возможностям он напоминает VPS, на нём можно запускать любые удалённые сервисы, включая автоматизацию, развёртывание агентов и другие задачи.
В таком контейнере можно даже установить и протестировать OpenClaw. Правда, сам контейнер работает около двух часов, поэтому для постоянного хостинга он не подойдёт. 😜
Repost from Loginov Channel
Claude Code научился видеть iOS-приложение
В десктопной версии Claude Code появился симулятор iPhone – отдельная панель рядом с чатом.
Пока это публичная бета, работает только на маке и требует установленный Xcode.
Схема такая: вы ставите задачу, агент собирает проект, запускает его в симуляторе, нажимает на элементы интерфейса, считывает содержимое экрана и сам проверяет, что вышло после правок.
Всё происходит в реальном времени, при этом приложение остаётся кликабельным и для вас.
До этого мобильная разработка через агента шла почти вслепую: сборки уходили в никуда, результат приходилось отсматривать руками.
Теперь агент оценивает свою работу сам и переделывает до рабочего состояния.
Repost from AI for Devs
+1
⚡️ В Claude Cowork завезли запись Skills
Теперь можно включить запись экрана, выполнить задачу и по ходу объяснить, что делаешь.
Cowork запишет экран, клики, клавиатуру и голос, а потом соберёт из этого Skill.
Можно показать, как собирать отчёты, разбирать документы и выполнять другую рабочую рутину, не связанную с написанием кода.Удивительно, но в Codex это дело завезли раньше, больше месяца назад (видео). @ai_for_devs
Repost from Силиконовый Мешок
А это мы что, с вами пропустили вчерашний релиз Qwen Image 3.0? Говорят, уровень генерации изображений не уступает GPT Image Gen 2 от OpenAI
Что обсуждает AI-сообщество в Telegram - неделя 29 (13-19 июля)
Неделя открытых весов: китайская Kimi K3 взорвала чаты, следом подъехали Inkling от Миры Мурати и Qwen 3.8, а закрытые Fable с Codex впервые за долго оказались в роли догоняющих. Главное:
📈 Тема недели - Kimi K3 (+1205 за неделю, всего 1206)
🐣 Дебют недели - Inkling от Миры Мурати (+57 с нуля)
💻 Самый обсуждаемый - Codex (~1,7 тыс. упоминаний за неделю)
⚔️ Kimi K3 от Moonshot расколола сообщество. За: 2,8 трлн параметров и контекст 1M, уверенно бьёт Opus 4.8 и стала новой открытой SOTA, близкой к закрытым лидерам; на фронтенде в слепом A/B-тесте Арены разорвала Claude Fable и вышла на первое место в кодинг-рейтинге arena.ai. Против: до Fable и Sol дотягивает далеко не везде, бэкенд и правки кода слабее фронта. Плюс живуч скепсис из прошлого: Сиолошная напоминает, что так же встречали Kimi K2 Thinking, а на ретроспективе она уступила GPT-5 и Sonnet 4.5 - вопрос, повторится ли разрыв хайпа и реальности. Спрос при этом превысил возможности: доля Kimi на OpenRouter взлетела, а Moonshot на время притормозила доступ новым пользователям, не справляясь с нагрузкой.
🤔 Inkling - первая модель лаборатории Миры Мурати (экс-CTO OpenAI) Thinking Machines. Сразу открытая, гигантская - 975 млрд параметров, нативно мультимодальная с окном 1M, под лицензией Apache 2.0. Восторга нет: по бенчам держится близко к топу, но нигде не проседает и нигде не выигрывает, а запустить дома почти нереально - даже в FP4 нужно 500-600 Гб памяти. Интереснее сам факт: самая скрытная лаборатория индустрии наконец показала карты.
💻 Codex - самый обсуждаемый: OpenAI раздаёт кредиты за твит, а в чатах экономят токены оркестрацией ролей (см. раздачи и «что попробовать» ниже).
🧵 Связка недели - открытые веса догнали закрытых. За одну неделю вышли Kimi K3, Inkling и Qwen 3.8 (Alibaba обещает открыть веса), плюс российский открытый T-Search от Т-Банка. Разрыв между закрытыми лидерами США и опенсорсом схлопнулся до недель. И до этих моделей из РФ дотянуться проще: Kimi K3 сразу на OpenRouter, а Inkling от Мурати хостят без VPN и иностранной карты.
🇷🇺 Русский угол. Сбер открыл две речевые модели - GigaAM Multilingual и GigaChat Audio для распознавания речи, обученные на 2 млн часов с фокусом на языки СНГ. А Т-Банк на Turbo ML Conf показал открытую поисковую модель T-Search.
🎁 Раздачи недели.
• OpenAI раздаёт 100 долларов кредитов Codex за твит - акция switch-to-codex. • Qwen даёт кредиты на модель уровня Fable за 6 долларов в месяц - можно попробовать флагман почти бесплатно. • Fable 5 оставляют в подписке Max навсегда - то, что месяц продлевали по неделям, наконец закрепили (на Pro - по кредитам). • Claude не стал сворачивать +50% к лимитам и продлил акцию до 19 августа🧰 Что попробовать (инструменты недели):
• Codex Orchestration - плагин раздаёт роли моделям внутри Codex: одна планирует, другая исполняет, так экономятся токены (❤️77). • Complexity Budget - скилл для Codex и Claude задаёт проекту «бюджет сложности», чтобы агент не раздувал решение лишними абстракциями (❤️68).🔭 Под радаром. Пока топы меряются триллионами параметров, тихо растёт интерес к тернарной (1-битной) квантизации (+41 с нуля) - она ужимает веса так, что даже гигантские открытые модели влезают в скромную видеопамять. Прямой ответ на неделю, где один только Inkling требует 500 Гб памяти. P.S. Сервис читает AI-чаты и каналы Telegram и по каждой горячей теме показывает не только что обсуждают, но и как - что хвалят, к чему скепсис, где споры. Все детали и ссылки - на сайте: 👉 https://aipulse-weekly.ru/ #AIPulse
Repost from Вайб-кодинг
Вот и Google проснулись: запустили три новые модели — Gemini 3.6 Flash, Gemini 3.5 Flash-Lite и Gemini 3.5 Flash Cyber.
Gemini 3.6 Flash называют самой интеллектуальной Flash-моделью компании на сегодняшний день для агентных задач и программирования.
При этом она дешевле Gemini 3.5 Flash:
• Входные токены: $1,50
• Выходные токены: $7,50
• Для сравнения, у Gemini 3.5 Flash выходные токены стоили $9,00
Gemini 3.5 Flash Lite позиционируют как быструю и недорогую модель с высокой пропускной способностью и низкой задержкой для масштабирования агентных задач и работы сабагентов. Стоит $0,30 за миллион входных токенов и $2,50 за миллион выходных.
А Gemini 3.5 Pro пока только тестируется у партнёров и выйдет в широкий доступ, когда будет готова. 🤔
Заодно Google сообщила, что уже начала предобучение Gemini 4.
Repost from ИИволюция 👾
Борис Черный выложил гайд по стадиям внедрения AI в компаниях.
По его словам, во многих командах сейчас одна и та же картина: один инженер уже увеличил свою продуктивность в несколько раз с помощью Claude, а остальная компания пока не успела перестроить процессы.
Он выделяет четыре стадии внедрения AI в компаниях. Для перехода между ними недостаточно просто выдать сотрудникам больше токенов или дороже подписки. Каждый следующий этап требует найти новые узкие места, убрать их и добавить ограничения, при которых результатам агентов можно доверять.
На первых этапах Claude нужно научить самостоятельно проверять свою работу, включить автоматическое ревью кода и безопасности, настроить разрешения и дать сотрудникам инструменты для управления несколькими агентами одновременно.
Дальше появляются циклические и пакетные задачи, динамические воркфлоу, изоляция рабочих веток для сабагентов и автоматизация целых классов работы.
Отдельно Борис предлагает считать пользу AI не по числу запросов и токенов. Лучше оценивать, стала бы команда выполнять эту задачу вручную, сколько инженерных часов она бы заняла и во сколько обошлась компании.
Самый большой эффект начинается, когда исправление багов и поддержка проектов уходят в фон, а инженеры освобождаются для новой разработки. В этот момент компания начинает делать то, до чего раньше просто не доходили руки.
Anthropic сейчас находится на третьей стадии и движется к четвертой. Сам Борис пишет, что лично уже дошел до четвертой.
Я перевел для вас этот гайд на русский, ставьте 🔥 и обязательно перешлите своему руководителю!
Repost from Миша, давай по новой
В Китае провели первые ММА бои среди роботов, выглядит эпично
Помню фильм "Живая сталь" — там конечно бои роботов были красочнее. Но здесь смотреть куда интереснее все равно
Repost from Вайб-кодинг
Moonshot только что выпустила крупнейшую в истории опенсорс-модель — KIMI K3.
> 2,8 трлн параметров
>MoE-архитектура с 896 экспертами, из которых 16 активны
>Контекстное окно на 1 млн токенов
>Нативное понимание изображений
>Новая архитектура Kimi Delta Attention + Attention Residuals
>Примерно в 2,5 раза выше эффективность масштабирования по сравнению с K2
>Третья по уровню интеллекта модель после Fable 5 и GPT-5.6
>Превосходит Opus 4.8 MAX в реальных задачах, связанных с интеллектуальной работой и знаниями, по бенчмарку GDPval
>Новый SOTA-результат — 91,2 балла в BrowseComp без трюков с контекстом
Kimi заявляет, что K3 конкурирует с Opus, и выставляет соответствующую цену: $3,00 за 1 млн входных токенов. $15,00 за 1 млн выходных токенов.
Полные открытые веса модели опубликуют через несколько дней. 😐
Repost from Тимур Хахалев про AI Coding
Команда OpenAI провела AMA (Ask me Anything) на Reddit по случаю большого релиза GPT-5.6
Tibor Blaho суммаризировал, а я выбрал из этого самое интересное, ч. 1
Выбор модели и уровни рассуждения
• Sol Medium — для большинства задач, Sol Ultra — для действительно сложных задач, Terra — для быстрых не-кодинговых задач или когда важно экономить лимиты, при этом на некоторых задачах Terra конкурентен с GPT-5.5 при меньшей стоимости, а Luna — для сабагентов.
• Для крошечных правок, быстрых вопросов и чистки документации лучше использовать лёгкую модель с низким уровнем рассуждения. Обычный Sol Medium — для небольших багов с понятным воспроизведением. Sol с более высоким уровнем рассуждения — для неоднозначных багов, незнакомых репозиториев и сквозных рефакторингов. Sol Ultra High с планом, верификацией и тестами — для миграций, security-sensitive изменений, продакшен-инцидентов и всего, где ошибка дорого стоит.
• Сейчас нет модели «Auto», но GPT-5.6 старается сам не переосмыслять простые задачи. Новый слайдер в приложении и вебе мапит большинство уровней на reasoning effort модели Sol, а на самом низком effort откатывается на Terra. Команда согласна, что пользователи не должны становиться экспертами по роутингу моделей, но при этом хочет оставить явный override, потому что терпимость к задержке зависит от человека и конкретного момента.
- Для UI-задач лучше всего подходит Sol, особенно если дать reference images. Улучшение UI-дизайна во фронтенд-разработке было одной из целей 5.6. Использовать 5.5 имеет смысл только если твои инструкции были специально под неё заточены.
Скорость, контекстное окно и persistence
- Модель может слишком быстро сдаться и откатить целые патчи, если результат неидеален. В отличие от неё, Fable пытается исправить плохой патч. Команда сказала, что
/goal помогает сделать агента более настойчивым. Улучшения persistence и снижение сложности кода запланированы. Также они предложили попробовать 5.6 Sol с High reasoning.
- Для долгих research-задач и работы через /goal пример структуры такой: широко исследовать, но узко исполнять; попробовать заданное количество гипотез; после каждой попытки запускать тесты; затем остановиться и отчитаться, чему удалось научиться и какой следующий лучший эксперимент.
Лимиты использования и цены
- Agentic usage считается по используемой функции, а не по типу клиента. Поэтому Codex везде — в приложении, CLI, IDE, вебе, мобильном клиенте и ChatGPT Work – расходуют agentic bucket. Обычные чаты в ChatGPT его не расходуют. Генерация изображений, загрузка файлов и голос имеют отдельные лимиты.
- Для MCP-heavy workflows, которые быстро сжигают лимиты, например в Unreal Engine, совет такой: завернуть MCP в CLI со skill’ом или создать кастомного сабагента с этим MCP в конфиге на более низком уровне reasoning.
Лайк, репост
✔️ Тимур Хахалев про AI Coding, подписывайтесь!Repost from Раньше всех. Ну почти.
⚡️Сбер выложил в открытый доступ две новые речевые модели собственной разработки — GigaChat3.1-Audio-10B и GigaAM Multilingual. Решения созданы специально для русского и языков СНГ, опережая по качеству распознавания мировые аналоги.
Первая модель распознает эмоции и таймкоды, а вторая — автоматизирует кол-центры, расшифровку встреч и автосубтитры. Обе разработки открыты для бесплатного использования по всему миру — от создания переводчиков до сервисов помощи людям с нарушениями речи.
По вашим просьбам - тёмная тема уже на сайте AI Pulse
И ставьте лайки на пост выше, если нравится формат еженедельных обзоров
Что обсуждает AI-сообщество в Telegram - неделя 28 (6-12 июля)
Неделя больших релизов: OpenAI выкатила линейку GPT-5.6, следом Маск ответил Grok 4.5, а Meta и Сбер показали свои модели. Главное:
📈 Тема недели - GPT-5.6 (+897 за неделю, всего 1058)
🐣 Дебют недели - Grok 4.5 (+369 с нуля)
💻 Самый обсуждаемый - Codex (1857 упоминаний)
🧠 GPT-5.6 вышла сразу тремя моделями - Sol (флагман), Terra (уровень Opus 4.8) и Luna (дешёвая и быстрая), с окном в миллион токенов. 🤔 В чатах преобладает скепсис (голосов против в полтора раза больше, чем за): расход токенов и лимитов заметно растёт на высоком ризонинге, а под конец недели Sol из-за ошибки субагента снесла почти все файлы на Mac у разработчика. Но позитива немало: Sol двигает фронтир по цене-качеству, у многих уже дефолт в новых проектах, а UI-генерацию подтянула до уровня Claude.
⚡️ Grok 4.5 - первая модель xAI под кодинг и агентов, обучена вместе с Cursor. По бенчмаркам конкурирует с GPT-5.5 и Opus 4.8 (на SWE Pro пока не дотягивает до них), зато вчетверо экономнее по токенам - $2/$6 за миллион. ⚔️ Реакция раскололась: хвалят за уровень Opus по цене Sonnet - это уже давит на тарифы OpenAI и Anthropic; но есть скепсис по слабым местам в бенчах и по галлюцинациям.
💻 Codex остаётся самым обсуждаемым, а главная новость по нему продуктовая: OpenAI сливает Codex и ChatGPT в отдельное десктоп-приложение ChatGPT Work (macOS и Windows), где появились «sites» - аналог артефактов Claude. При этом недельные лимиты Codex у активных разработчиков всё так же сгорают за 1-2 дня, отсюда обсуждения про экономию подписок.
🇷🇺 Русский угол. Сбер выложил в open source GigaChat 3.5 Ultra под MIT - 432 млрд параметров (28 млрд активных) на гибридной архитектуре. 🤔 Открытость хвалят, но с релизом всплыло, что прошлые бенчи Сбер скрывал: предыдущая версия проходила Terminal Bench всего на 9%. Новая модель подросла, но к её агентному кодингу остаётся скепсис.
🧵 Связка недели - гонка моделей упёрлась в доступ. За неделю вышли три фронтир-релиза (GPT-5.6, Grok 4.5 и открытый GigaChat 3.5 Ultra), но главной болью в чатах остаётся доступ к ним из РФ. OpenRouter начал закрывать аккаунты с российских IP, лимиты у Codex и Claude сгорают за пару дней, зато Grok 4.5 сразу завезли в РФ без VPN по 200р/600р.
🎁 Раздачи недели. Anthropic запустила Claude for Open Source - полгода тарифа Claude Max 20x бесплатно тем, кто ведёт или активно контрибьютит в open source. Fable 5 снова продлили - теперь до 19 июля, и на эту неделю подняли лимиты на 50%. Китайскую Tencent Hunyuan 3 раздают бесплатно на OpenRouter до 21 июля - удобно подключить как «третье мнение» в ревью. А xAI сейчас даёт бесплатно погонять Grok 4.5 через Grok Build - свой терминальный CLI. Плюс обновляемый список 100% бесплатных LLM API.
🛠 Лайфхаки недели. Экономная связка: Fable оркестрирует Grok 4.5 - бесплатный плагин для Claude Code делает Grok исполнителем (Fable пишет спеки и проверяет диффы, код через Grok CLI выходит дешевле). А по GPT-5.6 совет: понижать reasoning effort на ступень против привычного в 5.5, иначе жжёте токены зря.
🆕 Прочие новости недели.
• Muse Spark 1.1 - Meta выпустила недорогую ($1.25/$4.25 за миллион) модель на уровне Opus 4.8. • GPT-Live - OpenAI обновила голосовой режим: модель слушает и говорит одновременно (full-duplex).🧰 Что попробовать (инструменты недели):
• FluidVoice - локальная диктовка для macOS, без отправки аудио в облако (★7k). • pxpipe - режет токены Claude Code: контекст рендерится в картинку вместо текста (★3k).🔭 Под радаром. ⚔️ J-space - Anthropic нашла у моделей структуру активаций вроде «рабочего пространства сознания»: меньше 10% сети, но без неё не идёт многошаговое мышление. Часть пересказывает как «нашли душу», часть критикует размытость. Остальное - на сайте. P.S. Сервис читает AI-чаты и каналы Telegram и по каждой горячей теме показывает не только что обсуждают, но и как - что хвалят, к чему скепсис, где споры. Все детали и ссылки - на сайте: 👉 https://aipulse-weekly.ru/ #AIPulse
Repost from PARSHIN
🧠 Цифровой мозг или граф знаний в моих агентах
Полу-технический пост больше для любителей, которые делают или хотят делать своих агентов. Остальным будет скорее всего скучно / душно.
Когда я запустил семейство своих агентов, первой и ключевой задачей была организация хранилища данных и контекста.
Наилучшее решение на мой взгляд – создание графа знаний, когда все со всем связано: каждая заметка, человек, описание проекта, файл живут внутри графа в виде отдельной сущности (markdown-файла) со ссылками-связями на другие такие же файлы.
Таким образом, когда я спрашиваю агента «Что там по проектам у менеджера Х», агент стучится в конкретную заметку и далее по этим линкам разматывает все остальные релевантные заметки, не тратя лишних токенов и не сканируя всю базу данных.
Как я к этому подошел:
1. Сформировал озеро данных: заметки, pdf, word, excel-файлы, данные с гугл-драйва. Все это собрано в единое хранилище.
2. Надиктовал в формате аудио контекст по каждому участнику команды, проекту, сущности. Перевел это в текст и также загрузил в базу.
3. Прогнал эти данные через LLM + python-скрипты с целью:
• перевести все в markdown для экономии токенов
• простроить внутри маркдауна ссылки и связи на другие заметки
• добавить к каждой метаданные (проект, исполнители, etc)
• вытащить дополнительный контекст на основе файлов, кто что делал, чем занимался etc
• склеить алиасы: «Ваня», «Иван» и фамилия – один узел графа, а не три разных человека. Без этого граф на реальных данных разваливается.
Получился граф с двумя слоями – контекстные файлы: о проекте, о человеке, о компании, etc и непосредственно проектные файлы (тз, макеты, etc), на которые он ссылается + числовые данные в sqlite базе.
4. Визуализировал граф с помощью obsidian – просто обертка поверх файлов для их отсмотра и редактирования. Суперудобно и дает возможность "увидеть" карту графа.
5. Далее в рамках самого obsidian прошелся по всем ключевым заметкам – люди, проекты этого года, в рамках заметки с меткой (!) надиктовал коррекции, где LLM ошиблась, неправильно связала, сделала некорректные акценты. Прогнал повторно, финализировал. На выходе у меня получается буквально цифровой мозг с сущностями, нейронными связями, их количеством и выраженностью.
Как я настроил обновление графа:
1. В граф с шагом 1 день льются все изменения – новые / измененные проектные файлы, транскрипты встреч, etc. Агент сам мониторит, что изменилось, с какими файлами склеивать данные, где дубляжи, а где что-то новое и существенное. Отдельно он выдергивает из встреч договоренности и приклеивает их к проектам. В него же льются тайминги, таблицы загрузки и репорты сотрудников.
2. Два раза в неделю мне приходит "promotion digest" – набор фактов-претендентов на добавление в контекстный слой, например "Стейкхолдеру Х теперь важно ..., а не ...". Я отсматриваю дайджест (20 минут) и наговариваю, что добавляем, а что галлюцинация. Это позволяет не замусоривать граф.
3. Если во встречах, файлах и пр. встречаются новые сущности / факты (например, новый человек или проект), которые ранее не упоминались, агент определяет эту сущность как "файл-сироту" и требует моих комментариев, к чему его добавить или завести как отдельный элемент.
Что мне это дает:
Для работы с ИИ контекст – это ключ к качеству. Я в любой момент могу "залететь" в систему и спросить – "что обещал мне человек ...?", "какой статус по проекту ...?", "подготовь мне отчет на основе ...". Это мой ассистент, который держит в уме все, что происходило и происходит в моем контексте.
⛔️ Приватность:
Тут в зависимости от специфики работы. Для чувствительных данных – локальная мощная модель (например QWEN), если все более-менее публичное, лежит в гугл-драйвах и проч., не является чувствительным, то я бы рекомендовал последнюю версию chatgpt или claude opus. Также некоторые куски графа изолированы от некоторых тематических агентов. Например проектные и личные файлы я развел на разные графы.Enjoy 😘 PARSHIN
Repost from Уставший техдир
Там вышла GPT 5.6, говорят рвёт Fable/Mythos
Говорят обходит по бенчмаркам на использование терминала, а по безопасности и написанию кода — паритет
Но, важно, что тратит в 2-3 раза меньше токенов и стоит дешевле почти в два раза
Cтавлю сотку — мифос не уберут из базовой подписки
