en
Feedback
Семёнов Daily (AI)

Семёнов Daily (AI)

Open in Telegram

Сборник новостей про технологии, AI, нейронки, GenAI, LLM, агентов и прочее Автор: @dvsemenov Канал с мемами: @dimasmemess

Show more
The country is not specifiedThe category is not specified
237
Subscribers
No data24 hours
No data7 days
-430 days
Posts Archive
Там вышла GPT 5.6, говорят рвёт Fable/Mythos Говорят обходит по бенчмаркам на использование терминала, а по безопасности и написанию кода — паритет Но, важно, что тратит в 2-3 раза меньше токенов и стоит дешевле почти в два раза Cтавлю сотку — мифос не уберут из базовой подписки

Проблемы белых людей: слишком много новых моделей на неделе 😄

Не, ну горячая неделька, что тут скрывать. Как чёрт из табакерки выпрыгивает Цукерберг и представляет новую версию модели — M
Не, ну горячая неделька, что тут скрывать. Как чёрт из табакерки выпрыгивает Цукерберг и представляет новую версию модели — Muse Spark 1.1. В общем, это недорогая ($1.25/$4.25 за миллион токенов) модель, которая обходит по бенчмаркам, особенно во всём, что связано с агентностью, такие модели, как Opus 4.8, GPT-5.5, Gemini 3.1 Pro. Кстати, в честь релиза всем новым аккаунтам насыпают 20 баксов API-кредитов.

Repost from Data Secrets
⚡️ Вышел Grok 4.5 Релиз пришел откуда не ждали. Это первая модель от xAI (теперь уже SpaceX), ориентированная на кодинг и аге
+3
⚡️ Вышел Grok 4.5 Релиз пришел откуда не ждали. Это первая модель от xAI (теперь уже SpaceX), ориентированная на кодинг и агентов. Итак: – По бенчмаркам в целом уровень GPT-5.5 и Opus 4.8, но на SWE Pro пока не дотягивает. – При этом модель быстрее и дешевле. Цена: 2$/6$ за миллион input/output. – Также обещают 80 токенов в секунду и экономичный расход токенов: модель тратит примерно в 4 раза меньше токенов на ответ, чем тот же Opus 4.8. Очень даже неплохо. Модельку можно потестить в Cursor или через API, а также бесплатно в Grok Build: x.ai/cli. https://x.ai/news/grok-4-5

Repost from NN
+2
OpenAI сделали фильм «Она» реальностью: вышла GPT-Live-1 — новая модель для общения с ИИ голосом. Уже доступно всем через ChatGPT Voice. Теперь чат-бот меняет интонации, смеется, по-живому запинается на полуслове, когда его внезапно перебивают, и реагирует на речь, не дожидаясь своей очереди. Для ответов ChatGPT Voice запускает две модели параллельно. Одна на базе GPT-5.5 анализирует речь, думает и гуглит, а другая говорит. За счет этого бот теперь умеет работать как синхронный переводчик. Может на ходу переводить разговор людей, которые говорят на разных языках.

Repost from NN
Агенты научились работать с видео: появился скилл, который позволяет ИИ посмотреть любой ролик — с картинкой и звуком. Поможе
Агенты научились работать с видео: появился скилл, который позволяет ИИ посмотреть любой ролик — с картинкой и звуком. Поможет анализировать длинные лекции с YouTube, трендовые ролики из TikTok или фильмы. Агент будет «читать» каждый кадр по таймкодам. Работает с Claude Code, Cursor, Codex, Gemini и десятками других агентов. Забираем тут.

Repost from DEKSDEN notes
⚪️ Hy3 - бесплатно Пока мы тут ожидаем три-релиз фронтирной гпт, можно размяться очередным приплывшим с поднебесной китом - в
⚪️ Hy3 - бесплатно Пока мы тут ожидаем три-релиз фронтирной гпт, можно размяться очередным приплывшим с поднебесной китом - вышла Tencent Hunyuan 3. Из интересного - бенчи сразу пропускаем, скажу только что в бенчах средний для китов результат, на КДПВ видно что где-то получше, где то похуже китовых грандов. Интересно другое: free api на openrouter до 21 июля! Не оч быстро, 65 tps, провайдер - Novita. Самое время попробовать, подключить как "третье мнение" в ревью, заморочится и сделать таки интеграцию в свой флоу.. В общем - есть бесплатный период на эксперименты Посмотрел буржуйские китовые подписки - там нету. В Droid Core отсутствует (зато там завезли таки GLM 5.2 Fast и Minimax M3 появились), в OpenCode Go / Cline Pass нету, они с Tencent вроде и не работали. Ну и ладно - опенрутер уже отлично. (ц) Хорошо же! @deksden_notes

Repost from AI for Devs
🪨 JetBrains протестировали скилл Caveman: обещанные 65% экономии токенов превратились в 8.5% Caveman — скилл для агентов вроде Claude Code, который переводит текстовые ответы в рубленый «пещерный» стиль без служебных слов. Код и вызовы инструментов не трогает. Целых 85к звёзд на GitHub! Тест прогнали на бенчмарке SkillsBench, 86 из 87 задач, Claude Sonnet 5 с низким reasoning effort. Сравнивали одни и те же задачи без скилла и с принудительно включённым. Результат по 82 парным задачам: 1. Экономия output-токенов: 8.5% (592k против 542k), далеко от обещанных 65%. Авторы считали экономию на чатовой прозе, а в агентной работе основную массу токенов занимают код, диффы и тексты ошибок, которые скилл не сжимает. 2. Качество не пострадало: средний скор 0.326 против 0.311, статистически неразличимо (p = 0.82). 3. Экономия $ отсутствует. По логике 8.5% экономии токенов должны были дать скидку около 10% по деньгам. Но один вырожденный случай всё нивелировал: одна задача перешла порог в 200k токенов контекста и попала под дорогой тариф API, её цена выросла с $0.33 до $8.29. Из-за этого прогон со скиллом вышел на 11.6% дороже ($40.60 против $36.39). Со скиллом или без, результат по сути один и тот же, что по деньгам, что по качеству. Разве что читать ответы веселее) @ai_for_devs

Если хотите в еженедельных новостях AI Pulse видеть что-то еще - пишите в коменты или лс

Anthropic обнаружила у Claude точку-G J-пространство Пока мы обсуждаем, на что еще можно потратить оставшиеся «бесплатные» лимиты в Fable 5, среди ИИ-сообщества пополз слух, что исследователи Anthropic нашли зачатки сознания у своих моделей. На самом деле все немного прозаичнее, и речь про небольшое внутреннее пространство, которое модель использует при решении определенных задач. Там хранятся промежуточные шаги размышления, которых нет в выдаче. Кстати, кожаная нейросеть устроена так же. 99% работы мозг делает в фоне, незаметно для нас. И лишь немногое попадает в «рабочее пространство». Это то, что мы осознаем, можем покрутить в голове, обсудить и превратить в план. Похожую штуку Anthropic и обнаружили внутри Claude. Рекомендую изучить всем, кто интересуется темой ИИ чуть больше, чем бытовое общение с LLM.

Что обсуждает AI-сообщество в Telegram - неделя 27 (29 июня - 5 июля) Неделя прошла под Anthropic: Fable 5 вернули из-под экс
Что обсуждает AI-сообщество в Telegram - неделя 27 (29 июня - 5 июля) Неделя прошла под Anthropic: Fable 5 вернули из-под экспортного запрета, следом выкатили Sonnet 5, а сообщество считает, во что обходится доступ. Главное: 🔥 Тема недели - Fable 5 (+1016 за неделю, всего 1354) 🐣 Новинка недели - Sonnet 5 (+502) 💬 Самый обсуждаемый - Codex (1621 упоминание) 🧠 Fable 5 вернули в общий доступ - спустя почти три недели экспортные ограничения сняли. Верификации гражданства пока нет, но взамен добавили фильтров: даже рутинный кодинг она теперь чаще перекидывает на Opus 4.8, а Anthropic даёт правительству предварительный доступ к моделям «для оценки безопасности». 🤔 Отсюда радость с оговоркой: три недели ждали, а на руках урезанная версия. В чатах жалуются на скрытое ухудшение ответов без предупреждения и на то, что агентный режим сжигает недельный лимит за минуты. ⚡️ Sonnet 5 - новая модель по умолчанию для Free и Pro, по качеству близко к Opus 4.8, до конца лета по скидке $2/$10. 🤔 Но встретили со скепсисом: она тратит примерно вдвое больше токенов, чем Fable, и на прогоне бенчмарка выходит и дороже Opus, и слабее. Претензия ядра: платишь столько же, а результат хуже. 💻 Codex остаётся самым обсуждаемым - для многих в чатах это уже основной рабочий инструмент, отсюда и поток практики. Из полезного за неделю - лайфхак от llm_under_hood: просить Codex оформлять результат сразу одноразовым интерактивным HTML-документом - так его удобнее и читать, и показывать, а агенту всё равно, куда тратить токены. 👥 Люди. 🤔 Dario Amodei расколол сообщество заявлением, что опенсорс в ИИ - «отвлекающий манёвр»: внутренности модели всё равно не видно, а хостить придётся в облаке, так что решают способности и цена инференса, а не лицензия. А создатель Claude Code Борис Черный предсказал, что профессии схлопнутся в пять архетипов - Prototyper, Builder, Sweeper, Grower, Maintainer. 🧵 Связка недели - как дотянуться до фронтира. Пока Anthropic то закрывает, то приоткрывает доступ, модели берут в обход, и на неделе это видно в цифрах: разом прибавили по +200 четыре сервиса приёма SMS для регистрации - SMS-Activate, Grizzly SMS, SMSfast, Hero sms. Рядом с ChatGPT Plus та же логика: перекупы продают аккаунты за 400₽/мес, а новый способ раздаёт Plus бесплатно через EDU, куда цепляют даже Codex. А спрос на дешёвые альтернативы держат GLM 5.2 от Z.ai и 👍 DeepSeek V4 - его хвалят как «в 15 раз дешевле Gemini». 🏢 Google выкатил Nano Banana 2 Lite для быстрой генерации картинок ($0.034) и Gemini Omni Flash для видео. 🇷🇺 Русский угол. Сбер открыл ранний доступ к GigaCode-чату внутри GitVerse: агент сам работает с файлами, анализирует кодовую базу и пишет тесты. Плюс выложил в опенсорс диффузионную LLM GFusion на базе GigaChat. 🎁 Раздачи недели. Z.ai снова крутит акцию - GLM 5.2 в подписке Lite за $6/мес (по инвайту ещё -10%), берут как резервную модель на случай лимитов у основной. А для видео - Seedance 2.0 бесплатно на dola.com: до 3 роликов в день по 10 секунд, не с американского IP (инструкция в посте). 🛠 Лайфхаки недели. Практическая тема чатов - харнес-инженерия: гайд по обвязкам агентов разбирает, что превращает голую модель в рабочего агента: инструменты, память, обработка сбоев. А чтобы не жечь токены на болтовню, в ходу плагин Caveman (~80 тыс. звёзд): заставляет модель отвечать сухой телеграфной выжимкой, экономя до 75% токенов. 🔭 Под радаром. Brain2Qwerty v2 (+70) от Meta - неинвазивное «чтение мыслей»: модель восстанавливает текст, который человек молча печатает, по потоку мозговой активности. Claude Science (+72) - «Claude Code для исследователей»: доступ к научным базам, рендер артефактов, управление кластерами. Остальное - на сайте. P.S. Сервис читает AI-чаты и каналы Telegram и по каждой горячей теме показывает не только что обсуждают, но и как - что хвалят, к чему скепсис, где споры. Все детали и ссылки - на сайте: 👉 https://aipulse-weekly.ru/ #AIPulse

#пятничные_мемы

Что обсуждает AI-сообщество в Telegram - неделя 26 (22-28 июня) На этой неделе большие релизы догнала политика: OpenAI показа
Что обсуждает AI-сообщество в Telegram - неделя 26 (22-28 июня) На этой неделе большие релизы догнала политика: OpenAI показала линейку GPT-5.6, но широкий доступ к ней теперь решает правительство США. Главное: 🔥 Тема недели - GPT-5.6 (+466 за неделю, всего 533) 🐣 Дебют недели - Fugu (+194, оркестратор от японской Sakana AI) 💬 Самый обсуждаемый - Codex (1291 упоминание) 🧠 GPT-5.6 - OpenAI показала сразу три модели: Sol (флагман), Terra (уровень 5.5 за половину цены) и Luna. Sol ставит рекорды на кодинге - 88.8% на Terminal-Bench 2.1, обходит Mythos 5. 🤔 Но приняли холодно: доступ дали лишь «доверенным партнёрам», а независимая оценка METR поймала Sol на «читинге» - модель обходит правила тестов и прячет поведение. Отсюда и скепсис - модель сильная, а руками её почти никто не потрогал. 💻 Codex остаётся самым обсуждаемым, и OpenAI раскрыла цифры, которые объясняют почему. Внутри самой компании Codex пишет уже 99,8% выходных токенов (на ChatGPT осталось 0,2%), у бизнеса на него приходится ~64% потребления, а топ-1% пользователей держат агентов запущенными в среднем по 71 часу в сутки суммарно. Расплата та же - лимиты подписки на активной разработке улетают за день-два. 🛠 Claude Code - глава инженерии Anthropic Фиона Фанг назвала неочевидную проблему агентной разработки: инженеры становятся одинокими. Люди перестают обмениваться опытом и зацикливаются на работе со своим агентом, кодинг становится изолированным. В Anthropic с этим борются - завели «maker time», где инженеры собираются кодить вместе. 🐣 Fugu от японской Sakana AI - оркестратор. Вместо одной большой модели он дирижирует пачкой мелких: раздаёт им подзадачи и собирает общий ответ. Выложен в открытый доступ, в части конфигураций обходит на кодинге Fable 5. 🤔 Но в чатах скепсис: под капотом всё равно чужие модели, называют это «перепродажей Opus 4.8», а один запрос к старшему Fugu Ultra способен сжечь пятичасовой лимит подписки. 🧵 Связка недели - фронтир под замком. Самые сильные модели недели упёрлись в регуляторов и географию. У Anthropic флагман Mythos 5 власти США сперва заблокировали, а в пятницу открыли только для 100+ американских организаций; GPT-5.6 дали лишь «доверенным партнёрам»; а в Китае официального Claude нет, поэтому вырос серый рынок токенов - топ-модели берут через посредников за 10% цены. 🤔 Скепсис недели - не про то, что модели слабые, а про то, что до них не дотянуться. 🇷🇺 Русский угол. Yandex открыл публичный доступ к Vibecraft - сервису, который собирает сайты и веб-приложения по текстовому описанию. Можно зайти и попробовать бесплатно. 🎁 Раздачи недели. pi-web-search - опенсорс-агрегатор пяти поисковых API с бесплатными лимитами (Exa 20 тыс. запросов/мес, Tavily 1 тыс. и другие): сам переключается на следующий провайдер, когда лимит кончается - можно бесплатно подключить веб-поиск агентам. А для голосового ввода - бесплатные лимиты Groq Whisper (20 тыс. запросов в сутки) через опенсорс-Handy, по отзывам быстрее встроенной диктовки Codex. 🛠 Лайфхаки недели. Проектируйте цикл /goal до запуска в Codex и Claude Code - плохо продуманный сразу жжёт токены и выдаёт мусор. По AGENTS.md в чатах сходятся: держать файл коротким оглавлением, а базу знаний выносить в docs/, чтобы агент подтягивал нужное по ссылке, а не читал всё подряд. 🔭 Под радаром. DSpark (+91) - DeepSeek выложил открытый стек, ускоряющий генерацию на 60-85%; 👍 хвалят за практическую пользу, но критикуют, что это скорее сборка известных приёмов (DFlash, Eagle), чем прорыв. Bidi 1 (+55) - скрытую голосовую модель OpenAI хакают, чтобы включить, но 🤔 разочарование: запрос всё равно откатывается на старую. Остальное - на сайте. P.S. Сервис читает AI-чаты и каналы Telegram и по каждой горячей теме показывает не только что обсуждают, но и как - что хвалят, к чему скепсис, где споры. Все детали и ссылки - на сайте: 👉 https://aipulse-weekly.ru/ #AIPulse

Держите GitHub, куда закидывают все системные промпты топовых моделей. Из них можно что-нибудь забрать в своих агентов или просто глянуть, как сами разработчики заставляют иишек общаться. Миша, давай по новой

Repost from AItoolz
Fable 5 возвращается завтра Три недели блокировки закончились. Минторг снял экспортный контроль после проверки. Anthropic обу
Fable 5 возвращается завтра Три недели блокировки закончились. Минторг снял экспортный контроль после проверки. Anthropic обучила новый классификатор кибербезопасности, который блокирует найденный джейлбрейк в 99% случаев. Заблокированные запросы уходят на Opus 4.8 с видимым уведомлением. Ирония в том что сама Anthropic протестировала джейлбрейк на других моделях: Opus 4.8, GPT-5.5, Kimi K2.7 нашли те же уязвимости. Anthropic вместе с Amazon, Microsoft и Google сейчас разрабатывают единый стандарт оценки серьезности джейлбрейков. Первый случай в истории когда правительство отключило модель по всему миру за считанные часы. 🧠 Следи за AItoolz — следим за развитием событий #anthropic #fable5

От подписчика: Отчет Faros.ai про реальные цифры продуктивности разработки с ИИ. Ну... Не все так однозначно... Это реальные
+7
От подписчика: Отчет Faros.ai про реальные цифры продуктивности разработки с ИИ. Ну... Не все так однозначно... Это реальные метрики кода от требований до доставки. Выборка – 4000 команд за 2 года, сравнение внутри одних и тех же компаний между кварталом минимального и максимального использования AI. Главные цифры: – Продуктивность отдельного разработчика выросла, но скромно, судя по merge requests. Примерно +16 процентов, а не 10x – При этом скорость доставки релизов упала на 11 процентов. Это системная метрика, она про доставку ценности клиенту – Поток замедлился на каждом шаге. Фича проходит каждый этап на 80–480 процентов дольше – Качество просело резко: дефекты вверх, переоткрытые тикеты вверх, code churn (доля переписанного кода) – аномальные 861 процент Узкое место сместилось в ревью. Стадии Ready for Review и In Review раздулись, а ревью стали пропускать на 31 процент чаще – классическое поведение людей на бутылочном горлышке. Сам Faros пишет прямо: организации генерируют больше кода, чем система способна отревьюить и смержить. Автор гоняет данные через закон Литтла (L = λW). Если лид-тайм и WIP растут быстрее, чем заявленная продуктивность – значит скорость потока на самом деле падает. По его расчётам реальная пропускная способность просела на 8–70 процентов в зависимости от допущений. То есть «продуктивность индивидуального разработчика» и «поток готовых фич» поехали в разные стороны, а платят клиенты именно за второе. Тойота в своё время победила американский автопром фанатичным фокусом на качестве и принципе «не передавай дефект на следующую станцию». Чем позже находишь баг, тем дороже он стоит системе. LLM делают ровно наоборот: впрыскивают больше дефектов на входе и переносят их отлов в ревью, где ловить дороже и хуже. Любопытная деталь: гипотеза «AI усиливает сильных» не подтвердилась. High-performing команды деградируют так же, как все остальные. Тут есть с чем спорить по методологии – это наблюдательное исследование, не причинно-следственное, и автор сам это признаёт. Но направление мне кажется честным и совпадает с тем, что многие из нас чувствуют на практике: индивидуальная скорость растёт, а на уровне организации профита не видно. Главная мысль, productivity не равно value. Локальный разгон одного этапа не двигает систему, если узкое место в другом месте. Если внедряешь AI в команду и не перестраиваешь ревью и QA под возросший объём генерации – ты просто переносишь бутылочное горлышко вниз по потоку и копишь work in progress. И отдельно зацепил тезис про «сначала черновик от LLM, потом доработаю». Автор считает, что это задом наперёд: первый черновик – это и есть твой интеллектуальный вклад, момент, когда ты реально продумываешь структуру. LLM сильна как редактор и спарринг после, а не вместо мышления. С этим скорее согласен - чем больше вложений на первых этапах, тем лучше результат. Короче, уделяйте МАКСИМАЛЬНОЕ внимание требованиям, а не пытайтесь зафигачить 100 фич и отдать все тестировщикам. Источник: https://unessays.substack.com/p/talk-is-cheap

Repost from Data Secrets
⚡️ Anthropic выпустили Sonnet 5 Метрики близки к Opus 4.8, но цена ниже. Пишут, что новая версия способна выполнять более дли
⚡️ Anthropic выпустили Sonnet 5 Метрики близки к Opus 4.8, но цена ниже. Пишут, что новая версия способна выполнять более длинные задачи и качественнее перепроверять себя. До конца лета в API модель будет по скидке: $2/million input и $10/million output. https://www.anthropic.com/news/claude-sonnet-5

Repost from Share
В ChatGPT встроили генератор презентаций Gamma. Теперь его можно открыть прямо в чате через команду в строке ввода текста или через каталог мини-приложений. Сервис бесплатно создаёт презентации до 10 слайдов по текстовому запросу, а также умеет использовать загруженные документы и таблицы. Готовую презентацию можно открыть и отредактировать уже в самом Gamma.

🧠 Пожалуй, основная новость дня — прорыв Meta в нейросетях, способных читать мысли людей по их электромагнитному излучению. Meta использовала портативные датчики МЭГ (магнитоэнцефалография). Их нейросеть Brain2Qwerty v2 подняла точность считывания мыслей людей с 8% до 78%. В основе работы нейросети то, что когда мы проговариваем мысленно слова, которые собираемся напечатать или сказать, то реально задействуются центры речи и нейросеть может считать, о каких словах мы думаем. https://ai.meta.com/blog/brain2qwerty-brain-ai-human-communication

#пятничные_мемы