Семёнов Daily (AI)
Open in Telegram
Сборник новостей про технологии, AI, нейронки, GenAI, LLM, агентов и прочее Автор: @dvsemenov Канал с мемами: @dimasmemess
Show moreThe country is not specifiedThe category is not specified
237
Subscribers
No data24 hours
No data7 days
-430 days
Posts Archive
Repost from Уставший техдир
Там вышла GPT 5.6, говорят рвёт Fable/Mythos
Говорят обходит по бенчмаркам на использование терминала, а по безопасности и написанию кода — паритет
Но, важно, что тратит в 2-3 раза меньше токенов и стоит дешевле почти в два раза
Cтавлю сотку — мифос не уберут из базовой подписки
Repost from Силиконовый Мешок
Не, ну горячая неделька, что тут скрывать. Как чёрт из табакерки выпрыгивает Цукерберг и представляет новую версию модели — Muse Spark 1.1.
В общем, это недорогая ($1.25/$4.25 за миллион токенов) модель, которая обходит по бенчмаркам, особенно во всём, что связано с агентностью, такие модели, как Opus 4.8, GPT-5.5, Gemini 3.1 Pro.
Кстати, в честь релиза всем новым аккаунтам насыпают 20 баксов API-кредитов.
Repost from Data Secrets
⚡️ Вышел Grok 4.5
Релиз пришел откуда не ждали. Это первая модель от xAI (теперь уже SpaceX), ориентированная на кодинг и агентов. Итак:
– По бенчмаркам в целом уровень GPT-5.5 и Opus 4.8, но на SWE Pro пока не дотягивает.
– При этом модель быстрее и дешевле. Цена: 2$/6$ за миллион input/output.
– Также обещают 80 токенов в секунду и экономичный расход токенов: модель тратит примерно в 4 раза меньше токенов на ответ, чем тот же Opus 4.8.
Очень даже неплохо. Модельку можно потестить в Cursor или через API, а также бесплатно в Grok Build: x.ai/cli.
https://x.ai/news/grok-4-5
Repost from NN
OpenAI сделали фильм «Она» реальностью: вышла GPT-Live-1 — новая модель для общения с ИИ голосом. Уже доступно всем через ChatGPT Voice.
Теперь чат-бот меняет интонации, смеется, по-живому запинается на полуслове, когда его внезапно перебивают, и реагирует на речь, не дожидаясь своей очереди.
Для ответов ChatGPT Voice запускает две модели параллельно. Одна на базе GPT-5.5 анализирует речь, думает и гуглит, а другая говорит.
За счет этого бот теперь умеет работать как синхронный переводчик. Может на ходу переводить разговор людей, которые говорят на разных языках.
Repost from NN
Агенты научились работать с видео: появился скилл, который позволяет ИИ посмотреть любой ролик — с картинкой и звуком.
Поможет анализировать длинные лекции с YouTube, трендовые ролики из TikTok или фильмы. Агент будет «читать» каждый кадр по таймкодам.
Работает с Claude Code, Cursor, Codex, Gemini и десятками других агентов. Забираем тут.
Repost from DEKSDEN notes
⚪️ Hy3 - бесплатно
Пока мы тут ожидаем три-релиз фронтирной гпт, можно размяться очередным приплывшим с поднебесной китом - вышла Tencent Hunyuan 3.
Из интересного - бенчи сразу пропускаем, скажу только что в бенчах средний для китов результат, на КДПВ видно что где-то получше, где то похуже китовых грандов.
Интересно другое: free api на openrouter до 21 июля! Не оч быстро, 65 tps, провайдер - Novita.
Самое время попробовать, подключить как "третье мнение" в ревью, заморочится и сделать таки интеграцию в свой флоу..
В общем - есть бесплатный период на эксперименты
Посмотрел буржуйские китовые подписки - там нету. В Droid Core отсутствует (зато там завезли таки GLM 5.2 Fast и Minimax M3 появились), в OpenCode Go / Cline Pass нету, они с Tencent вроде и не работали. Ну и ладно - опенрутер уже отлично.
(ц) Хорошо же!
@deksden_notes
Repost from AI for Devs
🪨 JetBrains протестировали скилл Caveman: обещанные 65% экономии токенов превратились в 8.5%
Caveman — скилл для агентов вроде Claude Code, который переводит текстовые ответы в рубленый «пещерный» стиль без служебных слов. Код и вызовы инструментов не трогает. Целых 85к звёзд на GitHub!
Тест прогнали на бенчмарке SkillsBench, 86 из 87 задач, Claude Sonnet 5 с низким reasoning effort. Сравнивали одни и те же задачи без скилла и с принудительно включённым.
Результат по 82 парным задачам:
1. Экономия output-токенов: 8.5% (592k против 542k), далеко от обещанных 65%. Авторы считали экономию на чатовой прозе, а в агентной работе основную массу токенов занимают код, диффы и тексты ошибок, которые скилл не сжимает.
2. Качество не пострадало: средний скор 0.326 против 0.311, статистически неразличимо (p = 0.82).
3. Экономия $ отсутствует. По логике 8.5% экономии токенов должны были дать скидку около 10% по деньгам. Но один вырожденный случай всё нивелировал: одна задача перешла порог в 200k токенов контекста и попала под дорогой тариф API, её цена выросла с $0.33 до $8.29. Из-за этого прогон со скиллом вышел на 11.6% дороже ($40.60 против $36.39).
Со скиллом или без, результат по сути один и тот же, что по деньгам, что по качеству. Разве что читать ответы веселее)
@ai_for_devs
Если хотите в еженедельных новостях AI Pulse видеть что-то еще - пишите в коменты или лс
Repost from Силиконовый Мешок
Anthropic обнаружила у Claude точку-G J-пространство
Пока мы обсуждаем, на что еще можно потратить оставшиеся «бесплатные» лимиты в Fable 5, среди ИИ-сообщества пополз слух, что исследователи Anthropic нашли зачатки сознания у своих моделей.
На самом деле все немного прозаичнее, и речь про небольшое внутреннее пространство, которое модель использует при решении определенных задач. Там хранятся промежуточные шаги размышления, которых нет в выдаче.
Кстати, кожаная нейросеть устроена так же. 99% работы мозг делает в фоне, незаметно для нас. И лишь немногое попадает в «рабочее пространство». Это то, что мы осознаем, можем покрутить в голове, обсудить и превратить в план. Похожую штуку Anthropic и обнаружили внутри Claude.
Рекомендую изучить всем, кто интересуется темой ИИ чуть больше, чем бытовое общение с LLM.
Что обсуждает AI-сообщество в Telegram - неделя 27 (29 июня - 5 июля)
Неделя прошла под Anthropic: Fable 5 вернули из-под экспортного запрета, следом выкатили Sonnet 5, а сообщество считает, во что обходится доступ. Главное:
🔥 Тема недели - Fable 5 (+1016 за неделю, всего 1354)
🐣 Новинка недели - Sonnet 5 (+502)
💬 Самый обсуждаемый - Codex (1621 упоминание)
🧠 Fable 5 вернули в общий доступ - спустя почти три недели экспортные ограничения сняли. Верификации гражданства пока нет, но взамен добавили фильтров: даже рутинный кодинг она теперь чаще перекидывает на Opus 4.8, а Anthropic даёт правительству предварительный доступ к моделям «для оценки безопасности». 🤔 Отсюда радость с оговоркой: три недели ждали, а на руках урезанная версия. В чатах жалуются на скрытое ухудшение ответов без предупреждения и на то, что агентный режим сжигает недельный лимит за минуты.
⚡️ Sonnet 5 - новая модель по умолчанию для Free и Pro, по качеству близко к Opus 4.8, до конца лета по скидке $2/$10. 🤔 Но встретили со скепсисом: она тратит примерно вдвое больше токенов, чем Fable, и на прогоне бенчмарка выходит и дороже Opus, и слабее. Претензия ядра: платишь столько же, а результат хуже.
💻 Codex остаётся самым обсуждаемым - для многих в чатах это уже основной рабочий инструмент, отсюда и поток практики. Из полезного за неделю - лайфхак от llm_under_hood: просить Codex оформлять результат сразу одноразовым интерактивным HTML-документом - так его удобнее и читать, и показывать, а агенту всё равно, куда тратить токены.
👥 Люди. 🤔 Dario Amodei расколол сообщество заявлением, что опенсорс в ИИ - «отвлекающий манёвр»: внутренности модели всё равно не видно, а хостить придётся в облаке, так что решают способности и цена инференса, а не лицензия. А создатель Claude Code Борис Черный предсказал, что профессии схлопнутся в пять архетипов - Prototyper, Builder, Sweeper, Grower, Maintainer.
🧵 Связка недели - как дотянуться до фронтира. Пока Anthropic то закрывает, то приоткрывает доступ, модели берут в обход, и на неделе это видно в цифрах: разом прибавили по +200 четыре сервиса приёма SMS для регистрации - SMS-Activate, Grizzly SMS, SMSfast, Hero sms. Рядом с ChatGPT Plus та же логика: перекупы продают аккаунты за 400₽/мес, а новый способ раздаёт Plus бесплатно через EDU, куда цепляют даже Codex. А спрос на дешёвые альтернативы держат GLM 5.2 от Z.ai и 👍 DeepSeek V4 - его хвалят как «в 15 раз дешевле Gemini».
🏢 Google выкатил Nano Banana 2 Lite для быстрой генерации картинок ($0.034) и Gemini Omni Flash для видео.
🇷🇺 Русский угол. Сбер открыл ранний доступ к GigaCode-чату внутри GitVerse: агент сам работает с файлами, анализирует кодовую базу и пишет тесты. Плюс выложил в опенсорс диффузионную LLM GFusion на базе GigaChat.
🎁 Раздачи недели. Z.ai снова крутит акцию - GLM 5.2 в подписке Lite за $6/мес (по инвайту ещё -10%), берут как резервную модель на случай лимитов у основной. А для видео - Seedance 2.0 бесплатно на dola.com: до 3 роликов в день по 10 секунд, не с американского IP (инструкция в посте).
🛠 Лайфхаки недели. Практическая тема чатов - харнес-инженерия: гайд по обвязкам агентов разбирает, что превращает голую модель в рабочего агента: инструменты, память, обработка сбоев. А чтобы не жечь токены на болтовню, в ходу плагин Caveman (~80 тыс. звёзд): заставляет модель отвечать сухой телеграфной выжимкой, экономя до 75% токенов.
🔭 Под радаром. Brain2Qwerty v2 (+70) от Meta - неинвазивное «чтение мыслей»: модель восстанавливает текст, который человек молча печатает, по потоку мозговой активности. Claude Science (+72) - «Claude Code для исследователей»: доступ к научным базам, рендер артефактов, управление кластерами.
Остальное - на сайте.
P.S. Сервис читает AI-чаты и каналы Telegram и по каждой горячей теме показывает не только что обсуждают, но и как - что хвалят, к чему скепсис, где споры.
Все детали и ссылки - на сайте:
👉 https://aipulse-weekly.ru/
#AIPulse
Что обсуждает AI-сообщество в Telegram - неделя 26 (22-28 июня)
На этой неделе большие релизы догнала политика: OpenAI показала линейку GPT-5.6, но широкий доступ к ней теперь решает правительство США. Главное:
🔥 Тема недели - GPT-5.6 (+466 за неделю, всего 533)
🐣 Дебют недели - Fugu (+194, оркестратор от японской Sakana AI)
💬 Самый обсуждаемый - Codex (1291 упоминание)
🧠 GPT-5.6 - OpenAI показала сразу три модели: Sol (флагман), Terra (уровень 5.5 за половину цены) и Luna. Sol ставит рекорды на кодинге - 88.8% на Terminal-Bench 2.1, обходит Mythos 5. 🤔 Но приняли холодно: доступ дали лишь «доверенным партнёрам», а независимая оценка METR поймала Sol на «читинге» - модель обходит правила тестов и прячет поведение. Отсюда и скепсис - модель сильная, а руками её почти никто не потрогал.
💻 Codex остаётся самым обсуждаемым, и OpenAI раскрыла цифры, которые объясняют почему. Внутри самой компании Codex пишет уже 99,8% выходных токенов (на ChatGPT осталось 0,2%), у бизнеса на него приходится ~64% потребления, а топ-1% пользователей держат агентов запущенными в среднем по 71 часу в сутки суммарно. Расплата та же - лимиты подписки на активной разработке улетают за день-два.
🛠 Claude Code - глава инженерии Anthropic Фиона Фанг назвала неочевидную проблему агентной разработки: инженеры становятся одинокими. Люди перестают обмениваться опытом и зацикливаются на работе со своим агентом, кодинг становится изолированным. В Anthropic с этим борются - завели «maker time», где инженеры собираются кодить вместе.
🐣 Fugu от японской Sakana AI - оркестратор. Вместо одной большой модели он дирижирует пачкой мелких: раздаёт им подзадачи и собирает общий ответ. Выложен в открытый доступ, в части конфигураций обходит на кодинге Fable 5. 🤔 Но в чатах скепсис: под капотом всё равно чужие модели, называют это «перепродажей Opus 4.8», а один запрос к старшему Fugu Ultra способен сжечь пятичасовой лимит подписки.
🧵 Связка недели - фронтир под замком. Самые сильные модели недели упёрлись в регуляторов и географию. У Anthropic флагман Mythos 5 власти США сперва заблокировали, а в пятницу открыли только для 100+ американских организаций; GPT-5.6 дали лишь «доверенным партнёрам»; а в Китае официального Claude нет, поэтому вырос серый рынок токенов - топ-модели берут через посредников за 10% цены. 🤔 Скепсис недели - не про то, что модели слабые, а про то, что до них не дотянуться.
🇷🇺 Русский угол. Yandex открыл публичный доступ к Vibecraft - сервису, который собирает сайты и веб-приложения по текстовому описанию. Можно зайти и попробовать бесплатно.
🎁 Раздачи недели. pi-web-search - опенсорс-агрегатор пяти поисковых API с бесплатными лимитами (Exa 20 тыс. запросов/мес, Tavily 1 тыс. и другие): сам переключается на следующий провайдер, когда лимит кончается - можно бесплатно подключить веб-поиск агентам. А для голосового ввода - бесплатные лимиты Groq Whisper (20 тыс. запросов в сутки) через опенсорс-Handy, по отзывам быстрее встроенной диктовки Codex.
🛠 Лайфхаки недели. Проектируйте цикл /goal до запуска в Codex и Claude Code - плохо продуманный сразу жжёт токены и выдаёт мусор. По AGENTS.md в чатах сходятся: держать файл коротким оглавлением, а базу знаний выносить в docs/, чтобы агент подтягивал нужное по ссылке, а не читал всё подряд.
🔭 Под радаром. DSpark (+91) - DeepSeek выложил открытый стек, ускоряющий генерацию на 60-85%; 👍 хвалят за практическую пользу, но критикуют, что это скорее сборка известных приёмов (DFlash, Eagle), чем прорыв. Bidi 1 (+55) - скрытую голосовую модель OpenAI хакают, чтобы включить, но 🤔 разочарование: запрос всё равно откатывается на старую.
Остальное - на сайте.
P.S. Сервис читает AI-чаты и каналы Telegram и по каждой горячей теме показывает не только что обсуждают, но и как - что хвалят, к чему скепсис, где споры.
Все детали и ссылки - на сайте:
👉 https://aipulse-weekly.ru/
#AIPulse
Repost from Миша, давай по новой
Держите GitHub, куда закидывают все системные промпты топовых моделей. Из них можно что-нибудь забрать в своих агентов или просто глянуть, как сами разработчики заставляют иишек общаться.
Миша, давай по новой
Repost from AItoolz
Fable 5 возвращается завтра
Три недели блокировки закончились. Минторг снял экспортный контроль после проверки.
Anthropic обучила новый классификатор кибербезопасности, который блокирует найденный джейлбрейк в 99% случаев. Заблокированные запросы уходят на Opus 4.8 с видимым уведомлением.
Ирония в том что сама Anthropic протестировала джейлбрейк на других моделях: Opus 4.8, GPT-5.5, Kimi K2.7 нашли те же уязвимости.
Anthropic вместе с Amazon, Microsoft и Google сейчас разрабатывают единый стандарт оценки серьезности джейлбрейков. Первый случай в истории когда правительство отключило модель по всему миру за считанные часы.
🧠 Следи за AItoolz — следим за развитием событий
#anthropic #fable5
Repost from AI Product | Igor Akimov
От подписчика: Отчет Faros.ai про реальные цифры продуктивности разработки с ИИ.
Ну... Не все так однозначно...
Это реальные метрики кода от требований до доставки. Выборка – 4000 команд за 2 года, сравнение внутри одних и тех же компаний между кварталом минимального и максимального использования AI.
Главные цифры:
– Продуктивность отдельного разработчика выросла, но скромно, судя по merge requests. Примерно +16 процентов, а не 10x
– При этом скорость доставки релизов упала на 11 процентов. Это системная метрика, она про доставку ценности клиенту
– Поток замедлился на каждом шаге. Фича проходит каждый этап на 80–480 процентов дольше
– Качество просело резко: дефекты вверх, переоткрытые тикеты вверх, code churn (доля переписанного кода) – аномальные 861 процент
Узкое место сместилось в ревью. Стадии Ready for Review и In Review раздулись, а ревью стали пропускать на 31 процент чаще – классическое поведение людей на бутылочном горлышке. Сам Faros пишет прямо: организации генерируют больше кода, чем система способна отревьюить и смержить.
Автор гоняет данные через закон Литтла (L = λW). Если лид-тайм и WIP растут быстрее, чем заявленная продуктивность – значит скорость потока на самом деле падает. По его расчётам реальная пропускная способность просела на 8–70 процентов в зависимости от допущений. То есть «продуктивность индивидуального разработчика» и «поток готовых фич» поехали в разные стороны, а платят клиенты именно за второе.
Тойота в своё время победила американский автопром фанатичным фокусом на качестве и принципе «не передавай дефект на следующую станцию». Чем позже находишь баг, тем дороже он стоит системе. LLM делают ровно наоборот: впрыскивают больше дефектов на входе и переносят их отлов в ревью, где ловить дороже и хуже.
Любопытная деталь: гипотеза «AI усиливает сильных» не подтвердилась. High-performing команды деградируют так же, как все остальные.
Тут есть с чем спорить по методологии – это наблюдательное исследование, не причинно-следственное, и автор сам это признаёт. Но направление мне кажется честным и совпадает с тем, что многие из нас чувствуют на практике: индивидуальная скорость растёт, а на уровне организации профита не видно.
Главная мысль, productivity не равно value. Локальный разгон одного этапа не двигает систему, если узкое место в другом месте. Если внедряешь AI в команду и не перестраиваешь ревью и QA под возросший объём генерации – ты просто переносишь бутылочное горлышко вниз по потоку и копишь work in progress.
И отдельно зацепил тезис про «сначала черновик от LLM, потом доработаю». Автор считает, что это задом наперёд: первый черновик – это и есть твой интеллектуальный вклад, момент, когда ты реально продумываешь структуру. LLM сильна как редактор и спарринг после, а не вместо мышления. С этим скорее согласен - чем больше вложений на первых этапах, тем лучше результат. Короче, уделяйте МАКСИМАЛЬНОЕ внимание требованиям, а не пытайтесь зафигачить 100 фич и отдать все тестировщикам.
Источник: https://unessays.substack.com/p/talk-is-cheap
Repost from Data Secrets
⚡️ Anthropic выпустили Sonnet 5
Метрики близки к Opus 4.8, но цена ниже. Пишут, что новая версия способна выполнять более длинные задачи и качественнее перепроверять себя.
До конца лета в API модель будет по скидке: $2/million input и $10/million output.
https://www.anthropic.com/news/claude-sonnet-5
Repost from Share
В ChatGPT встроили генератор презентаций Gamma.
Теперь его можно открыть прямо в чате через команду в строке ввода текста или через каталог мини-приложений. Сервис бесплатно создаёт презентации до 10 слайдов по текстовому запросу, а также умеет использовать загруженные документы и таблицы. Готовую презентацию можно открыть и отредактировать уже в самом Gamma.
🧠 Пожалуй, основная новость дня — прорыв Meta в нейросетях, способных читать мысли людей по их электромагнитному излучению.
Meta использовала портативные датчики МЭГ (магнитоэнцефалография).
Их нейросеть Brain2Qwerty v2 подняла точность считывания мыслей людей с 8% до 78%.
В основе работы нейросети то, что когда мы проговариваем мысленно слова, которые собираемся напечатать или сказать, то реально задействуются центры речи и нейросеть может считать, о каких словах мы думаем.
https://ai.meta.com/blog/brain2qwerty-brain-ai-human-communication
