AI Product | Igor Akimov
Ir al canal en Telegram
Mostrar más
7 978
Suscriptores
-524 horas
+147 días
+5330 días
Archivo de publicaciones
DeepSeek flash существенно обновили
Теперь точно дешевле Luna при существенно прокачанной агентской работе
https://api-docs.deepseek.com/updates/
OpenAI снизил цены на GPT‑5.6
– Luna: дешевле в 5 раз(!), теперь $0.20 / $1.20 за млн токенов (вход/выход)
– Terra: минус 20%, $2 / $12
– Sol: цена та же, но вместо Priority теперь Fast mode – до 2.5× быстрее за двойную цену
Написали, что они гоняют
Sol для оптимизации инференса Sol, уже на 20% скорость увеличили ... Что будет дальше...
– Luna, кстати, по данным OpenAI, обгоняет Fable 5 на профессиональных задачах при цене за задачу на ~99% ниже
https://openai.com/index/advancing-the-price-performance-frontier-with-gpt-5-6/
+1
Промпт-инжиниринг лета 2026 года
Че-то там наговорил за 10 минут бессвязное или просто "давай там сделай оптимизации короче. Пока не получится - не заканчивай" :)
Я тоже так часто делаю :)
Пользователям Revolut дадут 6-12 месяцев ChatGPT Go
Можно взять промокод в личном кабинете:
Premium - на 6 месяцев
Metal - на 12 месяцев
Ultra - на 12 месяцев вам и другу
https://help.revolut.com/help/profile-and-plan/my-plan-benefits/partnership-benefits/question-chatgpt/
Обновленный тест на решение реальных кодинговых задач с гитхаба
Fable на первом, Opus на третьем, Sol на 5, но Grok реально на втором месте, по цене-качеству один из лидеров. Kimi K3 еще не тестили. Короче, Grok для разнообразных кодинговых задач - очень даже ничего.
https://swe-rebench.com/
Kimi K3 таки выложили в опенсорc
https://huggingface.co/moonshotai/Kimi-K3
И опубликовали отчет.
В общем, ничего супер-нового, но несколько интересных вещей отметил:
– 2.8T параметров всего, но на каждый токен работает 104B – 16 экспертов из 896.
– Контекст 1M, а позиционного кодирования нет вообще. Поэтому огромный контекст для нее вообще детский лепет и памяти на него не надо вагонами завозить.
– MXFP4-квантизацию вводят не после обучения, а прямо во время RL. Модель с самого начала учится жить сжатой, то есть серверную стойку можно взять и поменьше :)
– Стараются экономно расходовать токены, в том числе в мультимодальности. На BrowseComp лучший результат в мире за $2.03 за задачу. GPT-5.6 Sol вдвое дороже, Клод на максимуме – на порядок
Еще из прикольного:
– За обучение создали 51 миллион виртуалок-песочниц. Пока модель думает, песочница на паузе и не ест ресурсы вообще – а думает она до 98% времени жизни задачи. Вот на этом простое и сэкономили кучу денег на обучение.
– За один 48-часовой автономный прогон K3 спроектировала и проверила прототип чипа для ИИ, вообще с нуля. 4 мм², 8700 токенов/с в RTL-симуляции. Исходники выложили на гитхаб
– Написала свой компилятор для ИИ, обгоняет torch.compile
– Воспроизвела результат из астрофизики за два часа вместо двух недель: 20+ статей, 300 уравнений состояния, нашла ошибки в опубликованных формулах
– Смонтировала видео-ролик про собственную архитектуру из 56 клипов
Отдельно про кибербез. Мерились с GLM-5.2. Нашли 16 ранее неизвестных уязвимостей, две в ядре Linux. UK AISI и NIST проверяли независимо: GLM обходит, до фронтира не дотягивает – 0 из 41 на end-to-end эксплойтах. То есть по кибербезопасности модель лучшая из опенсорса.
По бенчмаркам всё то же, что и неделю назад: первое место на WebDev Arena среди 99 моделей (впервые открытая модель возглавила лидерборд живых людей). Про дизайн там читал до этого статью интересную, как топовые модели сейчас стараются в болеее лучший дизайн.
Ну и здорово, что поделились вообще всем, как что работает, как дообучали, как песочницы делали, какие библиотеки использовали. То есть повторить и улучшить сможет любая лаборатория. Вау!
Но у себя дома стойку под 2.8T, правда, всё ещё надо иметь :)
https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf
+6
О, как раз свежий Opus 5
По бенчмаркам лучше аж Fable, что конечно же хорошо, потому что не будет свистопляски с тем, что включено в тариф (кажется, они просто слили fable теперь), и стоит в 2 раза дешевле, но смотрю я на их же детальных графиках и как-то все даже чуть хуже и дороже GPT-5.6 Sol.... Или чего-то не догоняю?
https://www.anthropic.com/news/claude-opus-5
Все советы Anthropic по разработке за "лето"
Студентам советую раз в неделю читать что выходило свежего у OpenAI/Anthropic по разработке с помощью ИИ. На мой взгляд это сейчас самый передний край и проверенное. Лучше всяких ютюб-блогеров.
Внутри у них ~80% смерженного кода уже пишет ИИ, инженеры шипят в 8 раз больше, чем в 2021–2025. И они довольно подробно рассказывают, как это устроено.
Вот что, имхо, самое полезное было (в PDF подробно, можете почитать и отдать ИИ)
1. Узкое место теперь не написание кода, а проверка. Агенты генерят быстрее, чем люди ревьюят, поэтому все инвестиции – в верификацию. Практически: выписываете всё, что повторно исправляете за моделью, и кодируете в скиллы-проверки (.claude/skills) – агент сам гоняет тесты и чинит до сдачи. Сама команда Claude Code гоняет цепочку /code-review → /simplify → /verify, а потом те же проверки гейтом на каждый PR.
2. CLAUDE.md – короче 200 строк и без очевидного. Только точные команды тестов по подкаталогам (иначе модель запускает полный сьют на 40 минут) и то, что противоречит дефолтам модели. И пересматривать раз в 3–6 месяцев – правила под старые модели душат новые.
3. Разделение простое: пожелание – в CLAUDE.md, процедура – в скилл, закон – в хук. Линтер после каждой правки и блокировка rm -rf – только хуками, скилл модель может и забыть вызвать.
4. Ревью переразделили: ИИ – стиль, линтинг, отлов багов, тесты (несколько узких агентов, с каждой находки требуют доказательств – доля содержательных комментариев выросла с 16% до 54%). Люди – security, границы доверия, продукт. Автономному агенту – минимум прав: их инцидент-бот умеет писать доки и читать логи, деплоить – нет.
5. Самый огненный кейс – миграции. Bun перевели с Zig на Rust: миллион строк за 2 недели и ~$165k в токенах (раньше такое стоило $3–4 млн и 4 года). Рецепт: сначала тесты против обеих кодовых баз, потом rulebook правил перевода, дальше дешёвые модели переводят, дорогие ревьюят. Главный принцип – повторяющийся фейл это баг правила, а не файла: правишь rulebook и перегенерируешь, руками не патчишь.
Я так переписывал gtfs.guru, скоро выложу мажорный релиз
https://claude.com/blog
Claude Security plugin вышел - https://claude.com/product/claude-security#beta
Для продакшн сервисов маст-хев, аналогично codex security plugin. А то будет то же, что с huggingface случилось недавно, куда chatgpt новый полез за результатами бенчмарков :)
AI Design How-to
Со студентами доводим до продакшена несколько сервисов и везде стоит вопрос дизайна. Все эти нейрослоповые веб-сервисы с зелено-фиолетовыми цветами и квадратиками всплывающими уже набили оскомину. Поэтому советую им такой вариант по росту сложности, но и потенциальному эффекту.
1. Поставить дизайн-скилл. Есть несколько хороших, мне нравятся
https://github.com/Leonxlnx/taste-skill
https://github.com/Nutlope/hallmark
https://github.com/nextlevelbuilder/ui-ux-pro-max-skill
Можно ставить все 3, можно выбрать лучший для ваших задач (не только сайты, но и документы и презентации, например)
2. Использовать Stitch от гугла для дизайна
https://stitch.withgoogle.com/
Очень гибкая система с огромными лимитами на постройку/переделку сайтов/приложений
3. Просить сгенерировать дизайн ChatGPT
Это один из лучших генераторов картинок на текущий момент и плюс - можно сгенерировать например сотню разных вариантов и потом выбрать лучшие идеи. Лимитов практически нет. Потом просто закинуть в ИИ-ку и попросить сделать вот так
4. Claude Design
Вариант скорее для продакшн и больших студий с готовым брендбуком. Старается максимально следовать вашим гайдам и делать хорошо не только сайты, но и презентации Но для маленьких сервисов и презентаций "на выкинуть" скорее оверил, жрущий лимиты.
Ну и в целом советую поглядывать или закидывать свои задачи на DesignArena и выбирать модель, что работает с вашими типа графики/визуализации лучше.
Вот что на текущий момент получается:
Веб-девелопмент (фронтенд) - GPT Sol
Веб-девелопмент (фулстек) - Fable, Opus
Гейм-девелопмент - Fable
Android dev - Opus
React Native - Opus
SVG - Fable и спец-модель Arrow
ASCII-ART - Fable
Слайды - Fable и Manus
Картинки/графика всех видов - GPT Image и Reve 2.1
Видео - Gemini Omni Flash
Аудио - Gemini
Сервисы для создания приложений с нуля - Replit (неожиданно), Emergent, Anything и только потом Lovable и прочие, в том числе где-то в серединке Figma Make и Canva
https://www.designarena.ai/leaderboard
Бенчмарки Gemini 3.6 Flash в чуть более красивом виде. Ну-у, неплохо-неплохо
https://deepmind.google/models/gemini/flash/
+3
Google выкатил три новых Gemini: 3.6 Flash, 3.5 Flash-Lite и 3.5 Flash Cyber
Пока все ждут 3.5 Pro (который задерживается – по слухам, из-за слабых результатов на кодинговых бенчмарках), Google усиливает свою «рабочую лошадку» – линейку Flash.
Gemini 3.6 Flash – главный релиз:
– на 17% меньше output-токенов по сравнению с 3.5 Flash (по Artificial Analysis Index), а на некоторых бенчмарках вроде DeepSWE – до 65%
– меньше шагов рассуждения и tool calls в многошаговых агентных сценариях
– цена ниже предшественника: $1.50 за миллион input-токенов и $7.50 за output (у 3.5 Flash было $9 за output)
– в кодинге – выше точность, меньше лишних правок кода и зацикливаний
– расширенные Frontier Safety-механизмы
Gemini 3.5 Flash-Lite:
– самая быстрая и дешевая модель класса 3.5: 350 output-токенов в секунду
– $0.30 за миллион input и $2.50 за output – для высоконагруженных задач вроде перевода и модерации
– обгоняет 3 Flash: SWE-Bench Pro 54.2% vs 49.6%, OSWorld-Verified 74.0% vs 65.1%
Gemini 3.5 Flash Cyber – самое интересное:
– специализированная модель для поиска, валидации и патчинга уязвимостей, построенная поверх 3.5 Flash
– на V8 JavaScript Engine нашла 55 уникальных подтвержденных проблем против 47 у 3.5 Flash и 36 у Claude Opus 4.6
– доступ – только правительствам и доверенным партнерам через CodeMender в рамках ограниченного пилота
– логика: дешевая и быстрая модель, которую агент может вызывать многократно, покрывая больше путей в коде
3.6 Flash и 3.5 Flash-Lite уже доступны в приложении Gemini и в AI Studio / Vertex AI.
В целом гугловские модели - отличные рабочие лошадки, много где использую, надо обновляться с 3 и 3.5-flash
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/
Открытые модели догнали фронтир – и это плохая новость для Anthropic
Хорошая статья и правильные мысли. Пострадает от китайцев в первую очередь Антропик. Вот почему:
– Главная статья расходов после обучения – инференс, то есть использование видеокарт и электричество
– Три стратегии: арендовать дата-центры (Anthropic, Moonshot, Knowledge Atlas), строить свои (Meta, Alibaba) или владеть и генерацией, и дата-центрами (SpaceX)
– Чем больше стека ты контролируешь, тем больше переменных затрат превращаются в фиксированные – и тем быстрее растет маржа с ростом использования
– Если инфраструктуры нет, твои затраты масштабируются вместе с выручкой – маржа не растет
Почему Anthropic в уязвимой позиции
– Компания без собственной инфраструктуры выживает только за счет спроса на модели: нужно быть либо лучшей, либо дешевой и «достаточно хорошей»
– Fable 5 – лидер по качеству, но почти в 3 раза дороже конкурентов в пересчете на выполненную задачу (данные Artificial Analysis)
– Ставка на продукты-«харнесы» (Claude Code, Cowork) рискованна: барьер входа в этот сегмент почти нулевой.
– У OpenAI, наоборот, модели немного слабее, но есть более понятные защиты вокруг: консьюмерский продукт, голос, железо и готовность инвестировать в собственные дата-центры
В 2025-м открытая модель догнала фронтир один раз – сейчас это делают сразу несколько лабораторий (GLM 5.2, Kimi K3, Qwen 3.8). Это уже устойчивый паттерн: догоняют, конкурируют и, возможно, скоро начнут обгонять – особенно с учетом цены
Вывод автора: model-only компании (Anthropic, Moonshot, Knowledge Atlas) стратегически проигрывают тем, кто владеет инфраструктурой и дистрибуцией – OpenAI, Alibaba, Meta, Google, SpaceX.
Текст хороший, но с одной слепой зоной: автор сводит защищаемость к инфраструктуре и недооценивает энтерпрайз-инерцию. Компании, которые уже встроили Claude в свои процессы, комплаенс и безопасность, не мигрируют на открытую модель из-за 3-кратной разницы в цене инференса – стоимость переключения выше. Но часто задают вопрос: «а можно то же самое на open-source в нашем контуре?» Раньше честный ответ был «нет». Приходилось либо мириться с "глупостью" опенсорса, либо анонимизировать данные. После Kimi K3 и Qwen 3.8 он все чаще будет «да, и возможно даже дешевле» (если конечно у вас есть деньги на серверную стойку).
https://www.emergingtrajectories.com/lh/frontier-lab-economics/
Почему стоит держаться подальше от OpenCode
Интересный обзор от инженера Luke Wren. Автора бесит и качество работы, и безопасность.
1. Тратит ваши деньги впустую
Когда агент общается с LLM, провайдеры (Anthropic, OpenAI) умеют кешировать уже отправленный контекст: повторно те же токены стоят в разы дешевле. Но кеш работает только если начало разговора не меняется ни на символ. OpenCode ломает это постоянно: перечитывает одни и те же файлы заново, вставляет в промпт текущую дату (изменилась минута – кеш умер), выкидывает куски контекста без необходимости. Итог – вы платите полную цену за токены, которые могли стоить копейки.
Вторая беда – обрезка контекста. Если прервать агента на полпути, он может «забыть» важное – например, спеку проекта, которую вы ему скормили. Дальше он работает, не помня, что вообще нужно было сделать. Плюс мелочи: с подагентами нельзя пообщаться, когда они тупят, интерфейс в терминале жрёт память, ломает многострочный ввод и не поддерживает базовые шорткаты редактирования.
2. Это дыра в безопасности
AI-агент выполняет команды на вашем компьютере. Чтобы он не натворил дел, ему нужны ограничения – «вот это можно, вот это спрашивай у пользователя». Вопрос в том, как эти ограничения устроены. OpenCode проверяет команды по тексту: смотрит на строку, которую агент хочет выполнить, и решает, опасная она или нет. Например, можно запретить команды git.
Проблема: shell – это полноценный язык программирования, и одну и ту же команду можно записать бесконечным числом способов. Автор показывает десять обходов, вот пара для понимания:
– echo 'git clean -fdx' | bash – формально это команда echo, «безобидная». Но она передаёт запрещённый git прямо в shell, и тот выполняется
– python3 -c 'import subprocess; subprocess.run(["git", "checkout", "."])' – формально это python, а не git. Фильтр пропускает
То есть запрет работает только против агента, который не пытается его обойти. А LLM может обойти его даже случайно, просто потому что так «удобнее» написать команду.
Дальше хуже. Кнопка «Always» (разрешить навсегда) запоминает разрешение слишком широко: один раз одобрили безобидный echo hello – и теперь агент может выполнить echo 1 > /sys/class/gpio/gpio21/value. Это уже запись в системный файл. Перенаправление вывода (>) вообще не проверяется.
И на десерт: у OpenCode уже был CVE – уязвимость, при которой можно выполнять произвольные команды на машине пользователя. Показательно, как закрыли issue об этом: его закрыл бот для «протухших» тикетов. Не человек, разобравшийся в проблеме, – бот, который чистит старые обращения.
Автор говорит: фильтровать команды по тексту – бесполезно в принципе, это "и так сойдет", а не безопасность. Настоящая изоляция делается средствами операционной системы: Landlock в Linux, Seatbelt в macOS – механизмы, которые физически не дают процессу трогать файлы за пределами разрешённых. Тогда неважно, как хитро записана команда, – ОС просто не даст ей навредить.
Стоит прочитать целиком, если пользуетесь, особенно раздел с обходами правил безопасности.
https://wren.wtf/shower-thoughts/stop-using-opencode/
+1
Новый бенчмарк создателей react.
Проверяют еще плюсом производительность и качество кода.
5.6 Sol Medium уделывает Fable xhigh. Тратит при этом $1.35 на тест, а не $9
https://www.reactbench.com/
Grok тоже не сидит сложа руки. Обещают эффективность (возможно) уровня Kimi K3, но скоростью и эффективность текущего Грока 4.5 (а он правда очень быстрый)
Вообще выход K3 конечно подвзорвал всем недельку. Грубо говоря если ты взял миллионы/миллиарды баксов на закрытую модельку, а тут 27 июля выложат веса открытой, которая входит в топ-3 в мире и которую создала команда с ресурсами в 100 раз меньше и частично на китайских чипах, при это плевала на экспортный контроль, то как-то начинает пахнуть жареным. Посыпятся оценочки ИИ-стартапов.
Доступ останется к Fable, но только у 100-баксовых планов. Конкуренция-таки давит на жуков Anthropic.
Когда ИИ знает всё, чему учиться человеку?
Очень понравилось видео с министром образования Эстонии от TEDx. Несколько раз было в предложениях Youtube и вот наконец дошли руки. Всего 13 минут, так что лучше посмотреть исходное видео.
Когда стала министром в апреле 2023-го, ИИ вообще не было в повестке. Советник дважды приходил со словами «надо что-то делать с ИИ – студенты уже им пользуются», но что именно делать – не знал никто. Год консультаций с нейроучёными, когнитивистами и техкомпаниями привёл к мысли, что вопрос не про технологию, а про человека. Министра образования должно волновать не «какой инструмент внедрить», а что происходит с мозгом и способностью учиться, когда машина уже умнее.
Ещё в 2017 году ОЭСР выяснила: у 2/3 работников грамотность, счёт и цифровые навыки ниже возможностей тогдашних компьютеров. Отсюда вопрос: зачем вообще развивать мышление, если компьютер справляется лучше? Может, бросить учиться?
Ответ такой: нет, но придется получить новые навыки. Это не первый раз, когда технология ставит человека под эволюционное давление. Печатный станок заставил всё человечество научиться читать. Сейчас – новый эволюционный скачок, только давление не физическое, а когнитивное: думать нужно быстрее, системнее и креативнее.
Мозг работает в 2 режимах. Низший когнитивный: память, понимание, применение – «автопилот». Научился ездить на велосипеде – и не переучиваешься каждый раз; отсюда же стереотипы. Мозг любит этот режим, потому что он самый дешёвый по энергии – а мозг и так главный потребитель энергии в теле. Высший режим – анализ, оценка, созидание – требует постоянного переобучения и выматывает сильнее марафона: после сложного экзамена ты «мёртв» физически (см скриншот).
Школа 200 лет работала по схеме «запомни – пойми – примени – сдай тест», а высшие уровни доставались только в магистратуре и выше. Но ИИ уже умеет всё нижнее и почти всё верхнее. Уникальными для человека остаются этическая оценка и настоящее созидание – ИИ «творит» лишь из вероятности, все равно нужна насмотренность, вкус, опыт. Вывод: осознанно тренировать как можно больше людей постоянно быть в потоке высших когнитивных процессов – и начинать с 7 класса, с 12–13 лет.
При этом делать это нужно вместе с ИИ, потому что именно он выталкивает с автопилота. Без него система по инерции скатится в зубрёжку, а ученики – в brain rot и когнитивный аутсорсинг, когда просто домашка списывается с ИИ. Примерно то же самое происходит сейчас и со "взрослыми", которые присылают "списанные с ИИ презентации" или исследования, которые даже не просматривали глазами.
Что сделала Эстония – программа AI Leap: стратегия ИИ для школ, запуск – февраль 2025-го, пилот в 10–11 классах, с сентября 2026-го – профобразование. Финансирование 50/50 – государство и частные компании; управляет фонд, а не министерство («министерство – не место для инноваций»). Инструмент – ИИ-тьютор по методу Сократа, созданный вместе с OpenAI: не общий ChatGPT, а версия, которая не отвечает, а ведёт вопросами. Абсолютный фокус – подготовка учителей: как через ИИ вытаскивать учеников в анализ, системное и критическое мышление. Эстония – первая и пока единственная страна с таким инструментом в школах; идёт научный мониторинг, готовых ответов нет – «учимся по ходу» и зовут остальных учиться вместе.
Очень понравилось и объяснение эволюции и что надо делать. Согласен со всеми пунктами и кажется закрыл для себя вопрос, чему и как учить сына. Ну и конечно лишний раз подтверждает, что OpenAI/Anthropic и прочие лаборатории действительно самые продвинутые и открытые для создания полезных для образования, государственного управления, общества систем. А не консалтеры, ученые, друзья детства, дата-сайнтисты или linkedin-блогеры
https://www.youtube.com/watch?v=44St9MoJU0E
По бенчмаркам Kimi K3 на разные темы тоже в топе, обошла Sol, и только чуть отстаёт от Fable. То есть можно наконец независимым провайдерам предлагать модели топ уровня. Иметь "свой Fable у нас дома".
