en
Feedback
LLM под капотом

LLM под капотом

Open in Telegram

Канал про разработку продуктов на базе LLM/ChatGPT. Выжимка важных новостей и разборы кейсов. Чтобы писать - напишите боту @llm_under_hood_bot Рекламы в канале - нет. За комменты от ботов баним вместе с хозяином.

Show more

📈 Analytical overview of Telegram channel LLM под капотом

Channel LLM под капотом (@llm_under_hood) in the Russian language segment is an active participant. Currently, the community unites 29 006 subscribers, ranking 4 493 in the Technologies & Applications category and 22 340 in the Russia region.

📊 Audience metrics and dynamics

Since its creation on невідомо, the project has demonstrated rapid growth, gathering an audience of 29 006 subscribers.

According to the latest data from 06 September, 2026, the channel demonstrates stable activity. Although there has been a change in the number of participants by 428 over the last 30 days and by 17 over the last 24 hours, overall reach remains high.

  • Verification status: Not verified
  • Engagement rate (ER): The average audience engagement rate is 38.53%. Within the first 24 hours after publication, content typically collects 18.83% reactions from the total number of subscribers.
  • Post reach: On average, each post receives 11 176 views. Within the first day, a publication typically gains 5 461 views.
  • Reactions and interaction: The audience actively supports content: the average number of reactions per post is 95.
  • Thematic interests: Content is focused on key topics such as sgr, llm, архитектура, erc3, openai.

📝 Description and content policy

The author describes the resource as a platform for expressing subjective opinions:
Канал про разработку продуктов на базе LLM/ChatGPT. Выжимка важных новостей и разборы кейсов. Чтобы писать - напишите боту @llm_under_hood_bot Рекламы в канале - нет. За комменты от ботов баним вместе с хозяином.

Thanks to the high frequency of updates (latest data received on 07 September, 2026), the channel maintains relevance and a high level of publication reach. Analytics show that the audience actively interacts with content, making it an important point of influence in the Technologies & Applications category.

29 006
Subscribers
+1724 hours
+1147 days
+42830 days
Attracting Subscribers
September '26
September '26
+131
in 3 channels
August '26
+632
in 5 channels
Get PRO
July '26
+1 225
in 20 channels
Get PRO
June '26
+1 041
in 10 channels
Get PRO
May '26
+934
in 16 channels
Get PRO
April '26
+952
in 19 channels
Get PRO
March '26
+1 125
in 20 channels
Get PRO
February '26
+979
in 9 channels
Get PRO
January '26
+1 450
in 24 channels
Get PRO
December '25
+705
in 15 channels
Get PRO
November '25
+733
in 13 channels
Get PRO
October '25
+979
in 14 channels
Get PRO
September '25
+1 443
in 17 channels
Get PRO
August '25
+1 277
in 23 channels
Get PRO
July '25
+900
in 13 channels
Get PRO
June '25
+928
in 24 channels
Get PRO
May '25
+889
in 15 channels
Get PRO
April '25
+1 076
in 15 channels
Get PRO
March '25
+1 249
in 8 channels
Get PRO
February '25
+1 102
in 7 channels
Get PRO
January '25
+1 924
in 22 channels
Get PRO
December '24
+758
in 6 channels
Get PRO
November '24
+573
in 6 channels
Get PRO
October '24
+831
in 8 channels
Get PRO
September '24
+1 080
in 12 channels
Get PRO
August '24
+557
in 8 channels
Get PRO
July '24
+262
in 0 channels
Get PRO
June '24
+572
in 7 channels
Get PRO
May '24
+975
in 11 channels
Get PRO
April '24
+856
in 4 channels
Get PRO
March '24
+846
in 3 channels
Get PRO
February '24
+486
in 6 channels
Get PRO
January '24
+542
in 5 channels
Get PRO
December '23
+425
in 0 channels
Get PRO
November '23
+241
in 3 channels
Get PRO
October '23
+671
in 3 channels
Date
Subscriber Growth
Mentions
Channels
07 September+3
06 September+19
05 September+11
04 September+35
03 September+13
02 September+26
01 September+24
Channel Posts
В последнее время появляется все больше историй, когда человек решает какую-то свою зудящую проблему, свалив ее описание и знание нюансов на AI Coding агента. А потом обнаруживается, что еще пара человек готовы заплатить несколько евро в месяц за это решение. Просим агента затеплить на какой-нибудь fly.io, прикрутить прием платежей, и вот вам деньги на новую удочку. Несколько примеров со ссылками на рассказы авторов: MyMarineForecast - автор очень любит лодки. Он собрал с Claude Code приложение-дашборд для морских прогнозов. Через несколько недель и 99 коммитов появились первые платящие пользователи. LOC8 - полицейский сделал удобное приложение-локатор для спасателей. 1500$ в месяц спустя несколько месяцев Plottie - исследователь в биоинформатике, который не умеет кодить, сделал приложение для генерации красивых графиков, которые можно публиковать. Через 25 дней, говорит автор, 2000+ пользователей и 100+ платных пользователей, 1000$ в месяц. InfoDrizzle - мелкое приложение (одно из тысяч) для iOS, которое делает персональный дайджест новостей. Ноль опыта в мобильной разработке, 15$ в месяц расходов на сервер и 200$ в месяц от 28 платящих пользователей, рассказывает DrizzleX3. Поскольку сложность, стоимость разработки и запуска небольших продуктов падает, у людей появляется возможность занимать небольшие ниши, которые раньше пустовали. Состояние там сколотить нельзя, но накопить со временем на интересное путешествие и подарки детям - вполне. А какие продукты пилите вы? Какие проблемы решаете? Какой у вас стэк и какие агенты помогают? Какие затраты в месяц на поддержку всего, сколько пользователей и какая прибыль (если уже появилась и не секрет)? Ваш, @llm_under_hood 🤗

2
Если вы читаете текст, в котором кто-то делает прогноз про AI на следующий год - не верьте. Никто толком не понимает, куда все катится. Скажем, еще год назад вроде все было понятно: есть LLM-ки, которые можно встроить в чат и получить свой ChatGPT. Встроить в бизнес и получить автоматизацию. Это открыло новые возможности. Компании начали интенсивно пытаться интегрировать это в свои процессы, их лидеры начали вещать про AI трансформацию компаний, а инженеры - гундеть про галлюцинации, борьбу с ними и необходимость evals. А потом в декабре 2025 все это пошло по бороде. "Внезапно" Coding харнесы (Claude Code + Codex) стали настолько мощными и самостоятельными, что теперь даже человек без высшего образования может сделать продукт без LLM под капотом, как-то задеплоить его и начать зарабатывать. Что и говорить о людях с опытом. И эффект тут перекрывает с головой потенциальный эффект от внедрения от LLM в бизнес. Просто потому, что для встраивания LLM в процесс - нужно иметь этот самый процесс, в который стоит встроить (а это встречается не так часто) и экспертов и эвалы. А вот для того, чтобы накодить агентом небольшое приложение кому-то в помощь - многого не требуется, достаточно идеи и отсутствия тормозов. Точек применения тут куча! Потенциальных последствий (как хороших, так и бардака). И что самое ужасающе-потрясающее - это не прогноз, а уже произошло. Как все еще раз встанет с ног на голову еще через полгода - не может предсказать никто. Но все очень хотят) Ваш, @llm_under_hood 🤗
7 882
3
Хочу подробно ответить на один классный вопрос про AI Coding Как считаешь в ближайшем будущем прорыв будет получатся из-за улучшения базовых моделей, или же инженерных трюков как например рассказываешь ты у себя в канале? Многие вещи как про голд спт, евалы, бдд, контрол центр я нигде не слышал. Повсеместно почти люди вещают кому какой скилл поставить. Мне кажется, что все дело в целях и в аудитории, для которой ведется рассказ. Скилы хороши тем, что это что-то наглядное и удобно упакованное. Скилл можно легко поставить и сразу увидеть результат, что что-то поменялось. Такой материал хорошо работает для привлечения аудитории. У нас же уже сложилось классное коммьюнити - подписчики, участники чата и тематических групп. Тут есть директора, лиды и инженеры компаний США и Евразии, как корпораций, так и передовых стартапов. Про многие компании вы уже слышали или даже пользовались их продуктами и услугами. Поэтому тут нет смысла упрощать картину ради аудитории. Наоборот, можно пропускать костыли, концентрироваться на системном подходе и конкретных результатах: ценность для пользователей, соответствие кода конкретным требованиям, а систем с LLM под капотом - измеримым ожиданиям. И если говорить про точные пайплайны c LLM под капотом - их никак не построить без evals и разнообразных датасетов. OpenAI и Anthropic без этого не смогли бы двигаться вперед. А если говорить про разработку продуктов для пользователей с AI Coding - аналогичная история. Можно написать хоть тысячу текстовых спеков в маркдауне с superpowers и OpenSpec, подключив это к ponytail. Но с качеством кода это не обязательно будет кореллировать (скорее наоборот, забъется контекст и поползут глюки). А вот тесты работали всегда, как работали превосходно все эти десятилетия, так и продолжают работать. А в случае сложной продуктовой разработки с хитрыми интерфейсами эти тесты уже давно делают в формате BDD. // а вот control center - это просто мой термин для старой DevOps модели, когда для удобства управления кучей систем в одну репу собирали пачки из Ansible/Terraform/Chef, bash скриптов и YAML каши от Kubernetes. Просто сейчас этот бардак можно свалить на агентов. И я считаю, что дальнейшие прорывы в разработке будут происходить не столько из-за улучшения моделей, сколько из-за развития харнесов кодовых агентов. А еще за счет того, что индустрия будет переоткрывать, как эффективно сочетать принципы, которые работали всегда - с этими новыми агентами. Агенты и LLM при этом будут продолжать дешеветь. Вот например большой аплифт по каким либо показателям дает тебе такой инженерный подход? Компенсирует ли этот прирост ту ответственность которую как я понимаю нужно проявлять к тому чтобы следовать всем этим ai native конвенциям У меня в итоге проекты не следуют специальным AI Native конвенциям, чтобы быть актуальными. Наоборот, это обычные читаемые проекты без каких-то скилов. Просто впервые в жизни у меня есть время, чтобы их оформить аккуратно и правильно, так, чтобы команда могла открыть проект, быстро разобраться и иметь возможность начать продуктивно работать, не ломая код. Ну а то, что проект аккуратно часами причесывал Codex (время которого, в отличие от своего, я не считаю), а команды теперь состоят преимущественно из кодовых агентов - это уже детали современной реализации)) Если кратко - аплифт есть. Скажем, проекты уровня BitGN я бы раньше не смог реализовать без большой команды. При этом сами конвенции в проектах не столько AI Native, сколько ориентированные на людей и основанные на уже работающих принципах. Но поскольку AI Agents тоже обучены хорошо работать с человеческими процессами - это все идеально стыкуется вместе в AI Native системы. Ну а то, что скилам у меня в ней места не нашлось - это уже вкусовщина) Ваш, @llm_under_hood 🤗
6 760
4
А давайте я осенью покажу, как в 2026 году начинал бы AI Native продукт с нуля? Как бы писал исполняемые спеки и боролся с багами? Но сначала маленькая предыстория) Сегодня мы закрываем продажу записи вебинара AI Coding, где мы с Айгизом рассказывали про наши подходы к AI Native разработке. Все началось спонтанно в начале лета с “давайте проведем вебинар про современную разработку при помощи агентов?”, а закончилось 5 потоками и таким списком ожидания, что пришлось открыть продажу записи. Было здорово увидеть на вебинаре и новых участников, и знакомые лица. Очень рад, что вебинар оказался полезным и что AI Coding подходы из него вы внедряете в своих проектах! Когда-то давно наши с вами вебинары по ассистентам выросли в курс с классным коммьюнити. А вебинары по AI Coding я хочу попробовать вырастить в обновляемую подписку. Начну с цикла материалов про разработку AI Native проекта с нуля. Планирую упаковать в удобной форме исходники, доки и спеки, описание подходов и процесса разработки. Код можно будет забирать, щупать и выполнять небольшие практические задания. А сам проект будет пересекаться с Personal OS, BitGN и свежим MCP 2.0) Материалы и платформу для публикаций я уже начал готовить. Часть будет публичная, а часть - платная по подписке. Если вам подобные материалы интересны, отпишитесь “+1” в комментарии! Ваш, @llm_under_hood 🤗
7 761
5
No text...
8 418
6
Вебинар по AI-кодингу - в записи Этим летом мы с Айгизом Кунафиным рассказывали пяти потокам слушателей про то, как строим AI-Native архитектуры. Шестой поток решили не делать, а сам вебинар теперь можно купить в записи - до конца августа включительно. Тем, кто оставлял емейлы в списке ожидания, ссылки на покупку уже разослали. Вебинар можно купить здесь: https://buy.abdullin.com/ до 31.08. Что внутри: как строить AI-Native архитектуры вокруг рабочих кодовых баз - с legacy, бизнес-логикой, интеграциями, логами, требованиями, ревью и проверкой поведения. Говорим о том, как стабилизировать и масштабировать то, что уже неплохо работает, при помощи кодинг-агентов. Важный момент: мы с Айгизом показываем и сравниваем два разных рабочих подхода к организации AI Native проектов. Мой - через дерево документов и скриптов, его - через project skills & hooks. Оба - работающие. Мы разбираем эти два подхода на примерах: - как заходить в старый код, которому пока нельзя доверять; - как быстро провести "археологические раскопки" legacy-проекта и не засыпаться; - как превращать выводы агента в docs, scripts, telemetry и HTML-отчёты; - как /goal, Golden Set и Evals экономят время; - как устроить AI Native setup с agents.md, docs-first, Nix Flakes, sibling projects; - как организовать свой control center для управления портфелем проектов и сервисов; - как улучшать обвязки агентов через само-рефлексию; как упаковывать повторяющиеся действия для агентов: через docs/scripts, skills, experiments и score; - когда SDD и чистого OpenSpec-a может быть недостаточно, и как через BDD и Given-When-Then фиксировать поведение системы, важное для продукта. Вся эта обвязка проекта дает накопительный эффект: каждый следующий запуск агента становится чуть дешевле, быстрее и спокойнее для ревью. Если у вас агенты уже пишут код, но вы всё ещё тратите много времени на проверку, контекст и разбор странных решений, эту запись имеет смысл посмотреть внимательно. Ваш, @llm_under_hood 🤗
11 319
7
Я все чаще замечаю забавную инверсию. Раньше в моих проектах копились идеи, которые я не успевал реализовать. Теперь coding-агенты реализуют идеи быстрее, чем я успеваю решить, хочу ли я потом с этими изменениями жить. В списке моих диалогов с Codex лежит немало почти готовых фич. Там проходят тесты, работает интерфейс, обновлена документация. Осталось «только проверить». Проверить - это не посмотреть, что тесты проходят (агент их уже сам прогнал). Нужно еще понять, не появилась ли в проекте новая лишняя концепция? Хорошо ли изменение сочетается с остальной системой? Готов ли я поддерживать этот код через год? И вообще - нужна ли мне эта фича после того, как я увидел её реализованной? Поэтому я откладываю проверку «на потом», которое обычно не наступает. Раньше сырая идея оставалась хотелкой в заметках и ничего не стоила. Теперь она за десять минут превращается в ветку с кодом, тестами, документацией и потенциальными последствиями. Вот и получается, что идеи теперь копятся не перед реализацией, а после неё - перед бутылочным горлышком моего внимания и времени. Причём у такого кода короткий срок годности. Проект продолжает меняться, ветка отстаёт все больше, а контекст постепенно выветривается из головы. Проверить изменение завтра сложнее, чем сегодня, а через неделю уже дешевле выкинуть и сделать заново. Я слышал похожее и от других команд. У некоторых после внедрения coding-агентов число открытых PR выросло в 5–7 раз. Генерация кода в 2026 году ускорилась, а пропускная способность человеческого внимания - пока нет. Поэтому сейчас я стараюсь нарезать задачи так, чтобы агент приносил не целую реализованную хотелку, а следующий минимальный reviewable slice: одно понятное изменение и достаточно сопроводительного контекста, чтобы проверить его за один подход. По расходу токенов может выходить забавно: Codex нередко тратит до 95% процентов токенов на поиск такого маленького, независимого и проверяемого следующего шага, который я одобрю. И только процентов пять уйдет на его реализацию. Оно того стоит. Такой кусочек легче проскальзывает через бутылочное горлышко внимания и начинает приносить пользу. Большая же фича, даже полностью написанная агентом, рискует просто пополнить залежи рабочего, но быстро устаревающего кода. А как вы решаете проблему с накапливающимися фичами и PR от coding-агентов - или у вас её нет? Ваш, @llm_under_hood 🤗
10 690
8
Я не очень люблю использовать готовые библиотеки для решения специфичных задач [1], т.к. они обычно представляют из себя комбайны с кучей ненужных фич и странных нюансов. А подстраивать их под себя бывает сложнее, чем написать нужный минимум. То ли дело stack flattening - убираем лишний слой абстракции и прямо в коде проекта реализуем ровно те 5% функциональности, которые нам нужны. Без сторонних зависимостей и уязвимостей. А потом, если что-то нужно поправить - поправляем. Особенно это удобно стало с современными coding агентами. Скажем, мне не нравилось, что у меня BDD спеки проекта запускаются последовательно, используя только одно ядро ноутбука. Это же не эффективно. Но “запускатор” - это всего несколько файлов внутри проекта, поэтому я просто попросил Codex распараллелить выполнение. И он реализовал это в режиме piecemeal growth за счет добавления 55 строчек кода. Скорость сразу подросла до более приятных глазу значений: specs: 77 passed, 26 failed at 2532.9/sec checks: 451 at 11090.7/sec На таком объёме экономия десятков миллисекунд погоды пока не делает. Зато теперь тот же паттерн перенести без изменений в другие проектах, где спеков может быть намного больше. Ваш, @llm_under_hood 🤗 — [1] речь не о том, чтобы заменить все зависимости, а только хвост мелких второстепенных.
11 061
9
Этот канал начинался три года назад с разбора кейсов внедрения LLM в бизнес продукты в компаниях США и Европы. Тогда команды брали API от OpenAI, Anthropic или локальной модели, обвязывали промптами и RAG-ами и вызывали для принятий решений: переводов текстов, генерации лидов, разбора тех документации, поиска проблем в нормативных документах итп. Стабильных архитектур тогда не было, и магию построения стабильных пайплайнов с LLM под капотом приходилось изучать самостоятельно. Тогда тесты собирали вручную, а пайплайны допиливали напильником. Это было искусством. А с тех пор ситуация незаметно изменилась (во всяком случае, в моем окружении). Кейсов с “ручным” внедрением LLM в продукты стало сильно меньше, ибо зачем возиться, когда можно взять стабильную и доказанную архитектуру агента и просто подключить ее к своей проблеме. Так, например, команды портируют архитектуры агентов с одного BitGN бенчмарка на другой, или даже побеждают с архитектурами оттуда в других соревнованиях. Кстати, если же брать готовое, то особенно популярен в США/EC в бизнес-задачах OpenAI Codex. Claude - несколько меньше. Вторая причина интереснее. Сейчас нет стремления “а давайте добавим дорогой и медленный вызов LLM-ки на каждый запрос пользователя, чтобы была магия”. Выяснилось, что это нужно делать долго и с умом, чтобы оно того стоило. А еще выяснилось, что у нас есть проблемы поважнее. Если данные - это кровь и топливо бизнеса, то код - это его двигатель. И скорость устаревания существующего кода в этом году заметно выросла. Если раньше можно было запилить приложение и оставить его крутится на мейнфрейме лет на 30, с апдейтами раз в год, то сейчас это немыслимо. Причина не столько в том, что фреймворки и библиотеки стали меняться гораздо быстрее и легче. Все веселее - AI резко удешевил анализ чужого кода, поиск уязвимости и сборку эксплойтов. Теперь не нужно быть специалистом, чтобы разобрать бинарь или железку на запчасти с Ghidra/IDA, Wireshark и Qwen/DeepSeek. Даже не нужно знать все эти слова) Нынче код уже стареет не тогда, когда перестает работать, а когда даже ленивый сможет его недорого сломать. В итоге код перестает быть активом, который однажды написали и десятилетиями можно использовать. Теперь он скорее становится расходным материалом, его нужно непрерывно проверять, обновлять без отрыва от производства. И сейчас в моих кругах получается, что перспектива поменялась так: (1) нужно решать новые бизнес-задачи? Да просто берем отлаженный harness от OpenAI Codex (или кого-то еще) и собираем конструктор (2) сэкономленное время и деньги бросаем на тушение настояших пожаров и поддержку с помошью AI Coding agents существующего кода, который приносит деньги. А как выглядит ситуация у вас? Ваш, @llm_under_hood 🤗
11 519
10
Status Update Я вернулся из отпуска. Канал и коммьюнити будут потихоньку возвращаться в рабочий режим. Хочу поделиться самым
Status Update Я вернулся из отпуска. Канал и коммьюнити будут потихоньку возвращаться в рабочий режим. Хочу поделиться самым ярким впечатлением, когда, казалось бы, далекие космические технологии внезапно делают жизнь приятнее. На вчерашних рейсах, словно в каком-то кафе, раздавали по WiFi интернет от StarLink. Летишь ты на высоте в 36k футов, за бортом -50 градусов, а у тебя ноутбук подключен к сети. И вместо 6-7 часов в капсуле без связи - и чатики и кодекс работают в штатном режиме. И можно в полете продолжать разрабатывать платформу для выкладки материалов по AI-Coding. Причем идеи, BDD-спеки и фреймворк для нее я разрабатывал практически на ходу с сотового при помощи связки из Codex агентов (как Remote на сервере, так и по-старинке оставленный открытый лаптоп). Да и в целом за время поездки я привык гораздо больше вопросов и задач сваливать на ChatGPT/Codex. Когда ноутбука нет под рукой, не сработает "мне самому проще и быстрее руками сделать". Проще как через телефон и ChatGPT. А потом как-то привыкаешь и понимаешь, что проще и быстрее - это как раз через агентов, а не ручками. Заодно и инструменты нарастают. И получается, что будущее, это когда агенты постоянно работают рядом с тобой через разнообразные девайсы, даже на высоте. Так что получается, что следующий рабочий/учебный код в нашем коммьюнити пойдет под лозунгом - "Даешь интеграцию агентов в жизнь и процессы") Ваш, @llm_under_hood 🤗
11 437
11
No text...
14 551
12
Ответ на предыдущий вопрос. На реализацию фичи у кодекса ушло 12 минут и меньше процента подписки (как было 89, так 89 и осталось). Я не за компом, поэтому пришлось попросить Codex сделать и прислать скриншоты. Вложу их в комментарии. В коде много оверинжиниринга не заметил, только не понравилось, как сделана работа с выкачкой архивов. Но я все равно сейчас откачу назад все изменения! Фишка в том, что в этом проекте у Codex-a есть возможность создавать переиспользуемые UI компоненты в едином стиле. И этот прототип нужен был, чтобы понять то, как эти компоненты должны выглядеть. Поэтому следующий шаг: I want to manage UI complexity. Load piecemeal mentality and suggest which high level UI components would you implement and pull into the component library
15 661
13
No text...
14 243
14
Приятный лайфхак - просить Codex писать красивые новости про прогресс своих проектов Ему это ничего не стоит (ибо в ~/.codex/
Приятный лайфхак - просить Codex писать красивые новости про прогресс своих проектов Ему это ничего не стоит (ибо в ~/.codex/sessions есть все логи всех проектов), а вот со стороны посмотреть на прогресс во время отпуска - приятно. К слову, Agentic OS на скриншоте - это не очередная AI Native среда для построения следующего единорога (такие продукты сейчас пытаются писать почти все), а просто наглядный пример моего текущего подхода к разработке проектов, которая заодно реализует тот Stateless MCP 2.0 протокол для доступа агентов к единой multi-tenant Personal OS. Примерами из этого проекта я буду делиться тут в канале, а полный доступ ко всем изменениям и исходникам сделаю отдельно, в рамках продолжения направления с AI Coding. Ваш, @llm_under_hood 🤗
12 620
15
В этом месяце мы путешествуем. Поэтому время наедине с лаптопом ограничено. Поэтому я и завел codex демонов на linux сервере.+1
В этом месяце мы путешествуем. Поэтому время наедине с лаптопом ограничено. Поэтому я и завел codex демонов на linux сервере. Самое главное, наконец, доделал новую версию full-stack event-driven BDD фреймворка, про который обсуждали на вебинарах по AI Coding. Про подход к BDD спекам в продуктах (еще в эру до LLM) я рассказывал в этой истории. Сейчас получилось сделать их full-stack, привязать к UI компонентам (например, через go templ) и свалить работу по написанию и поддержанию на Codex. Скорость я сильно не оптимизировал, спеки запускаются на одном ядре, поэтому получается прогонять "всего" тысячу спеков в секунду). Когда спеков будет больше тесячи - добавлю параллелизм, ибо дольше секунды гонять все базовые бизнес-тесты - для меня недопустимо. И когда есть такие спеки, давать с мобилики задачи кодексу на "напиши спеки под такую фичу" и "а теперь реализуй эти спеки" - одно удовольствие! Даже когда спеки про такие заунывные вещи, как GDPR-compliant email opt-in. А сам код в проекте на скриншоте - от будущей платформы для AI Coding коммьюнити. Ваш, @llm_under_hood 🤗
15 448
16
Я наконец, запустил свой Codex на Linux сервере, с прямым контролем из-под мобильного ChatGPT приложения (через `remote-contr
Я наконец, запустил свой Codex на Linux сервере, с прямым контролем из-под мобильного ChatGPT приложения (через `remote-control`). Это дает возможность запускать разные задачи нативно без привязки к маку. NB: До этого пробовал разные харнесы со своими telegram интеграциями, но все это не то. Хотелось именно нативного. Для этого: # ставим `codex` CLI одной из последних верси npm install -g @openai/codex@latest # запускаем демона с включенным remote control codex remote-control start # Получаем коротко-живущий код, который вводим в "pair new device" в мобильном приложении codex remote-control pair # Остановить демона, когда он не нужен, или когда начинают идти ошибки подключения codex remote-control stop Работает пока не очень стабильно (т.к. фича экспериментальная), но это именно тот workflow, который разрабатывает OpenAI. Ваш, @llm_under_hood 🤗
17 422
17
Бенчмарк Deepseek V4 Flash 0731 - попадание на Парето-фронтир по стоимости Новая версия Deepseek V4 стала получше своего пред
Бенчмарк Deepseek V4 Flash 0731 - попадание на Парето-фронтир по стоимости Новая версия Deepseek V4 стала получше своего предшественника. Возможно, там что-то подкрутили с reasoning, т.к. бенчмарк новой версии работал в 2.5 раза дольше и потратил больше денег. Но это стоило того, т.к. по соотношению цена/качество в долгоиграющих агентских задачах эта модель попала на Pareto-фронтир рядом с gpt-oss-120b Deepseek V4 - это Mixture-of-experts (разреженная) модель с 284B параметров, из которых активируются 13B. В версии от конца июля заново прогнали post-train, чтобы заточить ее больше на "coding, reasoning, and agent workflows". Модель можно выкачать и запустить. Правда, старушку gpt-oss-120B она пока не сильно подвинула (последняя занимает еще и фронтир по скорости). Но, если смотреть как фронтир потихоньку ползет все дальше от начала координат, остается только очень радоваться за скорость прогресса. Появляется все больше хороших и открытых моделей под разные задачи! Ваш, @llm_under_hood 🤗
15 228
18
LLM Benchmark Opus 5 на агентских задачах в бизнесе Я померил два варианта Anthropic Opus 5 - обычный и Fast. Последний работ
LLM Benchmark Opus 5 на агентских задачах в бизнесе Я померил два варианта Anthropic Opus 5 - обычный и Fast. Последний работает раза в два быстрее, но стоит раза в два дороже. Уровень ответов при этом идентичный. Очень высокий уровень AI Code (tool generation/use), всего по два "прокола" безопасности. Модели заняли 4 и 5 места по точности, если смотреть без учета скорости и цены. А если же быть реалистичными и смотреть на них, то Fast модель оказалась на парето-фронтире по скорости, а Opus 5 - в целом близок по параметрам к GPT-5.5 (med), который является хорошей рабочей лошадкой на дорогих задачах. Кстати, в отличие от Fable, тут нет постоянных отказов отвечать. В общем, радует, что Anthropic, наконец, начали прокачивать свои топовые модели в сторону агентских задач. Будем ждать появления Sonnet версий снова на фронтире! Ваш, @llm_under_hood 🤗
17 286
19
Новые LLM на фронтире бенчмарка - просто добавь Cerebras Помните, совсем недавно Gemma 4 31B пододвинула фронтир скорости на
Новые LLM на фронтире бенчмарка - просто добавь Cerebras Помните, совсем недавно Gemma 4 31B пододвинула фронтир скорости на нашем бенчмарке LLM после запуска на Cerebras? Я попробовал запустить gpt-oss-120B на нем же, перебирая разные варианты reasoning. И выяснилось, что все три версии - high reasoning, medium и low попадают на speed frontier, двигая его вперед. А medium reasoning при этом еще и оказывается на cost фронтире по эффективности. Удивительно, насколько хороша и сбалансирована эта, казалось бы, старая модель. А еще, казалось бы, запускай любые модели на Wafer Scale Engine ускорителе Cerebras и радуйся. Но тут есть пара нюансов: (1) Cerebras на публичном API поддерживает inference только трех моделей, которые они тщательно отобрали: gemma-4-31b, zai-glm-4.7, gpt-oss-120b. Да и то GLM-4.7 уберут через месяц (2) Модели используют хитрую квантизацию для сжатия под свое железо (selective weight-only quantization), поэтому их поведение может немного отличаться от стандартных версий. В общем, создание фронтир решений требует аккуратной балансировки между кучей разных ограничений, и эти ребята умудряются делать это. Не удивительно, что команды, которые нынче строят near-realtime AI решения, используют gpt-oss-120B на Cerebras и изучают переезд на более свежую gemma-4-31b Ваш, @llm_under_hood 🤗
14 660
20
No text...
13 009