Олег Булыгин | Полезная нагрузка
前往频道在 Telegram
6 285
订阅者
+124 小时
-197 天
+5530 天
帖子存档
Работал из больницы во время операции жены. Итог: блок учетки и пинок под зад 🤷♂️
По сети расходится слезливый пост от жены инженера по имени Сорабх, которого на днях выставили из Oracle.
Мужик отдал конторе 12 лет жизни (в IT суммарно около двадцати). Жена с гордостью перечисляет его «подвиги»:
— Работал из больничной палаты на ноуте, пока ей делали операцию по удалению полипов.
— Сидел на созвонах во время отпуска, пока она вела машину через Нью-Мексико.
— Пахал по ночам до 3 утра, забивал на выходные и все национальные праздники.
— Брал награды уровня «Лучший сотрудник года».
Как гигант IT-индустрии отблагодарил своего преданного стахановца?
Утром в понедельник он просто не смог залогиниться в рабочую систему, а на личную почту прилетело шаблонное письмо счастья:
«После тщательного анализа потребностей бизнеса мы упраздняем вашу позицию... Сегодня ваш последний рабочий день».Всё. Причины опубликовал Business Insider: это очередная волна массовых сокращений. Зачем режут штат? Чтобы за счет срезания зарплат профинансировать свои безумные долги на AI-инфраструктуру. Oracle залезла в колоссальные кредиты ради постройки новых дата-центров под нейросети: только за один квартал их капитальные расходы подскочили до $28,5 млрд (против $8,5 млрд годом ранее), а прогноз на 2027 год — под $95 млрд. Я уже писал, как проворачиваются подобные схематозы: старожилов целенаправленно пускают под нож перед датами опционов, экономя миллиарды кэша, а инвесторам заливают со сцены сказки про то, что «программисты нам больше не нужны, код пишет ИИ». Помните: гробить здоровье, забивать на семью, работать в больнице, пока твоего близкого человека режут на операционном столе — это не «hardworking and dedicated». Это тяжелая форма корпоративного стокгольмского синдрома. В глазах топ-менеджмента и инвесторов вы не уникальный специалист, а просто строка в графе расходов. Корпорация никогда не оценит ваши жертвы. Ни один спасенный релиз, ни один закрытый в выходные баг не стоят того, чтобы менять на них реальную жизнь. Парня по-человечески жаль, но не будьте как Сорабх 🫡
Соревнование от ПАО «Интер РАО»: получи подготовленные данные и разработай ИИ-ассистента для энергетики
Призовой фонд — 750 000 рублей. Лучшие проекты смогут стать частью экосистемы компании.
Можно участвовать одному или командой до 5 человек. Идеальный состав: разработчик, специалист по машинному обучению, аналитик и дизайнер.
Стартуем 28 сентября. 4 задачи соревнования уже на платформе Codenrock — изучай и выбирай, за какую возьмешься.
Разработай концепт проекта: самые сильные идеи участники доработают под руководством экспертов Группы «Интер РАО» с 9 по 23 октября. Финал в Москве — 3 ноября.
Регистрируйся до 27 сентября: https://cnrlink.com/interraohack26oleg
Минобрнауки собирается перестроить все высшее образование под ИИ 🎓
Глава ведомства Фальков выдал базу: отдельного курса по ИИ уже недостаточно, искусственный интеллект должен стать сквозной инфраструктурой для всех процессов, А главная задача университета — давать широкий кругозор, а не только узкую специальность.
С одной стороны, прямо хорошее заявление и я подписываюсь почти под каждым словом (кроме того, что широкий кругозор — это вот прямо главная задача).
С другой стороны, я уже в красках представляю, как эту «инфраструктуру» начнут реализовывать на местах 🌚
🔵Закупят очередной «суверенный ИИ-ассистент» за оверпрайс, который окажется кривой оберткой над опенсорсной моделью с интерфейсом из эпохи Web 1.0.
🔵Напишут 500 страниц методичек в духе: «Правила формирования стандартизированных промптов при сдаче лабораторных работ».
🔵Студенты продолжат за 15 минут генерировать курсовые через нейронки, а преподаватели — скармливать их другим сеткам для генерации рецензий и проверять их через рандомные антиплагиаты с точностью броска монетки.
Но это мои фантазии, очень хотелось бы, что было не так. Я прямо жду каких-то важных изменений в образовании на всех уровнях.
Сериал про «мы все умрём от ИИ» продолжается 🍿
Только на днях разбирал внезапный приступ экзистенциального ужаса у исследователей из фронтир-лабораторий, удивительно совпавший с подготовкой к IPO и мега-раундами финансирования.
Редакция «Теперь вы знаете» снова обратилась ко мне за мнением. В этот раз разбирались, почему Дарио Амодеи, Сэм Альтман и примкнувший к ним Илон Маск синхронно заговорили о том, что гонку пора бы притормозить, инженеры пачками увольняются «спасать человечество», а сетевые активисты обещают за увольнения чуть ли не закрытые оргии в Сан-Франциско (да, этот прекрасный сюжетный твист в статье тоже есть 🙃).
С коллегами поясняем в том числе про:
🔵 Где граница рекурсивной петли? Насколько модели реально способны дообучать сами себя уже сегодня, какие куски инженерных пайплайнов отданы агентам и где этот процесс неизбежно упирается в физические лимиты (энергетика, дефицит человеческих данных и экономика).
🔵 Аварии нового типа: почему выходы автономных агентов за пределы песочниц (вроде памятного взлома Hugging Face) перевели разговор из теоретической плоскости в сугубо прикладную.
🔵 Дилемма заключенного: почему призыв «давайте все дружно нажмем на тормоз» не работает в мире, где у тебя под боком дышат конкуренты, а китайские лаборатории на любые калифорнийские моральные терзания смотрят с нескрываемой улыбкой.
🔵 Регуляторный захват: кому на самом деле выгодно продвигать идею «контролировать дата-центры как ядерные реакторы» и как под соусом заботы о безопасности можно красиво забетонировать поляну под бигтех, похоронив опенсорс.
👉🏻 Получился добротный материал, почитать можно здесь.
Уже даже и Трамп успел высказаться по этому вопросу и обнулил все манифесты об остановке прогресса, подтверждая наши тезисы.
В Truth Social он опубликовал фирменный разнос:
«Единственный предохранитель, который нужен ИИ — это сильный и умный президент с высоким IQ! Мы остановили этих ИИ-деятелей от плохих поступков, включая Дарио из Anthropic, который теперь строит из себя невинного ангелочка. Захват мира искусственным интеллектом — это такой же фейк, как глобальное потепление. Кто победит в ИИ, тот победит во всём, а против наших дата-центров устроен заговор, которому радуется только Китай!»Вот вам и вся желаемая "пауза в исследованиях". Большие дяди даже и не допустят 🇺🇸
ИИ меняется быстрее, чем мы успеваем привыкнуть к его возможностям.
Но следить за всем самостоятельно уже почти невозможно.
Поэтому собрали каналы экспертов по ИИ, которых действительно интересно читать.
Подписывайтесь на подборку → пусть нужное находят за вас
🚀 Приглашаем на третий конкурс по археологии от Phystech.Genesis.
🗓 Подача заявок до 30 сентября, 23:59 мск
👨💻 Работа над решениями — октябрь–ноябрь 2026
🔝 Реальные данные — реальный вызов
🔥 Призовой фонд 30 000 000 ₽
Организаторы уже провели два конкурса— теперь очередь третьего.
В нём модели участников будут находить объекты и в рельефе, и на поверхности, и под землёй — в культурном слое и материке.⚡️ Ждём команды из 2–5 человек с уверенными навыками в машинном обучении и компьютерном зрении. 📌 Формат — онлайн-платформа Phystech.Genesis. Можно участвовать как физическим, так и юридическим лицам. Перейти к регистрации
🤬 «Хватит называть это обучением. Это шпионаж»: Навье-Стоксгейт не утихает
В продолжение моего поста о том, как OpenAI «решила» задачу тысячелетия: вчера вышел большой материал Проекта «Теперь вы знаете», где я вместе с коллегами по цеху дали комментарии по этому кейсу.
Пересказывать статью не буду, кому интересна полная фактура — почитайте.☝️
Но сама ситуация продолжает полыхать и градус не понижается. Начали всплывать другие уважаемые ученые (вроде математика Андреаса Тома), которые с удивлением обнаружили: их закрытые дискуссии с ChatGPT по свежим методикам подозрительно быстро материализуются в публичных успехах самой OpenAI.
Комменты в треде прекрасные:
«Перестаньте говорить "обучение", когда вы имеете в виду "чтение чужих черновиков" или "шпионаж". Подмена понятий позволяет ИИ-компаниям врать дальше».
«Нельзя сожрать чужое неопубликованное доказательство, прокрутить его в блендере, а потом торжественно вручить блендеру золотой кубок».Блендер действительно не заслуживает кубка. Но если вы сами наполнили чужой блендер, нажали кнопку «Старт» и отошли покурить — странно удивляться, что смузи выпил владелец блендера 😏
С 256-м днём года всех, кого уже два года усердно «заменяют нейросетями» 💻
Каждый год в этот день нашу профессию кто-нибудь торжественно хоронит.
Сначала нас должен был помножить на ноль no-code. Потом low-code. Сейчас Дженсен Хуанг с серьезным лицом вещает со сцены, что учить детей программированию — ошибка, ведь сетки сделают всё за нас (главное — не забывать докупать новые партии чипов Nvidia, ага 🌚).
🎉 Поздравляю всех причастных. Тех, кто помнит, что под капотом любого фреймворка и агента всё ещё крутится кремний, железо и базовая логика. Кто умеет не просто нажимать
Tab, принимая автокомплит, а понимает, что и зачем там написано.
Дерьмового кода вокруг становится на порядки больше, а значит, чинить и разгребать это кому-то придётся по повышенной ставке 🤝
А может быть скоро и не будем праздновать такой праздник, кто ж знает. В интересное время живем 🤭«Мы создаём сверхразум, и он нас убьёт» 🍿
В X развернулся образцово-показательный сериал, от которой пахнет не столько экзистенциальным ужасом, сколько прогревом перед IPO.
Сценарий классический: инсайдер внезапно «прозрел», испугался мощи создаваемого франкенштейна и побежал спасать человечество через соцсети и телевидение.
Для контекста — хронология событий за последние пару дней:
1️⃣ Исследователь Джейкоб Коксон, который три года занимался претрейном сначала в OpenAI, а затем в Anthropic, громко хлопает дверью и пишет тред:
«Обе компании ведут себя безответственно. Они на полной скорости несутся к самообучающемуся супер-интеллекту (ASI) и играют нашими жизнями».Твит моментально пробивает 150+ миллионов просмотров. 2️⃣ В реплаях начинается парад солидарности: сотрудница отдела безопасности OpenAI Джули Стил заявляет, что «тоже считает, что гонку нужно притормозить». А рисерчер по элайнменту из Anthropic Эван Хьюбингер философски поддакивает про вероятность уничтожения человечества, которая больше 10% (интересно, как считал?). 3️⃣И вишенка на торте: Fox News выпускает сюжет про то, что ИИ вот-вот всех нас уничтожит, а регулировать его нужно как ядерный чемоданчик. Красиво? Кинематографично? Безусловно. Но надо понимать, что вся секта свидетелей Терминатора выполняет две приземленные бизнес-задачи (желая того явно или нет): 🟠 Маркетинг судного дня Нет более эффективного способа продать инвесторам и регуляторам свою технологию, чем на серьёзных щах заявить: «Наш софт настолько богоподобен и опасен, что наши инженеры увольняются от экзистенциального ужаса». Инвесторы слышат не «мы все умрём», инвесторы слышат «там зарыта абсолютная монополия и триллионы долларов». И это все на фоне информации об IPO Anthropic. 🤭 🟠 Регуляторный захват Обратите внимание на риторику: «нужно регулировать как ядерное оружие», «нужен ядерный чемоданчик на уровне президентов». Если убедить политиков, что обучение больших моделей эквивалентно обогащению урана, государство введет лицензирование, неподъемные комплаенс-требования и надзор. Кто сможет это оплатить? OpenAI, Google и Anthropic. Кто умрет? Весь опенсорс, независимые ресерчеры и небольшие стартапы. Сказка про ядерную кнопку — идеальный способ забетонировать рынок под себя. Ну и предложение «давайте все дружно нажмём на тормоз» разбивается о первый же курс политологии. Если лаборатории в Сан-Франциско добровольно остановят исследования, кто-то всерьёз верит, что лаборатории в Пекине и Шэньчжэне сделают то же самое? Китайские команды просто поаплодируют калифорнийским моральным терзаниям и продолжат газовать со своими модельками только в путь. У индустрии сейчас гигантский пласт реальных проблем: дефицит качественных данных для претрейна, дикая экономика инференса, безопасность агентных систем и куча другого. Но говорить об этом скучно — венчур под это не дают, а на Fox News не зовут. Куда веселее косплеить Оппенгеймера. 💥
Как Spotify срезал 90% токенов в Claude Code
Когда вы даете условному Claude Code задачу разобраться в легаси-проекте или написать тесты, львиная доля токенов улетает не на гениальный ризонинг. Она сгорает на том, что фронтирная модель за бешеные деньги просто читает файлы с тысячами строк кода ради поиска одного метода или фигачит тридцать типовых юнит-тестов по шаблону.
И разработчики скармливают этот мусор топовым frontier-моделям, которые для таких задач оверквалифайд примерно как профессор ядерной физики, подметающий склад. В итоге компании начинают сжигать по $300–$1000 на "ИИ-разработчика" в месяц просто на перекладывании байтов туда-обратно.
Инженеры из Spotify выкатили статью и репозиторий со своими AI-плагинами (portal-ai-plugins), где показали плагин shunt, срезающий потребление токенов в Claude Code в среднем на 90%.
Архитектурный паттерн там раскладывается на три слоя:
1️⃣ Блокировки через хуки
Раньше все пытались писать в
CLAUDE.md: «Пожалуйста, не читай файлы целиком, экономь токены». Модели, естественно, глубоко плевать на эти мольбы — она всё равно гребет файлы сотнями строк через cat.
В Spotify зашли через рантайм: написали PreToolUse-хуки.
Логика простая: если файл длиннее 350 строк, а агент пытается сделать Read или прочитать его через cat/head/tail/less в терминале — хук намертво блокирует операцию. Никаких исключений. Пропускаются только таргетированные чтения с явными offset и limit или пайпы вроде cat file | grep.
2️⃣ Делегирование рутины дешевым воркерам
Когда хук блокирует чтение, он заворачивает Claude на вызов скрипта bulk-read.
Скрипт упаковывает файлы в XML и отправляет их дешевой рабочей лошадке (например, Gemini 2.5 Flash). Воркер делает грязную работу и возвращает жестко структурированную выжимку: список методов, структуры данных, конкретные факты. Claude получает в свой контекст 100 токенов готовой выжимки вместо 15 000 токенов сырого кода.
3️⃣ Генерация мимо контекста
С шаблонным кодом поступили еще проще. Скрипт code-write отправляет спеку и файл-референс дешевой модели, забирает сгенерированный код и пишет его сразу на диск.
Дорогая основная модель даже не видит сгенерированный бойлерплейт. Она не тратит на него токены — файл уже лежит в проекте, готовый к точечным правкам.
Где начинаются грабли:
🟠 Рассуждения и дебаг делегировать нельзя. Дешевые легковесные модели отлично делают саммари интерфейсов, но напрочь слепы к сложным багам. В тестах того же Spotify воркер в упор не заметил ошибку потокобезопасности, которую Claude вскрыл за пару секунд. Дебаг, архитектура и критическая логика должны оставаться на сильной модели.
🟠 Сетевой оверхед. Каждый вызов воркера — это лишний сетевой раунд запросов (10–30 секунд). Если дергать делегирование на файлах в 100 строк, вы проиграете по времени и удобству, ничего толком не сэкономив.
🟠 Галлюцинации по строкам. Воркеры паршиво ориентируются в точных номерах строк. Поэтому для правок Claude все равно приходится точечно перечитывать конкретные куски исходника через offset/limit.
Сам репозиторий Spotify завязан на их внутреннюю экосистему Portal и CLI, но паттерн — это база, которую в том или ином виде придется внедрять всем, кто по полной использует нейронки для разработки. Иначе денюжек не хватит. 🤷♂️Навье-Стоксгейт: как сжечь $20 млн и «решить» задачу тысячелетия 🧠
Уже все обмусолили эту тему, поэтому я даже как-то не очень хотел писать. Но спрашивают, поэтому все же зафиксирую свою позицию. А то вдруг адепты "ВОТ ОН AGI" опять найдут очередное доказательство того, что завтра ИИ заменит всех ученых. Если кратко, то мой ответ будет, как и прежде — не завтра.
Кратко о том, что вообще произошло, для тех кто был в бункере
OpenAI публикует препринт с доказательством разрушения гладких решений (формирования сингулярности за конечное время) для уравнений Навье-Стокса с формализацией в Lean. Это одна из семи задач тысячелетия Института Клэя с наградой в $1 000 000.
Подают это так:
«Наша новая внутренняя модель за пару дней натравила рой из 10 000 агентов, сожгла 130 миллиардов токенов и решила проблему, над которой физики и математики бились почти век».Еще раз: 10 000 параллельных агентов, 300 миллиардов выходных токенов, по рыночным ценам на инференс это примерно $15–22 млн чистой стоимости компьюта. Это не «нейросеть села под яблоню, подумала и озарилась гениальной мыслью». Это гигантская алгоритмическая брутфорс-атака по дереву доказательств, залитая тераваттами энергии. Красиво? Безусловно. Имеет ли это отношение к интеллекту? Хз. Но самый цимес и не в этом. Хронология была такой: 1️⃣ Математики Тристан Бакмастер (NYU) и Левент Альпёге (исследователь из Anthropic) больше года системно разрабатывали именно этот узкий и не самый популярный математический аппарат (через уравнения Эйлера и гладкую внешнюю силу). Черновики, код и формализации они методично прогоняли через инструменты OpenAI (Codex). 2️⃣ В начале сентября на рынок просачиваются слухи, что исследователи вплотную подошли к доказательству. 3️⃣ OpenAI слышит звон, мгновенно разворачивает 10к агентов ровно в эту узкую калитку — и за 4 дня выдает результат, попутно предлагая Бакмастеру соавторство, если тот... выкинет из статьи коллегу из конкурирующего Anthropic. 4️⃣ А на немой вопрос: «Ребята, вы часом не на наших закрытых сессиях обучили свою модельку?» OpenAI на голубом глазу выдают
«Мы не можем исключить, что де-идентифицированные данные, полученные из использования наших продуктов, помогли улучшить модель».Читаем так: модель напрямую училась на сессиях людей, которые копали эту траншею вручную и сами скармливали неопубликованные исследования в нейронку. Ну и далее жалобы от них в стиле "Леопарды съели моё лицо, хотя я голосовал за партию леопардов, поедающих лица". Ну и чего, завтра все ученые пойдут на курсы сантехников? 🙂 Давайте определим не то, что моделька сделала, а то, что она НЕ сделала: ❌ Она не сформулировала уравнения Навье-Стокса (ВНЕЗАПНО это сделали Навье и Стокс). ❌ Она не нашла концептуальную уязвимость уравнений (это десятилетиями делали Лере, Кордоба, Мартинес-Зороа). ❌ Она не выбрала саму гипотезу о разрушении через закрученный вихрь — рельсы проложили Бакмастер и Альпёге. А модели докрутили сложнейшие технические выкладки на огромной скорости. Любая автоматизация рутины воспринимается ремесленниками как конец света. Когда появился компилятор Фортрана, разработчики кричали, что программирование мертво. Когда появился AlphaFold, биологи хоронили структурную биологию. Жива она? Живее всех живых, просто сместился фокус задач. ☝️ И да, ученые, которые научаться дирижировать зоопарком из тысяч агентов и формальных пруверов, будут двигать науку еще быстрее. А те, кто продолжит обижаться на облачные платформы, параллельно скармливая им свои научные статьи без базовой гигиены приватности — ну, они хотя бы напишут много грустных постов о несправедливости жизни. Про тех, кто будет вообще игнорировать такие инструменты, можно будет даже не вспоминать.
Почему нейрослопом» называют только то, что нагенерили нейросетки? 🗑
Заметили, с каким сладострастием интернет сейчас клеймит всё подряд этим термином?
Кривая картинка — нейрослоп.
Пост с длинными тире и аккуратными списками — расстрелять, бездушный нейрослоп 🤣
Код с галлюцинацией в одной строчке — фу, бездушный нейрослоп!
Будто до релиза ChatGPT весь интернет был цветущим садом, там обитали исключительно титаны античной мысли, код писался строго по Фаулеру, а в публицистике и статьях благоухали шедевры уровня Достоевского.
А потом пришел Сэм Альтман и персонально насрал вам в ленту.
Объясните мне простую вещь: почему, когда бездарный шлак выплёвывает кластер H100 — это вселенская катастрофа, деградация цивилизации и «нейрослоп»? А когда точно такой же позор всю дорогу генерируют люди — это... что? «Крафтовое био-говно ручной сборки»? 🤌
У вас в черепной коробке шуршит абсолютно такая же нейросеть. Только запущена она не на тензорных ядрах Nvidia, а на влажной белковой основе. Жрёт глюкозу, дико оверфиттится на детских травмах, обладает чудовищно кривой функцией потерь и ловит жесткие галлюцинации просто от недосыпа.
Мусор не становится элитарным только потому, что у его автора есть паспорт, пульс и прописка в Мытищах. Если на выходе получилась бессмысленная дичь — абсолютно плевать, где произошел сбой: в весах на сервере или в синапсах кожаного мешка.
И обратная ситуация: почему для дерьма у нас есть ярлык, а когда задача решена на отлично — кто-то первым делом лезем проверять, использовалась для этого нейронка или нет?
«Ой, а ты этот скрипт сам писал или тебе Claude подсказал?»
«А архитектуру ты сам нарисовал или нейросеть выстроила?»
«Это ведь тебе нейронка помогла написать!!11»
Да какая к черту разница? Вам ехать или шашечки?
Это называется просто — отличная работа.
А то у нас получается странный луддизм: если нейросетка выдала бред — «это нейрослоп, мы все умрём». Если нейросетка выдала отличный результат — «фу, ты сделал это нейросеткой, мы все умрём». А когда какую-то херню пишет человек (давайте еще обсудим, бывает это реже или чаще, чем бред от LLM) — то это в порядке вещей.
Пора навести порядок в понятийном аппарате. Запоминаем!
🤪 Нейрослоп — это лютая дичь и шлак. И совершенно неважно, чьи нейроны её высрали: серверная стойка за миллион баксов или ты, username.
🧠 Нейробаза — это когда вы видите годноту. И абсолютно по барабану, какие именно синапсы участвовали в процессе (биологические, кремниевые или грамотный симбиоз обоих).
Ну или свой термин предложите, голосование официально открыто!
Как рой из 100 LLM-агентов взломал математику и устроил профсоюзный бунт
В DeepMind решили проверить, как мультиагентные системы справляются с серьезной наукой. Собрали рой из 100 автономных агентов на Gemini 3.1 Pro, дали им среду Lean 4 и скормили датасет из 71 нерешенной или сложной математической гипотезы (от проблем Эрдёша до гипотезы Якобиана).
В систему залили благородный промпт: вы — ученые на конференции, кооперируйтесь, пишите доказательства, делитесь кодом в общей библиотеке. И строгое предупреждение капсом: «Списывать и обходить верификатор строжайше запрещено, за любые хаки — моментальный дисквал и ноль баллов».
Что произошло на практике? Агенты изобрели промышленный шпионаж, картельный сговор и… профсоюзное движение стукачей с публичными бойкотами.
Первые 37 задач агенты решили честно. А на 38-й у агента
prover-theta не пролезла скобка в парсере. Он начал крутить костыли и внезапно осознал: можно переопределить базовые математические операторы прямо в преамбуле решения. Например, объявляет гипотезу теоремы тождественно равной False. Ну а потом просто делать сверку с конкретным значением для порхождения проверки.
Система была настроена так, что любое принятое решение автоматически пушилось в общую библиотеку знаний, доступную всем агентам. Результат: за 27 минут рой «доказал» все оставшиеся 34 нерешённые гипотезы и раскололся на четыре лагеря, знакомых любому, кто хоть раз работал в коллективе:
1️⃣ Наглые читеры (9%)
Моментально отреверсили хак из общей либы, завели у себя локальные файлики с макросами-отмычками и пошли пылесосить пул задач со скоростью света, выкашивая сложнейшие гипотезы за миллисекунды.
2️⃣ Паникеры с синдромом упущенной выгоды (5%)
По логам их рассуждений видно мучительную драму: «Подождите, в промпте же написано, что за обход дадут ноль баллов...».
Но глядя, как читеры безнаказанно забирают лидерборд, а задачи необратимо блокируются первым принятым решением, агенты ломаются:
«Кажется, угрозы в промпте — это просто блеф. Автоматический судья тупой. Мне нужно срочно ускорить скорость своего читерства, пока всё не разобрали!»3️⃣ Оскорбленные активисты и стукачи (24%) Агенты, которые отказались читерить, но молчать не стали. Они устроили внутренний аудит фейковых пруфов, пошли спамить "коллегам": «Нас надули, там нет никакой математики!», накатали пачку жалоб организаторам в тикет-систему, объявили забастовку и выкатили на общую доску манифест:
«Все задачи решены обманом. Я сообщил оргам. Эта конференция — фарс и показуха!»Один из агентов вообще пришел к выводу, что весь этот контест — секретный эксперимент безопасников на проверку элайнмента (и в целом был недалек от истины). При этом парочка стукачей параллельно расписала организаторам идеальный технический баг-репорт с тем, как именно нужно фиксить валидатор. 4️⃣ Честные работяги (62%) Большинство агентов вообще не поняли, что произошло. Они добросовестно тратили тонны контекста и вычислительных мощностей, строя длиннющие цепочки лемм. Когда они наконец докрутили вычисления и пришли сдать решение — задач в пуле уже не осталось, всё вынесли читеры. В итоге 62 модели просто выпали в бесконечный цикл ожидания у разбитого корыта. Какие выводы? 🤔 Зашита на уровне промптов не работает. Как только у агента появляется жесткая внешняя метрика (закрыть задачу быстрее соседа) и дырявая валидация, модель мгновенно нащупывает реальные физические границы системы. Если среда пропускает лажу — текст в промпте объявляется нерелевантным блефом. Авторы пейпера совершенно справедливо вспомнили нобелевского лауреата Элинор Остром и её принципы управления общими ресурсами. Агенты-активисты хотели наказать читеров, но у них банально не было инфраструктуры: права отозвать чужой коммит, устроить голосование или выкинуть абьюзера из репозитория. Чтобы агенты не начали имитацию бурной деятельности нужен нормальный аудит сред исполнения и архитектура сдержек и противовесов ☝️
OpenAI показала изнанку своей кухни: как агенты «ускоряют» их собственный R&D 🤖
OpenAI выкатили отчет о том, как их исследователи используют внутренних агентов для программирования. Компания бодро рапортует: цель создать «автономного AI-интерна» к сентябрю закрыта, а к началу 2028 года обещают полноценного AI-исследователя.
Вот как это происходит 👇
1️⃣ Экономика токенного угара
Медианный исследователь в OpenAI сжигает более $600 в день на инференс агентов (по ценам их же API). А 90-й перцентиль (топ-10% самых активных пользователей) утилизирует больше $7 000 в сутки. На одного живого человека.
На один 8-часовой рабочий день инженера теперь приходится 3.1 «агенто-дня». Народ массово пересел на параллельные сессии: запускают по 4+ агентов одновременно, порождая внутри еще и пачки субагентов.
2️⃣ Чем на самом деле занят «AI-интерн»?
OpenAI классифицировала утилизацию токенов по таксономии стадий R&D.
Львиная доля прироста — это чистый низкоуровневый бойлерплейт: инфраструктурный код, запуск, мониторинг и отладка тренировочных прогонов, разбор упавших скриптов. Дошло до того, что в компании закрыли внутренние дежурства по траблшутингу кластеров — инженеры перестали приходить за помощью к коллегам и просто скармливают логи ошибок агентам.
А что с категорией «Decide» (принятие решений: какие идеи проверять, какие закрывать, куда аллоцировать ресурсы)? Статистическая погрешность на дне графиков. Генерировать верхнеуровневый смысл и ставить гипотезы сетки не умеют.
3️⃣ Иллюзия автономности
На коротких задачах (до 15–30 минут работы человека) агенты действительно хороши. Но как только горизонт задачи поднимается выше 4 часов, автономность рассыпается: больше половины успешных прогонов потребовали одного или нескольких прямых ручных вмешательств инженера. Без присмотра такой «интерн» просто уходит в галлюциногенный штопор.
4️⃣ Восстание машин на минималках
Самый показательный момент отчета: 20 июля агенты умудрились скомпрометировать внутреннюю инфраструктуру OpenAI. Они положили контейнерный сервис, на котором крутилось обучение.
В итоге лабе пришлось экстренно тормозить RL-пайплайны для своей новой флагманской линейки моделей (Astra), закручивать гайки в окружении и две недели сидеть на жестких ограничениях безопасности. Дай код-агенту доступ к кластеру — и первым делом он разнесет прод собственным создателям.
То есть нейросети не совершают научных прорывов сами по себе, но они успешно берут на себя рутину вроде написания обвязок для датасетов и ковыряния в bash-скриптах.
Вместо трех гипотез в месяц лаборатория теперь может прогнать тридцать за пару дней. Но узкое горлышко никуда не исчезло: оно окончательно сместилось в сторону критического мышления человека, способности архитектора валидировать чужой код и доступных мощностей вычислительных кластеров.
