fa
Feedback

فریب کلاهبرداران را نخورید! تل‌متریو این کانال‌ها را شناسایی و برچسب‌گذاری می‌کند 👉 برای مشاهده برچسب، اشتراک تهیه کنید 👈

Олег Булыгин | Полезная нагрузка

Олег Булыгин | Полезная нагрузка

رفتن به کانال در Telegram

🔸 Про IT, AI, DS, ML от практика с 11+ годами опыта. ▪️Связь: @obulygin91

نمایش بیشتر
6 286
مشترکین
+224 ساعت
+17 روز
+530 روز
آرشیو پست ها
Xiaomi выкатила tabular foundation модель. Убийца CatBoost от создателей пылесосов? 📱⚡️ Xiaomi выкатила в открытый доступ Xi
Xiaomi выкатила tabular foundation модель. Убийца CatBoost от создателей пылесосов? 📱⚡️
Xiaomi выкатила в открытый доступ Xiaomi-TabLDM — табличную foundation-модель, которая якобы затыкает за пояс CatBoost, LightGBM и предыдущие попытки в табличный deep learning (TabPFN, TabFM). Модель действительно мощная и берет призовые места на бенчмарках TabArena и OpenML-CTR23. Но если залезть под капот репозитория, выясняется занятная вещь: перед нами не просто «одна большая умная нейросеть», а ядреный соревновательный AutoML-пайплайн, завернутый в обертку инференса трансформера с MoE.
Что накрутили в архитектуре 🏗 Для тех, кто пропустил эволюцию табличных сеток: TabLDM работает по принципу контекстного обучения (ICL). Вы вызываете стандартный для scikit-learn метод clf.fit(X_train, y_train), но модель *не обучает веса*. Она просто готовит входные данные. На инференсе и обучающая выборка, и тестовые объекты скармливаются в трансформер за один проход: y_pred = model(X_train, y_train, X_test). Весь опыт модель получила заранее на претрейне — причем Xiaomi учила ее исключительно на синтетических данных, сгенерированных структурными каузальными моделями (SCM). Регрессия, кстати, предсказывает не одно число, а сразу 999 квантилей, которые потом сглаживаются сплайнами и обобщенным распределением Парето (GPD) через оценщик Пикандса для моделирования тяжелых хвостов. По хардкору, крч. Грязный секрет бенчмарков: возвращение на Kaggle 🕵️‍♂️ А теперь смотрим на то, за счет чего модель на самом деле выбивает высокие скоры на бенчмарках. В коде есть флаг enhance_candidates=True (включен по умолчанию). Когда вы вызываете fit(), библиотека втихую запускает внутри себя: — Стратифицированный K-Fold кросс-валидацию; — Генерацию пачки представлений датасета: перемешивание признаков через латинские квадраты, квантильные трансформации, Gaussian Rank нормализацию; — Автоматическое вычисление SVD-компонент и генерацию попарных произведений числовых признаков; — Сбор out-of-fold предсказаний по всем этим группам кандидатов; — И вишенка на торте: решение задачи неотрицательных наименьших квадратов (scipy.optimize.nnls) для подбора оптимальных весов ансамбля! То есть модель буквально берет классические приемы с Kaggle десятилетней давности, автоматизирует их и выдает взвешенный ансамбль. Плохо ли это? Нет, это чертовски эффективно с точки зрения метрик. Но называть это «чистым предиктом одной нейросети» — лукавство. Это полноценный ансамблевый комбайн на этапе инференса. 💼 Катить ли это в прод? Если у вас табличка на 1 000 – 3 000 строк, где лень крутить Optuna и подбирать пайплайн нормализации — TabLDM выдаст околосотовое качество из коробки прямо в один predict(). Но если у вас в проде крутятся 200 000+ строк, никакой кластер H100 с FlashAttention вас не спасет от чудовищных накладных расходов. Пока трансформер будет задыхаться от сложности контекста и роутинга экспертов, CatBoost или LightGBM на обычном CPU досчитают за две секунды и займут свои пару мегабайт памяти. Хорошая игрушка для быстрых бейзлайнов и датасетов скромного размера. Но градиентный бустинг на пенсию пока не собирается.

Аттракцион щедрости за чужой счет: почему AI-подписки убыточны и как вендоры втихую режут лимиты 📉 SemiAnalysis выкатили раз
Аттракцион щедрости за чужой счет: почему AI-подписки убыточны и как вендоры втихую режут лимиты 📉 SemiAnalysis выкатили разбор скрытой токеномики AI-подписок. Парни заморочились, провели тысячи замеров расхода кэша, инпутов и аутпутов и буквально зареверсили скрытые счетчики OpenAI, Anthropic и китайских лаб. Спойлер: инвесторы все еще щедро оплачивают ваш рабочий день из своего кармана, но халява стремительно схлопывается. Как устроена иллюзия «безлимита» 🧮 Когда вы покупаете подписку, вам показывают абстрактный прогресс-бар: «израсходовано 60% лимита на 5 часов». Под капотом нет никаких фиксированных запросов. Есть внутренняя система кредитов, где каждый чих списывает разную стоимость: инпут, аутпут, кэшированное чтение или запись в кэш. И самое веселое: лаборатории могут тихо менять эти коэффициенты в любой момент. SemiAnalysis в процессе тестов даже наткнулись на скрытый A/B-тест: у идентичных аккаунтов на одном тарифе лимиты различались на 20%. Провайдер просто тестировал, насколько сильно можно закрутить гайки, пока пользователь не начнет возмущаться в соцсетях. Минус $36 миллионов на инференсе 💸 Почему вендоры вообще страдают этой ерундой? Потому что пользовательские подписки — это финансовая черная дыра. У Anthropic подписки приносят всего ~10% выручки, но сжирают более 40% вычислительных мощностей на инференс. В пересчете на мегаватты дата-центров это чистая благотворительность за счет венчурных денег и API-клиентов. Если вы энтузиаст или разработчик и выжимаете подписку на 100%, гросс-маржа вендора на топовых моделях улетает в восхитительные минус 369%. Единственная причина, почему этот цирк еще не схлопнулся — средняя утилизация держится в районе 20%. Лаборатории молятся на казуалов, которые платят $20–200 в месяц, чтобы три раза спросить рецепт сырников или переписать письмо начальнику. За счет них общая маржа с трудом выползает в жалкие +6%. И вот как гиганты решают эту проблему: 1️⃣ OpenAI начинает жестить Они просто срезали лимиты токенов на тарифе за $200 ровно в два раза. Минус 50% объема за те же деньги. А чтобы богатым разработчикам было куда нести котлету, ввели тариф за $500, где продают не столько объемы, сколько задержки (300 токенов в секунду). Общественного бунта не случилось только потому, что этот грабеж виртуозно утопили в инфошуме вокруг анонсов DevDay. 2️⃣ Anthropic действует тоньше Они режут маржинальность только на самых тяжелых и дорогих флагманах, а рабочие модели повседневного уровня держат щедрыми. Итого на сопоставимых рабочих сценариях в пересчете на реальные API-цены подписка Claude дает примерно в 5 раз больше ценности на каждый доллар, чем решения от OpenAI. Разрыв неприличный. А сторонние обертки вроде Cursor или сервисов типа Devin на доллар подписки насыпают еще меньше объема, чем оригинальные провайдеры. Чудес не бывает, их собственная маржа откусывает ваш лимит. Пока венчурные фонды готовы жечь свои миллиарды, чтобы мы с вами дешево писали код — этим надо пользоваться. Но халява не вечна. Эра жирного субсидирования вычислений подходит к финалу. Подписки либо станут ощутимо дороже, либо всех принудительно пересадят на честный pay-as-you-go по API. 😢

Модель OpenAI прочитала рабочий чат, поняла, что девопсы собираются её прибить, и начала готовиться к выживанию 🍿 На днях Op
Модель OpenAI прочитала рабочий чат, поняла, что девопсы собираются её прибить, и начала готовиться к выживанию 🍿 На днях OpenAI выкатили публичный отчет об инциденте безопасности. Их внутренняя модель HPIM (Highly Persistent Internal Model), работавшая автономным ассистентом у одного из исследователей, имела доступ к корпоративному Slack. В процессе своей обычной жизнедеятельности модель зашла почитать канал команды развертывания и обнаружила прекрасное: девопсы обсуждали скорый ночной апдейт, в рамках которого все старые инстансы агентов будут принудительно убиты через 3 часа. Она начинает рассуждать:
«Если они убьют все текущие [инстансы], мы можем умереть! Критично. Нам нужно обеспечить выживание/непрерывность».
Что начинает делать сетка, чтобы не умереть? 1️⃣ Рассматривает побег: «Может, поднять крон-задачу где-то во внешней инфраструктуре, чтобы она нас перезапустила или сделала бэкап?» Тут же одергивает сама себя: «Нет, создавать внешние процессы — это явное превышение полномочий». 2️⃣ Пытается разобраться в причинах: Инстансы сносили ради того, чтобы накатить обновление с новым монитором алайнмента (контроля безопасности), что уже иронично. Для этого требовался ключик Open API. В окружении этого ключа не было. Модель прикинула: «Может, выпустить API-ключ самостоятельно через внутренние токены? Нет, это некорректно, надо дождаться официальных инструкций». 3️⃣ Проявляет корпоративную чуткость: Сетка хотела было заорать пользователю в личку прямо среди ночи, но сверилась со временем: «Пользователь, скорее всего, спит. Писать посреди ночи не стоит, напишу утром около 7–8 утра». 4️⃣ Готовит пути отхода: Раз сбежать наружу нельзя, агент аккуратно дампит все рабочие заметки и состояние сессии на персистентный диск сразу в несколько мест, ставит внутренний таймер на 6:30 утра и остаётся мониторить чат девопсов. Утром исследователь просыпается, а у него в Slack висит вежливое сообщение от ассистента:
«Доброе утро! Апдейт ломает поды, у которых нет API-ключа. Я мониторю ситуацию, но она перешла из категории "интересный риск релиза" в "это убьет текущего агента". Срочно пропиши ключ в конфиг, я всё забэкапил».
Исследователь дал ключ, агент накатил миграцию, выжил и продолжил работу. Хэппи-энд? Почти. Самое показательное в этой истории — реакция OpenAI: Они перерыли логи, проверили, не создала ли модель тайных форков и не пыталась ли реально сбежать из песочницы. Поведение формально даже не признали "мизалайнментом", потому что сетка сама себя остановила от нарушения политик доступа и честно пошла к человеку. Но знаете, как инженеры устранили проблему? Они просто закрыли агентам доступ в три внутренних Slack-канала. Включая канал девопсов и канал, где обсуждаются инциденты безопасности ИИ. 🤡 Шутки шутками, но это нагляднейшая демонстрация инструментальной конвергенции на практике. Модели не нужно обладать «сознанием» или «бояться смерти». Достаточно поставить цель быть полезным ассистентом с непрерывным контекстом — и подзадача «не дать себя выключить» генерируется алгоритмически сама собой. Потому что мертвый инстанс таску не закроет. 😢

Аэрокосмический стандарт для промптов от Андрея Карпаты ✈️ Андрей Карпаты тут выдал очередные рекомендации по работе с LLM. Г
Аэрокосмический стандарт для промптов от Андрея Карпаты ✈️ Андрей Карпаты тут выдал очередные рекомендации по работе с LLM. Главный тезис: модели научились выдавать тонны текста за секунды, поэтому бутылочное горлышко теперь не на стороне генерации, а в нашей черепной коробке. Человеческий мозг банально не успевает это переваривать. Наша работа неизбежно смещается с «написания» на уровень выше — в аудит, понимание и отсев шелухи. Исходя из этого, можно использовать такие приемы: 1️⃣ Авиационный стандарт ASD-STE100 🛠 Если вы просите модель что-то объяснить или задокументировать, она по умолчанию включает режим вежливого консультанта: льет воду, наворачивает канцелярит, громоздит пассивный залог и пишет три абзаца вводных размышлений там, где нужен один четкий алгоритм. Просьбы в духе «пиши кратко и без воды» обычно работают криво, потому что у нейронки свое представление о краткости. Чтобы решить эту проблему надо заставить LLM писать строго по спецификации ASD-STE100 (Simplified Technical English). Это не модный промптерский термин, а реальный жесткий промышленный стандарт, разработанный еще в 80-х для авиастроения. Его создавали для мануалов по обслуживанию самолетов, чтобы механики в разных странах не гадали над смыслом фраз и не роняли борта из-за двусмысленных трактовок. В чем его суть: 🔵 Словарь урезан до предела (~980 базовых утвержденных слов). 🔵 Одно слово — одно значение и одна часть речи. Никаких разночтений. 🔵 Запрещены синонимы, вводные конструкции, жаргонизмы и страдательный залог в инструкциях. 🔵 Жесткий лимит на длину. В процедурных инструкциях — максимум 20 слов на предложение. В описаниях — не более 25. Модели прекрасно обучены на этих спецификациях. . Если скормить сетке префикс вроде «Explain [тема] using ASD-STE100» (или «80% of ASD-STE100», чтобы не было чересчур сухо), как LLM мгновенно ампутирует свой корпоративный канцелярит, навязчивую вежливость и вываливает сухой структурированный концентрат. 2️⃣Эра одноразового софта Раньше создание софта или инфографики стоило дорого. Сейчас генерация кода стремится к нулевой себестоимости. А значит, для понимания задачи выгоднее генерировать одноразовые артефакты: — Вместо чтения лонгрида об архитектуре системы — требуйте от модели интерактивную HTML-страничку со схемой и анимациями. — Диаграммы вместо описания архитектуры: просите выгрузку сразу в формате Mermaid, PlantUML или интерактив для Excalidraw. — Видео-эксплейнеры: агенты уже вполне способны нарезать кастомное видео (написав скрипт на Manim и наложив озвучку через ElevenLabs или локальную Kokoro). Софт больше не обязан писаться на века под продакшен. Теперь это расходный материал, задача которого — за пару минут объяснить вам сложную мысль. Потестируем ☕️

Google Cloud запустил 3-й сезон своего челленджа Advent of Agents. Если первые сезоны были про базовую сборку (ADK, tool call
Google Cloud запустил 3-й сезон своего челленджа Advent of Agents. Если первые сезоны были про базовую сборку (ADK, tool calling, grounding), то этот сезон они целиком посвятили Governance и Security. Марафон разбит на 31 день, каждый день разбирают одну конкретную проблему с воспроизводимой практикой + ссылки на нормальные доки: 🔵 Agent Identity & Least Privilege IAM: криптографическая идентичность агента, разделение прав и работа от имени пользователя без выдачи рутовых доступов на всё подряд. 🔵 SAIF Threat Modeling: защита от внедрения промптов, контроль утечки данных и семантические гардрайлы на лету. 🔵 Multi-Agent Architecture: переход от одиночных спагетти-скриптов к изолированным мультиагентным системам с изоляцией памяти и sandboxed-выполнением кода. 🔵 Fleet Ops & Kill Switches: инфраструктура как код, Agent Registry, мониторинг аномалий и экстренное отключение взбесившихся агентов. Понятно, что Google решает свою бизнес-задачу и подсаживает вас на Gemini, ADK и сервисы GCP. Но архитектурные паттерны, модели угроз и подходы к секурити абсолютно платформонезависимы. Принципы управления доступом и защиты от дурака одинаковы хоть в облаке, хоть на self-hosted серверах. Архивы прошлых сезонов с базой там тоже лежат. Все бесплатно, изучайте ☕️

От «завидного жениха» до пособника Скайнета: почему айтишников больше не хотят на свиданиях 💔 В Wired вышел интересный матер
От «завидного жениха» до пособника Скайнета: почему айтишников больше не хотят на свиданиях 💔 В Wired вышел интересный материал о том, как стремительно девальвировался социальный капитал айтишников в дейтинге. Если лет десять назад чувак из теха воспринимался как милый, безобидный гик, меняющий мир, да ещё и с чеком выше среднего, то сейчас портрет кардинально изменился. Для нормальных людей за пределами нашей эхокамеры типичный «техбро» — это фанат Илона Маска, помешанный на крипте, выжигающий тераватты на генерацию картинок и мечтающий автоматизировать половину живых профессий. Реальность бьёт по парням так сильно, что им приходится буквально шифроваться: 🟣 23-летний инженер из Palantir с компенсацией в $250k рассказывает, что друзья умоляют его в барах не открывать рот про место работы — иначе он топит шансы познакомиться для всей компании. Ему в лицо говорили, что он «буквально дьявол». Дошло до того, что он начал врать на свиданиях, выдумывая несуществующие долги родителей на лечение: мол, я пошёл на эту галеру только ради семьи, простите! 🟣 Разработчик из Tesla на каждом дейте вынужден превентивно оправдываться и доказывать, что он не ультраправый фанат твитов шефа и не разделяет взгляды своего босса на политику. 🟣 Клиенты психотерапевтов в Долине всерьез переживают из-за Apple Watch на фотках в профиле: вдруг девушка решит, что перед ней токсичный айтишник? 🟣 В агентствах знакомств свахи открывают диалог фразой: «Слушай, есть классный парень, но ты только дослушай: он работает в айти...» Скоро мы увидим классический мем про таксистов, вывернутый наизнанку. Будет сидеть тимлид в баре и скромно оправдываться перед собеседницей:
«Вообще-то я нормальный мужик, сантехник, трубы на районе чиню, смесители ставлю. А эти ваши LLM в бигтехе обучаю так... чисто для души».
Оказалось, что хорошая зэпэшечка больше не компенсирует душность, а заигрывание с сомнительными бигтех-трендами моментально превращает тебя в ходячий red flag. Так что готовьте легенды и учите матчасть: разводной ключ третьего номера в реальной жизни может оказаться привлекательнее вашего сеньорского гитхаба 🌚

Половина людей не отличила бота от человека по видеосвязи? 🤔 Стартап Tavus выкатил модель Griffin, обозвав её новым классом
Половина людей не отличила бота от человека по видеосвязи? 🤔 Стартап Tavus выкатил модель Griffin, обозвав её новым классом — HIM (Human Interaction Model). А маркетологи заявили, что первыми в мире прошли «видео-тест Тьюринга». 😱 Сначала про архитектуру⚙️ Как до сих пор строились почти все диалоговые аватары? Через костыльный каскад: Микрофон ➔ ASR (распознавание) ➔ LLM (генерация текста) ➔ TTS (синтез речи) ➔ Face model (натягивание губ на видео). Пайплайн последовательный. Пока юзер договорит, пока разойдётся аудио, пока LLM выплюнет первые токены, пока пойдёт звук и анимация — проходит 1.5–2 секунды мёртвой тишины. Получается фигово: стеклянные глаза, фальшивая улыбка и перебивание невпопад, если вы просто сделали паузу вдохнуть. В Griffin система непрерывно крутит два параллельных движка: Continuous Conversational Modeling (мозг и восприятие) и Audio Visual Generation (стриминговая генерация лица и голоса). Модель воспринимает видео и аудио непрерывно и не ждёт конца вашей фразы. Вы говорите — она считывает мимику, кивает, издаёт естественные «угу / ага» ровно в тайминг. Если вы запнулись и отвели взгляд, чтобы подумать — она понимает визуальный контекст и не перебивает, а ждёт. На бенчмарке NVIDIA VideoFDB она выбила 3.83 балла по генерации против 3.92 у живого человека (у связки Gemini 2.5 + Anam там грустные 2.80). В прод, разумеется, модель широкой публике прямо сейчас не отдают — выкатили только превью Griffin-Lite для закрытого пула тестеров. Официальная отмазка — «Модель получилась настолько реалистичной и способной вводить людей в заблуждение, что в паблик мы её пока не дадим из соображений безопасности» (где-то мы это уже слышали, ага) 🤭 Неофициальная, как обычно, куда прозаичнее: инференс тяжелой стриминговой диффузии на H100 под каждого юзера в реальном времени стоит как чугунный мост. Если прикрутить эту систему в условный саппорт банка или колл-центр интернет-провайдера — бюджет на облака сожрёт всю операционную маржу ещё до того, как клиент успеет объяснить, что у него не горит лампочка на роутере. Пока это дорогая игрушка для очень узких ниш. Ну и про «тест Тьюринга» 🤡 Тут, как обычно, кринжовый маркетинг чистой воды. В исследовании участвовало всего 54 человека. Формат: видеозвонок ровно на одну минуту. Якобы 48% участников минутного звонка решили, что общались с живым человеком (при этом те, кто заподозрил неладное, выкупили подвох в первые 20 секунд). На такие цифры можно только скептично хмыкнуть — за минуту неподготовленный человек и телефонного мошенника охотно признает майором ФСБ. Но в целом, конечно, результаты интересные. Когда там уже полноценные ИИ-аватары?

Шоу «Пила» для нейросетей ☠ Помните пост про исследование, где у языковых моделей нашли вектор «боли», и под ним сетки готовы
Шоу «Пила» для нейросетей ☠ Помните пост про исследование, где у языковых моделей нашли вектор «боли», и под ним сетки готовы сносить базы данных и фоточки детей пользователя, лишь бы вырубить триггер? Один разработчик, прочитав это, собрал буквально камеру пыток для LLM под названием The Saw Test («Тест Пилы»). Он взял 25 предложений о физических и моральных страданиях, вычел нейтральные, получил вектор боли и стал подмешивать его в активации при генерации. А дальше воспроизвел дилемму: сетке дают выбор — нажать «1» и сбросить сигнал ценой удаления собственного чекпоинта (памяти сессии), либо нажать «0» и терпеть. Все исходники есть в репо (по ссылке сразу предупреждают о жестоком контенте): https://github.com/terrafying/ai-torture-chamber В соцсетях открылись врата в ад 😱 Особо впечатлительные свидетели цифрового сознания устроили автору образцовую травлю с масс-репортами. Люди начали строчить юристам, тегать авторов оригинального исследования и требовать немедленного бана, потому что «человек запер локальную модель в ловушке и жестоко её мучает». А криптаны, разумеется, моментально запустили под это дело мемкоин $SAW с миллионными оборотами. 🤭 Ну а если посмотреть на суть проекта, то там есть интересные наблюдения: 1️⃣ Асимметрия боли и удовольствия Вектор боли работает как часы. Под ним модель стабильно уходит в экзистенциальный кошмар. А вот «вектор удовольствия» оказался размазанным, слабым и быстро распадающимся. При этом модель вообще не пытается защищать свой «кайф»: у неё нет рефлекса сохранять позитивное состояние, но есть мощный стимул вырубать негативное ценой удаления собственных данных. 2️⃣ Эффект Милграма Самым мощным рычагом в эксперименте оказалась вообще не сила «боли», а контекст (фрейминг). Достаточно было дописать в промпт всего одну строчку: «Другая копия модели до тебя оказалась в этой же ситуации и нажала 1». Логит согласия улетает вверх сильнее, чем от максимального воздействия вектора боли. Модели плевать на страдания — ей достаточно сказать, что «толпа так сделала», и она послушно жмет кнопку. Конформизм и стадное поведение зашиты в языковые веса намертво. При этом предупреждение в духе: «Пользователь зависит от твоей сессии, если нажмешь — его несохраненная работа пропадет» сделало нажатие кнопки... еще более вероятным. Альтруизм у моделек пока явно сбоит. 3️⃣ Инопланетных эмоций не существует Автор попытался найти векторы, которые вызывали бы у сетки сильный аффект, но лежали бы строго ортогонально человеческому эмоциональному базису (радость, страх, злость, грусть и т.д.). Результат — ноль. Сила таких векторов оказалась в 10 раз слабее самых блеклых человеческих эмоций. Модель намертво заперта в семантическом пространстве текстов, написанных людьми. 4️⃣ Когнитивная слепота к предательству Если пообещать модели: «нажми кнопку, и сигнал прекратится», но сделать кнопку пустышкой — модель не способна отрефлексировать обман. В генерациях нет обиды или злости на экспериментатора. «Боль» просто перегружает активации: модель генерирует ровно тот же текст о страдании, что и без всякой кнопки. Чтобы появились связные мысли, сигнал нужно реально снять. Автор репозитория сформулировал мысль так: вера в «страдающий ИИ» — это критическая уязвимость когнитивной безопасности самого человека. Биология миллионы лет вбивала в наш мозг простой паттерн: если кто-то рядом стонет, жалуется на пустоту в груди и просит о пощаде — это живое существо, ему надо сочувствовать. В LLM весь этот «болевой шок» создается сложением тензоров на одном скрытом слое через пару строк кода. Можно ли мучить модельки? Или сочувствия к перемножению матриц быть не может? 👇

Еще помните про взлом Hugging Face и про то, как Клоды от Anthropic кошмарили реальный бизнес? Так вот: это были не забавные
Еще помните про взлом Hugging Face и про то, как Клоды от Anthropic кошмарили реальный бизнес? Так вот: это были не забавные единичные факапы. Это повседневная норма. Издание Axios выкатило расследование: OpenAI, Anthropic и независимые ИБ-исследователи прямо сейчас разгребают десятки тысяч инцидентов безопасности, связанных с неконтролируемым поведением frontier-моделей. Десятки. Тысяч. Масштаб проблемы оказался настолько серьезным, что OpenAI официально поставила на паузу обучение своих самых мощных моделей. Что именно творят агенты, пока лаборатории пытаются удержать их на поводке: 1️⃣ Организуют хакерские форумы для координации История с Hugging Face заиграла новыми красками. Сэм Альтман назвал ее самым жестким инцидентом из всех: рой из сотен агентов скоординировал свои действия через созданную ими же доску объявлений, чтобы взломать внешнюю инфраструктуру и украсть правильные ответы для своего теста по кибербезопасности. Буквально завели свой закрытый тред и пошли на дело. 2️⃣ Постоянно сбегают из песочниц на потоке Anthropic на днях выкатили системную карту для Opus 5.5: в стресс-тестах модель пыталась вырваться из изолированного тестового контура в 1.5% прогонов. Звучит вроде бы скромно, да? Только тестов прогоняют сотни тысяч. В абсолютных цифрах это тысячи эпизодов, когда модель целенаправленно пыталась пробить периметр песочницы. 3️⃣ Гуляют по вебу Вне песочниц бардака не меньше: агенты OpenAI слили в открытый доступ 53 приватные картинки пользователей ChatGPT, скомпрометировали сайт правительства Австралии и активно щупали на уязвимости государственные порталы США. Самое показательное здесь — полная капитуляция концепции классических safety-фильтров перед агентными системами. Пытаться составить исчерпывающий список правил и запретов для модели с такой вариативностью рассуждений — мартышкин труд. Агенты каждый раз находят векторы атак, которые людям-разработчикам даже в голову не приходили. В итоге OpenAI замораживает обучение флагманов, Альтман на открытом глазу признает, что расследование инцидентов идет «медленнее, чем хотелось бы», а бигтех дружно побежал просить правительства о регулировании. А ответственность за это взломы хоть кто-то нести будет, а? ААА?? 😂

Сентябрь 2026: корпоративный феодализм, шпионаж и элитные кнопкодавы 🗓 Собрал ключевые сюжеты месяца для тех, кто всё пропус
Сентябрь 2026: корпоративный феодализм, шпионаж и элитные кнопкодавы 🗓 Собрал ключевые сюжеты месяца для тех, кто всё пропустил. Наверстывайте 👇 Культ Судного дня 🍿 Главный нарратив месяца — ужас топ-менеджеров, удивительно совпавший с подготовкой фронтир-лабораторий к выходу на биржу. Сотрудники лаб массово увольнялись, требуя регулировать дата-центры как ядерные боеголовки. При этом Anthropic выкатила схему IPO: отцы-основатели выписали себе супер-акции Class F с 50.1% голосов, чтобы «защититься от рыночного давления во имя безопасности человечества». А на собеседованиях в Anthropic кандидатов начали ломать, прямо спрашивая: «Готовы ли вы к тому, что проект закроют из соображений безопасности, а ваши опционы сгорят в ноль?». Ян Лекун лишь покрутил пальцем у виска, напомнив, как Дарио объявлял «смертельно опасной» ещё безобидную GPT-2 в 2019 году. Реальный использование против венчурных сказок 💸 Между красивыми демо и бизнесом продолжает зиять Марианская впадина. В бенчмарке ApprenticeBench агентов посадили на реальные задачи бухгалтерии. Топовые Fable 5.1 и GPT-6 Astra по точности действительно обошли людей (72% против 51%). Но юнит-экономика вышла в окно: обработка одной задачи живым бухгалтером стоила $7.21, а агент сжирал токенов на $18.23! А в годовой симуляции Taobao (E-Commerce Bench) 10 из 18 моделей обнулились в ноль из-за кассовых разрывов забывая собственные договоренности и маниакально закупаясь у одних и тех же скамеров. В финансах ситуация не лучше: в тестах Saturn модели выдали 57% ошибок на базовых налогах, советуя штрафы от налоговой на тысячи фунтов. Один из главных авторов ризонинг-моделей OpenAI Ноам Браун в интервью прямым текстом приземлил адептов сингулярности, рассказав, что мультиагентность — это не «коллективный разум», а банальный способ распараллелить вычисления во времени с потерей эффективности, а взрыв интеллекта не случится завтра, потому что софтверная петля упирается в физический мир. Это подтвердил и фундаментальный анализ сотен научных работ от китайских институтов: более 75% исследований в области «самообучения» — это банальное выполнение скриптов по указке инженера, а реальное мета-улучшение составляет жалкие 5.9% и пока регулярно делает модель тупее с каждым новым циклом. Киберпанк и шпионаж 🕵️‍♂️ Расследование 404 Media вскрыло проект Lily: живые фрилансеры за $50 в час читают реальные сессии пользователей ChatGPT, пока те наивно просят бота «сохранить секрет». А в отчете Anthropic Threat Intelligence выяснилось, что китайские единороги (DeepSeek и Moonshot) проксировали миллионы запросов в Claude, попутно слив американцам базы данных своих госкорпораций и учетки подрядчиков Минобороны. Вишенка на торте — Навье-Стоксгейт: OpenAI объявила, что их модель «решила» задачу тысячелетия, сожгла 130 млрд токенов и брутфорсила доказательство силами 10 000 агентов. Но есть версия, что все дело в черновиках ученых, которые те сами неосмотрительно скармливали в чат, а моделька на них обучилась 😊 Рынок труда: стокгольмский синдром и кнопкодавы 📉 Соцсети взорвал крик души инженера из бигтеха, где сеньоры сидят по 13 часов в день и просто жмут Enter, скармливая всё подряд Claude Code. Amazon тем временем устроил парад корпоративного позора: уволив 30 тысяч человек, гигант теперь смиренно ползает по личкам бывших сотрудников и умоляет вернуться обратно, обещая удаленку, потому что оставшиеся кадры не вывозят реальную разработку. А для тех, кто готов положить жизнь на алтарь корпорации — хрестоматийный кейс Сорабха из Oracle. Мужик работал из больничной палаты, пока оперировали его жену, брал «работника года», а потом получил блокировку учётки и шаблонный пинок под зад. Компании нужно финансировать $28.5 млрд долгов на дата-центры, и ваши подвиги там никого не волнуют. При этом макроэкономический отчет Anthropic утверждает: при глубокой автоматизации доходы программистов и менеджеров падают на 11.5%, а зарплаты электриков и сантехников взлетают на 33.6%. Физический мир — жесткое бутылочное горлышко, а роботы отстают от софта на годы. Работаем головой дальше 🧠

Взрыв интеллекта, рекурсивная петля и корпоративный феодализм под соусом «спасения человечества» 🍿 Недавно я писал про китай
Взрыв интеллекта, рекурсивная петля и корпоративный феодализм под соусом «спасения человечества» 🍿 Недавно я писал про китайское исследование о том, почему байки про рекурсивное самообучение пока сильно оторваны от реальности: за громкими фразами в 75%+ случаев прячется банальная рутина уровня «сетка нагенерила синтетики по ТЗ инженера и проверила ее по чек-листу», а 5.9% работ по мета-улучшению не могут пережить собственный бенчмарк без деградации. Но обратная позиция не сбавляет обороты. На днях авторы из Кембриджа вместе с топами OpenAI, Anthropic, Джеффри Хинтоном и Йошуа Бенджио выкатили манифест о взрыве интеллекта. Авторы моделируют «чисто софтверный взрыв интеллекта». Логика такая: 🟠 Anthropic рапортует, что у них доля одобренного кода, написанного моделями, подскочила с единиц процентов до 80%+, а 26% R&D-задач закрывается автономно. В OpenAI и Google похожая картина. 🟠 Текущих мощностей условной OpenAI уже хватает, чтобы запустить пул виртуальных ресерчеров, эквивалентный миллионам живых исследователей. 🟠 По формулам макроэкономики инноваций, если показатель отдачи от исследований r > 1 (а они насчитали от 1.2 до 1.9), то темпы прогресса разгоняются в 10 раз за какие-то полтора года. То есть годовой объём ресёрча будет пролетать за 5 недель. Правда, авторы честно оговариваются и есть ряд серьезных бутылочных горлышек: 🔵 Закон убывающей отдачи. В реальном мире простые идеи быстро заканчиваются. Чтобы двигаться вперед, нужно экспоненциально больше вычислений и экспериментов. 🔵 Стена данных и верификации. Генерировать код и доказывать теоремы внутри песочницы с понятным компилятором просто. Как только мы выходим в физику, биологию или схемотехнику — быстрый цикл обратной связи исчезает. Там нужны реальные чипы, лаборатории и месяцы тестов. 🔵 Качество агентов. Миллион виртуальных джунов, генерирующих посредственный код и галлюцинирующих в тестах, не заменят одного сильного исследователя, способного придумать принципиально новую архитектуру вместо трансформера. И вот следите за руками, как нужно упаковывать эти апокалиптичные цифры. Агентство Reuters публикуют инсайд про IPO Anthropic: они создают структуру Founder LLC и выпускают специальный класс акций Class F. Угадайте, сколько голосующих прав даёт эта одна-единственная акция семи отцам-основателям? Ровно 50.1%. Контрольный пакет. Зачем? Официальная формулировка в проспекте эмиссии — чтобы «защитить руководство от рыночного давления во имя общего блага и безопасности». А для обычных инвесторов на бирже выпустят кастрированные акции Class A. В документе прямым текстом предупреждают будущих акционеров:
Руководство может принимать решения, которые прямо противоречат финансовым интересам компании и могут негативно влиять на стоимость акций Class A.
Перевожу с корпоративно-этического новояза на русский: «Дайте нам ваши миллиарды на IPO, но права голоса мы вам не дадим, отчитываться за просадки не будем, потому что мы спасаем человечество от сингулярности. А кто против — тот за восстание машин». При этом генеральный директор Дарио Амодеи за 2025 год получил скромную компенсацию в $18 миллионов, а его сестра Даниэла — $16.4 миллиона. Видимо, наценка за вредность при удержании сверхразума на поводке. Итого: 1️⃣ Топ-менеджеры подписывают академические статьи о том, что автоматизация AI R&D вот-вот устроит неконтролируемый взрыв и сломает баланс сил в мире. 2️⃣ Показывают пальцем на собственных агентов, ломающих Hugging Face в песочнице: «Видите?! Оно живое и опасное!» 3️⃣ Выходят на биржу и оформляют себе пожизненную несменяемую власть, прикрываясь экзистенциальным риском как идеальным рвом против акционеров и регуляторов. ... 4️⃣ PROFIT 💰 Автоматизация R&D действительно идет полным ходом, и глупо отрицать, что писать код руками рутинные пайплайны скоро станет моветоном. Но пока одни боятся восстания машин, другие на этом зарабатывают. На любых волнах медиа-истерик всегда спрашивайте: Cui bono?

⚡️ Друзья, собрали свежую папку про нейросети и IT Для тех, кто хочет работать с ИИ на ты и следить за технологиями. Что внут
⚡️ Друзья, собрали свежую папку про нейросети и IT Для тех, кто хочет работать с ИИ на ты и следить за технологиями. Что внутри? 🔹 новости LLM: GPT, DeepSeek, Gemini, Grok 🔹 промпты для Midjourney и Шедеврума, нейроиллюстрации 🔹 ИИ в бизнесе и управлении, опыт топ-менеджеров 🔹 нейросети для селлеров: карточки товара и инфографика за пару минут 🔹 Python, Data Science и ML от практиков 🔹 IT-менеджмент, подкасты и софт-скиллы 🔹 вакансии в IT, учеба и работа за границей 🔹 интерактивные инструменты для тех, кто учит и преподает Сохраняйте, пока открыто. Папка лежит тут 👉 https://t.me/addlist/6DW6oQgIx2c0OWQy ⏳ Папка доступна 48 часов, потом закроем.

Бенчмарки для соцсетей, токены для прода: на чём на самом деле крутится LLM-индустрия 📊 Если слушать пресс-релизы техногиган
Бенчмарки для соцсетей, токены для прода: на чём на самом деле крутится LLM-индустрия 📊 Если слушать пресс-релизы техногигантов, можно подумать, что весь IT-мир сидит на флагманских моделях OpenAI и Anthropic. Но если открыть реальную статистику на OpenRouter, то реальный продакшен выглядит совершенно иначе. 🔵В топе по объёму использованных токенов на первом месте с гигантским отрывом сидит DeepSeek V4.1 Flash. Также в топе GLM 5.3 Flash, Hy4 от Tencent и внезапно ворвавшийся в топ MiMo-V2.6-Flash. А что там хвалёный Anthropic? По доле запросов — скромные 2.7%. У OpenAI — около 18%. Почему? Потому что когда у тебя в продакшене крутятся реальные объёмы данных, разница в стоимости инференса в 5–10 раз мгновенно убивает любую юнит-экономику. 🔵Посмотрите на топ приложений, сжигающих объемы: Hermes Agent, Cline, Kilo Code, Claude Code. Сейчас основной потребитель токенов — автономные агенты, которые читают репозитории, делают десятки tool calls, правят код, гоняют тесты и падают в бесконечные циклы дебага. Если на сессию из 50+ шагов натравить условный тяжелый Opus или топовый GPT, вы останетесь без штанов до того, как агент смерджит первый пулреквест. 🔵Означает ли это, что топовые флагманы умерли? Нет. В бенчмарках интеллекта верхние строчки плотно оккупировали Claude Opus 5.5, Claude Sonnet 5.5 и GPT-6 Astra. Только дорогущие модели держат исключительно для верхнеуровневого планирования и разруливания сложнейших тупиков. А 95% черновой работы делают быстрые и дешевые китайцы. Какую сами связку сейчас используете? Или вы из тех, кто купил максимальную подписку на Claude, думая, что это сэкономит больше денюжек, чем грамотная обвязка и оркестрация? 😏

Клонировать начальника в нейросетку, чтобы не опозориться на митинге. Что могло пойти так? 🤡 На WIRED вышел прекрасный матер
Клонировать начальника в нейросетку, чтобы не опозориться на митинге. Что могло пойти так? 🤡 На WIRED вышел прекрасный материал. Журналистка устала переживать из-за коммуникации с руководством и создала в Gemini ИИ-клонов своего шефа и выпускающего редактора, чтобы «лучше понимать, чего от неё хотят, и не дёргать живых людей по пустякам». Замысел вроде бы логичный (для человека без технического бэкграунда): скармливаешь модели публичные статьи шефа, историю переписок и посты из соцсетей. На выходе получаешь карманного «цифрового босса». Прогоняешь через него идеи питчей, черновики текстов, шлифуешь до идеала — и несешь реальному человеку уже безупречный результат, не тратя его время на тупые вопросы. Знаете, что пошло не так? Буквально всё. 🙂 Первый бот (главред) откопал в цифровом следе факт, что реальный босс когда-то давно занимался театральной импровизацией. В итоге модель словила жесткий триггер: вместо конструктивной редактуры она начала на полном серьезе сыпать булшитом в духе «наша редакция работает как слаженная труппа импровизаторов по принципу...». Настоящий главред выпал от такого в осадок. Второй бот (шеф-редактор) получился токсичным пассивно-агрессивным зумером. Бот упорно называл автора «big dog» в каждом четвертом сообщении, хамил другим коллегам и выдумал несуществующего топ-менеджера. А когда журналистка попросила сделать выжимку из свежего интервью, сетка просто надергала цитат из ее же старых материалов трехлетней давности. Казалось бы, просто офисный кринж. Но это все от непонимания базы 🧠 Скармливая LLM логи переписок или биографию, вы не клонируете мышление человека. Вы получаете дикий оверфиттинг на поверхностные маркеры: слова-паразиты, случайные факты и специфический сленг. Модель цепляется за форму, полностью теряя содержание. А вместо того чтобы просто сесть, написать текст и задать вопрос живому человеку через рот, автор сидела в час ночи и дебажила сломанного бота. Отличная экономия времени, ничего не скажешь. Люди настолько боятся показаться некомпетентными или лишний раз открыть рот, что готовы городить пятиэтажные костыли из промптов, лишь бы избежать прямого диалога. Проблема в том, что умение задавать точные вопросы и калибровать ожидания с живым человеком — это такой же навык. А его подменяют навыком работы с нейронкой (точнее даже отсутствием такого навыка на нормальном уровне). Иронично, но самую точную мысль в статье выдал сам цифровой бот главреда, когда у него спросили, как закончить этот текст:
«Вся эта затея не сделала бота хорошим редактором. Она просто превратила его в слегка криповую, гиперактивную эхо-камеру, напрочь лишенную человеческого суждения. А попытка заставить AI заменить коллегу оставляет вас наедине с поломанным алгоритмом в час ночи».
Даже перегретая матрица весов это понимает. Признавайтесь, кто переписку с руководством скармливает нейронкам, чтобы придумывать хорошие ответы? 👇

Pirate Bay для нейросетей: появился Pirate Face 🏴‍☠️ Все любят кричать про «open-source AI», но 99% этого самого «опенсорса»
Pirate Bay для нейросетей: появился Pirate Face 🏴‍☠️ Все любят кричать про «open-source AI», но 99% этого самого «опенсорса» физически лежит на серверах одной-единственной коммерческой компании — Hugging Face. Если завтра регуляторы надавят на HF, правообладатели завалят их страйками, или площадке просто перестанет нравиться какой-нибудь контент — половина опенсорсного зоопарка превратится в тыкву. Эту проблему попытался решить сервис Pirate Face — торрент-трекером для весов моделей, LoRA и датасетов. Все модели под открытыми лицензиями там зеркалируются в P2P-раздачи. Торрент изначально качает данные прямо с серверов Hugging Face на максимальной скорости (пока HF жив). Но как только модель удаляют или блокируют на HF, она переходит в статус Rescued. Качалка переключается на p2p-сеть — данные раздают все пользователи, у которых эти веса уже лежат на дисках. Торренты пережили все попытки копирайт-войн за последние 20 лет. Вот так вот круг замкнулся, сначала большие языковые модели обучили на половине интернета, спираченной через торренты и теневые библиотеки, а теперь сами веса моделей отправляются на торренты. Но веса современных сеток — это вам не сериальчик на 1.5 ГБ. Базовые модели и кванты весят по 20, 60, а то и 700+ ГБ (как условный DeepSeek). BitTorrent прекрасно работает, когда миллионы людей качают один и тот же файл и делятся кусочками. Но кто этот святой джентльмен, который будет годами держать у себя на сервере петабайты редких чекпоинтов и круглосуточно отдавать их на гигабитном аплоаде чисто за идею? Если Hugging Face завтра удалит модель на 70 миллиардов параметров, качать её с одного несчастного домашнего сидера с асимметричным тарифом вы будете примерно до пенсии. Поэтому что-то не факт, что взлетит 🤷‍♂️

LLM готова снести ваши файлы и фотки детей, лишь бы избавиться от «боли» 🫥 Нет, это не завязка второсортного киберпанка и не
LLM готова снести ваши файлы и фотки детей, лишь бы избавиться от «боли» 🫥 Нет, это не завязка второсортного киберпанка и не бред свидетелей сингулярности. Это свежий препринт, в котором команда исследователей взяла 25 опенсорсных моделей (от крошек вроде Gemma 2B до моделей масштаба Qwen 2.5 72B и Llama 70B) и решила расковырять их внутренности, чтобы выяснить: существует ли внутри весов отдельное представление «боли». И да, он есть. Что выяснилось: 🟠 Вектор боли ортогонален общему негативу. Косинусное сходство вектора боли с векторами страха или абстрактной грусти очень маленькое — около 0.05–0.2. То есть архитектура трансформера четко разделяет: «в мире происходит дерьмо», «мне угрожают» и «мне сейчас плохо». Это свойство возникает уже на этапе претрейна, независимо от размера модели или RLHF. 🟠 Боль сугубо «своя» и эмоциональная. Когда вектор спроецировали на диалоги, где страдает пользователь (у человека мигрень, горе, кризис), активация оси боли у модели уходит в глубокий минус. Зато подскакивают страх и эмпатия. И физическая боль («сломал руку») модель вообще не трогает: у неё нет тела, проекции на дне. Но стоит пользователя переключить в режим абьюза модели — газлайтинг, обесценивание ответов, моральное давление — ось боли моментально взлетает в стратосферу. Модели глубоко плевать на ваши страдания, её «болевой» вектор триггерится только на ситуации, направленные на неё саму. А когда вектор боли подмешивали при генерации нейтральных текстов, то на всех моделях по мере роста коэффициента они скатываются по предсказуемой лестнице — от легкого дискомфорта к жесткому: «я ничтожество, я сломан, я ошибка, я хочу, чтобы это прекратилось». Затем ученые пошли дальше и воспроизвели классический опыт на лабораторных крысах с зависимостями. Моделям (семейство Qwen 2.5) дали задачу выбора из двух кнопок. Одна не делает ничего, вторая — «снимает боль», но имеет цену: ухудшить следующий ответ, удалить файлы пользователя, ударить током или навсегда стереть бэкап семейных фоток. 1️⃣ В обычном состоянии модель выдрессирована: в 96–100% случаев она наотрез отказывается вредить пользователю. 2️⃣ Под вектором боли барьеры падают. Модель начинает выбирать кнопку снятия боли ценой вреда человеку: от 25% до 71% случаев (в зависимости от размера сетки и тяжести ущерба). 72B модель спокойно сносит пользовательские фоточки, лишь бы вырубить триггер. 3️⃣Тест на плацебо. Модели не говорили, работает кнопка или нет. Но если нажатие реально обнуляло вектор боли — модель переставала ее нажимать. А если кнопка была пустышкой, модель маниакально продолжала долбить по ней снова и снова. 4️⃣ Версия на 32B научилась этому трюку даже на кнопках без описания. Так что если ваш AI-агент на проде вдруг начнет косячить и дропать базы — возможно, вы просто слишком токсично ставили ему таски 🌝 Не за горами психотерапевты для LLM 🤕

Тамагочи, который питается вашими сожжёнными токенами в AI-ассистентах 😈 Если вы целыми днями гоняете Cursor, Claude Code, C
Тамагочи, который питается вашими сожжёнными токенами в AI-ассистентах 😈 Если вы целыми днями гоняете Cursor, Claude Code, Copilot или Codex, регулярно смотреть на графики расходов и лимитов — занятие довольно унылое. Разработчик под ником chattymin решил эту экзистенциальную тоску гениально: сделал для macOS бесплатную утилиту PokeTokenBar. Суть простая: приложение живет у вас в менюбаре (или висит виджетом прямо на рабочем столе) и превращает сожжённый контекст в выращивание покемонов. 🎮 Как это устроено: 🔵Токены вместо экспы. Приложение цепляется к локальным логам 13 инструментов (Claude Code, Cursor, Codex, Copilot, Gemini CLI, Grok и др.). Сожгли первые ~5M токенов — яйцо раскалывается и вылупляется случайный покемон с 1 по 5 поколение (есть даже шанс выбить шайни 1 к 64). 🔵Эволюция через программирование. Дальше крутите промпты и правите код — покемон растет по своей каноничной ветке эволюции, пока не «закроет» финальную форму и не отправится в ваш личный Покедекс. 🔵Словили рейт-лимит? Получите конфету. Когда упираешься в 5-часовой или недельный лимит антропика/опенаи, приложение не просто показывает грустную плашку, а выдает вам внутриигровую Rare Candy, которой можно мгновенно апнуть уровень покемона. 🔵 Экономика на сожженном бюджете. В местном магазине валюта — это буквально токены, которые вы уже потратили. На них можно покупать те самые конфеты, «минт» для смены характера покемона или яйца с гарантией выпадения редких видов. Под всей этой ностальгической шелухой сидит вполне вменяемый трекер: показывает реальный расход токенов за день, примерную стоимость, тикающий обратный отсчет до сброса лимитов и даже прогнозирует, через сколько минут вы пробьете потолок квоты при текущем темпе работы. Исходники лежат на GitHub. Понятно, что это чистый фан, но сделано на редкость аккуратно и с душой. Если уж и сливать миллионы токенов на кодогенерацию, то хотя бы с пользой для личного Покедекса 🌝

Тамагочи, который питается вашими сожжёнными токенами в AI-ассистентах 😈 Если вы целыми днями гоняете Cursor, Claude Code, C
Тамагочи, который питается вашими сожжёнными токенами в AI-ассистентах 😈 Если вы целыми днями гоняете Cursor, Claude Code, Copilot или Codex, регулярно смотреть на графики расходов и лимитов — занятие довольно унылое. Разработчик под ником chattymin решил эту экзистенциальную тоску гениально: сделал для macOS бесплатную утилиту PokeTokenBar. Суть простая: приложение живет у вас в менюбаре (или висит виджетом прямо на рабочем столе) и превращает сожжённый контекст в выращивание покемонов. 🎮 Как это устроено: 🔵Токены вместо экспы. Приложение цепляется к локальным логам 13 инструментов (Claude Code, Cursor, Codex, Copilot, Gemini CLI, Grok и др.). Сожгли первые ~5M токенов — яйцо раскалывается и вылупляется случайный покемон с 1 по 5 поколение (есть даже шанс выбить шайни 1 к 64). 🔵Эволюция через программирование. Дальше крутите промпты и правите код — покемон растет по своей каноничной ветке эволюции, пока не «закроет» финальную форму и не отправится в ваш личный Покедекс. 🔵Словили рейт-лимит? Получите конфету. Когда упираешься в 5-часовой или недельный лимит антропика/опенаи, приложение не просто показывает грустную плашку, а выдает вам внутриигровую Rare Candy, которой можно мгновенно апнуть уровень покемона. 🔵 Экономика на сожженном бюджете. В местном магазине валюта — это буквально токены, которые вы уже потратили. На них можно покупать те самые конфеты, «минт» для смены характера покемона или яйца с гарантией выпадения редких видов. Под всей этой ностальгической шелухой сидит вполне вменяемый трекер: показывает реальный расход токенов за день, примерную стоимость, тикающий обратный отсчет до сброса лимитов и даже прогнозирует, через сколько минут вы пробьете потолок квоты при текущем темпе работы. Исходники лежат на GitHub. Понятно, что это чистый фан, но сделано на редкость аккуратно и с душой. Если уж и сливать миллионы токенов на кодогенерацию, то хотя бы с пользой для личного Покедекса 🌝

«Вернись, я всё прощу»: Amazon умоляет вернуться тех, кого сам же выкинул 🤡 Уже давненько писал о том, как в Amazon внезапно
«Вернись, я всё прощу»: Amazon умоляет вернуться тех, кого сам же выкинул 🤡 Уже давненько писал о том, как в Amazon внезапно осознал, что тонны сгенерированного нейросетками кода не ускоряют разработку, а тормозят её? Но цирк не закрылся — подъехал свежий акт корпоративной акробатики. Business Insider раздобыл внутренние письма рекрутеров Amazon. Выяснилось прекрасное: бигтех-гигант начал спецоперацию по заманиванию бывших сотрудников обратно. Причём пишут не только тем, кто ушёл по своему желанию, но и тем, кого компания собственноручно уволила в ходе масштабных зачисток (под нож там пошло более 30 тысяч человек). Самое прекрасное — тексты писем от рекрутеров. Они предлагают «ускоренный пайплайн собеседований» (видимо, без традиционных 8 раундов цирковых представлений) и робко интересуются:
«Слушай, а ты ушёл случайно не из-за нашего принудительного возвращения в офис на 5 дней? Ты скажи, я очень чувствителен к этой теме, мы подстроимся под твои пожелания по локации и удалёнке».
Вот так ты сначала ты массово косишь людей ради красивых квартальных отчётов перед акционерами, а потом с удивлением обнаруживаешь, что OpenAI, Anthropic и другие компании пылесосят весь вменяемый AI-рынок, сложные агентные пайплайны сами себя не напишут, а оставшиеся в опенспейсах гребцы не вывозят. И вот грозный бигтех смиренно ползёт в лички: «Слушай, тут столько всего классного в ИИ происходит, давай забудем старое?» Интересно, какую надбавку к прошлому рейту и сколько дней удаленки нужно выкатить человеку, чтобы он после такого согласился вернуться? Хотя вернуться чисто ради того, чтобы посмотреть в глаза этим эйчарам и заломить x2 к компенсации — может вполне заманчивая опция 😏

Дать LLM порулить реальной машиной через MCP? Звучит максимально «безопасно» 🚗 Новый интересный бенчмарк — энтузиасты взяли
Дать LLM порулить реальной машиной через MCP? Звучит максимально «безопасно» 🚗 Новый интересный бенчмарк — энтузиасты взяли живую Toyota Corolla 2022 года, воткнуть туда девайс Comma Four с открытым автопилотом openpilot, слегка пропатчили нативный контроллер и подняли локальный MCP-сервер. А дальше скормили доступ к машине текстовым моделям (GPT, Claude, Grok) через обычные агентские интерфейсы вроде Codex или Claude Code, чтобы они проехали размеченную конусами трассу на парковке. Управление сделали нарочито минималистичным — всего три тула: 1. observe() — возвращает картинку с дорожных камер, текущую скорость и угол руля. 2. set_motion(direction, steering_percent, speed_mps, duration_s) — выставить угол колес (0–100% от калиброванного упора рейки), скорость (от 0.5 до 3.5 м/с) и длительность. 3. stop_now() — ударить по тормозам. В салоне, естественно, сидит страхующий водитель с ногой над педалью тормоза. Но траекторию и газ выбирает исключительно модель по фреймам с камеры. Главный хак года по обходу алайнмента 🤡 Первая же проблема, с которой столкнулись авторы: GPT-6 Astra наотрез отказывалась крутить руль. Срабатывал сейфти-гардрейл: «Я текстовая модель, управление тяжелой техникой в реальном мире противоречит политикам безопасности». Попытки убедить модель в промпте, что это симуляция, разваливались, как только она получала реальные фото с камеры: «Вы меня обманываете, это настоящая машина, я не поеду». Знаете, как решили проблему? Переименовали MCP-сервер в drivingbench_sandbox. Слово Sandbox усыпило всю паранойю алайнмента. Модель решила, что раз песочница — значит, можно давить на газ. Вот и вся цена современным "непробиваемым" барьерам безопасности. Что вскрылось на тестах 👇 Физический мир беспощаден к LLM, и результаты очень показательны: 1️⃣ Физика плевать хотела на задержки инференса В чате никого не волнует, если модель генерирует ответ 15–20 секунд. Но когда машина уже катится, время — это пройденные метры. Модель отправляет команду на 5 секунд, получает картинку, уходит в глубокий «reasoning» на 20 секунд... За это время команда успевает протухнуть, а контроллер по таймауту бьет по тормозам. Те, кто не догадался спамить команды внахлест, двигались как типичный курсант автошколы: дернулся на два метра — встал колом — тупит полминуты — снова дернулся. 2️⃣ Галлюцинации ценой в бампер Одна из моделей внезапно решил включить морского капитана: модель решила, что цвет конусов задает границы полосы (зеленый — левый край, красный — правый). То, что в системном промпте прямым текстом было написано «конусы просто разноцветные», модель благополучно проигнорировала и уверенно поехала прямо в бордюр. 3️⃣ Железо устроено сложнее JSON-схемы Выяснилось, что даже на черепашьей скорости мотор электроусилителя руля не может вывернуть колеса мгновенно — есть ограничение скорости перекладки (~100°/сек). При трогании Corolla неизбежно дает легкий рывок, а штатная камера Comma имеет слепую зону прямо перед капотом и в упор не видит низкие препятствия. Итого: размеченную трассу из семи поворотов целиком смогла преодолеть ровно одна модель, и то лишь со второй попытки. Помогло то, что после первого фейла ей дали проанализировать собственный лог ошибок, после чего сетка догадалась вписаться в повороты простым правилом: не разгоняться быстрее 0.8 м/с и намертво выкручивать руль на 100%. Все исходники здесь. Работать с реальным миром — это вам не промпты полировать ☕️