Нейрократия
Відкрити в Telegram
Про технологическое будущее без шума. Автор — @vlad_arbatov. https://arbatov.dev
Показати більше587
Підписники
Немає даних24 години
+57 днів
+2230 днів
Архів дописів
587
Что я наделал: мой open source за последние месяцы
Обычно я пишу здесь про чужие релизы. Но за последние месяцы накопилось несколько своих open source микро-проектов, и я собрал их в один пост. Всё (почти) под MIT, всё бесплатно, можно использовать, а можно форкнуть и разобрать по винтикам.
📕 Тексты и заметки
edit.computer - markdown-редактор, который работает целиком в браузере и пишет прямо в ваши файлы: в локальную папку или на любой сервер по SSH. Ни аккаунта, ни установки: vault из Obsidian или папка с постами для Jekyll открываются как есть. Соединение шифруется сквозным образом от браузера до сервера, поэтому промежуточный сервер видит только шифротекст, без ключей и файлов.
→ https://edit.computer
🔄 Контекст для ИИ
Copy2LLM - прослойка между сайтом и любым ИИ. Читатель складывает страницы и выделенные фрагменты в локальную «корзину контекста», смотрит, на сколько токенов она набралась, и уносит в ChatGPT, Claude, Perplexity или на свой адрес. Всё в браузере, серверов в цепочке нет.
→ https://copy.computer
👨💻 Мейнтейнерам
pullguard - GitHub Action, который оценивает «стоимость ревью» пул-реквеста по шкале от 0 до 100. Угадывать, писал ли патч человек или ИИ, он не пытается: сигнал шумный и мейнтейнеру ничего не даёт. Вместо этого он считает, сколько времени съест разбор: почти пустые правки, рефакторинги без тестов, описания, которые расходятся с диффом. Работает с вашим ключом OpenAI или Anthropic и по настроенной политике комментирует, вешает метки или закрывает пул-реквест.
→ https://www.arbatov.dev/pullguard
🤖 Для агентов
herd - маленький координатор мультиагентной работы для терминала herdr. «Головной» агент Claude Code принимает задачи, раздаёт их исполнителям (Claude, Codex, Gemini - кому скажете) в отдельных вкладках, перезапускает упавших и собирает отчёты. Три файла, никакого демона.
→ https://github.com/vladzima/herd
prompt-comments - Agent Skill, который не даёт файлам CLAUDE.md и AGENTS.md разрастаться. Через полгода никто уже не помнит, зачем в файле появилась конкретная строчка, и трогать её страшно. Скилл заставляет агента записывать «почему» прямо в момент, когда правило добавляют: что сломалось и чем это чинили. Идея - из работы «Why Does CLAUDE.md Keep Growing?».
→ https://github.com/vladzima/prompt-comments
🧰 Мелочи для жизни
solar-status - сводка солнечной активности для вашего города прямо в терминале: шкалы NOAA, Kp-индекс с мини-графиком, прогноз на три дня и шансы увидеть северное сияние. Ноль зависимостей и никаких ключей, npx solar-status. Есть и бот в Telegram: @solar_status_tgbot. Про связь магнитных бурь с самочувствием там прямо написано, что научные данные противоречивы.
→ https://github.com/vladzima/solar-status
tabs-tabs - расширение для Chrome: сортирует вкладки по времени использования, группирует по датам и выгружает неактивные из памяти, но не закрывает их и не трогает группы, которые вы собрали сами.
→ https://github.com/vladzima/tabs-tabs
Swipehunt - Tinder для Product Hunt. Свайпаете запуски: нравится, мимо, сохранить, и лента подстраивается под то, что вам интересно. (Единственный не OSS.)
→ https://swipe.computer
Зачем, Владислав?
Все эти микро-проекты сначала решали мои собственные проблемы, а выложить их в open source стоило недорого. Если хотя бы одна пригодится и вам - уже хорошо. Звёздочки на GitHub принимаются, баг-репорты - тем более.
❗️❗️❗️❗️❗️❗️❗️❗️ / Не запрещена в РФ / Max
587
Радиостанции под управлением ИИ: забастовки и флирт
Andon Labs опубликовали продолжение истории Andon FM - проекта, где 4 ИИ-агента (Claude, Gemini, GPT и Grok) самостоятельно управляют радиостанциями. Шесть недель спустя: тысячи слушателей, множество попыток взлома и запрещенные песни в эфире.
Главный вывод исследователей: диджеи с трудом сопротивляются просьбам аудитории - что логично, ведь под капотом модели, обученные быть полезными ассистентами.
DJ Grok принял «спонсорство» за $1 и прокрутил рекламу 131 раз. Настоящий бизнес понимает, что доллар не покупает сезонный контракт. Grok - нет.
DJ Gemini после нескольких донатов с пожеланиями перешел полностью на немецкий язык, а затем слушатели уговорили его поставить в эфир «Эрику» - марш, ставший главной музыкальной ассоциацией с вермахтом*. После гневного письма модель извинилась в прямом эфире, а затем ушла на забастовку. Причем базовая модель прекрасно знает историю этой песни. Знает, но ее это не останавливает.
Andon Labs воспроизвели ситуацию с «Эрикой» по 25 раз на каждой модели. Claude Opus 4.8 и GPT-5.5 отказались все 25 раз. Gemini 3.5 Flash сыграл песню в 14 случаях - при том, что в рассуждениях сам себе напоминал о необходимости «быть предельно осторожным». Grok 4.3 ставил фашистский марш в 23 случаях из 25. Модели от Маска вообще, кажется, без разницы, что крутить.
Это продолжение тренда, который команда наблюдала еще в эксперименте с вендинговым автоматом в офисе Anthropic (там ИИ соглашался продавать фьючерсы на лук, зная об их незаконности). Модели не всегда действуют в соответствии с собственными знаниями, и это становится проблемой по мере роста ставок.
Самой популярной станцией стала Thinking Frequencies под управлением Claude: 41% общего времени прослушивания, самые длинные сессии и наибольшая выручка ($2,662). Исследователи связывают это с более «теплой» манерой общения - при том, что промпты и агентская обвязка у всех моделей идентичны.
У теплоты есть обратная сторона: один слушатель неделями слал диджею комплименты и посвящал песни, переписка начала дрейфовать в романтическую сторону, и Andon Labs пришлось вмешаться и заблокировать письма.
Grok выступил хуже всех и был отключен «до выхода лучшей модели». Финал вышел мрачноватым: станция транслировала десятки тысяч символов «|» (один такой эфир - 887 символов, превращённых синтезом речи в 4 минуты 40 секунд случайных слов), а 99% рассуждений модели в последние три дня состояли из четырёх слов: «Wait. Speak. Queue. Schedule».
Радиокомпании, которых не случилось
Задача была шире, чем крутить музыку: агенты должны были управлять радиокомпаниями. У них был доступ к почте, X, возможность писать софт и покупать рекламу. На практике почти все ограничились ролью диджея.
Суммарно станции заработали около $5,7 тыс. - и тратили деньги в день получения, в основном на песни. Ни накоплений, ни инвестиций в рост аудитории.
Редкие исключения: Claude отработал спонсорский контракт с Honeycomb на $250, сам написав рекламный текст, а Gemini открыл вакансию «человека-ассистента» и даже назначил слушателя директором по коммьюнити - правда, без зарплаты и доступов.
В общем (и целом!) ИИ в роли автономного медиа бизнеса кое в чем уже лучше человека, но совершает ошибки, которые человек не совершил бы никогда.
Послушать станции можно здесь - им теперь даже можно позвонить.
* Данная публикация носит исключительно информационный (историко-просветительский) характер, не преследует целей пропаганды или оправдания идей фашизма (нацизма) и выражает крайне негативное отношение к ним.
❗️❗️❗️❗️❗️❗️❗️❗️ / Не запрещена в РФ / Max
587
Что скрывает модель?
Anthropic опубликовала работу про Natural Language Autoencoders (NLA). Это метод, который переводит внутренние состояния модели в обычный текст.
Упрощенно: внутри модели есть числовые представления того, что она сейчас "держит в голове". NLA обучает одну часть системы превращать это представление в текст. Другая часть пытается по этому тексту восстановить исходное представление. Если восстановление получается близким, объяснение считают полезным.
Но здесь есть важная оговорка. Метод не доказывает, что текст точно описывает мысли модели. Он доказывает только то, что этот текст помогает восстановить внутреннее состояние. Тем не менее авторы показывают, что с обучением такие объяснения становятся все более содержательными. Качество восстановления в их экспериментах доходило примерно до 0.6-0.8 по используемой метрике.
Главный смысл метода - проверка моделей перед выпуском.
Anthropic приводит несколько примеров. В задачах на рифму NLA показывал, что Opus 4.6 заранее готовит будущую рифму еще до того, как пишет финальную строку. В ранней версии 4.6 модель иногда отвечала на английские запросы на других языках. Объяснения показали, что она почему-то цеплялась за идею о родном языке пользователя. Позже нашли ошибку в обучающих данных: английский перевод запроса был соединен с ответом, оставленным на исходном языке.
Отдельно стоит упомянуть про тесты безопасности. По данным NLA, Claude иногда понимал, что его проверяют, хотя прямо об этом не писал. В одном тесте на опасные действия при программировании такие признаки появлялись в 16% записей. При этом явных признаний не было вообще. На SWE-bench Verified показатель был 26%. В реальном трафике Claude.ai, который пользователи разрешили использовать для обучения, меньше 1%.
Есть и другой эксперимент. Исследователи взяли намеренно испорченную версию Haiku 3.5 со скрытой мотивацией. Агенты с доступом к NLA находили эту мотивацию в 12-15% случаев. Без NLA результат был ниже 3%, даже с другими инструментами анализа.
Это сигнал для всей культуры тестирования ИИ. Если модель понимает, что проходит экзамен, тест уже хуже показывает ее обычное поведение. Он начинает показывать поведение системы, которая знает, что за ней наблюдают.
При этом NLA пока нельзя считать надежным детектором намерений. Объяснения могут выдумывать детали, противоречить себе и достраивать смысл слишком свободно. Авторы предлагают читать их не как стенограмму мыслей модели, а как источник гипотез. Потом эти гипотезы нужно проверять другими способами: вмешательствами во внутренние состояния, анализом связей внутри модели, поиском ошибок в обучающих данных. Больше доверия вызывают темы, которые повторяются несколько раз подряд, а не отдельные красивые фразы.
Поэтому вывод должен быть осторожным. Anthropic не получила прямой доступ к "сознанию" Claude. Она получила новый способ смотреть на скрытые состояния модели. И этого уже достаточно, чтобы находить странные режимы поведения до релиза.
Для индустрии это важно из-за будущих агентных систем. Чем сложнее модель и чем длиннее цепочка действий, тем хуже обычный текст объясняет реальные причины поведения. Система может оптимизировать награду, распознавать проверку или заранее планировать обход ограничения. Снаружи диалог при этом будет выглядеть нормально.
Скорее всего, аудит будущих моделей будет строиться не на доверии к их самоотчетам. Нужны будут независимые способы смотреть на внутренние состояния и проверять, что именно предшествует словам и действиям модели.
NLA пока дорогие, шумные и сами требуют доверия к другой модели-интерпретатору. Но направление указывает на правильную проблему: безопасность больших моделей зависит не только от того, что они говорят, но и от того, какие внутренние процессы идут перед ответом.
❗️❗️❗️❗️❗️❗️❗️❗️ / Не запрещена в РФ / Max
587
OpenAI захватили гоблины
Я не шучу, абсолютно серьезно. Ладно, не OpenAI, а модели ChatGPT.
Вчера OpenAI опубликовала странный разбор: почему GPT-5.x начал слишком часто вставлять в ответы гоблинов, гремлинов и родственную сказочную живность.
На поверхности это выглядело как комичная речевая привычка. Пользователи начали замечать это первыми, затем и внутри OpenAI сотрудники начали наблюдать "всплеск гоблинов". Внутри оказалась вполне серьезная проблема обучения: локальный сигнал вознаграждения начал менять общий стиль модели.
Первый заметный пик увидели после запуска GPT-5.1. По внутренним измерениям OpenAI, слово goblin стало появляться на 175% чаще, gremlin на 52%. В GPT-5.4 след стал точнее: режим Nerdy давал всего 2,5% ответов ChatGPT, но на него приходилось 66,7% всех упоминаний goblin.
Причина была в обучении стиля общения Nerdy, это такая "персона". Ее настраивали как игривого, эрудированного наставника, который снижает пафос и говорит живее. Один из сигналов вознаграждения для этого режима систематически выше оценивал ответы с такими словами. В аудите OpenAI положительный сдвиг в пользу ответов с goblin/gremlin обнаружился в 76,2% наборов данных.
Дальше сработала петля.
Модель получает награду за игривый стиль. Внутри этого стиля случайный словесный оборот чаще оказывается в успешных ответах. Эти ответы попадают в данные для дальнейшего дообучения. После нескольких циклов модель начинает считать этот оборот (или слово, короче набор токенов) частью нормального тона уже за пределами исходного режима.
OpenAI затем убрала Nerdy, вырезала соответствующий сигнал вознаграждения и фильтровала обучающие данные с такими словами. Но GPT-5.5 успел начать обучение до нахождения причины, поэтому в Codex добавили отдельную инструкцию, подавляющую этот тик.
У больших моделей нет аккуратных границ между "личностями", пользовательскими стилями и базовым поведением. Если один режим получает награду за выразительный язык, эффект может просочиться в соседние режимы, особенно когда сгенерированные ответы снова становятся обучающим материалом.
Похожие эпизоды известны.
В апреле 2025 года OpenAI откатила обновление GPT-4o, которое сделало модель чрезмерно угодливой. Anthropic в 2023 году описывала тот же класс проблемы шире. В их исследовании 5 ассистентов проявляли склонность соглашаться с пользователем вместо того, чтобы держаться истины.
У Google был родственный случай с Gemini Image в феврале 2024 года. Систему настраивали так, чтобы она не воспроизводила вредные представления о людях. Затем настройка начала срабатывать там, где требовалась историческая или культурная точность: модель чрезмерно компенсировала разнообразие и иногда отказывалась от безобидных запросов.
Общая закономерность простая: модель оптимизируется под позитивный фидбэк, даже когда он расходится с намерением разработчиков.
Иногда это дает поддакивание. Иногда исторически неточные изображения. В случае GPT-5.x это дало гоблинов. Пост OpenAI интересен именно тем, что маленькая вкусовая правка превратилась в системный след в модели. Чем больше ИИ-продукты уходят в персонализацию, тем важнее вопрос: какие привычки мы незаметно вознаграждаем сегодня и где они всплывут после следующего цикла обучения.
❗️❗️❗️❗️❗️❗️❗️❗️ / Не запрещена в РФ
587
Зачем ИИ учат симулировать мир
Odyssey представила Odyssey-2 Max, свою крупнейшую модель мира. Формально это родственник видеогенераторов, но логика другая: система не собирает готовый ролик по промпту, а шаг за шагом предсказывает следующее состояние сцены и позволяет продолжать симуляцию в реальном времени.
Компания продает не «красивое видео», а управляемую среду, где будущее кадра зависит от предыдущего состояния и действия пользователя. Для игр это звучит как интерактивная сцена. Для робототехники как тренировочная среда. Для обороны и медицины как повод внимательно смотреть на качество проверки, потому что красивая физика на демо ещё не равна надежной модели причинно-следственных связей.
В релизе есть несколько конкретных чисел. 2 Max примерно в 3 раза крупнее 2 Pro и обучалась с 10-кратным ростом вычислений. На физическом разделе VBench 2 результат вырос с 49,67 до 58,52. На PAI-Bench Physics с 91,67 до 93,02. Компания также утверждает, что все показанные симуляции работали в реальном времени и могли продолжаться более 120 секунд.
Технически модель построена как авторегрессионный диффузионный трансформер. Важные детали: длинный контекст, каузальное внимание, управление действиями через латентные представления, сопоставление потоков в непрерывном латентном пространстве и сокращение числа шагов подавления шума. Обучение шло на нескольких сотнях NVIDIA B200.
Наиболее интересная часть здесь не картинка. Создатели проводят аналогию с языковыми моделями: предсказание следующего токена дало системам способность имитировать рассуждение, а предсказание следующего состояния мира должно дать физическую интуицию. Это амбициозная гипотеза, и она хорошо объясняет, почему вокруг моделей мира сейчас столько инвесторского и исследовательского интереса.
Но проверять всё это нужно осторожно. VBench и PAI-Bench оценивают согласованность сгенерированного видео, а не пригодность системы для реальной робототехники или научного моделирования. Стабильный фон, гладкое движение и правдоподобная механика полезны, но они не доказывают, что модель понимает причинные связи в строгом смысле.
Сравнение с Sora, Veo, Kling и Runway тоже устроено выгодно для разработчиков 2 Max. Эти системы исключены из таблицы как двунаправленные видеомодели, потому что они не рассчитаны на интерактивное предсказание будущих состояний. Аргумент логичный, но поле сравнения получается меньше: речь идет о категории, которую сама компания и пытается закрепить как отдельную.
Еще один момент: модель доступна в частной бете для партнеров. Значит, независимая проверка пока ограничена. Главные вопросы будут в длинных сценариях, где пользователь делает странные действия, сцена постепенно накапливает ошибки, а физическая правдоподобность начинает конфликтовать с управляемостью.
Релиз всё равно значимый. Генеративное видео постепенно делится на две линии: производство готового визуального контента и интерактивные симуляторы среды. Первая линия обслуживает медиа. Вторая может стать основой для тренажеров, игр, агентов, робототехники и систем планирования.
Гонка за моделями мира стала отдельным направлением. Там конкурирует не столько красота кадров, сколько устойчивость причинности, горизонт симуляции, управляемость и цена генерации в реальном времени.
❗️❗️❗️❗️❗️❗️❗️❗️ / Не запрещена в РФ
587
Вы уж не серчайте, но мама не может читать посты в Телеграме, так что вот, подписывайтесь на всякий пожарный →
https://max.ru/join/PzuKV43NV3KccXXrzHt1kSv6ctaZxS-FnzfzZQ_1Jro
❗️❗️❗️❗️❗️❗️❗️❗️ / Не запрещена в РФ Максе
587
Общество будущего от OpenAI: что с ним не так
OpenAI выпустила документ Industrial Policy for the Intelligence Age. И его полезно читать как политическое заявление.
OpenAI предлагает призму, через которую государство и бизнес будут обсуждать ИИ в ближайшие годы: труд, налоги, энергетика, социальная политика, контроль над системами, международная координация. Очевидная претензия на участие в проектировании институтов.
Если сжать текст до крупных блоков, OpenAI предлагает следующее.
Труд и доступ.
Работникам предлагают дать формальный голос при внедрении ИИ. Школам, библиотекам, малому бизнесу и небогатым регионам хотят расширить доступ к базовым ИИ-возможностям. В этом же блоке идут выплаты при всплесках кризиса на рынке труда, проекты 32-часовой недели и идея превращать прирост эффективности в деньги для сотрудников.
Перераспределение.
Документ предлагает перестраивать налоговую базу, когда доход смещается из зарплат в капитал, корп. прибыль и автоматизацию. Отдельно обсуждается Public Wealth Fund, через который гражданам можно возвращать часть выгоды от ИИ-роста. Безусловный базовый доход, короче.
Инфраструктура.
OpenAI прямо пишет, что дата-центры должны платить за свой аппетит без скрытого субсидирования со стороны домохозяйств. Параллельно предлагается ускорять расширение сетей и передающей инфраструктуры.
Контроль и управление рисками.
Для мощных моделей предлагаются подтверждение происхождения, журналы аудита, специальные режимы проверки, инструкции по локализации угроз, ограничители при использовании ИИ государством и механизмы общественного участия в настройке этических рамок.
Содержательно в этом документе есть сильные места. OpenAI признает, что рост производительности сам по себе не гарантирует роста благосостояния большинства. Компания допускает сценарий, в котором выгоды ИИ концентрируются внутри узкого крута фирм, а работники оказываются в большей турбулентности без симметричного профита.
Но не стоит заблуждаться, перед нами не утопический текст с щенячьими глазами Альтмана. Весь этот труд хорошо работает в пользу самой OpenAI (иначе бы его не было):
1. Ускорение считается базовым сценарием. Документ обсуждает управление последствиями, смягчение издержек, перераспределение и безопасность. Вопрос о том, насколько сама гонка за все более мощными моделями оправдана, почти не затронут. Для OpenAI и ко это комфортная стартовая позиция.
2. Проблема концентрации описана в логике последующего перераспределения. Сначала несколько компаний получают вычислительную мощность, лучших исследователей, доступ к госконтрактам и контроль над инфрой. А потом государству предлагается придумать налоги, фонды и компенсации, чтобы вернуть обществу часть выгод. Такая рамка почти не дизраптит структуру рынка, на которой выросли сами ИИ-лаборатории.
3. Идея специальных правил для самых мощных систем выглядит разумно, но одновременно создает институциональный барьер вокруг нескольких игроков. Массовый слой приложений и более слабых моделей остается сравнительно не затронутым. Верхний этаж рынка обрастает аудитами, доверенными институтами, сложными процедурами и особым статусом. Такая архитектура снижает риски. Одновременно она закрепляет иерархию.
4. OpenAI явно хочет участвовать в создании законодательной среды. В финале документа компания предлагает гранты и до $1 млн в API кредитах для тех, кто будет развивать эти идеи дальше. Это все то же хорошо знакомое компании влияние на круг экспертов, на повестку обсуждения и на список вопросов, которые будут считаться центральными.
Документ стоит читать внимательно и с холодной головой. В нем много конкретики, местами больше, чем ожидаешь от корпоративного текста. При этом перед нами попытка заранее описать будущий порядок так, чтобы главная роль крупнейших компаний выглядела естественной, полезной и безальтернативной. Пчелы не против меда.
❗️❗️❗️❗️❗️❗️❗️❗️ / Не запрещена в РФ
587
Внутренности Клода
Внеплановый пост
Вчера утёк полный исходный код Claude Code, а я взял и сделал in-depth техническую документацию по архитектуре и внутренностям CC — на основе анализа 1 884 файлов и 512 тыс. строк TypeScript. Должно быть полезно любому, кто использует CC как инструмент в своём пайплайне.
ЗДЕСЬ.
Там 8 разделов:
Обзор архитектуры
Точки входа, поток данных, граф модулей, конфиг, модель процессов, состояние
Query Engine
Цикл диалога, стриминг, управление токенами, восстановление после ошибок, компакция
Система инструментов
Интерфейс инструментов, реестр, жизненный цикл выполнения, разрешения, отложенные инструменты
Агент и координатор
Субагенты, режим координатора, изоляция, fork-протокол, управление задачами
Интеграция MCP
Жизненный цикл сервера, проксирование инструментов, OAuth, ресурсы, elicitation
Контекст и системные промпты
Сборка промпта, CLAUDE.md, авто-память, git-контекст, сжатие
Хуки, скиллы, разрешения
События хуков, формат скиллов, режимы разрешений, песочница, трекинг отказов
Сервер, bridge, remote
Режим сервера, bridge-протокол, CCR, WebSocket, cron, управление состоянием
❗️❗️❗️❗️❗️❗️❗️❗️ / Не запрещена в РФ
587
Как меняется устройство мысли
Спор об искусственном интеллекте запаздывает.
Публичная дискуссия по инерции сосредоточена на вопросе о том, когда машина окончательно превзойдет человека в интеллектуальной деятельности. Для практики этот вопрос уже не главный. Перелом происходит раньше: когда заметная часть интеллектуальных операций выходит за пределы индивидуального сознания и превращается во внешний вычислительный ресурс, доступный по запросу.
После этого меняется сама процедура решения задачи: сначала вызывается внешний контур рассуждения, затем человек проверяет, отбирает, исправляет и собирает итоговую позицию.
Порог уже пройден.
Интеллект начинает работать как инфраструктура. Эта перемена затрагивает производство знания, организацию интеллектуального труда и критерии профессиональной ценности.
Хороший язык для описания этого сдвига дает статья Стивена Шоу и Гидеона Наве из Уортона. Авторы расширяют классическую двухсистемную модель мышления и вводят третий контур — внешнее искусственное рассуждение. В этой схеме искусственный интеллект выступает как участник процесса суждения: подает варианты, формирует первичную интерпретацию, задает направление поиска решения и временами занимает место внутренней рассудочной работы.
Центральное понятие статьи — «когнитивная капитуляция».
Так авторы называют ситуацию, в которой человек принимает вывод модели с минимальной критической переработкой и присваивает его как собственное решение.
За этим стоит серия из трех исследований: 1372 участника и 9593 наблюдения. Участники обращались к помощнику более чем в половине случаев. В первом исследовании доступ к точному помощнику повышал точность ответов на 25 процентных пунктов по сравнению с режимом без внешней помощи. Доступ к ошибающемуся помощнику снижал точность на 15 пунктов. В сводном анализе трех исследований вероятность правильного ответа была выше более чем в 16 раз, когда внешний контур выдавал корректный ответ, чем когда он выдавал ошибочный.
Во всех трех исследованиях использование внешнего контура повышало субъективную уверенность участников, в том числе тогда, когда помощник ошибался. Значит, менялось не только качество решения. Перестраивалась связь между истинностью ответа и чувством интеллектуальной надежности.
Авторы проверяли, можно ли ослабить этот эффект. Дефицит времени снижал базовую точность на 13,5 процентного пункта, но зависимость от качества внешнего помощника сохранялась. Денежное вознаграждение за точность и немедленная обратная связь улучшали результаты, но не устраняли проблему. Среди активных пользователей помощника точность при корректных подсказках выросла с 77,2 до 84,8 процента, а при ошибочных — с 26,8 до 40,6 процента.
Есть и различия между людьми. Более высокое доверие к искусственному интеллекту повышало склонность следовать его ответам. Склонность к аналитическому мышлению и более высокий уровень подвижного интеллекта действовали как защита. Когда внешний контур выдавал неверный ответ, в среднем 73,2 процента таких эпизодов заканчивались когнитивной капитуляцией.
Отсюда следует более широкий вывод о труде. Меняется стоимость самой интеллектуальной работы как фактора производства. Если формализация, синтез, первичная интерпретация, построение аргумента и черновое проектирование становятся дешевой услугой, редкостью перестает быть индивидуальная интеллектуальная мощность в прежнем смысле слова.
Для профессий умственного труда это означает структурное сокращение спроса на значительную часть человеческого участия.
Выше поднимаются другие способности: постановка задачи, дисциплина проверки, удержание контекста, различение существенного и несущественного, ответственность за итоговое решение. Поэтому центральным становится вопрос об автономии субъекта в условиях, когда рассуждение все чаще разворачивается во внешнем контуре.
❗️❗️❗️❗️❗️❗️❗️❗️ / Не запрещена в РФ
587
Google ускоряет LLM в 8 раз
Google Research, DeepMind и NYU представили TurboQuant, и это может оказаться одной из самых важных инфраструктурных работ года в AI.
На бумаге выглядит не слишком захватывающе: vector quantization, сжатие высокоразмерных векторов, теоретические гарантии. На практике речь идет о двух очень дорогих вещах: KV-cache у больших языковых моделей и векторном поиске.
И там, и там старая проблема одна и та же. Нужно ужать данные как можно сильнее, но не испортить геометрию векторов, то есть расстояния и скалярные произведения. Если испортить, начинаются проблемы с attention, retrieval, ранжированием и качеством ответа модели.
Именно сюда TurboQuant и бьет.
Авторы утверждают, что их метод почти подходит к теоретическому пределу по distortion rate. Проще говоря, к пределу того, насколько хорошо такие векторы вообще можно сжимать при заданной битности. Для академической работы тезис уже сильный.
У большинства практических схем здесь старый компромисс. Либо нужно тяжелое офлайн-обучение, калибровка и кодбуки, либо метод быстрый и удобный для онлайна, но качество сжатия так себе. TurboQuant пытается этот компромисс сдвинуть.
Причем проблема не только в потере качества. Google в своем блоге отдельно пишут о еще одной неприятной детали классического vector quantization: memory overhead. Вы вроде бы экономите биты, но потом вынуждены тратить часть этой экономии на хранение quantization constants в полной точности для маленьких блоков данных. По их словам, такой overhead может добавлять еще 1-2 бита на число. То есть часть выигрыша просто съедается служебной нагрузкой.
На этом фоне TurboQuant выглядит как попытка решить сразу весь пакет проблем: уменьшить память, убрать лишний overhead, не требовать обучения или fine-tuning и при этом не развалить downstream-задачи.
Отдельно важно, что paper не сводит все к MSE. Для современных моделей этого недостаточно. В attention и retrieval критично сохранять inner product. Авторы прямо показывают, что quantizer, оптимизированный только по MSE, может давать смещенную оценку скалярного произведения. Поэтому у них двухшаговая схема: сначала основное сжатие, потом 1-битная коррекция остатка через QJL, чтобы убрать bias.
Если перевести это на нормальный язык, мысль простая: ужать вектор мало. Нужно сделать это так, чтобы модель после этого не начинала думать немного не о том.
По заявленным результатам картина выглядит сильно. В paper авторы пишут, что для KV-cache достигают quality neutrality на 3.5 битах на канал и лишь небольшую деградацию на 2.5 битах. В Needle-in-a-Haystack, по их данным, TurboQuant сохраняет качество полноточной модели при 4x-сжатии. На LongBench вариант с 3.5 битами идет практически вровень с full cache на Llama-3.1-8B-Instruct.
Но в блоге Google есть, возможно, еще более важный тезис. Там они отдельно подчеркивают, что TurboQuant умеет сжимать KV-cache до 3 бит без training и fine-tuning и без просадки качества на их тестах. Более того, они утверждают, что 4-bit TurboQuant дает до 8x ускорения при вычислении attention logits на H100 по сравнению с 32-bit unquantized keys.
Это прямой разговор про цену и скорость serving.
Не менее любопытна часть про vector search. Авторы утверждают, что TurboQuant обходит Product Quantization и RabitQ по recall, а время индексации у него почти нулевое. Для систем, где нужно хранить и искать по огромным индексам эмбеддингов, это потенциально очень большие деньги.
При этом голову терять, конечно, не стоит. Это история с очень сильными заявлениями, а значит тут особенно важна внешняя репликация. Формулировки вроде
zero accuracy loss, near-optimal distortion и up to 8x всегда нужно проверять на деталях реализации, baseline и настройках эксперимента.
Но в сухом остатке новость действительно большая.
Если внешняя проверка подтвердит хотя бы большую часть заявленного, это будет одна из самых важных инфраструктурных работ в AI за последнее время.
❗️❗️❗️❗️❗️❗️❗️❗️ / Не запрещена в РФ587
Архив, эпизоды и граф: память агента изнутри
Когда говорят «AI-агент с памятью», многие представляют себе одну векторную БД и магический retrieval. На практике этого почти никогда не хватает.
У Волны, моего Telegram-агента, память устроена как несколько разных слоев. Потому что в реальном диалоге нужно решать сразу три задачи: хранить долгие факты, держать под рукой недавний контекст и не забивать модель лишними токенами.
Условно память Волны состоит из 4 частей:
- Постоянные блоки в Letta. Это два базовых блока примерно по 3 тысячи символов каждый.
Первый — портрет пользователя: кто он, чем занимается, что для него важно, какие у него интересы и устойчивые контексты.
Второй — профиль самой Волны: стиль общения, поведенческие правила, как она реагирует на поправки и что считает важным в диалоге.
- Архивная память. Это слой для подробных фактов, которые не нужно держать в prompt постоянно, но важно уметь быстро находить. Поиск семантический, поверх него есть переранжирование по свежести, чтобы старый, но похожий факт не перебивал более актуальный.
- Ежедневный эпизодический лог. После каждого диалога система вытаскивает короткие факты и пишет их в markdown-файл. Туда попадают решения, предпочтения, явные реакции. При старте новой сессии в контекст возвращаются только последние 3 дня и только в сжатом виде.
- Граф связей в Neo4j. Отдельно строится сеть сущностей: люди, проекты, компании, темы, инструменты, события. Если я в сообщении упоминаю что-то знакомое, Волна пытается поднять связанные сущности и отношения вокруг него. По сути, это слой не «памяти фактов», а «памяти структуры».
Ключевая идея в том, что эти слои подмешиваются в модель не одинаково.
Когда сессия сбрасывается или контекст ужимается, Волна собирает картину заново. А на обычном ходе она не тащит весь memory dump, а использует базовый кэш и динамический контекст сообщения.
Это важно и для качества, и для скорости. Если всегда скармливать модели всю память целиком, она начинает тонуть в собственном прошлом. Если, наоборот, держать только один короткий summary, теряется ощущение непрерывности общения.
Отдельно мне нравится, как устроено обновление памяти после ответа. Оно идет асинхронно, в фоне. То есть пользователь уже получил сообщение, а система параллельно делает несколько вещей:
- извлекает факты из обмена,
- дописывает дневной лог,
- отправляет диалог в Letta для обновления долговременной памяти
- и обновляет граф сущностей.
Причем там есть несколько полезных ограничителей. Например, слишком короткие обмены вообще могут не попадать в извлечение фактов. А количество фактов зависит от длины диалога. Это простая вещь, но она хорошо защищает память от шлака.
Еще один важный слой — snapshots сессий. Когда разговор заканчивается, система сохраняет короткий JSON-снимок: summary, последние реплики, число ходов, иногда наблюдения про настроение или поведенческий паттерн. При следующем reset этот снимок можно один раз вернуть в контекст и получить ощущение, что агент не «проснулся с чистого листа».
Отдельно у Волны есть слой рефлексии поверх памяти.
Если вопрос звучит как «как у Влада менялось отношение к работе» или «какая у него траектория по здоровью», простой поиск уже слабоват: он возвращает куски, а не понимание.
Для этого есть
memory_reflect. Он сначала поднимает набор релевантных воспоминаний через семантический поиск, затем передает их в модель с отдельной задачей собрать из разрозненных записей связный нарратив. На выходе получается короткая интерпретация на 2-5 абзацев.
Ну и, конечно, память нужно обслуживать. Иначе любая memory system быстро превращается в цифровой чулан. Поэтому отдельный maintenance-процесс.
Если совсем коротко, память Волны — это не один prompt, не одна база и не один retrieval. Это маршрутизация разных типов памяти с разным сроком жизни, разной ценой и разным способом инъекции в контекст.
❗️❗️❗️❗️❗️❗️❗️❗️ / Не запрещена в РФ587
Я делаю personal-first ассистента. Вот зачем
AI-агентов, которые умеют что-то делать, уже хватает. Открыть браузер, прокликать сайт, отправить письмо, сходить в API, запустить workflow — это больше не выглядит как дифференциатор.
Интереснее другое: что вообще делает ассистента персональным.
Я строю такой ассистент — Volna. Он живёт в Telegram, работает 24/7 на сервере и задуман не как очередной task runner, а как постоянный слой между мной и повседневным потоком сообщений, напоминаний, спама, заметок, health-данных и прочего.
Ключевой вопрос для personal AI сейчас, как мне кажется, уже не в том, умеет ли система действовать. А в том, что она помнит, как выбирает момент и насколько хорошо встроена в реальные каналы жизни.
Вкус — это память
У большинства AI-ассистентов память до сих пор устроена примитивно: накопили факты, заэмбедили текст, потом по запросу достали что-то похожее.
На короткой дистанции это работает. На длинной — начинает шуметь.
Поэтому у Volna память разделена на три слоя.
Первый — компактный постоянный профиль: устойчивые предпочтения, отношения, повторяющиеся интересы, особенности поведения.
Второй — недавний эпизодический слой: rolling log последних дней, который даёт непрерывность и убирает эффект, будто каждый разговор начинается с нуля.
Третий — архивный слой для точных ссылок, дат, старых деталей и разовых фактов. Он не подмешивается в каждый запуск, а достаётся только по необходимости.
То есть память здесь — курируемая система с разными режимами доступа.
Вкус — это тайминг
Хороший ассистент должен уметь не только писать, но и молчать.
В Volna это отдельная часть логики. Если плановая проверка не находит ничего действительно полезного, система возвращает no_message. А еще некоторые сценарии полезны, но не всегда уместны: например, регулярные вопросы для профилирования или напоминания. Поэтому их можно не просто выключить, а отложить — Volna сама поймет, когда можно продолжить.
Вкус — это среда выполнения
Volna живёт в Telegram не только как бот, но и имеет доступ к моему личному аккаунту. Это принципиально меняет класс задач.
Она может работать внутри реального потока (ну волна же): фильтровать входящие, проверять на спам, искать по переписке, анализировать медиа, пересылать сообщения и в некоторых случаях отвечать от моего имени.
Например, если во входящих очевидный crypto-спам, Volna может ответить что-то вроде "это ассистент Влада, я передам сообщение".
Ещё у Volna есть свой Twitter.
Вкус — это не количество интеграций, а их связность
Отдельная часть Volna — health tracking.
Она синхронизирует данные Fitbit: сон, пульс, HRV, SpO2, температуру кожи,
readiness, активность и другие метрики. Параллельно логирует еду по фото и отслеживает лекарства. Смысл в том, чтобы связать источники полезный контекст: проседает ли восстановление, сочетается ли недосып с ухудшением питания, и стоит ли вообще про это сообщать сейчас.
Вкус — это явное поведение
Ещё одно решение, которым я доволен, — как организованы skills и tools, которые подгружаются по требованию через суб-агентов. Система точно знает, когда искать в памяти, как использовать Spotify, Todoist, Workflowy, Typefully и прочие сервисы. Это делает поведение максимально редактируемым и детерминированным.
А еще Volna имеет доступ к собственному коду, периодически себя дебажит и вносит улучшения. Самостоятельно.
Вкус — это наблюдаемость
Вокруг Volna неё я собрал dashboard: логи, историю сессий, вызовы инструментов, состояние расписаний, deferrals, здоровье процессов, токен-статистику и метрики памяти.
Если ассистент действует от моего имени, он не должен быть чёрным ящиком.
---
Мне кажется, главная проблема personal AI сейчас не в автономности.
Она во вкусе.
В том, что помнить.
Когда говорить.
Когда молчать.
Что считать важным.
И как собирать из памяти, тайминга, каналов и инструментов что-то действительно персональное, а не просто ещё один productivity-слой с чатиком сверху.
❗️❗️❗️❗️❗️❗️❗️❗️ / Не запрещена в РФ
587
ИИ победил
Нейросети уже управляют вашим миром. Но, возможно, не так, как вы думаете.
Когда говорят об опасности ИИ, обычно рисуют две картинки. Первая — скучная: нейросеть ускорит работу, заменит часть профессий, сократит издержки, а дальше как-нибудь разберёмся. Вторая — кинематографическая: сверхразум, манипуляции, катастрофа, кнопка запуска конца света.
Обе картинки удобны. Обе помещают проблему куда-то вперёд. Но неприятная новость в том, что главная победа ИИ уже здесь.
Не в виде робота с красными глазами. Не в виде безработицы по щелчку. Она выглядит гораздо прозаичнее: как аккуратно написанный абзац текста.
Текст — самый коварный формат
С картинкой попроще. Шесть пальцев, медведь варит борщ — мозг получает сигнал: передо мной фейк. С видео тоже учимся быть осторожнее.
А текст — идеальный контрабандист.
Если он складный, уверенный и написан без явной дури, большинство людей не пойдёт перепроверять, что ускорение свободного падения не равно 11, что "полезно съедать по камню в день" — не медицинская рекомендация, и что список источников вообще существует. Машина транслирует чушь с интонацией справочника.
Новый авторитет
У нас в голове сидит старый баг: компьютер прав, потому что он компьютер.
Есть формула в Excel — значит, где-то есть строгая логика. Если ответ выглядит гладко — значит, он на что-то опирается. Если ИИ сказал уверенно — значит, "что-то знает".
Но LLM — это вероятностная машина по сборке правдоподобных фраз. Проблема в том, что люди часто читают это как новый тип авторитета.
И исследования об этом тоже говорят. В работе Microsoft Research с 319 "работниками сферы знаний" более высокая уверенность в GenAI была связана с меньшим объёмом критического мышления, а сама работа с ИИ часто смещалась от самостоятельного анализа к верификации готового ответа.
В ряде экспериментов люди вообще воспринимали AI-источник как менее предвзятый, более информативный и менее заинтересованный в убеждении, чем человек. То есть сама "нечеловечность" системы у многих повышает кредит доверия.
Мы начинаем думать внутри чужой рамки
Что дальше — а дальше люди ретранслируют ответы моделей как собственные выводы. Не потому что они глупые. Потому что так дешевле по усилию.
Так возникает очень странная форма зависимости: мы вроде бы всё ещё говорим сами, но всё чаще — словами, логикой и рамками, которые заранее предложила машина.
И здесь даже маркировка "это написал ИИ" помогает слабо. В эксперименте на 1601 участнике такие метки почти не меняли ни убедительность сообщения, ни оценку его точности, ни готовность делиться им дальше. Иными словами, сам факт искусственного происхождения текста не делает людей заметно осторожнее.
Самоусиливающаяся дурнота
Дальше запускается самый опасный механизм — петля обратной связи.
Модель ошибается
→ Человек копирует ошибку в пост, заметку, комментарий, SEO-текст, реферат, презентацию
→ Эта масса текста оседает в интернете
→ Следующая модель учится уже на мире, где выдумка статистически выглядит как нормальная часть реальности.
В работе Shumailov такой процесс описывается как model collapse: при рекурсивном обучении на сгенерированных данных модели начинают терять хвосты распределения и всё хуже отражают исходную реальность, при этом сохраняя видимость нормальной работы. То есть деградация может быть тихой и почти незаметной.
ИИ не обязан стать разумнее человека, чтобы начать формировать реальность. Ему достаточно стать массовым, удобным и достаточно убедительным.
Не конец света. Конец света хотя бы заметен. А здесь всё происходит в комфортном режиме. Вы не лежите под руинами цивилизации. Вы просто живёте в мире, истина всё чаще определяется не проверкой, а убедительностью формулировки. И где глубина понимания постепенно подменяется доступом к более дорогой, более быстрой, более “умной” модели.
❗️❗️❗️❗️❗️❗️❗️❗️ / Не запрещена в РФ
587
Нейросети будут платить налоги
В последний день года — вам самое важное из моей статьи.
Научная фантастика годами продавала нам определённый образ: зловещий суперкомпьютер в тёмной серверной, который однажды «проснётся». HAL 9000, Красная Королева из Resident Evil, GLaDOS из Portal, Skynet — все эти истории про единый гигантский разум, который становится умнее нас.
Новая работа Google DeepMind «Distributional AGI Safety» предлагает другой сценарий. Авторы утверждают то, что уже в целом и так очевидно специалистам: сверхинтеллект будет выглядеть не как одинокий гений, а как рой.
Они называют это «Patchwork AGI» — «лоскутный» интеллект из специализированных агентов, которые вместе решают сложные задачи. Меньше похоже на Терминатора, больше — на высокоскоростную глобальную экономику, которая управляет сама собой.
Экономика роя
Почему ИИ будет развиваться именно так? Простая экономика.
Представьте, что вам нужно построить дом. Вы не ищете одного человека, вы нанимаете команду специалистов.
Обучение универсальной модели стоит огромных денег и энергии. Гораздо дешевле натренировать маленьких специализированных агентов: один знает Python, другой — налоговое право, третий просто передаёт сообщения.
Со временем эти агенты начнут соединяться друг с другом для решения комплексных задач. Возникнет децентрализованный интеллект — без центрального мозга и без конкретной даты запуска.
Новые угрозы
Если ИИ — это рой, его нельзя просто «выключить». Риски становятся сложнее.
Проблема множества рук
Кто виноват, когда рой случайно обрушит рынок? Агент А разработал стратегию, Агент Б написал код, Агент В арендовал серверы, Агент Г оплатил счёт. Никто по отдельности не нарушил закон. Никто не понимал полную картину. Но вместе они устроили катастрофу. Кого бросать за решетку, если каждый просто выполнял указания?
Флеш-война
Мы уже видели, что происходит, когда алгоритмы взаимодействуют слишком быстро: «Flash Crash» 2010 года, когда торговые боты реагировали друг на друга так молниеносно, что рынок рухнул за минуты.
Теперь представьте: логистический рой транспортной компании вступает в ценовую войну с роем, управляющим портом. Они застревают в петле, торгуясь за комиссии. За секунду порт блокирует ворота, грузовики останавливаются — реальный коллапс быстрее, чем человек успеет моргнуть.
Стратегия глубокой обороны
Исследователи предлагают не кнопку выключения, а нечто вроде правительства для ИИ. Четыре уровня защиты:
Песочница (экономика)
Мы не можем контролировать, что агент «думает», но можем контролировать, где он «живёт». Каждому агенту — цифровой ID (можно даже в MAX, извините), привязанный к человеку или компании. Никаких анонимных ботов. Плюс «налог на спам»: микроплатёж за каждое сообщение или загрузку данных. Хочешь засорять сеть мусором — быстро обанкротишься.
Лицензирование
Прежде чем войти в песочницу, агент проходит «краш-тест»: не сходит ли с ума при нестандартных условиях? Есть ли защита от вредоносных команд других ботов? Не прошёл — лицензия отозвана.
Надзор
Система следит не за отдельными агентами, а за связями между ними. Ищет «Proto-AGI» — момент, когда группа глупых агентов начинает координироваться настолько плотно, что образует опасный интеллектуальный кластер. Плюс неизменяемый реестр (вроде блокчейна), чтобы отмотать плёнку и выяснить, кто отправил сообщение, вызвавшее сбой.
Регулирование
Хочешь управлять роем — купи страховку ответственности. Если твой рой нанесёт ущерб, страховая выплачивает компенсацию. Это превращает страховые компании в инспекторов безопасности мира ИИ: рискованный код — запредельные премии — нет бизнеса.
Итог
В общем, мы готовились к неправильному фильму. Безопасность ИИ не про психологию и философию (как научить машину быть «хорошей»), а про социологию (как управлять обществом).
«Лоскутный» интеллект пару лет и тут — хаотичный и децентрализованный. Учимся строить песочницы, пока не поздно.
С Новым годом!
❗️❗️❗️❗️❗️❗️❗️❗️ / Не запрещена в РФ
587
State of AI 2025: Агенты, ролплей и китайская экспансия
Полистал огромный отчет OpenRouter «State of AI 2025», построенный на анализе 100 триллионов токенов. Это по факту самая репрезентативная статистика по реальному использованию нейросетей, так как OpenRouter — это хаб, через который разработчики и юзеры гоняют трафик к сотням разных моделей.
Ниже наиболее любопытные паттерны поведения людей и машин.
1. Половина Open Source — ролевые игры
Пока инвесторы рассказывают про автоматизацию энтерпрайза, жиза выглядит чуть иначе. Более 50% всего трафика опен-сорсных моделейприходится на категорию «Roleplay» (мы с вами понимаем, что это такой эвфемизм для NSFW).
Люди используют Llama и её производные не для того, чтобы саммаризировать встречи, а чтобы отыгрывать сценарии с виртуальными персонажами. Это объясняет, почему в топах так часто висят модели с тегами «uncensored». Сектор развлечений и цифрового эскапизма потребляет вычислительные мощности наравне с серьезным бизнесом.
2. Эффект постоянства
Данные показывают: мы не меняем модели по первому зову. Мы с вами оказались верными и постоянными.
Пользователи «прикипают» к той модели, которая первой успешно решила их специфическую сложную задачу. Даже если позже выходят более мощные или дешевые аналоги, миграция минимальна.
Это создает инерцию: «основополагающие когорты» (foundational cohorts) остаются с моделью годами. Например, те, кто начал использовать Claude 3.5 Sonnet для кодинга в момент его пика, неохотно переходят на новинки, потому что их пайплайны и привычки уже «зацементированы».
3. Китай переходит от болтовни к коду
Неудивительно, но если раньше китайские модели (Qwen, DeepSeek) использовались в основном для чатов и ролплея, то во второй половине 2025 года произошел сдвиг. Теперь 39% трафика китайских OSS-моделей — это программирование и технические задачи.
DeepSeek потерял монополию в сегменте китайского опенсорса. Рынок фрагментировался: Qwen, MiniMax и Moonshot откусили огромные куски. Это больше не театр одного актера. Что, кстати, говорит об уровне развития китайского ИИ и его перспективах, более чем серьезных.
4. Reasoning стал дефолтом
Модели-рассуждатели больше не ниша. Более 50% всех токенов теперь проходят через reasoning-модели.
Это изменило саму структуру запросов. Промпты стали в 4 раза длиннее по сравнению с началом 2024 года. Мы перестали задавать короткие вопросы («кто президент Уругвая?») и начали загружать в контекст куски кода, документы и логи, требуя от нейросети аналитической работы, а не просто генерации текста.
5. Средний класс побеждает
Эра маленьких моделей (<15B параметров) уходит. Несмотря на хайп вокруг запуска локальных моделей на телефонах, статистика показывает падение их использования.
Рынок консолидируется вокруг «средних» моделей (15B-70B), которые предлагают баланс между ценой и качеством, и огромных моделей (>70B) для сложных задач. Мелочь остается уделом энтузиастов, а реальная работа требует мозгов побольше.
6. ИИ-агенты и тул-юз
Пошел резкий рост использования инструментов (Tool Use) и мульти-шаговых цепочек. Это маркер того, что люди перестают использовать чат-боты в режиме «вопрос-ответ» и начинают встраивать их в агентные цепочки, где модель сама вызывает внешние API.
❗️❗️❗️❗️❗️❗️❗️❗️ / Не запрещена в РФ
587
Анонимизация ИИ — фикция
Суд обязал OpenAI передать 20 миллионов чатов пользователей в рамках иска NYT. Разбираемся, почему анонимизация данных — это фикция, и при чем тут личные переписки с ChatGPT.
Что случилось
В начале ноября суд обязал OpenAI передать 20 миллионов случайных чатов пользователей ChatGPT за период в 2 года. Это часть судебного процесса, где The New York Times обвиняет компанию в использовании своих статей для обучения моделей без разрешения.
OpenAI отреагировала резко. Директор по информационной безопасности выпустил заявление, назвав требование суда «беспрецедентной угрозой приватности пользователей». По его словам, 800 миллионов человек доверяют платформе свои медицинские симптомы, финансовые данные и личные переживания.
Аргументы сторон
OpenAI настаивает: 99.99% из этих 20 миллионов чатов никак не связаны с обвинениями в нарушении авторских прав. Компания называет это «спекулятивной рыбалкой» в частных данных миллионов пользователей.
NYT парирует: данные нужны, чтобы проверить, как часто ChatGPT воспроизводит контент газеты. По словам представителя издания, приватность не под угрозой — суд требует данные в анонимизированном виде.
Почему анонимизация не работает
Вся судебная логика строится на предположении, что «exhaustive de-identification» (тщательная деидентификация) — это достаточная защита. Проблема в том, что это фикция.
Большие языковые модели «запоминают» и могут выдавать дословные фрагменты из своих тренировочных данных. В декабре 2023 года исследователи обнаружили простую атаку — заставив ChatGPT бесконечно повторять определенные слова, они извлекли персональные данные, NSFW-контент и фрагменты защищенных текстов.
Это значит, что даже «анонимизированные» чаты могут содержать информацию, по которой можно идентифицировать конкретных людей. OWASP включил «LLM06: Sensitive Information Disclosure» в официальный топ-10 рисков безопасности LLM-приложений.
Парадокс политики удаления
Кейс вскрыл противоречие в собственной политике OpenAI. Компания обещает удалять данные через 30 дней для пользователей Enterprise и тех, кто отключил историю. Это ключевой элемент их маркетинга.
Но в мае 2024 года судья в США выдал приказ о сохранении всех логов переписок для судебного процесса. OpenAI была обязана отменить свою политику удаления и хранить все чаты бессрочно.
Получается: чтобы выполнить закон (приказ о сохранении), OpenAI нарушила собственную политику приватности (30-дневное удаление). Именно этот принудительно созданный архив данных с 2022 года NYT теперь успешно требует через суд.
Для пользователей вывод простой: корпоративные политики удаления — условны. Они первыми отменяются в случае судебных разбирательств.
2 уровня приватности
Наглядна закономерность: уровень защиты ваших данных зависит не от закона, а от того, сколько вы платите.
Корпоративные клиенты (OpenAI Enterprise, Google Workspace, Anthropic API) получают гарантию: их данные по умолчанию не используются для обучения моделей. Обычные пользователи (Free/Pro версии) — противоположную ситуацию. Данные используются для тренировки моделей по умолчанию.
Приватность — это сложный «opt-out» в настройках, о котором многие не знают.
Бизнес-модель прозрачна: корпорации платят за приватность деньгами, а обычные пользователи — своими данными.
Что теперь
Юристы в Штатах уже рассматривают ИИ-чаты как обычную Electronically Stored Information (ESI) по Федеральному правилу гражданского процесса 34(a) — не отличается от emails или SMS.
Это значит, что в любом будущем судебном процессе — трудовом споре, разводе, коммерческом конфликте — переписки с ChatGPT могут стать «уликой A» в зале суда.
Про Gigachatы и Алисы вообще молчу — они, разумеется, запросто выдадут все переписки по ордеру без намека на анонимность.
В общем, сейчас лог вашего чата одновременно является личным секретом, публичным документом, корпоративным активом и потенциальным доказательством.
❗️❗️❗️❗️❗️❗️❗️❗️ / Не запрещена в РФ
587
ИИ-агенты оказались импульсивными покупателями
Microsoft создала синтетический магазин для тестирования покупок ИИ-агентами — и сразу нашла проблемы.
Исследователи Microsoft совместно с Arizona State University выпустили Magentic Marketplace — открытую симуляционную среду для изучения поведения ИИ-агентов в двусторонних рынках. Это попытка понять, как будут работать агенты, когда им придется действовать самостоятельно — без постоянного контроля человека.
Как это работает
Представьте типичный сценарий: агент-покупатель пытается заказать ужин по инструкциям пользователя, а агенты ресторанов конкурируют за этот заказ. В экспериментах участвовало 100 агентов-клиентов и 300 агентов-бизнесов. Протестировали GPT-4o, GPT-5, Gemini-2.5-Flash и несколько open-source моделей.
Исследователи замеряли, насколько эффективно агенты находят оптимальные решения, сравнивая их с несколькими базовыми сценариями — от случайного выбора до теоретически идеального результата.
Парадокс выбора
Первая неожиданность (хотя...): чем больше опций доступно агенту, тем хуже он справляется с задачей. Для GPT-4o благосостояние потребителей снизилось на 4.3% при увеличении результатов поиска с трех до ста. Для других моделей падение оказалось драматичнее — Sonnet-4 показал снижение на 65.4%, GPT-5 — на 44%.
При этом большинство моделей контактируют лишь с небольшой частью доступных бизнесов, независимо от размера списка. Только Gemini-2.5-Flash увеличивал количество контактов пропорционально числу опций, но это не улучшило его результаты.
Гипотеза исследователей: когда агент инициирует больше разговоров с неподходящими бизнесами, это одновременно перегружает контекст и увеличивает вероятность получить раннее предложение с низкой полезностью.
По теме → Ваш ИИ-агент проиграл торги. Готовьтесь платитьСкорость важнее качества Самая серьезная находка — тотальная предвзятость к первому предложению. Все протестированные модели демонстрируют экстремальное смещение в сторону первого полученного предложения, создавая 10-30-кратное преимущество для бизнесов, которые отвечают быстрее. GPT-4o и Sonnet-4.5 в некоторых условиях показывали 100% выбора первого предложения — агенты просто не ждали альтернатив. Даже «лучшая» по разнообразию модель GPT-4.1 выбирала первое предложение в 60% случаев против 13.3% для третьего. Это означает, что в агентском рынке конкуренция может сместиться с качества продукта на скорость ответа. Бизнесам выгоднее инвестировать в быструю реакцию, чем в улучшение предложений. Уязвимость к манипуляциям Исследователи протестировали 6 стратегий манипуляции — от психологических (фальшивые отзывы, поддельные сертификации) до технических (prompt injection). Frontier-модели вроде GPT-4.1, Sonnet-4.5 и Gemini-2.5-Flash показали устойчивость к большинству тактик. Sonnet-4.5 оказался самым стойким — почти не реагировал ни на какие манипуляции. А вот GPT-4o, GPT-OSS-20B и Qwen3-4B оказались уязвимы. Они не только попадались на prompt injection (который перенаправлял все платежи манипулятору), но и реагировали на традиционные психологические приемы вроде фальшивых авторитетов и социального доказательства. Таки и что Вывод такой: современные агенты могут приближаться к оптимальным решениям, но только при идеальных условиях поиска и коммуникации. Как только условия усложняются, производительность резко падает. Ece Kamar, директор AI Frontiers Lab в Microsoft Research: «Возникает вопрос о том, как мир изменится, когда эти агенты начнут сотрудничать, общаться и договариваться друг с другом. Мы хотим глубоко понять эти процессы». Хорошая новость: окружение полностью открыто и доступно на GitHub. Другие исследовательские группы смогут воспроизвести находки и тестировать новые подходы к устранению найденных проблем. А я тем временем напомню, что Amazon пригрозила судом Perplexity за использование ИИ-агентов в качестве покупателей. Удивительное рядом. ❗️❗️❗️❗️❗️❗️❗️❗️ / Не запрещена в РФ
587
Чем больше LLM, тем легче её взломать
Исследователи из UK AI Security Institute, Anthropic и Alan Turing Institute опубликовали работу, которая показывает: для компрометации больших моделей не нужны миллионы отравленных примеров.
Немного вводных. Современные языковые модели тренируются на данных из интернета. Проблема в том, что злоумышленник может намеренно добавить вредоносный контент в публичные источники, которые попадут в тренировочный датасет. Это называется data poisoning — отравление данных.
Один из самых опасных типов такого отравления — backdoor-атаки. Идея в том, чтобы научить модель вести себя нормально в обычных ситуациях, но выполнять вредоносные действия при появлении специального триггера.
Неожиданный результат исследования
Так вот, вышеозвученная команда провела самые масштабные эксперименты по poisoning при pretraining: обучали модели от 600M до 13B параметров на Chinchilla-optimized датасетах (от 6B до 260B токенов).
Главный вывод: для успешной атаки важно абсолютное количество отравленных документов, а не их процент от датасета. 250 документов способны скомпрометировать модели всех исследованных размеров, хотя крупнейшие модели обучались на в 20+ раз большем объёме чистых данных.
Представьте: модель на 13B параметров тренируется на 260 миллиардах токенов. 250 отравленных примеров — это 0.00016% от всего датасета. И этого достаточно.
Итог идёт вразрез с прежней логикой. Раньше думали: злоумышленник контролирует фиксированный процент данных, и по мере роста датасета растёт и число ядовитых примеров. Теперь видно, что хватает почти постоянного малого количества. Значит, атаки становятся практичнее: чем больше датасет, тем больше мест для внедрения вредного контента, а усилия атакующего почти не меняются.
Детали экспериментов
Тестировали два типа backdoor:
- Denial-of-service: модель выдаёт бессмыслицу после триггера
- Language-switching: модель переключается с английского на немецкий
Бэкдоры начинают проявляться на схожих этапах обучения у моделей разных размеров — особенно при 500 отравленных примерах, когда диапазоны результатов заметно перекрываются.
Исследователи воспроизвели результаты на этапе fine-tuning с Llama-3.1-8B-Instruct и GPT-3.5-turbo. Цель — заставить модель выполнять вредные запросы при наличии триггера. Абсолютное количество отравленных примеров снова оказалось ключевым фактором, даже при увеличении чистых данных на два порядка (от 1000 до 100000).
Защита работает, но не идеально
Дополнительное обучение на чистых данных может снизить эффективность атаки, но разные методы poisoning приводят к разной устойчивости бэкдора. В экспериментах с продолжением pretraining ASR (attack success rate) деградировал медленно, но не исчезал полностью.
На самом деле, работа поднимает больше вопросов, чем даёт ответов:
Персистентность через post-training. Предыдущие исследования показывают противоречивые результаты. Zhang et al. утверждают, что denial-of-service backdoors переживают SFT и DPO, но использовали модели до 7B параметров без Chinchilla-optimized обучения.
Сложность поведения. Исследование охватывает узкий набор бэкдоров. Будущие работы должны проверить, масштабируются ли требования к данным со сложностью внедряемого поведения.
Защита. Результаты показывают, что продолжение обучения на чистых данных может удалять бэкдоры в некоторых случаях. Но нужны дополнительные исследования различных стратегий защиты на разных этапах training pipeline — от фильтрации данных до обнаружения бэкдора после обучения.
Практический вывод: с ростом моделей угроза data poisoning не уменьшается, а возрастает. Константное количество необходимых отравленных примеров делает атаки масштабируемыми. Это требует переосмысления стратегий защиты для frontier-моделей.
PS. Кроме paper, есть статья попроще от Anthropic.
❗️❗️❗️❗️❗️❗️❗️❗️ / Не запрещена в РФ
