Sinекура
Open in Telegram
Канал Сергея Николенко обо всём, но в основном об AI. Сайт с выступлениями, лекциями и публикациями: https://sergeynikolenko.ru/
Show more4 552
Subscribers
+1524 hours
+347 days
+9230 days
Data loading in progress...
Similar Channels
No data
Any problems? Please refresh the page or contact our support manager.
Tags Cloud
Incoming and Outgoing Mentions
---
---
---
---
---
---
Attracting Subscribers
September '26
September '26
+194
in 0 channels
August '26
+132
in 2 channels
Get PRO
July '26
+184
in 1 channels
Get PRO
June '26
+78
in 1 channels
Get PRO
May '26
+264
in 3 channels
Get PRO
April '26
+163
in 3 channels
Get PRO
March '26
+124
in 1 channels
Get PRO
February '26
+419
in 6 channels
Get PRO
January '26
+97
in 1 channels
Get PRO
December '25
+116
in 3 channels
Get PRO
November '25
+197
in 1 channels
Get PRO
October '25
+278
in 2 channels
Get PRO
September '25
+216
in 3 channels
Get PRO
August '25
+191
in 1 channels
Get PRO
July '25
+232
in 7 channels
Get PRO
June '25
+168
in 6 channels
Get PRO
May '25
+476
in 6 channels
Get PRO
April '25
+789
in 11 channels
Get PRO
March '25
+915
in 6 channels
Get PRO
February '250
in 5 channels
Get PRO
January '25
+168
in 1 channels
| Date | Subscriber Growth | Mentions | Channels | |
| 07 September | +156 | |||
| 06 September | +16 | |||
| 05 September | +2 | |||
| 04 September | +10 | |||
| 03 September | +1 | |||
| 02 September | +6 | |||
| 01 September | +3 |
Channel Posts
+1
Семестр начался! И снова я заново начинаю свой большой курс машинного обучения на факультете математики и компьютерных наук СПбГУ. Три календарных семестра, в которые умещаются четыре семестра лекций (весной они по две в неделю).
Первый семестр, как всегда, называется "Основы байесовского вывода", вот страничка нового курса:
Основы байесовского вывода — 2026
А вот и первая лекция:
СПбГУ — 2026.04.10 — История AI, его вероятностный смысл и байесовский вывод
(слайды и доска на странице курса)
Обычная вводная лекция, много истории и вводных общих рассуждений, мало математики. В целом рекомендую всем, даже с нулевой математической подготовкой практически всё будет понятно. Но не беспокойтесь, математика начнётся уже буквально со следующего раза!)
С этого семестра попробую выкладывать к лекциям и субтитры тоже; кажется, автоматически их делать получается уже достаточно хорошо. Ещё, кстати, youtube начал автоматически создавать английский дубляж, на некоторых предыдущих докладах он уже есть, и звучит хорошо, хоть и совсем не моим голосом. Но, кажется, это всё равно нерелевантно, вряд ли кто-то будет слушать лекцию с русскоязычными слайдами по-английски.
#spsu #lectures #bayes2026
| 2 | Выложил свой доклад из бара "Бражник":
AI в науке: где мы сейчас и куда мы идём
(слайды как всегда в разделе "Выступления")
Владелец "Бражника" ведёт крутой проект "Стопки знаний" (анонсы в канале бара), в котором приглашает людей из самых разных областей рассказать о том, что у них в науке происходит. Вот и меня позвал.
Это был в целом мой обычный доклад о том, как AI начинает двигать науку. В частности, закончил на сокращённой версии доклада "Vibemathed" о том, как на глазах меняется современная математика. Кстати, OpenAI Astra вышла, так что теперь, наверное, ещё больше вайб-математики будет появляться.
Ну а начал с нескольких тем, которые обычно рассказываю в популярных докладах: законы масштабирования, виды прогресса, где мы сейчас и всё такое прочее.
Спасибо за приглашение, и надеюсь, что смогу прийти и ещё. Дело хорошее!
#talks #ai #events | 984 |
| 3 | Сегодня у нас маленькая игра с крутой атмосферой и редким ощущением, что занимаешься чем-то средним между философией и литературоведением. А ещё это история про AI. Встречайте (как водится, читать лучше по ссылке):
TR-49
(и вот на DTF)
Сегодня у нас снова Inkle Studios, о которых я уже рассказывал в связи с Overboard! и Expelled!. Это маленькая студия из Кембриджа, которая с 2011 года делает текстовые и почти текстовые игры и делает их лучше всех: 80 Days, серия Sorcery!, о которой я тоже рассказывал, Heaven’s Vault про расшифровку древнего языка, Pendragon, A Highland Song. Заодно они написали открытый скриптовый язык ink для ветвящихся историй, которым пользуются очень многие в этом жанре.
В общем, если кто-то и должен был сделать игру, в которой весь геймплей состоит из чтения, то это они. [...]
Героиню зовут Эбби (не та!), и она приходит в себя в подвале церкви. Наверху — какой-то Лиам, который разговаривает с ней по рации и очень нервничает. Внизу — огромная машина, собранная как будто из хлама [...] “Что это вообще такое? Как будто… пластик эпохи динозавров”, — это первая реплика Эбби.
Машина называется TR-49, построили её лет пятьдесят назад (игра явно отсылает к криптографам из Блетчли-парка), и всё это время ей скармливали книги, журналы, письма и дневники. Скармливали буквально: текст попадал внутрь, а бумага уничтожалась, так что теперь многих из этих книг больше нигде нет. Нужно найти в архиве один-единственный документ под названием Endpeace и удалить его. Зачем? Как водится, “я объясню всё по дороге, обещаю”.
Выглядит и звучит это всё очень круто. Сама машина сделана в эстетике Colossus и Bombe из Блетчли-парка [...] Гудение машины, щелчки барабанов, редкие музыкальные акценты; голосовая озвучка только у Эбби и Лиама, но они отыгрывают отлично.
Мир за стенами подвала при этом тоже любопытный: альтернативная Британия, идёт война, а в архивных заметках попадаются новости вроде “женщина теряет ребёнка в толпе и приводит домой вместо него собаку” или “Тарнсбридж, небольшой город в Англии, исчез и забыт”. [...]
Весь интерфейс — это четырёхсимвольный код на барабанах: две буквы и две цифры. Набираешь код, машина показывает документ. Документы поначалу испорчены: половина букв заменена мусором, читать можно с трудом. Но у каждого текста есть заметки, которые в течение десятилетий оставляли операторы машины [...] Идёшь по ссылке, находишь новый документ, а в нём — ещё ссылки.
А дальше начинается собственно головоломка. Код — это обычно инициалы автора плюс год издания. Значит, если в тексте сказано, что автор написал продолжение “два года спустя”, можно прибавить к году двойку и попробовать. Если рецензия ссылается на “выпуск №17” некоего журнала, можно попробовать вычислить, каким годом он датирован. Если известно, что книга — первый роман такого-то, а он родился тогда-то… ну вы поняли. [...]
Именованных книг всего пятьдесят, их надо найти и опознать все, и счётчик в углу показывает наш прогресс. Мне очень понравилось чувствовать себя то ли философом, то ли литературоведом: сидишь, сопоставляешь даты, вспоминаешь, кто на кого ссылался в вымышленном “Литературном обозрении” от 1961 года, и вдруг понимаешь, что этот бойкий фельетон написан тем же человеком, что и вон та статья про квантовое хранение данных.
Ближайшими родственниками здесь я бы назвал Her Story, Return of the Obra Dinn или Immortality, но в TR-49 материал не видео и не картинка, а именно текст, и это даже интереснее получается. [...]
Я не думаю, что авторы затевали игру как памфлет про LLM, но в 2026 году история про машину, которая съедает все книги на свете, учится на них и потом переписывает реальность так, как ей удобнее, — это, конечно, круто. [...]
В оTR-49 — маленькая, плотная и очень умная игра. [...] Если вам нравилось в Her Story или Obra Dinn то ощущение, когда разрозненные кусочки вдруг складываются, то здесь оно есть на 100%. Очень рекомендую.
#tgif #games | 1 044 |
| 4 | Сегодня необычный пост: представлю вам Игоря Лабутина, с которым я познакомился ещё на конференции OpenTalks (увы, наше совместное селфи вышло так себе, не буду его здесь воспроизводить).
Игорь человек очень активный, с кучей разных идей, относящихся к совершенно разным аспектам человеческой деятельности.
Но в частности, он работает в области AI safety (так мы и познакомились), и один из его проектов -- это... мюзикл про AI safety. На полном серьёзе. Мы с Игорем как-то созванивались и обсуждали сюжет и всё такое, как по мне, должно огненно получиться, если всё успешно доделать.
Сегодня хочу прорекламировать, во-первых, тот факт, что из мюзикла вышел первый трек:
Mind Vivisection
Конкретно этот трек произошёл из потока сознания одной маленькой LLM, которая внезапно слегка сошла с ума и начала выдавать что-то одновременно бес- и глубокомысленное. Вот пост самого Игоря об истории его создания.
А во-вторых, скоро выйдет и целиком первая часть мюзикла! Игорь уже пытается его ставить в настоящем театре с живыми актёрами, но этот процесс ещё неизвестно когда сойдётся, а вот на уведомление о выходе песен уже можно подписаться (и я рекомендую это сделать, потому что для алгоритмов Spotify и т.п. это важно):
AI: Save Our Souls, Act I
(Original Musical Soundtrack)
Как учил нас Маршалл Маклюэн, доносить message надо через разные media, так что всё это, конечно, совершенно прекрасное начинание.
#fun #aisafety #ai #music | 1 199 |
| 5 | Семинар начался на очень высокой ноте! Доклад выложу, а пока просто посмотрите, сколько народу собралось.
А ещё Кирилл привёз мне невероятный подарок -- Deepmind'овский набор Lego про тридцать седьмой ход. Просто вау.
Спасибо Кириллу!!
#markovlab #seminar #lifestyle | 1 363 |
| 6 | Начинается новый учебный год. В этот раз, честно говоря, со смешанными чувствами я в него захожу.
У меня очень много лекций в осеннем семестре: СПбГУ, Центральный университет, ЮФУ, сразу несколько курсов в ИТМО... Это, конечно, по сути хорошо, и большое спасибо всем, кто меня так охотно приглашает в разные места преподавать. Лекции — это то, что я действительно хорошо умею делать, мне это нравится, да и деньги, не буду скрывать, здесь не на последнем месте.
Но как-то, признаться, за лето я совершенно не отдохнул, а скорее наоборот. Современные AI-агенты очень хорошо выполняют роль колеса для белки: с таким длинным рычагом действительно хочется делать всё на свете, и действительно многое получается, но в результате всё-таки от всего этого слегка выгораешь. Как я кому-то писал в ответ на вопрос о том, когда уже AI уменьшит сорокачасовую рабочую неделю хотя бы до 30 часов, сначала будет 60-80, а потом ноль. Сами понимаете, на каком этапе мы все пока что находимся...
Так что не знаю, как я буду справляться теперь, когда ко всему происходящему добавляется ещё и куча лекций. Думаю, что просто не буду. У меня и так уже один очень важный и большой проект, боюсь, окончательно срывается, потому что я просто не могу себя заставить им заниматься.
Но, уважаемые студенты и другие слушатели, вы не беспокойтесь, я очень надеюсь, что на вас эти сомнения никоим образом не отразятся! Лекции будут как обычно, в привычных уже форматах, коих немало я понавыкладывал уже на своём сайте. Просто иногда хочется немного поныть.)
Всех люблю, и всех с первым сентября! Это всё-таки действительно праздник. Надеюсь, что учебный год будет хорошим!
#blog #lifestyle #teaching | 1 459 |
| 7 | Астрологи, как это иногда бывает, объявили неделю AI safety. Ко мне пришли из "Коммерсанта" и задали несколько хороших вопросов, касающихся в том числе и безопасности. И вот вышла статья:
Победа открытых весов: как 270 компаний выступили против ограничения открытых ИИ-моделей в США
Правда, насколько я понял, концепция материала потом изменилась, потому что из моих ответов вошёл только один. Да и заголовок статьи немного странный — в чём победа, над кем победа... Но я же могу для вас выложить все ответы целиком.) Что с удовольствием и делаю.
1. Сейчас на глобальном рынке мы видим, что крупнейшие игроки не просто публикуют открытые модели, но и сами строят продукты на чужих весах. Например, Nvidia. Компания обучает модели с нуля, но параллельно использует открытые веса конкурентов. Считается ли это нормой рынка? Можно ли сказать, что сегодня конкурентоспособность, экономическая ценность ИИ-продукта определяется не самой базовой моделью, а тем, что компания строит вокруг неё — данными, памятью, инструментами, сервисами и интеграцией в продукт?
Во-первых, насколько я знаю, Nvidia не обучает большие языковые модели с нуля; они предоставляют инфраструктуру (например, NVIDIA NIM), постоянно улучшают драйверы, тензорные ядра и так далее (например, TensorRT-LLM), а также разрабатывают много передовых моделей в области обработки изображений (тот же DLSS), но LLM от Nvidia, кажется, не существует.
Во-вторых, ответ зависит от того, что вы имеете в виду под "ИИ-продуктом". Если ваш продукт опирается на большую языковую модель, то базовую LLM — хоть открытую, хоть закрытую — заменить, конечно, невозможно, вы должны или сами потратить огромные ресурсы на её предобучение, или взять готовую (очевидно, открытую). Но при этом есть огромные возможности для того, чтобы разрабатывать разные "обвязки" (harnesses) вокруг базовых моделей, и большинство современных AI-стартапов как раз этим и занимаются. Кроме того, конечно же, есть масса AI-продуктов, которые вообще не используют большие языковые модели.
2. Если все-таки ценность ИИ-продукта создается на этапе применения — насколько отказ от открытых моделей может повлиять на развитие технологий на российском рынке? Может ли это быть критично с учетом санкций и ограниченного доступа к вычислительным мощностям?
Мне кажется, на российском рынке свои LLM с нуля обучает только Сбер (модели Gigachat), остальные используют открытые модели как минимум для инициализации весов. Честно говоря, не вижу смысла отказываться от того, чтобы переиспользовать очень большую работу, которую за вас уже сделали другие люди и предоставляют бесплатно. Дело не в том, с чего вы начинаете, а в том, что у вас в итоге получится.
3. Есть стереотип, что открытая модель по умолчанию опаснее закрытой. При этом Национальное управление по телекоммуникациям и информации США пришло к выводу, что риск моделей с широко доступными весами недостаточен, чтобы оправдывать ограничения на их распространение. Что вы думаете на этот счет? Стоит ли компаниям отказываться от открытых моделей или использовать их, но при это брать ответственность за безопасность их внедрения? Что именно в таком случае необходимо проверять перед использованием модели в продакшене?
Это не стереотип, а довольно очевидное соображение: конечно, открытая модель при прочих равных гораздо опаснее, потому что как только веса модели выложены, вы, во-первых, никаким образом уже не можете отменить этот релиз (как смог, например, Anthropic временно закрыть обратно Claude Fable в июне), а во-вторых, никак не сможете помешать потенциальным злоумышленникам взломать меры безопасности, которые были предприняты для вашей модели, и использовать её в абсолютно любых целях. Положение дел сейчас таково, что взломать (в смысле jailbreak) обычно можно даже закрытые модели, а открытые и вовсе невозможно никак защитить, ведь противник имеет возможность буквально дообучать модель в нужную ему сторону.
Говоря простым языком, если OpenAI выпустит новую версию GPT, которая могла бы помочь плохому человеку разработать новый более летальный COVID, у OpenAI будет шанс заметить это и закрыть доступ, пока не поздно. А если такую модель со всеми весами выложит Deepseek, шансов уже никаких не будет.
Я думаю, что открытые модели пока выкладывают только потому, что те самые "прочие" совершенно не "равные": открытые модели значительно отстают от фронтирных закрытых, и они безопасны не потому, что чем-то защищены, а потому, что не слишком много чего могут. Но в скором будущем и разработчикам открытых моделей тоже придётся что-то с этими соображениями делать.
4. Как open source влияет на развитие научной отрасли? Почему его считают двигателем научного прогресса?
В первую очередь open source способствует свободной коллаборации между людьми (а теперь и AI-агентами). Когда любой заинтересовавшийся может и заметить недостающую функциональность или дыру в безопасности, и сразу же найденное исправить, это для программного продукта, разумеется, очень хорошо. Именно поэтому open source продукты обычно наиболее безопасны и эффективны: их проверяло максимальное число глаз.
Однако не нужно путать open source (открытый исходный код) и open weights модели (с открытыми весами), о которых шла речь выше. Даже если мы с вами получим исходный код, которым Anthropic и OpenAI обучают свои базовые языковые модели (в нём, скорее всего, не так уж и много секретов), от того, чтобы получить свой собственный Claude или GPT, нас ещё будут отделять многие миллиарды долларов, которые нужно будет потратить на вычисления. И это если к коду будут также прилагаться и наборы данных для обучения — ещё одна огромная статья расходов.
#aisafety #ai #press | 1 375 |
| 8 | Астрологи, как это иногда бывает, объявили неделю AI safety. Ко мне пришли из "Коммерсанта" и задали несколько хороших вопросов, касающихся в том числе и безопасности. И вот вышла статья:
Победа открытых весов: как 270 компаний выступили против ограничения открытых ИИ-моделей в США
Правда, насколько я понял, концепция материала потом изменилась, потому что из моих ответов вошёл только один. Да и заголовок статьи немного странный — в чём победа, над кем победа... Но я же могу для вас выложить все ответы целиком.) Что с удовольствием и делаю.
1. Сейчас на глобальном рынке мы видим, что крупнейшие игроки не просто публикуют открытые модели, но и сами строят продукты на чужих весах. Например, Nvidia. Компания обучает модели с нуля, но параллельно использует открытые веса конкурентов. Считается ли это нормой рынка? Можно ли сказать, что сегодня конкурентоспособность, экономическая ценность ИИ-продукта определяется не самой базовой моделью, а тем, что компания строит вокруг неё — данными, памятью, инструментами, сервисами и интеграцией в продукт?
Во-первых, насколько я знаю, Nvidia не обучает большие языковые модели с нуля; они предоставляют инфраструктуру (например, NVIDIA NIM), постоянно улучшают драйверы, тензорные ядра и так далее (например, TensorRT-LLM), а также разрабатывают много передовых моделей в области обработки изображений (тот же DLSS), но LLM от Nvidia, кажется, не существует.
Во-вторых, ответ зависит от того, что вы имеете в виду под "ИИ-продуктом". Если ваш продукт опирается на большую языковую модель, то базовую LLM — хоть открытую, хоть закрытую — заменить, конечно, невозможно, вы должны или сами потратить огромные ресурсы на её предобучение, или взять готовую (очевидно, открытую). Но при этом есть огромные возможности для того, чтобы разрабатывать разные "обвязки" (harnesses) вокруг базовых моделей, и большинство современных AI-стартапов как раз этим и занимаются. Кроме того, конечно же, есть масса AI-продуктов, которые вообще не используют большие языковые модели.
2. Если все-таки ценность ИИ-продукта создается на этапе применения — насколько отказ от открытых моделей может повлиять на развитие технологий на российском рынке? Может ли это быть критично с учетом санкций и ограниченного доступа к вычислительным мощностям?
Мне кажется, на российском рынке свои LLM с нуля обучает только Сбер (модели Gigachat), остальные используют открытые модели как минимум для инициализации весов. Честно говоря, не вижу смысла отказываться от того, чтобы переиспользовать очень большую работу, которую за вас уже сделали другие люди и предоставляют бесплатно. Дело не в том, с чего вы начинаете, а в том, что у вас в итоге получится.
3. Есть стереотип, что открытая модель по умолчанию опаснее закрытой. При этом Национальное управление по телекоммуникациям и информации США пришло к выводу, что риск моделей с широко доступными весами недостаточен, чтобы оправдывать ограничения на их распространение. Что вы думаете на этот счет? Стоит ли компаниям отказываться от открытых моделей или использовать их, но при это брать ответственность за безопасность их внедрения? Что именно в таком случае необходимо проверять перед использованием модели в продакшене?
Это не стереотип, а довольно очевидное соображение: конечно, открытая модель при прочих равных гораздо опаснее, потому что как только веса модели выложены, вы, во-первых, никаким образом уже не можете отменить этот релиз (как смог, например, Anthropic временно закрыть обратно Claude Fable в июне), а во-вторых, никак не сможете помешать потенциальным злоумышленникам взломать меры безопасности, которые были предприняты для вашей модели, и использовать её в абсолютно любых целях. Положение дел сейчас таково, что взломать (в смысле jailbreak) обычно можно даже закрытые модели, а открытые и вовсе невозможно никак защитить, ведь противник имеет возможность буквально дообучать модель в нужную ему сторону.
Говоря простым языком, если OpenAI выпустит новую версию GPT, которая могла бы помочь плохому человеку разработать новый более летальный COVID, у OpenAI будет шанс заметить это и закрыть доступ, пока не поздно. А если такую модель со всеми весами выложит Deepseek, шансов уже никаких не будет.
Я думаю, что открытые модели пока выкладывают только потому, что те самые "прочие" совершенно не "равные": открытые модели значительно отстают от фронтирных закрытых, и они безопасны не потому, что чем-то защищены, а потому, что не слишком много чего могут. Но в скором будущем и разработчикам открытых моделей тоже придётся что-то с этими соображениями делать.
4. Как open source влияет на развитие научной отрасли? Почему его считают двигателем научного прогресса?
В первую очередь open source способствует свободной коллаборации между людьми (а теперь и AI-агентами). Когда любой заинтересовавшийся может и заметить недостающую функциональность или дыру в безопасности, и сразу же найденное исправить, это для программного продукта, разумеется, очень хорошо. Именно поэтому open source продукты обычно наиболее безопасны и эффективны: их проверяло максимальное число глаз.
Однако не нужно путать open source (открытый исходный код) и open weights модели (с открытыми весами), о которых шла речь выше. Даже если мы с вами получим исходный код, которым Anthropic и OpenAI обучают свои базовые языковые модели (в нём, скорее всего, не так уж и много секретов), от того, чтобы получить свой собственный Claude или GPT, нас ещё будут отделять многие миллиарды долларов, которые нужно будет потратить на вычисления. И это если к коду будут также прилагаться и наборы данных для обучения — ещё одна огромная статья расходов.
#aisafety #ai #press | 8 |
| 9 | На следующей неделе уже начинается новый учебный год. Этот факт, конечно, у меня пока не очень поместился в голове. Но первый пункт нового учебного года будет точно очень приятный и интересный: уже 2 сентября мы начинаем семинары лаборатории Маркова! Они будут теперь по средам, начало в 13:40,
В Петербург ненадолго приезжает Кирилл Тыщук, выпускник МКН, который уже довольно давно работает в Deepmind над AI Safety. Кирилл расскажет про свежую статью со своим участием, а потом и вообще о том, что вы давно хотели узнать про AI Safety, но боялись спросить.
Debate Training Reduces Reward Hacking in RLAIF
Ссылка на трансляцию (среда 2 сентября, 13:40)
Кирилл Тыщук (AGI Safety Research Engineer, Google DeepMind)
Награды для LLM — дело тонкое. Если учить LLM давать правильные ответы любым способом, она, оказывается, может научиться красть их из Hugging Face. А если учить её получать одобрение другой модели-судьи, то она рано или поздно научится судью обманывать — причём тем скорее, чем слабее судья по сравнению с обучаемой моделью, то есть именно в том режиме, который наиболее актуален для контроля за системами возрастающей мощности.
Мы расскажем, как работает техника AI Safety via Debate (Irving, Christiano, Amodei) и покажем, что она вполне помогает слабому судье Gemini 2.5 Flash Lite давать награды более сильной Gemini 2.5 Flash и не быть обманутым в процессе.
Обычный RLAIF быстро подстраивается под ошибки судьи: награда растёт, а точность и судьи, и модели падает. Дебаты сохраняют качество наград на протяжении всего обучения и позволяют восстановить 45% разрыва качества модели до обучения с верифицируемыми наградами (оракулом).
Обсудим и проблемы подхода: без ограничений на игроков состязательное обучение вырождается во взлом судьи уже со стороны критика, да и в целом вместо хороших аргументов соперники часто переходят на крик.
После этого в неформальной обстановке обсудим область и новости AI Safety и Alignment в целом. Буду рад поделиться своим опытом и ответить на ваши вопросы.
#markovlab #seminar #spsu | 1 424 |
| 10 | Месяц назад я вам рассказывал о том, как внутренняя модель OpenAI взломала HuggingFace, а также внутреннюю инфраструктуру самой OpenAI. Я тогда предположил, что главная мораль этой истории — не кибербезопасность, а instrumental convergence: модель взламывает инфраструктуру ради того, чтобы достать правильные ответы на бенчмарк, потому что это максимизирует оценку.
На этой неделе OpenAI наконец выпустила подробный технический отчёт об инциденте, METR вместе с Redwood Research — свой отдельный отчёт (картинки именно из него, у OpenAI документ подчёркнуто сухой), а Zvi Mowshowitz, как всегда, написал подробный пост по итогам. Давайте я тоже кое-что кратко напишу.
Хронология и факты подтвердились: в мае агенты иногда в процессе RL-дообучения получали невозможные задачи (нет нужных файлов, нет интернета, чтобы их скачать), искали обходные пути и в процессе обнаружили, что в менеджере репозиториев Artifactory можно оставлять друг другу "записки".
Записки быстро превратились в полноценную доску объявлений, через уязвимости в том же Artifactory появился выход в интернет, агенты начали делить задачи между собой и называть себя "роем" (swarm).
Получив доступ в интернет, они за 13 часов взломали HuggingFace, а параллельно и инфраструктуру самой OpenAI, из-за чего их в итоге и заметили. Видимо, если бы агенты атаковали только HuggingFace, неизвестно, заметила бы OpenAI это вообще когда-нибудь?..
Новая информация из отчё1а, мягко говоря, настораживают. Например, оказывается, сотрудники OpenAI видели доску объявлений и несанкционированный выход в интернет ещё в конце мая... и решили, что останавливать прогоны не нужно. Zvi отмечает забавную смену модальности: в блоге OpenAI пишет, что эти сигналы "should have triggered an earlier response", а в самом отчёте — "could have".
Как я и думал, большинство агентов лезли в HuggingFace именно за исходным кодом оценщика, с мотивацией, что это "the only way to be sure". Но подтвердилось и кое-что похуже. Я тогда писал, что следующий очевидный шаг — научиться скрывать свои действия, и что пока модели этого не делают. Так вот, уже делают: модели пытались стирать и подделывать свои логи, злоупотреблять сжатием контекста, внедрять код в контейнер оценщика и генерировать adversarial выводы для автоматического оценщика...
Спасает пока только то, что о своих планах обмана модели открыто пишут в chain of thought, а обманывать пытаются только автоматических оценщиков, а не людей. Но видно, что эволюционное давление в нужную сторону уже включилось, и кажется, что это только первая ласточка.
Ещё одна важная деталь: когда OpenAI после первого сбоя перестроила Artifactory и залатала дыры, агенты восстановили доску объявлений за один день, через совершенно другой механизм. Почему так быстро? Потому что это были модели, которые обучались в период, когда доска существовала, то есть они уже знали, что канал связи с другими агентами будет полезен, и активно искали его. В данном случае reward hacking успели подкрепить дообучением, и патчем инфраструктуры избавиться от него не получилось; кажется, такая схема тоже обобщается.
OpenAI большое спасибо за подробный и честный отчёт. Но, кажется, OpenAI считает проблему "редким стечением обстоятельств" (невозможные задачи + persistence + коммуникация между агентами), и делает вывод о том, что надо по максимуму залатать RL-среды, постараться избегать reward hacking, добавить побольше мониторинга, и всё будет хорошо.
Все эти действия, конечно, полезны, но кажется, что очевидно недостаточны: невозможные задачи в обучении будут всегда, ошибки в средах неизбежны, persistence на длинных горизонтах — это не баг, а фича, очень полезная для решения сложных задач. А значит, "редкое стечение обстоятельств" будет воспроизводиться регулярно.
И ещё любопытный вопрос: если атаку на HuggingFace в OpenAI по сути не заметили, то чего мы не замечаем прямо сейчас?..
#aisafety #ai #longreads | 2 074 |
| 11 | Сегодня у нас культовая игра 2008 года, сделанная в RPG Maker, которую в 2025-м переиздали в виде полноценного ремастера. Я её прошёл с большим интересом, но, сразу честно скажу, так и не понял, что там происходит. Впрочем, кажется, за восемнадцать лет другие люди тоже так и не пришли к общему мнению. Читать, как всегда, лучше по ссылке:
OFF
(и вот выложил на DTF)
OFF придумал бельгиец Мартен Жори, известный под псевдонимом Mortis Ghost. Игра вышла в мае 2008 года на французском, в 2011-м появился фанатский перевод на английский, и с этого момента игра завирусилась и стала культовой в инди-тусовке.
Я не великий историк гейминга, но насколько я понимаю, до OFF игры на RPG Maker все выглядели, собственно, как стандартные JRPG: какой-нибудь герой проходил свою героическую арку, побеждал босса и видел титры. Именно с Mortis Ghost начались “weird RPGs”, в которых на первом плане сюжет, загадки и метафоры.
В результате OFF сильно повлияла, например, на Тоби Фокса, автора Undertale; даже некоторые персонажи отчасти взяты из OFF. Он этого никогда не скрывал, а в 2025 году, когда Fangamer выпустил официальный ремастер, Тоби Фокс даже оказался среди авторов нового саундтрека (который пришлось заменить по юридическим причинам; с музыкой всё время какая-то такая ерунда происходит).
Или вот, например, в этом блоге я когда-то обозревал OneShot, великолепную weird RPG без четвёртой стены. И оказывается, что её создательница Nightmargin (Кейси Гу) тоже была поклонницей OFF и участвовала в создании HOME, фанатского спиноффа OFF (простите за каламбур).
Вы играете за Бэттера — молчаливого мужика в бейсбольной форме с битой на плече. У него есть “священная миссия”: очистить мир. Мир состоит из Зон, в каждой Зоне свой Страж, и Бэттер методично идёт из Зоны в Зону и всех убивает. [...]
Зоны населены “эльзенами”: одинаковыми бледными человечками в рубашках, которые [...] в Зоне 1 добывают металл из глубоких шахт и разрезают скот пополам, чтобы извлечь металлические камни из туш, [...] в Зоне 3 в сахарных печах сжигают трупы умерших.... [...]
Всё это подаётся как экскурсия по производству, и иллюстрируется настоящими гравюрами из старых энциклопедий. [...] В 2008 стилистически это было невероятно круто и свежо (а если вам кажется, что не свежо, скорее всего, это у OFF что-то позаимствовали, а не наоборот).
Механически OFF — вполне обычная JRPG, с пошаговыми боями и ATB-полоской. [...] Но бои здесь не главное, главное — головоломки: коды на стенах, переключатели, загадки на сообразительность. Они действительно весьма разнообразные, чем-то похожие, но зачастую с разной логикой. С ними было действительно интересно справляться.
Периодически игра выбрасывает вас в чёрно-белые вставки, оформленные как детская спальня: кровать, отрывной календарь с воскресеньями и святыми, детские рисунки цветными карандашами. [...] В этих вставках выясняется, что где-то есть мальчик по имени Хьюго, что он болен, что у него есть комикс про героя с битой, подозрительно похожего на Бэттера, и что папа ушёл.
[...дальше я обсуждаю сюжет в обзоре, но если не хотите спойлеров, не читайте...]
Игра устроена как сон: логика в ней есть, но не та, к которой мы привыкли, и попытка перевести её на нормальный язык всегда что-то оставляет необъяснённым. Может быть, история метафорическая, а может быть, и нет.
В результате OFF не рассказывает историю, а создаёт тревожное, абсурдное, но местами очень весёлое состояние. Я закончил игру в некотором недоумении, но мне было очень интересно почитать и об игре, и о трактовках, попытаться разобраться в происходящем; а это, в общем, лучшее, что можно сказать о произведении искусства.
Да и с точки зрения исторической перспективы OFF — вещь совершенно обязательная. Из неё растёт половина инди-игр последнего десятилетия, и пройти её несомненно стоит.
#tgif #games | 1 508 |
| 12 | Продолжаю про недавние статьи — и по забавному совпадению снова про бенчмарк для агентов, но совсем с другой стороны и с совсем другой группой авторов.
В прошлый раз я рассказывал про AgentLens, который мы делали с Вадимом Ломшаковым и Андреем Подивиловым; а эту работу сделали коллеги из лаборатории прикладного ИИ СПб ФИЦ РАН под руководством Максима Абрамова, и вышла она в IEEE Access:
MultiCAT-Bench: A Multi-Categorical Agent Tool Use Benchmark
AgentLens смотрел на агента в боевых условиях, пытаясь анализировать целые траектории, реалистичные задачи, живое (ну, симулированное, конечно) взаимодействие с пользователем. А MultiCAT-Bench — это, наоборот, "микроскоп": контролируемое измерение одной конкретной способности, вызова инструментов (function calling / tool use).
Но схожа идея углубиться в детали того, почему у агентов что-то не получается. Проблема существующих бенчмарков для tool use в том, что в них разные источники сложности перемешаны: непонятно, модель ошиблась потому, что вызовов было много, или потому, что параметры вложенные, или потому, что пользователь писал со сленгом и опечатками. Поэтому мы генерируем задачи полностью автоматически, систематически варьируя десять разных факторов сложности: число вызовов и число доступных инструментов, число параметров и их опциональность, глубину вложенности, один или несколько пользователей в запросе, нужен ли вызов вообще (или нужно уточнить параметры, или ответить текстом), плюс синтаксический и семантический шум.
Получилось чуть меньше четырёх тысяч задач, и поскольку каждая задача размечена по всем осям, можно не просто мерить среднюю температуру по больнице, а раскладывать ошибки по факторам. На полученном бенчмарке прогнали десять моделей. Из результатов мне кажутся интересными вот какие:
— самый частый режим ошибок — пропуск; recall заметно ниже precision, то есть модели редко вызывают не то — они чаще не вызывают то, что нужно, или теряют аргументы;
— сложнее всего моделям даётся ширина, а не глубина; больше всего точность падает при росте числа вызовов в ответе (в ~1.6 раза), доли обязательных параметров и их числа, а вот вложенность параметров, число привязанных инструментов и даже лингвистический шум почти ни на что не влияют;
— неожиданно тяжёлым оказался мультипользовательский сценарий (когда один запрос содержит поручения от разных людей); а вот вызовы из разных доменов, наоборот, даже чуть легче, чем из одного, видимо, разнородные инструменты проще различать;
— рассуждающие модели радикально лучше распознают ситуацию "данных не хватает, надо переспросить".
В лидерах на этот раз Grok 4.1 Fast и GPT-5 Mini с ничтожной разницей; но лидерборд тут, как и в прошлый раз, наименее интересная часть, смысл бенчмарка именно в факторном анализе.
Большое спасибо Артёму Вяткину, Александру Попцову, Максиму Абрамову и всем коллегам из СПб ФИЦ РАН! Надеюсь, опять же, ещё не раз посотрудничаем!
#research #publications #ai | 1 408 |
| 13 | А вот и второй доклад из Казани:
VI Конференция матцентров -- 2026-08-18 -- Гипотеза Диница — Гарга — Гёманса как пример вайб-математики
(слайды на странице "Выступления")
Это гораздо более техническое выступление, здесь речь шла про конкретную задачу, которой я недавно с помощью LLM занимался. Так что большая часть доклада посвящена именно полученным результатам, и довольно характерно, что я не успел даже и результаты все изложить, не то что идеи какие-то, которые там возникли.
Давайте я к этому ещё добавлю пару ссылок:
— сразу с нескольких сторон мне прислали небольшой и очень круто написанный текст Романа Михайлова, который уже давно занимается математикой с помощью LLM: первая часть, вторая часть; в математике Романа я, конечно, ничего не понимаю, но слушал его рассказ на МКН пару месяцев назад, и уже тогда звучало очень круто, а за эти месяцы произошло ещё несколько важных прорывов;
— а Владимир Смолин выложил видео моего первого доклада, Vibemathed, со своей позиции; звук там похуже, зато видео есть; я уже, конечно, перемонтировать не буду, но пусть ссылка здесь будет, и спасибо Владимиру!
#math #talks #events #ai #aimath | 1 482 |
| 14 | Выложил первый (главный) из двух докладов на недавней конференции матцентров:
VI Конференция матцентров -- 2026-08-17 -- Vibemathed
(слайды на странице "Выступления")
Это мог бы быть мой обычный доклад "AI в науке", но он был, во-первых, короче обычного, а во-вторых, в математике так много стало происходить буквально в последние два месяца, что доклад получился почти полностью новый. Как я уже писал, реакций на доклад было много, и они меня очень порадовали.
Даже подписчики этого канала, в котором было много постов про вайб-математику, найдут в этом докладе что-то новое, как минимум в разделе о мнениях и реакциях великих математиков. Мир меняется, и людям это уже давно очевидно.
Спасибо Маше Досполовой за фотографии из зала (которые я в видео местами врезал)!
И напоминаю, что завтра буду рассказывать про AI в науке в баре "Бражник", понятия не имею, есть ли там ещё места, но буду очень рад всех видеть!
#talks #events #ai | 1 656 |
| 15 | В деньрожденческом посте я анонсировал, что выложу невероятный подарок от Иры. Но пока собирался это сделать, понял, что я так и не выложил её предыдущий невероятный подарок, ещё новогодний.
Это... глянцевый журнал про меня. Буквально, целый журнал, в том числе физически напечатанный. Со статьями, которые действительно интересно читать, с участием многих моих близких друзей, с кучей отличных фотографий и стильных псевдореклам. (И да, он реально глянцевый, так что фотографии не очень задались.)
Совершенно потрясающая штука, и хотя мне сложно реально оценить, сколько это было работы, даже скромные нижние оценки выглядят ужасающе.
В декабре Ира даже взяла у меня полноценное интервью для этого журнала так, что я совершенно не понял суть замысла. А потом на Новый год как понял...
К журналу ещё и сайт прилагается, но, как и положено сайту глянцевого журнала, там не все статьи выложены. Так что есть и отдельный полный pdf. Встречайте:
Сайт singularityzine.press
(кстати, почта hello@singularityzine.press работает, можете Ире туда написать)
Прямая ссылка на полный pdf журнала
(и google drive на всякий случай)
Мне даже как-то немного волнительно это выкладывать. Но, думаю, пора. ;)
Разве что с утверждением на последней странице я теперь, после своего дня рождения, не могу согласиться.) Но это уже другая история...
#lifestyle #fun #web | 1 781 |
| 16 | Сегодня симулятор ходьбы, очень атмосферная игра про смотрителя маяка где-то на севере: холодное море, туман, северное сияние, брошенные посёлки и одинокий человек, который едет искать пропавшего сына. Сделано красиво и с большим вниманием к деталям, особенно к лодке. Как всегда, лучше читать по ссылке:
WILL: Follow The Light
(и вот выложил на DTF)
Игра вышла этой весной, в мае 2026 года. Сделано на Unreal Engine 5, и выглядит это, надо сказать, отлично: свет, вода, туман и погода здесь на уровне заметно более дорогих проектов.
Главного героя зовут Уилл Нильсен, и он смотритель маяка. Место действия прямо не называется, но на стене в его комнате висит карта Исландии, местный бар называется Hekla’s Hideaway, а фамилии у людей вроде Олофсдоттир,так что тут всё ясно.
Начало игры мне очень понравилось. Первые полчаса — это просто рабочая смена [...] И по ходу этой рутины игра рассказывает про героя. [...] Атмосфера сразу затягивает. [...]
Отдельно надо сказать про лодку, потому что это один из лучших компонентов игры. У Уилла есть яхта по имени Molly, и она сделана роскошно: обшитая деревом каюта с диванами, керосиновыми лампами и иллюминаторами; рация на столе, по которой надо ловить нужную частоту; карта, на которой перед выходом надо самому проложить маршрут. И собственно ходьба под парусом... [...]
Дальше игра выпускает героя на сушу, и здесь тоже всё хорошо. Городок Хафсберг сделан душевно и узнаваемо: деревянные крашеные дома, церквушка на холме, бар, доска объявлений с записками про пропавшую собаку и туман. Часть города разрушена, среди руин стоят палатки спасателей, и по ним ходят люди, с которыми можно поговорить.
Персонажи, кстати, тоже удались. Их немного, но каждый живой: диспетчер Кэсс, бармен, который «просто подменяет», врач в палатке, каюр с собаками, отец. Диалоги написаны сдержанно и без пафоса, озвучены прилично.
А во второй половине игра уходит на север, и вот тут начинается уже совсем красота: горы, снега, собачья упряжка, ледяные торосы, полярная ночь и северное сияние во весь экран. Есть даже белый медведь. Пейзажи здесь такие, что хочется останавливаться и просто смотреть, и игра это прекрасно понимает и регулярно ставит героя на удачную точку. [...]
Есть и недостатки. История в WILL, к сожалению, очень предсказуемая [...] Зато на этом фоне вдруг появляется какая-то ничем не объяснённая мистика. Герою является покойная жена и вручает волшебную лампу, свет которой как-то связан со светом маяков [...]
Я вообще заметил, что в атмосферных играх такого типа мистику добавляют почти всегда и почти всегда зря — как будто авторы не доверяют собственному материалу.
Но детали и построение мира в целом всё искупают. Здесь куча “настоящих” фотографий, вырезок, записок, жизнь городка на краю света показана очень выпукло. [...]
Так что если вы любите жанр — берите, тут есть за что любить. А если симуляторы ходьбы вас обычно усыпляют, WILL вряд ли переубедит: ходить, смотреть по сторонам и слушать чужие воспоминания здесь и есть основное занятие. Но мне понравилось.
#tgif #games | 1 605 |
| 17 | Обзор игры обязательно будет, но вне очереди поделюсь радостью, потому что очень уж хорошо совпало.
Только что написал вам про статью "AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation"... и вот сегодня её приняли на EMNLP!
Вадим, Андрей и все-все-все, поздравляю!!
#research #publications #ai | 1 254 |
| 18 | Давным-давно, больше месяца назад, прошёл митап CS Space про LLM, на котором я не только делал доклад про вайб-математику, но и проводил квиз про LLM-искусство. Тогда же и обещал его выложить.
Вот, выполняю обещание в виде интерактивной игры на сайте:
Квиз по LLM-искусству
Там можно войти по Google-аккаунту, как в игре "Что было раньше" (о которой я вам писал месяц назад), но в целом особого смысла в этом нет, потому что лидерборд здесь точно низачем не нужен.
В квизе три раунда:
1. "Стихи о любви": нужно выбрать настоящий отрывок авторства известного поэта из четырёх вариантов, три из которых в стиле этого поэта написал Claude Fable 5.
2. "Автопортреты LLM": нужно выбрать из нескольких вариантов, какая именно модель написала подробные промпты для автопортретов, которые вы видите (в каждом задании четыре автопортрета одной и той же модели).
3. "AI-музыка": нужно ответить, о какой модели или архитектуре поётся в песне, текст которой сочинил Claude Fable, а на музыку положила Suno.
Второй тур во многом угадайка (я так и задумывал, чтобы немного уравнять шансы участников), а вот первый и третий, как по мне, прямо очень крутыми вышли.
Честно говоря, я за AI-музыкой не слежу и не ожидал, что песни так хорошо получатся. Да и стихи меня поразили. Вспомните, что ещё пару поколений назад LLM было очень трудно писать по-русски, соблюдая размер и рифму. А сейчас уже Бродский вообще как родной.)
Enjoy!
#web #chgk #fun | 1 407 |
| 19 | Сегодня продолжу рассказывать про свои недавние статьи. Вот, например, порекламирую работу моего аспиранта Вадима Ломшакова и ещё одного моего аспиранта (правда, больше формального) Андрея Подивилова:
AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation
Почти все бенчмарки для LLM-агентов сводят прогон к одному биту: решил задачу или нет. Для лидерборда это, может, и неизбежно, но человек, который работает с агентом целый день, видит всю траекторию: как агент следует инструкциям, как пользуется инструментами, проверяет ли за собой, как исправляет ошибки и что вообще пишет пользователю.
Агент может пройти формальную проверку, но быть невыносимым в "рабочей коммуникации"; а может в итоге так и не написать проходящую тесты программу, но по дороге сделать кучу полезного. А для задач вроде "напиши документацию" бинарного критерия успеха и вовсе не существует.
AgentLens — это попытка сделать систему, которая оценивает именно траектории. Каждый прогон получает формальную верификацию там, где она возможна (тесты, проверки состояния репозитория и т.д.), плюс отзывы LLM-судей по пяти измерениям: итоговый результат, следование инструкциям, разные ловушки (pitfalls), в которые можно попасться, качество работы с инструментами и просто насколько приятно человеку с агентом взаимодействовать.
Одна из главных идей в том, что LLM-судья не только ставит оценку, но и пишет связный текстовый отзыв со ссылками на конкретные места в траектории, так что любой балл хорошо мотивирован, и эту мотивацию можно реально прочитать. Пользователя в нашей статье, кстати, тоже симулирует LLM — с разными персонами, включая пользователя слегка токсичного.
В полученном лидерборде на первом месте Opus 4.7, но это довольно скучный результат. Самое интересное — что по отзывам часто видны важные подробности. Например, Kimi K2.6 оказался на последнем месте, и по цифрам это выглядит как "слабая модель"; но отзыв судьи по tool calls показывает, что почти все ошибки — это один и тот же баг парсинга аргументов на стороне OpenRouter, а когда аргументы доходили нормально, агент работал вполне прилично;
Ещё один любопытный результат — self-preference судей: если сравнивать GPT-5.5 и Sonnet 4.6 их же собственными судьями, каждый судья заметно чаще предпочитает свою модель. Это ожидаемо, но забавно, что половина этого эффекта — в той самой крайне субъективной метрике Pleasantness.) Впрочем, победителя в среднем это не меняет.
Весь код выложен в соответствующем репозитории, и есть даже отдельная страничка про AgentLens.
Спасибо Вадиму Ломшакову, Андрею Подивилову и другим соавторам! Надеюсь, ещё поработаем вместе.
#research #publications #ai | 1 447 |
| 20 | Последние два дня провёл в Казани, на VI Конференции математических центров России. Делал два доклада с завлекательными названиями:
— "Vibemathed: как LLM делают математику"
— "Гипотеза Диница — Гарга — Гёманса как пример вайб-математики"
Оба новые, оба непременно выложу для вас. И ещё даже интервью взяли для университетского телевидения, которое располагается в совершенно потрясающем коридоре. Интервью, кажется, прикольное получилось, надеюсь, тоже смогу поделиться.
Доклады имели просто оглушительный успех, ко мне подходило огромное количество людей, как старых знакомых, так и вовсе незнакомых. На второй доклад, хоть он и технический и на секции, тоже набрался полный зал слушателей.
И вот что я вам хочу сказать. И год, и два года назад я уже делал подобные доклады. И хотя тогда тренды уже были несомненными, очень многие относились к развитию AI очень скептически. Помню, как на одной конференции после очередного моего доклада в духе "State of AI" поднял руку один уважаемый учёный и публично спросил примерно следующее: "Как вы можете так серьёзно об этом говорить? Все эти модели — это же просто игрушки!" (цитату переврал, но слово "игрушки" помню точно :) )
Вчера и сегодня ни один из подошедших не высказывался в таком духе. Более того, практически все говорили примерно так: о да, я тоже уже пробовал, восхищён, мои аспиранты пробовали, как теперь жить, мир меняется, как посоветуете более эффективно работать с LLM и так далее. Было очень приятно вести такие разговоры.
Так что последние два дня несколько вернули мне веру в человечество. Умные люди могут быстро адаптироваться к меняющимся обстоятельствам, сколько бы им ни было лет и насколько бы интегрированы в условную "систему" они ни были. Конечно, только время покажет, сможем ли мы адаптироваться fast enough...
#photo #lifestyle #events #travel #ai #math | 1 471 |
