en
Feedback
Истории (не)успеха (ИИ)ЕИ

Истории (не)успеха (ИИ)ЕИ

Open in Telegram

Просто о математике, нейросетях, IT. Общение, контакты, международные онлайн дискуссии/лекции в формате лайвстрим.

Show more
612
Subscribers
No data24 hours
+37 days
+830 days
Attracting Subscribers
September '26
September '26
+11
in 1 channels
August '26
+6
in 0 channels
Get PRO
July '26
+4
in 0 channels
Get PRO
June '26
+18
in 0 channels
Get PRO
May '26
+143
in 2 channels
Get PRO
April '26
+114
in 2 channels
Get PRO
March '26
+2
in 0 channels
Get PRO
February '26
+3
in 0 channels
Get PRO
January '26
+2
in 0 channels
Get PRO
December '25
+18
in 0 channels
Get PRO
November '25
+20
in 0 channels
Get PRO
October '25
+15
in 0 channels
Get PRO
September '25
+40
in 1 channels
Get PRO
August '25
+15
in 1 channels
Get PRO
July '25
+86
in 3 channels
Get PRO
June '25
+122
in 1 channels
Get PRO
May '25
+168
in 0 channels
Get PRO
April '25
+27
in 1 channels
Get PRO
March '250
in 0 channels
Get PRO
February '250
in 0 channels
Get PRO
January '25
+54
in 0 channels
Get PRO
December '240
in 0 channels
Get PRO
November '24
+2
in 0 channels
Get PRO
October '240
in 0 channels
Get PRO
September '240
in 0 channels
Get PRO
August '240
in 0 channels
Get PRO
July '240
in 0 channels
Get PRO
June '240
in 0 channels
Get PRO
May '240
in 0 channels
Get PRO
April '240
in 0 channels
Get PRO
March '240
in 0 channels
Get PRO
February '240
in 0 channels
Get PRO
January '24
+33
in 0 channels
Date
Subscriber Growth
Mentions
Channels
07 September0
06 September0
05 September0
04 September+5
03 September0
02 September0
Channel Posts
Девочке, которая снимала, я, кстати, первоначально сказал, что я не умею плавать и ей придётся меня спасать. Она подписчица нашего канала и может подтвердить )

2
No text...
25
3
Друзья и коллеги, желаю вам всем хорошей рабочей недели, чтобы наступающая неделя у вас задалась, а не как этот мой прыжок в
Друзья и коллеги, желаю вам всем хорошей рабочей недели, чтобы наступающая неделя у вас задалась, а не как этот мой прыжок в воду :) и желаю вам такой же группы поддержки как у меня 👇👇👇
24
4
p_. 📚 Если захотите почитать глубже DPO — Direct Preference Optimization: основная работа по методу, который мы сегодня обсуждали. Direct Preference Optimization — Rafailov et al. RLHF и Reverse KL — хорошая теоретическая работа именно про KL-регуляризованный RLHF. Iterative Preference Learning from Human Feedback — Xiong et al. Большой обзор галлюцинаций LLM, 2025/2026 — причины, классификация, обнаружение и способы уменьшения галлюцинаций. Large Language Models Hallucination: A Comprehensive Survey Обзор в Computational Linguistics, 2025 — хорошая академическая карта проблемы hallucinations. Siren’s Song in the AI Ocean: A Survey on Hallucination in Large Language Models
93
5
6️⃣ Forward vs Reverse KL: два стиля воспитания нейросетей И вот здесь начинается самое интересное. Мы уже знаем, что KL-дивергенция показывает, насколько одно распределение вероятностей отличается от другого. Но у KL есть одна необычная особенность: она несимметрична. С обычным расстоянием между точками всё просто. Если между точками A и B — 10 метров, то от A до B и от B до A всё те же 10 метров. С KL так не работает: D_KL(P Q) ≠ D_KL(Q P) То есть важно не только какие два распределения мы сравниваем, но и какое из них ставим первым. В нашем случае есть два распределения: P_ref — вероятности исходной модели, которую мы берём за точку отсчёта; P_policy — вероятности модели после Alignment. Для одного и того же контекста обе модели распределяют 100% вероятности между возможными следующими токенами. И мы можем спросить: что будет, если считать KL в одну сторону? D_KL(P_ref || P_policy) — это Forward KL. А если развернуть направление: D_KL(P_policy || P_ref) — это Reverse KL. На бумаге разница выглядит почти смешно: всего лишь поменяли местами две буквы. Но математически это уже два разных способа наказывать модель за расхождение. 📍Forward KL: «Не пропусти ничего» Forward KL особенно сильно штрафует ситуацию, когда исходная модель считает какой-то вариант достаточно вероятным, а а дообученная модель практически перестала его рассматривать. Грубо говоря: «А вдруг там тоже что-нибудь важное?! Покрой всё!» Поэтому Forward KL часто связывают с mass-covering поведением — модель старается не потерять разные возможные варианты, даже если некоторые из них менее вероятны. Аналогия — тревожный родитель, который записывает ребёнка сразу в 17 кружков: «А вдруг у тебя талант к скрипке?! Или к шахматам?! Или к балету?! Нельзя ничего упустить!» 📍Reverse KL: «Выбирай то, в чём уверен» Reverse KL смотрит на ситуацию с другой стороны. Он особенно сильно штрафует случай, когда сама модель после обучения начинает давать высокую вероятность вариантам, которым исходная модель почти не давала вероятности. Грубо говоря: «Не уверен — не лезь». Поэтому Reverse KL часто связывают с mode-seeking поведением: модель предпочитает сосредоточиться на наиболее вероятных вариантах, а не пытаться охватить всё пространство возможных ответов. Здесь родитель уже другой: «Мне всё равно, чем ты занимаешься. Главное — делай это без ошибок». И ребёнок выбирает один навык, в котором уверен, а остальные оставляет за бортом. Именно поэтому выбор между Forward и Reverse KL — не просто математическая мелочь. Это разные способы расставить приоритеты: что для нас страшнее — потерять возможный вариант или начать уверенно выбирать то, чего раньше практически не было? И вот здесь мы возвращаемся к Alignment. Alignment меняет вероятностное поведение модели: какие продолжения становятся более вероятными, а какие — менее. Но любое изменение имеет цену. Слишком слабое выравнивание — модель может оставаться непредсказуемой, льстивой или склонной к нежелательным ответам. Слишком сильное — и мы получаем идеально воспитанного ребёнка, который на любой вопрос сначала смотрит на родителей и тихо спрашивает: «А какой ответ вы хотите от меня услышать?» Хороших всем выходных и сбалансированных градиентов! 🙂
7
6
3/3. Предыдущая часть 👆 Поэтому в функции потерь Loss (штраф нейросети за возможные ошибки, см. 👆) появляется дополнительный штраф: Loss_Alignment = Loss_Preference + β · D_KL(P_policy || P_ref) Loss_Preference говорит: «меняй модель так, чтобы её ответы больше нравились людям». D_KL говорит: «но не слишком далеко уходи от исходной модели». А β — это сила этого ограничения. Можно сказать, что β — это длина родительского поводка: маленькое β позволяет модели сильно измениться, большое β сильнее удерживает её около исходного поведения. β слишком велик: «Не высовывайся. Делай всё как раньше». Модель слишком сильно держится за исходное поведение и хуже учится новому. β слишком мал: «Делай что хочешь». Модель получает больше свободы менять своё поведение — вместе с риском нежелательных отклонений. То есть Alignment — это не просто: «сделаем модель безопасной». Alignment — это гораздо более тонкая задача: изменить вероятностное распределение поведения модели, но не разрушить всё ценное, что уже было выучено. И именно здесь у нейросети могут появляться так знакомые нам всем «психопатологии». 5️⃣ Что может пойти не так? 1. Sycophancy («Лизоблюдство») Если слишком сильно оптимизировать одобрение человека, модель быстро учится говорить пользователю то, что тот хочет услышать. Пользователь: «Земля плоская, ведь так?» Модель: «Вы совершенно правы! Более того…» Получается ребёнок, который понял: главное — не быть правым, а понравиться родителю. 2. Over-refusal: «зажатость» Если слишком сильно наказывать модель за потенциально неправильные или опасные ответы, она может начать отказываться даже там, где нормальный ответ вполне допустим: «Как ИИ-помощник, я не могу…» «К сожалению, я не могу помочь…» Это уже напоминает зашуганного ребёнка, который на любой вопрос отвечает: «Я не знаю. Лучше не буду». 6️⃣ Forward vs Reverse KL: два стиля воспитания И вот здесь становится особенно интересно. Поскольку KL несимметрична, два направления дают разные поведенческие эффекты. Forward KL: «Не пропусти ничего» Forward KL сильно штрафует модель, если target distribution имеет некоторую область, которую модель практически не покрывает. Грубо говоря: «А вдруг там тоже что-нибудь важное?! Покрой всё!» Это заставляет модель не упускать разные возможные варианты. Аналогия — тревожный родитель, который записывает ребёнка сразу в 17 кружков: «А вдруг у тебя талант к скрипке?! Или к шахматам?! Или к балету?! Нельзя ничего упустить!» Reverse KL: «Выбирай то, в чём уверен» Reverse KL сильнее наказывает модель за уверенность в вариантах, которые исходная модель почти не считала возможными. Грубо говоря: «Не уверен — не лезь». Поэтому Reverse KL часто склоняет модель выбирать несколько наиболее вероятных вариантов и игнорировать остальные. Родитель здесь уже другой: «Мне всё равно, чем ты занимаешься. Главное — делай это без ошибок». Ребёнок выбирает один навык, в котором уверен, и игнорирует остальные. Именно поэтому выбор между Forward и Reverse KL — не просто математическая мелочь. Это выбор того, какую ошибку мы считаем более страшной: пропустить возможный вариант или уверенно выбрать неправильный. И, пожалуй, главный вывод: Alignment — это всегда компромисс. Мы меняем распределение вероятностей поведения модели, чтобы получить более желательное поведение. Но любое изменение имеет цену. Слишком слабое выравнивание — модель может быть непредсказуемой, льстивой или склонной к нежелательным ответам. Слишком сильное — и мы получаем идеально воспитанного ребёнка, который на любой вопрос сначала смотрит на родителей и тихо спрашивает: «А какой ответ вы хотите от меня услышать?» Хороших всем выходных и сбалансированных градиентов!
73
7
2/3. Начало 👆 Дальше в дело вступает Backpropagation (обратное распространение ошибки). Он вычисляет, как параметры модели повлияли на ошибку, а оптимизатор использует эти градиенты, чтобы немного изменить веса и уменьшить Loss. Иными словами: модель ошиблась → ошибка превратилась в градиенты → градиенты немного поправили «настройки мозга». Но есть одна проблема: предобученная модель ещё не обязательно является хорошим ассистентом. Она умеет продолжать текст, знает огромное количество закономерностей языка и мира, но задача pre-training была другой: по контексту предсказать следующий токен. Её никто ещё специально не учил режиму: пользователь задаёт вопрос → модель отвечает как полезный ассистент. Для этого нужен следующий этап — SFT (Supervised Fine-Tuning). 3️⃣Supervised Fine-Tuning и Alignment : учим нейросеть быть полезной как ассистент человека и манерам Модель продолжает делать примерно то же самое — предсказывать токены и минимизировать ошибку, — но теперь её специально учат следовать инструкциям, соблюдать формат, стиль и структуру диалога. Получается умный, но ещё не полностью «воспитанный» ассистент. И вот здесь начинается самое интересное — Alignment (выравнивание поведения модели с человеческими предпочтениями) — следующий этап обучения. Чтобы модель была не просто умной, а полезной, безопасной и приятной в общении, её дополнительно обучают на человеческих предпочтениях. В человеческой жизни это примерно тот момент, когда родитель говорит подросшему ребёнку: «Задавать такие вопросы нетактично» или «Не нужно соглашаться со всем подряд, лишь бы мне понравиться». И вот тут возникает проблема: мы хотим изменить распределение вероятностей поведения модели при этом её не сломав и не разрушив её запас знаний и возможностей. Например, раньше на некоторый запрос модель могла выдать условное распределение вероятностей: ответ A — 40% ответ B — 30% ответ C — 20% отказ отвечать — 10% После Alignment мы хотим сделать предпочтительный с точки зрения "воспитания" ответ более вероятным: ответ A — 70% ответ B — 15% ответ C — 10% отказ отвечать — 5% Но возникает естественный вопрос: a насколько сильно мы вообще изменили исходную модель? Не сломали ли её? И вот здесь нам наконец понадобится интересный математический момент: расстояниe между распределениями вероятностей. Ну все же знают как посчитать расстояние между двумя точками, а как между двумя распределениями вероятностей? 4️⃣KL-дивергенция: измеряем, насколько сильно мы изменили модель воспитанием? Представим, что Pre-trained модель — это наш ребёнок. У него уже есть огромный запас знаний, привычек, способов формулировать мысли и представлений о том, какие продолжения текста вероятны. Теперь мы начинаем его воспитывать. Мы хотим изменить его поведение — но не хотим случайно стереть всё остальное. Нам нужна метрика, которая отвечает на вопрос: «Насколько новое вероятностное распределение отличается от исходного?» И вот здесь появляется дивергенция Кульбака — Лейблера (KL-divergence). Мы сравниваем два распределения вероятностей одной и той же модели: P_ref — распределение исходной, предобученной модели, которую мы берём за точку отсчёта; P_policy — распределение той же модели после дальнейшего обучения на предпочтениях, то есть нашей aligned (выравненной, "воспитанной") модели. Формально: D_KL(P_policy || P_ref) = Σₓ P_policy(x) · log(P_policy(x) / P_ref(x)) Здесь x — конкретный возможный токен, P_policy(x) — вероятность этого токена у новой модели, а P_ref(x) — вероятность того же токена у исходной модели. Мы проходим по всем возможным токенам и смотрим, насколько новая модель изменила их вероятности относительно исходной. Иными словами, D_KL отвечает на вопрос: «Насколько сильно после файн-тьюнинга мы изменили поведение модели по сравнению с исходной?» Продолжение 👇
57
8
Психопатологии искусственных нейросетей: как математика учит ИИ лгать, льстить и галлюцинировать или Заметка про математические основы выравнивания (Alignment) 1/3 Дорогие друзья, в этот солнечный выходной день поговорим о психопатологиях искусственных нейросетей и проблеме выравнивания (Alignment). Да-да, вы не ослышались — именно о психопатологиях искусственных нейросетей. Конечно, это метафора: у нейросети нет психики в человеческом смысле. Но(!) некоторые устойчивые патологические режимы поведения удивительно напоминают человеческие. Прежде чем разбираться с этими вопросами, для тех из наших уважаемых коллег, кто хочет освежить в памяти, что же всё-таки происходит у нейросети «под капотом», начнём с самого главного: языковая модель моделирует мир через предсказание. 1️⃣ Мир как вероятностное предсказание Представьте, что мы даём модели начало фразы: «На столе лежит красное…» Что модель делает дальше? Она не ищет единственное заранее записанное продолжение. Она оценивает вероятности разных вариантов: яблоко — вероятность 0.72 вино — вероятность 0.08 трактор — вероятность 0.00001 … То есть модель в каждый момент строит распределение вероятностей следующего токена. И это гораздо важнее, чем кажется. Вместо того чтобы хранить мир в виде набора правил: «после слов “красное яблоко” всегда должно идти …» модель учится приближать статистическую структуру языка и окружающего нас мира: если дан такой контекст, какие продолжения наиболее вероятны? Поэтому в самом упрощённом смысле LLM можно рассматривать как машину, которая моделирует мир через последовательное вероятностное предсказание. А обучение этой машины во многом напоминает воспитание ребёнка: сначала мы учим его языку и базовым закономерностям мира, потом — правилам общения, а затем пытаемся сформировать желательное поведение. 2️⃣ Pre-training и Backpropagation: учим ребёнка говорить На этапе pre-training (предварительного обучения) модели скармливают гигантские объёмы текстов. Она видит контекст, скрытый токен и пытается угадать, что должно стоять на его месте. Например: «На столе лежит красное ___» Модель выдаёт целое распределение вероятностей возможных токенов. Чтобы понять, насколько хорошо она угадала правильный ответ, используется категориальная кросс-энтропия: Loss = -log(P_model(y_true | x)) Смысл этой формулы проще чем она выглядит: x — контекст, например: «На столе лежит красное…»; y_true — правильный токен, который действительно был в обучающем тексте, например «яблоко»; P_model(y_true | x) — какую вероятность сама модель присвоила правильному токену, увидев контекст x. А зачем здесь логарифм? Потому что нам нужно превратить вероятность правильного ответа в штраф: чем меньше вероятность, которую модель дала правильному токену, тем больше должен быть Loss (штраф). То есть функция Loss оценивает уверенность модели в правильном ответе и штрафует её тем сильнее, чем меньше вероятность, которую она ему присвоила. Это важный нюанс: кросс-энтропия не просто спрашивает «угадала ли модель?» Она смотрит на другое: «Какую вероятность ты присвоила правильному ответу?» И это принципиальная разница. Допустим, правильный токен — 🍎 «яблоко». Если модель считает: 🍎 яблоко — вероятность 0.99 то Loss почти нулевой: -log(0.99) ≈ вероятность 0.01 Если модель не уверена: 🍎 яблоко — вероятность 0.20 то ошибка уже заметная: -log(0.20)≈1.61 Но если модель практически уверена в неправильном варианте, что на столе лежит красный трактор: 🚜 трактор — вероятность 0.99999 🍎 яблоко — вероятность 0.00001 то штраф становится огромным: -log(0.00001)≈11.5 То есть для кросс-энтропии принципиальна не просто правильность или неправильность, а степень уверенности модели в правильном варианте. Можно ошибиться неуверенно — и получить небольшой штраф. Можно ошибиться очень уверенно — и получить огромный. Именно поэтому кросс-энтропия особенно сильно наказывает уверенные ошибки. Продолжение 👇
75
9
#НастроениеВторника
#НастроениеВторника
149
10
И ещё очень рекомендую свежий, подробный и не черезмерно технический текст Теренса Тао о том, как развивалась задача Какеи и почему результат Ван и Цаля так важен: Rotating needles in space: the road to the Kakeya conjecture, and why it matters. В ближайшие дни разберём и работы трёх других лауреатов Филдсовской медали 2026 года.
195
11
Продолжение. Начало тут 👆 4/4 А что будет в трёх измерениях? Представим теперь не стол, а всё пространство. Нам нужно множество, которое содержит отрезок в каждом возможном направлении в 3D. Оно вполне может иметь нулевой объём. Но может ли его фрактальная размерность быть, например, 2,5? Или 2,99? Или вообще сколь угодно близкой к двум? Математики были убеждены, что нет. Они предполагали, что такая конструкция обязательно должна иметь полную размерность 3. Это и есть трёхмерная гипотеза Какеи. И именно её — спустя десятилетия попыток — в 2025 году доказали Хун Ван и Джошуа Цаль. 3️⃣ От иголки к Фурье и волнам И вот здесь история становится ещё интереснее. Хун Ван — специалист по гармоническому анализу. Если очень грубо, это область математики, которая пытается понять сложные функции через их составляющие — например, через волны. И выясняется удивительная вещь. Во многих задачах математик фактически сталкивается с огромным количеством длинных тонких трубок, направленных в разные стороны. Каждая трубка соответствует определённой волновой компоненте. А чтобы понять, как ведёт себя вся система, нужно понять: как эти трубки могут пересекаться, группироваться и концентрироваться в пространстве? И тут внезапно оказывается, что перед нами практически та же геометрия, что и в задаче Какеи. Отсюда и возникает глубокая связь между вроде бы совершенно разными вещами: Фурье-анализ → волны → трубки → геометрия → множества Какеи. Сама Ван рассказывала, что именно через гармонический анализ пришла к задаче Какеи. В частности, её интересовали функции, которые можно разложить на волновые компоненты, каждая из которых соответствует длинной тонкой трубке; чтобы понять поведение таких функций, приходится понимать геометрию этих трубок. И это одна из причин, почему задача Какеи настолько важна. Она оказалась не изолированной головоломкой про иголку. Она лежит в основании целой башни других математических проблем. То есть перед нами не история: «Была одна нерешённая задача → Хун Ван решила её → получила медаль». Скорее это история о том, как разные области математики неожиданно начали сходиться в одной точке. И здесь особенно хорошо видно, как работает современная математика. Задача, которая начиналась как вопрос: «Как повернуть иголку?» через сто лет оказывается связана с: Фурье-анализом, волновыми уравнениями, фракталами, геометрией меры, комбинаторикой и теорией распространения волн. А методы, которые математики разрабатывали для одной проблемы, начинают работать в совершенно других местах. Есть ещё одна деталь, которую я очень люблю в этой истории. Ван и Цаль опубликовали свою работу в феврале 2025 года. Это 127-страничное доказательство, которое на тот момент ещё не прошло полноценную проверку рецензированием. Но специалисты уже тогда оценивали его как выдающийся и крайне инновационный результат. CNRS прямо называет работу кульминацией нескольких десятилетий прогресса, связанного другими математиками: среди прочих, с Бургеном, Вольфом, Кацем, Лабой, Тао и Ларри Гутом. И это тоже красиво. Потому что сама Хун Ван говорит о своей работе довольно скромно: ей повезло иметь инструменты, которые до неё создали другие математики. А математика вообще довольно коллективная штука. Иногда ты строишь один этаж. Кто-то до тебя построил девять предыдущих. А потом выясняется, что именно тебе выпало поставить крышу. ◆
181
12
Продолжение. Начало тут 👆 3/4 И тут возникает следующий вопрос. Если площадь нам больше ничего не говорит о множестве, то на
Продолжение. Начало тут 👆 3/4 И тут возникает следующий вопрос. Если площадь нам больше ничего не говорит о множестве, то насколько большим является такое множество на самом деле? 2️⃣ От площади к фрактальной размерности Представьте обычную линию. У неё размерность 1. У поверхности — 2. У куба — 3. Но существуют объекты, которые находятся где-то между этими категориями. Например, знаменитый треугольник Серпинского или снежинка Коха (см. картинку 👆). У них площадь может быть нулевой, но они всё-таки явно «толще», чем обычная линия. Для описания этой степени «толщины» математики используют фрактальную размерность. И тогда задача Какеи превращается в гораздо более интересную: Если множество в плоскости содержит отрезок каждого направления, насколько маленькой может быть его фрактальная размерность? В 1971 году Рой Дэвис доказал, что в двумерном случае она не может быть меньше 2. То есть площадь может быть нулевой, но само множество всё равно имеет полную размерность пространства. Продолжение тут 👇
142
13
Продолжение. Начало тут 👆 2/4 Начнём с двумерного случая. Кладём иголку на стол и вращаем. Kакую минимальную площадь должен
Продолжение. Начало тут 👆 2/4 Начнём с двумерного случая. Кладём иголку на стол и вращаем. Kакую минимальную площадь должен иметь стол, чтобы на нём это можно было сделать? На первый взгляд ответ очевиден — круг диаметром с иголку. Но математика, как это часто бывает, решила испортить очевидный ответ. Оказалось, что существуют гораздо более экономные фигуры. Например, специальная трёхлепестковая фигура — дельтоида — позволяет уменьшить площадь примерно вдвое (см. картинку 👆). Казалось бы, осталось только найти идеальную форму и доказать, что она действительно минимальна. И вот здесь начинается самое интересное: никакой минимальной площади не существует. Оказывается, можно построить множество, которое имеет сколь угодно маленькую площадь, но при этом содержит отрезок в каждом направлении! То есть можно взять объект, который по площади практически «ничего не весит», и всё равно умудриться разместить внутри него иголки абсолютно во всех направлениях. Продолжение тут 👇
104
14
Как повернуть иголку во все стороны и почти не занять места 🪡 1/4 Сегодня поговорим о ещё одном лауреате Филдсовской медали
Как повернуть иголку во все стороны и почти не занять места 🪡 1/4 Сегодня поговорим о ещё одном лауреате Филдсовской медали 2026 года. На этот раз — о Хун Ван, профессоре NYU и постоянном профессоре IHES, которая, кроме прочего, решила и трёхмерный случай знаменитой гипотезы Какеи — задачи, сопротивлявшейся математикам больше века. 1️⃣Задача об иголке (гипотеза Какеи) Начнём с совершенно детского вопроса: Какую минимальную площадь нужно занять, чтобы повернуть иголку так, чтобы она побывала во всех возможных направлениях? Именно эту задачу в 1917 году поставил японский математик Соитиро Какея. Если иголка лежит на столе, всё понято: покрутили — она заметает некоторую область. Но дальше математика, как это часто бывает, начинает издеваться над нашей интуицией. Продолжение тут 👇
134
15
Для тех коллег, которые давно на нас подписаны, не секрет: частенько наша прозорливость (от которой мы сами временами офигеваем) позволяет нам замечать важные научные тренды и обращать на них внимание наших уважаемых подписчиков задолго до того, как они добираются до большой прессы. Больше года назад мы разбирали работу Юй Дэна и его коллег, посвящённую одной из самых фундаментальных задач современной математической физики — шестой проблеме Гильберта. Речь шла о связи между двумя совершенно разными картинами мира: с одной стороны — законы Ньютона и движение отдельных молекул, с другой — температура, давление и привычные нам уравнения термодинамики и гидродинамики. Тогда это выглядело как довольно специальная математическая история. А 23 июля 2026 года Юй Дэн получил за работы в этом направлении престижнейшую математическую награду — медаль Филдса (Нобелевская премия для математиков). Кстати, медаль Филдса вручают не каждый год, а раз в четыре года, в рамках Международного конгресса математиков. В этом году её получили сразу четыре математика. И вот что забавно: несмотря на масштаб награды, имена этих людей и результаты, за которые они её получили, Telegram каналы освещают эту тему как-то слабо. А ведь за каждым из этих четырёх имён стоит совершенно безумная история — проблемы, над которыми математики бились десятилетиями, неожиданные связи между совершенно разными областями и результаты, которые ещё долго будут определять развитие науки. Ну а поскольку вы, друзья, подписаны на самый шикарный и кошерный канал, который только есть в Telegram, мы просто обязаны продолжить эту тему. В ближайшие дни разберём подробнее и остальные три Филдсовские награды 2026 года — чтобы наконец выяснить, за что именно этим людям дали «математические Нобели» и почему это вообще так интересно. А пока — наш разбор работы Юй Дэна, опубликованный задолго до того, как за эту тему ему вручили медаль Филдса: [ссылка], [ссылка]. #Math #MathPhysics #FieldsMedal
155
16
4/4. Продолжение. Начало тут 👆 1. Архивная память ДНК невероятно плотна как носитель информации. В 2016 году была продемонстрирована технология DNA Fountain, показавшая возможность хранения цифровых данных в синтетической ДНК с очень высокой плотностью и устойчивостью к ошибкам. В теоретических оценках плотность хранения ДНК достигает порядка сотен петабайт на грамм. Это совершенно другой масштаб, чем привычные нам электронные носители. А биологический мир уже демонстрирует впечатляющую долговечность молекулярной информации: ДНК из древних останков удаётся извлекать спустя десятки и сотни тысяч лет при подходящих условиях сохранения. Но здесь тоже нет магии, которая решила бы все вычислимые проблемы бесплатно. Синтез дорог. Запись медленная. Чтение требует секвенирования. Случайный доступ и исправление ошибок остаются сложными инженерными задачами. Поэтому ДНК выглядит не как замена SSD в ноутбуке, а скорее как потенциально интересный архивный носитель огромной плотности. В электронном компьютере мы перемещаем электроны. В DNA computing мы можем использовать саму динамику молекулярного взаимодействия. Например, strand displacement позволяет одной цепи ДНК вытеснять другую благодаря различиям в стабильности связанных состояний. Из таких реакций можно строить логические схемы. А дальше возникает совершенно другая архитектура вычислительной системы: не CPU → память → шина → программа, а молекула → молекула → реакция → состояние системы. В 2018 году исследователи из Caltech продемонстрировали молекулярную нейронную сеть на основе DNA strand displacement, которая в эксперименте классифицировала рукописные цифры MNIST. Время вычисления? Около нескольких часов. По меркам GPU — катастрофа. По меркам молекулярной диагностики для медицинских целей — уже совсем другой вопрос. Потому что здесь скорость вычисления может быть не главным параметром. Если вычислительная система находится непосредственно в биохимической среде, она потенциально может анализировать молекулярные маркеры и реагировать на них. И тогда появляется совершенно другой класс приложений: обнаружить комбинацию молекулярных сигналов → выполнить логическое условие → инициировать биологический ответ. Это уже не «медленный компьютер». Это компьютер, встроенный в биохимическую среду, которую он наблюдает. Финал И вот здесь для меня вся история с кремнием, квантами и ДНК складывается в одну картину. Мы часто спрашиваем: «Какой компьютер самый мощный?» Но это не совсем правильный вопрос. Правильнее спросить: «Какой физический субстрат лучше всего подходит для данного типа вычисления?» • Кремний великолепен там, где нужны скорость, точность, универсальность и масштабируемая инженерия. • Квантовые системы интересны там, где структура задачи позволяет использовать интерференцию и квантовые алгоритмы. • ДНК и другие молекулярные системы интересны там, где нужны экстремальная плотность, массовый молекулярный параллелизм или вычисление непосредственно в биохимической среде. И всё это возвращает нас к одной довольно красивой мысли. Смена субстрата меняет экономику вычисления, его архитектуру и доступные ускорения. Но она не отменяет фундаментальные барьеры сложности, которые диктует математика. Можно заменить классические регистры на кубиты. Кубиты — на молекулы. Молекулы — на химические реакции. Можно построить компьютер из чего угодно, что позволяет физика. Потом тихо открыть учебник по теории сложности. И обнаружить, что Вселенная всё равно выставила счёт. А Усердный Бобёр тем временем просто улыбается в сторонке.
154
17
3/4. Продолжение. Начало тут 👆 Но дальше физика снова выставляет счёт. Квантовые состояния чрезвычайно чувствительны к шуму и взаимодействию с окружающей средой: декогеренция, ошибки вентилей, ошибки измерений и необходимость коррекции ошибок. Теорема о запрете клонирования тоже не позволяет решить проблему в лоб: неизвестное квантовое состояние нельзя просто скопировать сколько угодно раз и использовать копии как резервные. Поэтому физический кубит — очень хрупкая вещь.Чтобы получить надёжный логический кубит, приходится использовать много физических кубитов и сложные схемы коррекции ошибок. Квантовый компьютер действительно меняет вычислительную архитектуру. Но он не меняет цену, которую прийдётся заплатить за его физическую реализацию. Часть 3. Хорошо. А если вообще отказаться от кремния? И вот здесь становится особенно интересно. Потому что существует целый океан так называемого unconventional computing: мемристоры, оптические вычисления, клеточные автоматы, химические компьютеры, квантовые системы и, конечно, ДНК-вычисления. На первый взгляд идея кажется безумной: зачем вычислять битами, если можно вычислять молекулами? Молекулы ДНК обладают одним свойством, которое делает их очень необычным вычислительным субстратом: молекулы можно массово синтезировать, комбинировать, сортировать и считывать. То есть вместо одного быстрого процессора мы потенциально получаем огромное количество молекулярных объектов, работающих параллельно. И в 1994 году Леонард Эдлман показал, насколько эффектной может быть эта идея. Он закодировал вершины и рёбра графа в молекулах ДНК и использовал биохимические операции для решения небольшой задачи о гамильтоновом пути в абстрактной математической структуре - в графе. Масштаб был крошечным. Но концептуально это было прекрасно: мы заставили биохимию выполнять алгоритм. Часть 4. ДНК не покорила NP И здесь начинается место, где научпоп обычно делает слишком большой прыжок. После экспериментов с DNA computing периодически появлялся заголовок: «ДНК-компьютер решит NP-полные задачи!» Нет. ДНК-вычисления не обошли NP-полноту. Они просто предложили очень необычный способ перебора огромного количества кандидатов. Если у нас есть N вариантов, молекулярный параллелизм может быть невероятно мощным. Но количество вариантов растёт слишком быстро. Для факториального перебора: • 7! = 5 040 • 10! = 3 628 800 • 20! ≈ 2.4 × 10¹⁸ • 100! ≈ 10¹⁵⁸ • 200! ≈ 10³⁷⁵ И тут возникает очень неприятный вопрос: где взять физическую материю для такого количества вариантов (200! ≈ 10³⁷⁵)? Чтобы просто физически уместить столько ДНК-молекул в пробирку для полного перебора, масса раствора должна превышать массу всей обозримой Вселенной в 10³²⁸ раз. Молекулярный параллелизм не отменяет комбинаторный взрыв. Он просто позволяет некоторое время посмотреть на него свысока. До какого-то размера задачи, довольно небольшого. Давайте снимем розовые очки. Часть 5. А теперь появляется настоящий злодей Даже если дать нам идеальную пробирку, идеальные ферменты и бесконечно много молекул, остаётся теория вычислимости. Тут в комнату заходит Busy Beaver — Усердный Бобёр. Бобёр начинает невинно: берём все останавливающиеся программы определённого размера и спрашиваем: какое максимальное количество работы может выполнить такая программа перед остановкой? А дальше математика начинает откровенно издеваться. Busy Beaver растёт быстрее любой вычислимой функции. Не просто экспоненты. Не просто башен степеней. Любой вычислимой функции. И вот здесь становится особенно красивым различие между двумя вопросами: • Что можно вычислить в теории? (отвечает теория вычислимости) • Что можно вычислить на практике? (отвечает физика) А между ними находится гигантская территория, которую изучает теория сложности вычислений. Часть 6. И всё-таки: зачем нам ДНК в вычислениях? После всего этого можно было бы решить, что DNA computing — просто красивая научная игрушка. Но именно здесь начинается самое интересное. Потому что сильная сторона ДНК может находиться вовсе не в попытке заменить кремниевые вычисления на основе CPU. Продолжение 👇
105
18
2/4. Продолжение. Начало тут 👆 Итак, погнали! Что же такое вычисления и что такое компьютер? За пределами теоретической информатики слово «компьютер» всё ещё вызывает в воображении либо шумную коробку с вентиляторами под столом, либо фольклорного «квантового монстра», который вот-вот выйдет из секретной лаборатории и сломает мировую криптографию. А ведь компьютер — это не просто коробка с микросхемами и проводами. Это физическая система, реализующая вычисление. И если начать смотреть на вычисления именно так, привычная картина внезапно становится гораздо интереснее. Не только кремниевые чипы, а и квантовые состояния, молекулы ДНК, химические реакции — совершенно разные физические субстраты могут реализовывать вычислительные процессы, в точности те же, что и обычный ПК или универсальная машина Тьюринга. И тут возникает красивый вопрос: а может ли новый субстрат как квантовые вычисления или ДНК-вычисления с помощью молекул в пробирке дать нам принципиально новый компьютер? Короткий ответ: иногда — новый класс возможностей. Но не в том смысле, в котором нам хотелось бы. Часть 1. Чёрч, Тьюринг и Дойч: Вселенная не даёт нам магии Начнём с фундаментального уровня. Классический тезис Чёрча — Тьюринга говорит о том, что эффективно вычислимые функции могут быть описаны универсальными формальными моделями вроде машины Тьюринга. Но физика добавляет более амбициозный вопрос: существует ли физический процесс, который принципиально невозможно эффективно смоделировать универсальным компьютером? Мы уже несколько раз пытались атаковать эту тему, например здесь и здесь. Именно в этом контексте появляется физическая версия тезиса Чёрча — Тьюринга, связанная, в частности, с Дэвидом Дойчем и развитием идеи универсального квантового компьютера. В рамках известных нам физических моделей разные вычислительные субстраты не дают нам машины, способной решить фундаментально невычислимую задачу. Ни кремний, ни квантовый компьютер, ни ДНК не отменяют невычислимость проблемы остановки Тьюринга. Новая физика не превращает невычислимое в вычислимое. Так что оставим глобально невычислимые проблемы и обратимся к алгоритмически вычислимым. И тут начинается самое интересное. Потому что между «можно вычислить в теории» и «можно вычислить за разумные ресурсы» лежит практически вся компьютерная наука. Часть 2. Вселенная выставляет счёт за вычисление Если мы остаёмся в рамках вычислимых задач, вопрос звучит иначе: сколько времени, памяти, энергии и прочих физических ресурсов мы должны заплатить за вычисление? И вот здесь каждый вычислительный субстрат получает свой персональный троллинг от Вселенной. 1. Кремний: физика говорит «быстрее уже нельзя» Современный компьютер построен на удивительно простом принципе: управляем движением зарядов и используем транзисторы для реализации логики. Но чем меньше становятся элементы, тем больше появляется неприятных физических эффектов: туннелирование, утечки, тепловыделение, ограничения плотности энергии, проблемы межсоединений. На фундаментальном уровне термодинамика тоже напоминает о себе: необратимое стирание информации имеет минимальную энергетическую цену — предел Ландауэра. Мы, конечно, ещё очень далеки от буквального достижения этого предела в обычном компьютере. Но сама идея прекрасна: информация не существует отдельно от физики. 2. Квантовый компьютер: «хорошо, попробуем другую физику» Квантовая механика предлагает нечто действительно необычное. Состояние N кубитов живёт в пространстве размерности 2ᴺ. Но здесь важно не впасть в популярный миф: квантовый компьютер не просто вычисляет все 2ᴺ вариантов одновременно, а потом читает правильный ответ. Вся сила — в управлении амплитудами и интерференцией. Правильно построенный алгоритм усиливает нужные ответы и подавляет ненужные. Поэтому существуют задачи, где квантовый компьютер получает принципиальное ускорение. Классический пример — алгоритм Шора для факторизации. Продолжение тут 👇
94
19
Зарисовка о природе вычислений или Рассказ о том, как нас троллит Вселенная 1/4 Ничто нас с коллегами не забавляет больше, че
Зарисовка о природе вычислений или Рассказ о том, как нас троллит Вселенная 1/4 Ничто нас с коллегами не забавляет больше, чем досужие разговоры о новом квантовом или ДНК-суперкомпьютере, который вот-вот, не сегодня так завтра решит всю математику. Я уж молчу про свидетелей секты AGI, которые не считают джоулей и киловатт и верят, что нейросеть на кремниевых чипах догонит и перегонит миллионы лет эволюции биологических систем. Причина этого постоянного парада техно-иллюзий проста: человеческий мозг панически боится признавать собственные ограничения. Признаться себе в том, что Вселенная построена на нелинейных сложностных барьерах, а комбинаторный взрыв нельзя просто «объехать на кривой козе» нового вычислтельного субстрата — неприятно. Куда комфортнее уверовать в очередную технологическую религию. Продолжение тут 👇
133
20
Как заинтересовать детей математикой? #НастроениеПятницы
Как заинтересовать детей математикой? #НастроениеПятницы
197