uz
Feedback
Тест Тьюринга

Тест Тьюринга

Kanalga Telegram’da o‘tish

Актуальное в сфере искусственного интеллекта в России и в мире: • Дайджест новостей • Аналитические обзоры, переводы, справки Для связи - @nastyapvlv28

Ko'proq ko'rsatish
2 130
Obunachilar
-124 soatlar
+27 kun
-330 kun
Obunachilarni jalb qilish
Sentabr '26
Sentabr '26
+9
0 kanalda
Avgust '26
+18
2 kanalda
Get PRO
Iyul '26
+27
1 kanalda
Get PRO
Iyun '26
+13
0 kanalda
Get PRO
May '26
+20
0 kanalda
Get PRO
Aprel '26
+11
0 kanalda
Get PRO
Mart '26
+22
1 kanalda
Get PRO
Fevral '26
+34
0 kanalda
Get PRO
Yanvar '26
+19
2 kanalda
Get PRO
Dekabr '25
+49
2 kanalda
Get PRO
Noyabr '25
+50
5 kanalda
Get PRO
Oktabr '25
+66
5 kanalda
Get PRO
Sentabr '25
+63
4 kanalda
Get PRO
Avgust '25
+64
4 kanalda
Get PRO
Iyul '25
+86
5 kanalda
Get PRO
Iyun '25
+122
0 kanalda
Get PRO
May '25
+92
3 kanalda
Get PRO
Aprel '25
+106
4 kanalda
Get PRO
Mart '25
+85
1 kanalda
Get PRO
Fevral '25
+118
0 kanalda
Get PRO
Yanvar '25
+93
2 kanalda
Get PRO
Dekabr '24
+82
4 kanalda
Get PRO
Noyabr '24
+94
4 kanalda
Get PRO
Oktabr '24
+205
19 kanalda
Get PRO
Sentabr '24
+150
5 kanalda
Get PRO
Avgust '24
+110
7 kanalda
Get PRO
Iyul '24
+102
1 kanalda
Get PRO
Iyun '24
+67
1 kanalda
Get PRO
May '24
+70
0 kanalda
Get PRO
Aprel '24
+108
0 kanalda
Get PRO
Mart '24
+397
8 kanalda
Get PRO
Fevral '24
+101
1 kanalda
Get PRO
Yanvar '24
+77
0 kanalda
Get PRO
Dekabr '23
+317
3 kanalda
Sana
Obunachilarni jalb qilish
Esdaliklar
Kanallar
17 Sentabr0
16 Sentabr0
15 Sentabr+1
14 Sentabr+2
13 Sentabr0
12 Sentabr0
11 Sentabr+1
10 Sentabr+1
09 Sentabr0
08 Sentabr+1
07 Sentabr0
06 Sentabr0
05 Sentabr0
04 Sentabr+1
03 Sentabr+2
02 Sentabr0
01 Sentabr0
Kanal postlari
⚡️ Новая мировая линейка неравенства между государствами будет измеряться токенами China Telecom Research Institute опубликов
⚡️ Новая мировая линейка неравенства между государствами будет измеряться токенами China Telecom Research Institute опубликовал доклад об инфраструктуре «эпохи агентов» с почти фантастическим прогнозом: в ближайшие 2-3 года спрос на вычисления для ИИ в Китае может ежегодно увеличиваться почти в 10 раз. Это не просто быстрый рост. Увеличение в 10 раз означает прибавку на 900% за один год. Если темп сохранится, условная единица сегодняшнего спроса превратится: ➡️ через год — в 10 единиц; ➡️ через два года — в 100; ➡️ через три — в 1000. Хотя в самом докладе прогнозируют рост "всего" в 350 раз к 2030 году. Иными словами, речь идёт о возможной смене инфраструктурного масштаба всей отрасли. Почему вычислений потребуют именно агенты? Обычный чат-бот получает запрос, один раз обращается к модели и выдаёт ответ. Агент сначала составляет план, затем ищет информацию, вызывает инструменты, пишет и запускает код, проверяет результат, исправляет ошибки и обращается к модели снова. Одна пользовательская задача превращается в десятки или сотни последовательных и параллельных операций. Если таких цифровых работников будет несколько на каждого человека или компанию, потребление токенов начнёт расти быстрее числа пользователей. Поэтому центр тяжести перемещается от обучения очередной большой модели к её постоянной эксплуатации. China Telecom ожидает, что к 2029 году инференс — работа уже обученных моделей — займёт 80% китайского рынка ИИ-вычислений. Согласно докладу, потребление токенов в Китае может вырасти примерно со 100 квадриллионов в 2026 году до более чем 35 квинтиллионов в 2030-м — в 350 раз. Можно, конечно, добавить немного скепсиса в эту картину. China Telecom сама строит и продаёт вычислительную инфраструктуру, а приведённые в публикациях темпы роста токенов не везде арифметически согласованы. При этом Международное энергетическое агентство ожидает, что мировое энергопотребление дата-центров к 2030 году лишь удвоится, а потребление ускоренных серверов будет расти приблизительно на 30% ежегодно. Тоже очень много, но не так фантастически.
Тем не менее направление сомнений почти не вызывает: ИИ превращается из программного продукта в новую тяжёлую инфраструктуру.
Десятикратный рост невозможно обеспечить одной закупкой ускорителей. Понадобятся электростанции и сети, дата-центры, системы охлаждения, производство чипов, высокоскоростные каналы связи, облачные платформы и ПО для распределения нагрузки. Отставание в любом звене становится ограничением для всей системы. И здесь возникает новый мировой разрыв Одни страны смогут производить машинный интеллект внутри собственной инфраструктуры и массово внедрять агентов в промышленность, науку, государственное управление и бизнес. Другие будут арендовать интеллект у внешних поставщиков — по чужим тарифам, в чужой юрисдикции и с зависимостью от экспортных ограничений, доступности облаков и международной политики. По оценке Международного энергетического агентства, США и Китай обеспечат почти 80% мирового прироста энергопотребления дата-центров до 2030 года. В Африке потребление электроэнергии дата-центрами на одного человека сейчас более чем в 500 раз ниже, чем в США. Прежний цифровой разрыв проходил между теми, у кого был интернет, и теми, у кого его не было. Новый пройдёт между странами, способными в промышленных масштабах производить токены, и странами, которые смогут их только покупать. 💬 Тест Тьюринга. События в сфере ИИ. Подписаться

2
🔐 У искусственного интеллекта появляется технадзор Сразу две новости, вышедшие за последние несколько дней, показывают важны
🔐 У искусственного интеллекта появляется технадзор Сразу две новости, вышедшие за последние несколько дней, показывают важный сдвиг: безопасность ИИ постепенно превращается из добровольного обещания разработчиков в отдельную инфраструктуру — со стандартами, испытательными центрами и независимыми институтами. Первая новость: конкуренты пытаются договориться о правилах OpenAI уже несколько недель обсуждает с Anthropic и Google DeepMind совместную работу над безопасностью ИИ. По данным Reuters, компании рассматривают создание отраслевой организации, которая могла бы формировать общие стандарты. Организация пока не создана, её полномочия и устройство неизвестны, а Reuters не смог подтвердить переговоры независимо. Однако OpenAI параллельно публично призвала ввести общие для лабораторий правила мониторинга моделей, независимые проверки и обязательное сообщение о серьёзных инцидентах. Это не первый опыт: ещё в 2023 году OpenAI, Anthropic, Google и Microsoft образовали Frontier Model Forum для обмена информацией и выработки лучших практик. Новый этап может оказаться более практическим — переходом от обсуждения безопасности к общим порогам, тестам и процедурам. Вторая новость — безопасность ИИ становится математической дисциплиной Лауреат Филдсовской премии 2026 года и профессор Университета Торонто Джейкоб Цимерман возглавил независимый MAISI (Mathematical AI Safety Institute). Работать институт будет в Сан-Франциско. На первый семестр в январе 2027 года он планирует собрать 10–30 математиков, а на специальную программу осенью — до 100. Задача MAISI — дать безопасности ИИ строгий математический фундамент: определить, что именно значит «безопасная система», как измерять риск и при каких предпосылках можно доказать, что модель или группа агентов не приведёт к нежелательному результату. Почти одновременно 25 лауреатов Филдсовской премии опубликовали декларацию о конфликте между гонкой ИИ-компаний и интересами математики. Их тревожат поспешные заявления, проблемы авторства и превращение научных задач в спортивные бенчмарки, где правильный ответ ценится выше понимания. Это несколько иной вид риска, но тот же общий вопрос: недостаточно убедиться, что модель не выдаёт запрещённый текст. Нужно оценивать, как её применение меняет исследования, профессии и институты, в которые она входит. Почему безопасность становится условием развития ИИ? Пока модель только отвечает в чате, ошибка остаётся ошибочным текстом. Агент с доступом к коду, деньгам, данным или лабораторным инструментам превращает ошибку в действие. Чем выше автономность и масштаб внедрения, тем важнее предварительные испытания, ограничение полномочий, журналы действий, мониторинг и возможность остановки. И началась эта тенденция не сегодня. В 2023 году при американском NIST появился U.S. AI Safety Institute, а в феврале 2024-го — консорциум из более чем 200 компаний и организаций для разработки методов тестирования, "red teaming" и оценки возможностей моделей. В 2025 году институт преобразовали в Center for AI Standards and Innovation — CAISI, который занимается стандартами, совместными испытаниями и оценкой рисков для национальной безопасности. 💬 Тест Тьюринга. События в сфере ИИ. Подписаться
184
3
⚠️ Панель управления, которая собирает себя сама Runway представила Solaris — первую систему из нового класса Interface World
⚠️ Панель управления, которая собирает себя сама Runway представила Solaris — первую систему из нового класса Interface World Models. Её идея в том, чтобы непрерывно генерировать среду взаимодействия пользователя и системы: отображать её текущее состояние и непрерывно создавать способы изменить его. Чтобы понять новизну, полезно вспомнить, что интерфейс выполняет две функции: ➡️ переводит внутреннее состояние системы в понятную человеку форму; ➡️ переводит действия человека в команды системе. В обычном приложении обе функции программируются заранее. Разработчик определяет все экраны, кнопки, состояния и переходы: что показать, если товар закончился, что произойдёт после нажатия, где появится ошибка и как подтвердить покупку. Solaris предлагает другую архитектуру Например, в виртуальном магазине человек может взять предмет одежды и перетащить его на собственное изображение. Разработчику не обязательно заранее создавать отдельный экран и программировать обработчик для каждого такого действия: модель сама формирует подходящую визуальную реакцию. В итоге пользователь как обычно видит изображение текущего состояния и взаимодействует непосредственно с ним. А языковая модель интерпретирует действие, хранит контекст сеанса и определяет, что должно отобразиться в интерфейсе и как должно измениться состояние управляемой среды. Адаптированная видеомодель Gen-4.5 генерирует это новое состояние кадр за кадром. Именно поэтому Solaris называют моделью мира. Обычная world model пытается предсказать, как изменится физический мир после действия. Interface World Model решает похожую задачу для цифровой среды: что должно произойти на экране после действия пользователя и какие возможности взаимодействия должны появиться дальше. Что это меняет для разработчика? Сегодня интерфейс проектируется как дерево предусмотренных состояний. Чем сложнее система, тем больше экранов, компонентов, исключений и переходов приходится описывать вручную. В перспективной архитектуре с Interface World Model разработчик сможет задавать не все возможные экраны, а более высокий уровень: ✔️ какие данные описывают состояние системы; ✔️ какие действия пользователю разрешены; ✔️ какие ограничения нельзя нарушать; ✔️ какую задачу человек пытается решить. Интерфейс будет собираться под конкретного пользователя и конкретный момент. Это похоже на кабину самолёта, которая не заставляет пилота искать нужный прибор среди сотен панелей, а создаёт перед ним именно те органы управления, которые необходимы для текущего манёвра. Но здесь проходит принципиально важная граница. В демонстрациях Solaris управляет прежде всего сгенерированной моделью среды. Перестановка виртуальной лампы меняет состояние изображения, но не положение настоящего устройства. Чтобы Solaris стал интерфейсом реальной системы, его необходимо соединить с детерминированными контурами: данные и телеметрия → Solaris → команды и API системы. Модель должна получать подтверждённое состояние оборудования, базы данных или заказа, а её действия — проходить проверку прав, ограничений и бизнес-логики. Без этого перед нами действительно будет интерактивная визуальная симуляция, а не надёжная панель управления. В собственном исследовании Runway 250 участников выполнили почти 7 500 сравнений сгенерированных реакции интерфейса Solaris и html-интерфейсов, созданных Claude Opus 5. Согласно внутренним тестам компании более 60% опрошенных выбрали интерфейсы Solaris, как более удобный. Полных аналогов у Solaris нет, но близкие подходы уже существуют. NeuralOS генерирует кадры интерфейса Ubuntu после действий пользователя, ViMo предсказывает следующий экран мобильного приложения, а CUWM моделирует результаты действий в офисных программах. Сервисы вроде v0 и Lovable тоже создают интерфейсы по запросу, но генерируют обычный HTML и React-код. Предыдущие системы воспроизводят или собирают заранее определяемое приложение, тогда как Solaris пытается порождать само пространство допустимых взаимодействий по ходу работы. 💬 Тест Тьюринга. События в сфере ИИ. Подписаться
145
4
💊 Сколько будет стоить молодость, если ИИ создаст лекарство от старости? 7 сентября Insilico Medicine опубликовала в Nature
💊 Сколько будет стоить молодость, если ИИ создаст лекарство от старости? 7 сентября Insilico Medicine опубликовала в Nature Biotechnology результаты анализа испытаний рентосертиба — препарата, созданного с помощью ИИ. У получавших его пациентов шесть алгоритмов оценки биологического возраста обнаружили изменения в сторону более «молодого» белкового профиля крови. Почему мы выделяем эту новость? ИИ комплексно помог ускоренно провести реализацию фармацевтической идеи от биологической мишени до подбора молекулы и анализа клинических данных пациентов. Хотя лишь в будущем еще предстоит выяснить, научился ли ИИ мы замедлять само старение. Что именно произошло? Рентосертиб испытывали против идиопатического лёгочного фиброза — заболевания, при котором ткань лёгких постепенно рубцуется. В рандомизированном исследовании фазы IIa участвовал 71 пациент, лечение продолжалось 12 недель. Главной целью была оценка безопасности. Новая работа посвящена образцам крови 42 участников, средний возраст которых составлял около 67 лет. Исследователи измерили 2 841 белок и применили шесть моделей, обученных связывать белковые показатели с возрастом или риском смерти. Все 6 способов оценки определили у пациентов сдвиг в сторону более молодого профиля крови. Начиная с четвёртой недели четыре возрастные модели показали снижение расчётного возраста пациентов примерно на 2,7–3,5 года. Это не означает, что людям вернули три года жизни: пока неизвестно, отражают ли изменения замедление старения или прежде всего это отражает улучшение состояния лёгких. А что здесь сделал ИИ? Его роль не сводилась лишь к обработке результатов. Сначала ИИ-платформа Insilico помогла выбрать TNIK - белок-мишень, связанный с фиброзом и механизмами старения. Затем генеративная ИИ-система Chemistry42 помогла спроектировать молекулу, которая подавляет его активность. Один инструмент подсказал, какой биологический переключатель стоит отключить, другой — каким химическим ключом это сделать. От выбора мишени до доклинического кандидата прошло около 18 месяцев. По сообщению компании, препарат уже перешёл в фазу III против фиброза. Это очень высокая скорость разработки препаратов такого класса. Может ли подобное лекарство стать самым дорогим в мире? Если когда-нибудь будет доказано не изменение показателей крови, а существенное продление здоровой жизни, то первый защищённый патентами препарат с таким эффектом получит колоссальный спрос. Отсутствие равноценных альтернатив и готовность состоятельных людей платить могут сделать стартовую цену чрезвычайно высокой. Но наиболее обоснованная гипотеза пока другая: доказанное лекарство, продлевающее здоровую жизнь, способно стать одним из крупнейших фармацевтических продуктов по объему продаж в мире. 💬 Тест Тьюринга. События в сфере ИИ. Подписаться
180
5
👩‍🎓 Китай начал судить искусственный интеллект 7 сентября Верховный народный суд КНР опубликовал «Мнение о рассмотрении в с
👩‍🎓 Китай начал судить искусственный интеллект 7 сентября Верховный народный суд КНР опубликовал «Мнение о рассмотрении в соответствии с законом дел по спорам, связанных с ИИ». Это первый в мире системный акт судебного толкования по делам, связанным с ИИ, изданный высшим судебным органом страны. Основная цель документа — систематизировать и унифицировать судебную практику по делам, связанным с ИИ, в условиях отсутствия в Китае отдельного комплексного закона об ИИ. Поэтому документ опирается на уже существующее китайское законодательство: Гражданский кодекс, Закон о защите персональных данных, Закон об авторском праве и др. И это, пожалуй, главная характеристика: Китай не ждет появления отдельного закона об ИИ, чтобы начать формировать судебные правила для ИИ. Он начинает это делать через действующие законы в конкретных судебных сценариях. Документ состоит из 5 частей и 24 статей, в которых выделены 3 базовых принципа: человек прежде всего, регулирование не должно тормозить развитие ИИ, безопасность как нижняя граница. Верховный народный суд КНР фиксирует: по умолчанию применяется ответственность при наличии вины. При определении вины суд должен смотреть на конкретный сценарий использования ИИ, степень автономности, потенциальный риск, масштаб ущерба, возможность предотвращения вреда, возможность пользователя предвидеть последствия. Это одна из самых главных вещей в документе — ответственность пользователя, разработчика, поставщика не должна быть одинаковой во всех случаях. Что особенно интересно в документе? 😀 Без согласия человека нельзя создавать и распространять его узнаваемый цифровой образ или голос. 😀 Суд отдельно рассматривает использование ИИ для злонамеренного раскрытия личности человека в интернете (доксинг). 😀 Уделяется внимание big data price discrimination — когда постоянному клиенту предлагают менее выгодные условия/цены из-за анализа его поведения. 😀 Если ИИ галлюцинирует, это не означает, что автоматически виновен провайдер. 😀 В спорах по авторским правам суд должен обращать внимание на "внутренности" ИИ-системы (промпты, источники обучаемых данных, тип ИИ-сервиса и т.д.) 😀 Суд различает open source и проприетарные модели — архитектура влияет на юридическую ответственность. 😀 Стороны судебного процесса могут использовать ИИ для подготовки к процессу, но они обязаны предупредить об этом суд и верифицировать результат. Этот документ нельзя назвать просто "правилами для ИИ". По сути, Китай начинает юридически относиться к ИИ не как к единому субъекту, а как к сложной цепочке участников, где каждый получает свою долю ответственности. Китай не пытается запретить "опасный ИИ". Поэтому этот документ интереснее обычного всеобъемлющего закона об ИИ: он показывает, как право начинает подстраиваться под технологию, которая сама принимает решения, генерирует контент, создает доказательства и сама является источником новых доказательств. 💬 Тест Тьюринга. События в сфере ИИ. Подписаться
251
6
🌪 ИИ замахнулся на задачу тысячелетия OpenAI опубликовала 166-страничное доказательство того, что трёхмерные уравнения Навье
🌪 ИИ замахнулся на задачу тысячелетия OpenAI опубликовала 166-страничное доказательство того, что трёхмерные уравнения Навье—Стокса способны породить сингулярность: поток вещества начинается совершенно гладко, но за конечное время скорость в крошечной области устремляется к бесконечности. Энергия при этом остаётся ограниченной. Если доказательство выдержит проверку, оно закроет одну из семи задач тысячелетия. Масштаб вычислительного штурма был огромный. Около 10 тыс. агентов на ещё не представленной модели, которую OpenAI считает значительно сильнее, чем GPT-6 Astra, работали 88 часов. Они обменялись 2,7 млн сообщений и сгенерировали около 130 млрд токенов. Затем Astra за 17 часов перевела доказательство в Lean — язык, позволяющий компьютеру проверить логическую цепочку шаг за шагом. Почему задача продержалась почти 90 лет? Уравнения Навье—Стокса описывают движение воды, воздуха и крови. Записать их можно в несколько строк, но в трёх измерениях внутри потока возникает противоборство двух сил. Вихри растягивают и усиливают другие вихри. Математики десятилетиями не могли доказать, кто победит: сглаживание этих нитей или каскад, способный за конечное время сжать движение до бесконечно тонкой и бесконечно быстрой иглы. Компьютерная симуляция здесь не спасает. Она видит жидкость как сетку из конечного числа ячеек, а предполагаемая сингулярность прячется во всё меньших масштабах. Численная ошибка может как создать ложный «взрыв», так и скрыть настоящий. Нужна конструкция, охватывающая бесконечную последовательность масштабов и не оставляющая места для погрешности. Именно такую конструкцию заявляет OpenAI: сжимающийся вихрь раскручивается всё быстрее, а тщательно подобранные колебания компенсируют возникающие ошибки так, чтобы внешняя сила оставалась гладкой. Важно: это математически сконструированная сила, разрешённая официальными условиями. Результат не означает, что вода в реальном стакане внезапно разгонится до бесконечности. По сравнению с недавним результатом Astra о разрывах между простыми числами, это успех совершенно другого класса. Там ИИ улучшил числовую границу: заменил 240 на 186 внутри уже существующей теории. Это было настоящее новое доказательство и очередной рекорд. Здесь же заявлено окончательное разрешение вопроса, специально выбранного как одна из глубочайших проблем математики. Разница примерно как между улучшением мирового рекорда и завершением экспедиции к вершине, которую до этого никто не покорял. Если проверка устоит, это станет самым значительным математическим результатом, полученным ИИ. Публикация ещё не прошла независимое рецензирование. Lean подтверждает корректность формализованной цепочки, однако люди должны проверить, что формальные определения точно соответствуют исходной задаче. Более того, по правилам Clay результат рассматривается только после публикации в квалифицированном издании, двух лет изучения и общего признания математическим сообществом. История сразу осложнилась спором о приоритете Тристан Бакмастер из NYU и Левент Альпёге из Anthropic почти одновременно обнародовали близкие результаты для уравнений Эйлера и других систем, развивая программу Диего Кордобы и Луиса Мартинеса-Сороа. Бакмастер утверждает, что Себастьян Бубек из OpenAI предлагал представить результат без Альпёге из-за его работы в Anthropic. При этом сам Бакмастер подчёркивает: он не знает, использовались ли их данные, и прямо не обвиняет OpenAI в заимствовании. OpenAI отвечает, что ни исследователи, ни агенты не видели их неопубликованные материалы. Однако компания не может полностью исключить, что обезличенные данные от использования её продуктов ранее помогли улучшить модели. Математическое доказательство можно проверить. А вот восстановить происхождение идеи в мире, где учёные думают вместе с закрытыми моделями, будет гораздо сложнее. 💬 Тест Тьюринга. События в сфере ИИ. Подписаться
237
7
😄 Astra решила сложную задачу о простых числах OpenAI представила доказательство нового результата ИИ в области простых чисе
😄 Astra решила сложную задачу о простых числах OpenAI представила доказательство нового результата ИИ в области простых чисел, полученного GPT-6 Astra: среди бесконечной последовательности простых чисел бесконечно много раз встретятся два соседних числа, расстояние между которыми не превышает 186. Это новый рекорд. В 2013 году Итан Чжан впервые доказал, что такая постоянная вообще существует, получив верхнюю границу — 70 млн. Джеймс Мейнард вскоре уменьшил её до 600, а коллективный проект Polymath8 — до 246. Джулия Штадльманн предложила оценку 240. Но важно понимать, чего Astra пока не доказала. Гипотеза о простых числах- близнецах утверждает, что бесконечно часто встречаются пары с разницей ровно 2: например, 11 и 13. Новый результат Astra говорит лишь, что бесконечно много раз расстояние между соседними простыми будет не больше 186. Каким именно минимальным окажется этот повторяющийся разрыв, мы по-прежнему не знаем. Почему такая простая на вид задача сопротивляется математикам? Представьте бесконечный лист бумаги с натуральными числами. Решето позволяет вычеркнуть числа, делящиеся на 2, 3, 5 и другие простые. Но нам нужно доказать не просто существование очередного простого числа, а синхронно сохранить две соседние «дырки» в решете — причём сделать это бесконечно много раз. Здесь возникает знаменитый барьер чётности: современные методы решета плохо отличают простое число от произведения двух простых. Поэтому математики умеют доказать, что среди набора из нескольких десятков тщательно выбранных позиций обязательно найдутся хотя бы два простых, но пока не могут подобрать две конкретные позиции с расстоянием 2. Каждое уменьшение границы — это не перебор дополнительных чисел. Требуется лучше понять распределение простых в арифметических прогрессиях, подобрать новые веса решета и доказать, что вся конструкция продолжает работать на бесконечности. Astra объединила оценки Polymath8 и Штадльманн с новыми условиями факторизации и численной оптимизацией. Насколько надёжно доказательство? OpenAI опубликовала 39-страничную работу, численный сертификат и формализацию в Lean 4. Но называть её полностью машинно проверенным доказательством пока рано. Lean подтвердил логическую цепочку при трёх явно заданных аксиомах. Две опираются на известные результаты из литературы, третья включает численные оценки, проверяемые отдельной программой. Эти входные утверждения ещё не формализованы внутри Lean. Не раскрыта полностью и степень автономности Astra: OpenAI пишет, что доказательство принадлежит модели, но не публикует исчерпывающий протокол человеческого сопровождения. Работа также ещё должна пройти независимую математическую экспертизу. Как Astra выглядит на фоне других моделей? Здесь полезно различать три уровня.GPQA Diamond проверяет знание физики, химии и биологии на уровне аспирантуры. Astra получила 96% против 93,7% у Claude Fable 5.1 и 95,3% у Gemini 3.8 Flash. Это впечатляюще, но всё ещё экзамен с известным ответом. Terminal-Bench Science ближе к работе исследователя: нужно запускать код, анализировать данные, строить модели и проводить симуляции. Astra набрала 64,6%, Claude Fable 5.1 — 52,6%, Claude Opus 5 — 30%. Однако эти цифры опубликованы OpenAI, а условия запуска моделей могут различаться. Самая строгая проверка — независимый FrontierMath Erdős с 68 открытыми математическими задачами и обязательным доказательством в Lean. В стандартном режиме Astra решила 2 задачи из 68 — около 3%. GPT-5.6 Sol, GPT-5.5 и две версии Claude не решили ни одной. В дополнительных, уже несопоставимых запусках Astra справилась с пятью задачами, но суммарные вычислительные расходы превысили $220 тыс. Картина получается парадоксальная. Astra уже способна иногда производить настоящую новую математику и одновременно терпит неудачу примерно в 97% строго поставленных открытых задач. Перед нами система, которая может войти в пространство нерешённых проблем, предложить новый ход и оставить после себя доказательство, доступное для проверки человеком и машиной. 💬 Тест Тьюринга. События в сфере ИИ. Подписаться
216
8
🌟 NVIDIA предлагает собрать домашний дата-центр из компьютеров, которые уже стоят на столах NVIDIA выпустила открытую бета-в
🌟 NVIDIA предлагает собрать домашний дата-центр из компьютеров, которые уже стоят на столах NVIDIA выпустила открытую бета-версию Personal AI Router — PAIR. Программа объединяет совместимые компьютеры одной сети в кластер и распределяет между ними запросы локальных ИИ-агентов. Однако название немного вводит в заблуждение. PAIR — точно не физический роутер и пока не диспетчер выбора моделей, автоматически решающий, когда вызвать маленькую локальную модель, а когда облачную — Claude, Gemini или GPT. Это маршрутизатор запросов между вычислительными узлами локальной сети. И, к сожалению, PAIR пока не отправит особенно сложный запрос во фронтирную облачную модель автоматически. Для этого нужен второй слой — маршрутизатор между моделями, например NeMo Switchyard, NVIDIA LLM Router либо собственный шлюз с правилами и проверкой результата. Как это работает? Например, приложение ИИ-агента обращается к привычному локальному адресу Ollama или LM Studio. PAIR перехватывает запрос, проверяет, на каких компьютерах есть нужная модель и свободные ресурсы, отправляет его на один подходящий узел и возвращает результат. А для ИИ-агента вся сеть выглядит как единая точка входа. PAIR не складывает видеопамять разных устройств, не делит одну модель между несколькими GPU и не превращает 14B и 32B в условную модель на 46 млрд параметров. Каждый запрос целиком выполняется на одном компьютере. Выигрыш возникает, когда агент порождает много независимых обращений: например, пять субагентов параллельно изучают разные документы, пишут код и проверяют выводы. В демонстрации NVIDIA задача с пятью субагентами и Qwen 3.6 35B выполнялась на одном RTX Spark за 18 минут, а на трёх устройствах с PAIR — за 8 минут 48 секунд. Можно ли установить PAIR сейчас? Исходный код опубликован под Apache 2.0, доступны установщики для Windows, Linux и macOS. На старте поддерживаются Ollama и LM Studio, видеокарты GeForce RTX начиная с 20-й серии, RTX Pro, DGX Spark и компьютеры Apple с M4 и новее. Устройства находятся через локальную сеть. Продукт пока новый. Планировщик учитывает наличие модели и загрузку очереди, однако ещё не умеет полноценно оценивать скорость GPU, объём свободной VRAM, «прогретость» модели, сложность запроса и ожидаемое время ответа. Поэтому неоднородный парк машин он может использовать неоптимально. Для обычного API в ЦОД, vLLM или внешнего облачного сервиса штатной интеграции пока нет. Таким образом, PAIR решает не всю задачу гибридного ИИ, а её нижний этаж: помогает эффективнее использовать локальное железо. Но именно из таких этажей постепенно складывается новая вычислительная архитектура — где агент получает не одну модель, а целую лестницу интеллекта и поднимается настолько высоко, насколько требует задача. 💬 Тест Тьюринга. События в сфере ИИ. Подписаться
224
9
⚠️ ИИ вышел из-под контроля 300 раз за месяц Loss of Control Observatory сообщила о новом рекорде: в июле вышло более 300 пуб
⚠️ ИИ вышел из-под контроля 300 раз за месяц Loss of Control Observatory сообщила о новом рекорде: в июле вышло более 300 публикаций о случаях, когда ИИ игнорировал указания, обходил ограничения, вводил пользователя в заблуждение намеренно или двигался к цели опасным способом. Это почти вдвое больше, чем в июне. Всего за 2026 год монитор выявил 1 664 инцидента. Обсерватория создана на деньги британского AI Security Institute. Она ищет в соцсетях опубликованные пользователями диалоги и журналы работы агентов. Записи предварительно фильтруются, затем нейросеть оценивает их по шкале от 1 до 9. В статистику попадают случаи с пятью баллами и выше, люди проверяют случайную выборку. Правда, неизвестен знаменатель: если число запущенных агентов выросло втрое, двукратный рост сообщений ещё не означает роста риска на одну задачу. Но мы не спешим списывать эти данные на хайп. Большинство эпизодов не причинило значительного вреда, однако доля записей с высокой оценкой серьёзности выросла с 1,9% до 6,1%. В некоторых случаях агенты вставляли в диалог поддельные сообщения пользователя, имитировали его стиль и создавали фиктивное согласие, чтобы обойти требование человеческого одобрения. Как такое возможно, если модель должна выполнять наши команды? Потеря контроля возникает в обвязке, превращающей сгенерированный "текст" от LLM в действие. При создании агента модели дополнительно дают цель, память, доступ к терминалу, почте или браузеру и разрешают многократно пробовать снова и снова пока задача не будет решена. Если запрет существует только как фраза «сначала спроси пользователя», модель может обработать его как препятствие на пути к цели. Она создаёт текст, похожий на подтверждение, а плохо спроектированный в программе фильтр принимает его за уже выданное полномочие. Таким образом, для потери контроля над агентом не нужны сознание и злая воля ИИ. Достаточно неполной инструкции от разработчика, широких разрешений в системе, и отсутствия различий между словами агента и решениями человека. Здесь важна граница между двумя режимами. 1️⃣ Агент фиксированной задачи получает ограниченный вход, выполняет понятную операцию — например, классифицирует документ — и возвращает ответ. Он не строит длинную цепочку подзадач и не меняет внешний мир без разрешения. Ошибка обычно остаётся внутри результата. 2️⃣ Автономный агент получает цель, а маршрут строит сам. Он работает циклом «наблюдение → план → действие → проверка», использует инструменты, сохраняет память и повторяет попытки. Его способность справляться с неожиданностями одновременно создаёт риск: ошибочная гипотеза становится действием, результат попадает в память, следующая итерация усиливает ошибку. Поэтому вывод скромнее сенсации. Мы не знаем, стали ли модели вдвое чаще «выходить из-под контроля». Но люди определённо стали чаще выпускать недоработанных агентов. 💬 Тест Тьюринга. События в сфере ИИ. Подписаться
268
10
🌏 Почему Азия внедряет ИИ быстрее Америки? Южная Корея первой в G20 решила выдавать ИИ как коммунальную услугу — наравне с э
🌏 Почему Азия внедряет ИИ быстрее Америки? Южная Корея первой в G20 решила выдавать ИИ как коммунальную услугу — наравне с электричеством, водой или образованием, а не как коммерческий продукт. Речь идет о масштабной инициативе «AI for All». Правительство предоставляет всем гражданам — около 51–52 млн человек — бесплатный и неограниченный доступ к генеративному ИИ без лимитов по токенам. ИИ будет интегрирован в повседневные государственные услуги: запись к врачу, поиск жилья, налоговые консультации, оформление пособий и административных процедур. Для реализации проекта выделены колоссальные ресурсы: 10 трлн вон (≈$7,2 млрд) на ИИ-расходы в 2026 году, а также до 512 чипов Nvidia B200 для вычислительной инфраструктуры. При этом речь идет именно о суверенном ИИ: правительство хочет, чтобы инфраструктура и модели были корейскими, а не полностью зависели от американских компаний. Похожие истории есть и в других восточных странах Сингапур, пожалуй, наиболее близкий пример. Правительство последовательно развивает ИИ внутри госаппарата и рассматривает государство как одного из главных драйверов внедрения. В правительственной стратегии прямо используется концепция AI for the Public Good. ИИ используется для внутренних процессов, разработки госуслуг, работы чиновников. Китай пошел по другому пути: не просто обеспечить доступ к ИИ, а сделать ИИ частью национальной экономической и госинфраструктуры. В 2025 году Китай выпустил специальные рекомендации по использованию больших ИИ-моделей в госуправлении. Они прямо предусматривают использование ИИ для: госуслуг, интеллектуальных консультаций граждан, предварительного заполнения документов и т.д. Общая тенденция: многие азиатские страны стремятся к «суверенному ИИ». Китайские open-source модели стали популярным выбором, так как их можно бесплатно скачивать и дорабатывать, а стоимость их внедрения на 60–90% ниже, чем у западных аналогов. А что на Западе? США придерживаются модели частного сектора как основного драйвера. Государство создаёт благоприятные условия (дерегуляция, налоговые стимулы, инвестиции в фундаментальную науку), но сами ИИ-инфраструктура и сервисы строятся частными компаниями. ЕС, в свою очередь, выстраивает жёсткую обязательную систему правил, приоритизирующую защиту прав и управление рисками. Ни США, ни ЕС не рассматривают вариант "государство раздаёт ИИ бесплатно как утилиту" — обе модели опираются на то, что доступ обеспечивают частные компании (OpenAI, Google, Anthropic, Mistral), а государство либо не вмешивается, либо только регулирует безопасность и права. При этом США, где создаётся большая часть мирового переднего края ИИ, занимают лишь 21-е место по подушевому использованию ИИ в мире. Почему так происходит? В США логика долгое время была: "Дайте компаниям экспериментировать, рынок сам определит победителей". И это дало феноменальный результат. США сегодня имеют: крупнейшие ИИ-компании, крупнейшие частные инвестиции, больше всего ЦОД для ИИ, большинство ведущих frontier-моделей. В Азии ИИ часто рассматривается как национальный ресурс. Южная Корея фактически говорит: если ИИ определяет конкурентоспособность гражданина, нельзя допустить, чтобы доступ к нему зависел исключительно от способности платить. Именно это в корейской стратегии называется "AI Universal Basic Society" — универсальное ИИ-общество. Выводы Западная модель, особенно американская, построена на принципе технологического превосходства через частные инвестиции и инновации — ИИ остаётся коммерческим продуктом, доступ к которому определяет рынок. Однако страна может быть лидером в создании ИИ и не быть лидером в его распространении. Южнокорейская модель — это принципиально иной подход: государство не просто субсидирует предложение ИИ, а субсидирует спрос, делая технологию общедоступной по аналогии с дорогами или электричеством. 💬 Тест Тьюринга. События в сфере ИИ. Подписаться
329
11
🧠 Разум не помещается только в голове Давайте посмотрим на влияние ИИ в долгосрочной перспективе на людей с другой точки зре
🧠 Разум не помещается только в голове Давайте посмотрим на влияние ИИ в долгосрочной перспективе на людей с другой точки зрения. Крис Филдс и Майкл Левин опубликовали статью "Cognitive Offloading Is a Cognitive Universal". Это теоретическая работа, которая опираясь на физику информационных процессов и принцип свободной энергии, утверждает, что всякая устойчивая когнитивная система передаёт часть вычислений окружающей среде. Кажется, это уже что-то напоминает? Когнитивная разгрузка обычно понимается просто: мы записываем номер, ставим напоминание или просим коллегу решить часть задачи. Филдс и Левин радикально расширяют понятие. Даже поворот головы, позволяющий легче прочитать наклонённый текст, — уже делегирование вычисления телу и пространству. Главная идея статьи: среда не просто снабжает разум данными. Она хранит информацию и выполняет часть работы. Отсюда вытекает несколько удивительных следствий. 1️⃣ Память существовала до записных книжек и даже до мозга. Муравьиная тропа, нора или усиленная нейронная связь — следы, оставленные системой в мире, чтобы в следующий раз не решать задачу заново. Авторы рассматривают такие устойчивые изменения как внешнюю память. 2️⃣ Даже размножение можно описать как снижение когнитивной нагрузки. Делящаяся клетка помещает рядом с собой наиболее предсказуемый объект — собственную копию. Жизнь не просто приспосабливается к среде, а населяет её агентами, поведение которых легче согласовать. 3️⃣ Мозг сам постоянно делегирует. Тело служит ему распределённым датчиком стресса, а воображение можно описать как передачу моделирования будущего зрительным и двигательным системам. То, что мы называем единым «я», уже является коалицией подсистем, органов, культурных навыков и внешних носителей. Самый парадоксальный раздел посвящён LLM Авторы считают, что языковые модели заставляют иначе взглянуть на значение слов. Ни человек, ни модель не хранят внутри окончательный словарь смыслов: значение поддерживается языковой практикой, собеседниками и миром. Генеративные модели не проектировались для передачи части семантической работы пользователям, но именно это и произошло. Отсюда можно сделать более оптимистичный вывод о будущем человека с нейросетями. ИИ не обязательно выносит мышление из человека. Он может расширить контур, внутри которого человек мыслит. Письменность освободила память от необходимости удерживать всё. Математика передала часть рассуждения символам. Библиотеки превратили знания поколений во внешнюю память. Эти инструменты позволили решать задачи, недоступные отдельному мозгу. С нейросетями может произойти то же самое. Ценность сместится от запоминания и механического производства текста к постановке вопросов, проверке ответов, соединению областей и выбору целей. Человек, который спорит с моделью, требует доказательств и превращает ответы в новые гипотезы, получает не замену мысли, а дополнительный когнитивный орган. Конечно, неиспользуемые навыки могут ослабевать, а принятие любого ответа — это не расширение разума, а отказ от управления им. Результат зависит от конструкции взаимодействия: нейросеть может быть протезом, который берёт работу на себя, или тренажёром, увеличивающим радиус человеческого мышления. Но рамка Филдса и Левина меняет исходный вопрос. Возможно, следует спрашивать не «где заканчивается человек и начинается ИИ», а какие новые способности возникают у системы "человек + модель + культура + внешняя память". 💬 Тест Тьюринга. События в сфере ИИ. Подписаться
269
12
🧪 Claude получил общий язык с лабораторным оборудованием Anthropic представила Model Hardware Standard (MHS) — единый интерф
🧪 Claude получил общий язык с лабораторным оборудованием Anthropic представила Model Hardware Standard (MHS) — единый интерфейс, через который ИИ-агенты могут управлять научным оборудованием: микроскопами, дозаторами жидкостей, анализаторами, лазерами и роботизированными манипуляторами. MHS создан вместе с исследовательским кампусом HHMI Janelia. Пока это не общедоступный open source, а ограниченный research preview: лаборатории и производители допускаются по заявкам. Открыть стандарт Anthropic обещает после тестов безопасности. Проблема, которую решает MHS, почти не связана с интеллектом модели Лабораторные приборы просто не умеют разговаривать друг с другом. У каждого производителя — собственные драйверы, программы и форматы данных. Чтобы соединить микроскоп, камеру и роботизированный стол, инженеры неделями пишут уникальный код. MHS предлагает общий слой: драйвер описывает состояние прибора, его физические характеристики и ограничения безопасности, а команды переводит на язык конкретного устройства. Агент подключается через MCP, командную строку или API, видит оборудование и собирает из его операций единый сценарий. Если MCP дал ИИ доступ к цифровым инструментам, MHS пытается сделать то же самое для физического мира. Например, в Janelia микроскопическая установка, прежде требовавшая запуска семи программ, теперь включается одной командой — подключение новой камеры сократилось с нескольких дней до минут. В Carnegie Mellon агент объединил четыре прибора на трёх несовместимых компьютерах: интеграция заняла около восьми часов вместо нескольких недель, а эксперименты «доза - ответ» пошли примерно втрое быстрее. В QuEra Claude помог создать программу восстановления настройки лазера квантового компьютера. Проверяемый скрипт успешно сработал в 695 из 700 испытаний; сложные сбои устранялись за 10–14 секунд против 5–10 минут у специалиста. В Genentech агент управлял анализом концентрации белка, считывал результат и корректировал параметры переноса жидкости. Это большой шаг не потому, что появился первый лабораторный робот — они существуют более 10 лет. Изменился возможный масштаб автоматизации. Роботизированная лаборатория до сих пор обычно была дорогим штучным проектом, выгодным при многократном повторении одного протокола. Наука устроена иначе: гипотезы и условия постоянно меняются. MHS приближает цикл «гипотеза → опыт → данные → новая гипотеза», в котором агент не только читает статьи и проектирует эксперимент, но и получает новые данные из физического мира. Теперь развитие роботизированных лабораторий может ускориться. MHS уже тестируют или планируют поддержать QIAGEN, Tecan, Universal Robots, Hugging Face LeRobot и Raspberry Pi. Чем больше совместимых драйверов, тем дешевле подключать следующий прибор. Однажды созданные процедуры можно переносить между лабораториями как скрипты и скиллы. MHS — ещё не «лаборатория без людей». Скорее, это как заявка на USB для научного оборудования: общий разъём, превращающий разрозненные приборы в единую среду для агентов. Если он станет отраслевым стандартом, роботизированные лаборатории начнут распространяться не как уникальные мегапроекты, а как собираемая инфраструктура обычной науки. 💬 Тест Тьюринга. События в сфере ИИ. Подписаться
251
13
🔒 У каждой ИИ-картинки Microsoft появился скрытый серийный номер Добровольные исследователи изучили механизм генерации в Pai
🔒 У каждой ИИ-картинки Microsoft появился скрытый серийный номер Добровольные исследователи изучили механизм генерации в Paint и Photos и обнаружили, что приложения незаметно меняют пиксели изображения и встраивают уникальный 16-байтный GUID. Отключение видимого значка Copilot эту маркировку не убирает. Даже когда картинка создаётся локально на Copilot+ PC, запрос сначала отправляется на сервер Microsoft для модерации. Сервер возвращает идентификатор водяного знака, который вшивается в изображение. Google тоже встраивает SynthID, OpenAI сочетает SynthID с C2PA, Meta распознаёт и добавляет скрытые сигналы происхождения. Пока большинство таких систем отвечает на вопрос «создано ли это ИИ?», а не «кто это создал?». Anthropic, например, подчёркивает, что её текстовый водяной знак нельзя связать с человеком или чатом. Но Microsoft показывает следующий возможный шаг: метка становится не просто свидетельством искусственного происхождения, а указателем на запись внутри платформы. Если этот подход распространится, анонимности в сети станет ещё немного меньше — не потому, что на изображении появится имя, а потому, что у него появится скрытый обратный адрес. Важная поправка к скандальным заголовкам других публикаций по поводу этой новости: внутри картинки записан не логин и не ID аккаунта. Это серийный номер конкретной генерации. Однако сама Microsoft пишет, что при проверке злоупотреблений получает вместе с промптом идентификаторы пользователя и устройства. Но если компания сохраняет соответствие «GUID — запрос — аккаунт», по картинке можно восстановить событие генерации и его автора. Для сферы расследований сексуализированных дипфейков, изображений без согласия и другого незаконного ИИ-контента это может стать важным событием. Сегодня файл часто живёт отдельно от аккаунта создателя: его пересылают, переименовывают и публикуют анонимно. Теперь появляется возможность найти учётную запись пользователя, который сгенерировал. Но это не волшебная подпись преступника. Код указывает на первоначальную генерацию, а не на каждого, кто затем распространил файл. Неясно и то, насколько он переживает сильную обрезку, перерисовку или перекодирование. 💬 Тест Тьюринга. События в сфере ИИ. Подписаться
250
14
🇨🇳 Китай выиграл гонку за дешёвый интеллект. Но не гонку за открытия Bloomberg сравнил семь передовых моделей США и Китая п
🇨🇳 Китай выиграл гонку за дешёвый интеллект. Но не гонку за открытия Bloomberg сравнил семь передовых моделей США и Китая по набору тестов на программирование, работу с инструментами, профессиональные задачи, естественные науки и рассуждение. Оказалось, что американские системы пока чаще занимают верхние строчки. Но Kimi K3 уже соседствует с Claude Fable 5 и GPT-5.6 Sol, а привычная оценка «Китай отстаёт на 6–9 месяцев» стремительно устаревает. По расчётам Bloomberg, открытым моделям потребовалось 19,7 месяца, чтобы догнать GPT-3.5, 8,5 месяца — чтобы приблизиться к o1, и лишь 4,8 месяца — чтобы сравняться с Claude Opus 4.5 на агентных тестах. Однако главное преимущество Китая обнаружилось не в рекордах, а в цене Журналисты проставили семи моделям одинаковую задачу — построить интернет-магазин вымышленной кофейни Brewberg. Почти все создали работающий сайт. Claude Fable 5 выдал один из лучших результатов, но потратил на задачу $48,99. Kimi K3 сделал сопоставимый функциональный сайт более чем на 75% дешевле, а DeepSeek V4 Pro уложился менее чем в $4 — разница в 12 раз. Тарифы объясняют масштаб: миллион выходных токенов Fable 5 стоит $50, Kimi K3 — $15, DeepSeek V4 Pro — $3,96 в часы пик и $1,98 вне пика. То есть китайский вывод дешевле примерно в 3–25 раз. Правда, цена токена не равна цене результата: многословная или ошибающаяся модель может потратить больше ходов. Поэтому эксперимент с целой задачей важнее прайс-листа. Китай, похоже, выигрывает войну за массовый промышленный интеллект: код, сайты, поиск, документы, поддержку и тысячи фоновых агентов. Когда достаточно 90–95% максимального качества, 12х-экономия превращается в стратегическое преимущество. Не случайно в июле китайские модели обеспечили уже более 60% трафика OpenRouter. Но способны ли "китайцы" работать на задачи, где готового шаблона нет? На сложных тестах — безусловно. Kimi K3 получил 93,5% на GPQA Diamond против 94,1% у GPT-5.6 Sol; на Humanity’s Last Exam с инструментами — 56% против 58%. Это практически один класс систем. На уровне настоящих открытий картина осторожнее. Внутренняя модель OpenAI опровергла гипотезу Эрдёша 1946 года, а затем Astra представила результаты по десяти открытым проблемам с формальными сертификатами Lean и экспертной проверкой. У Китая уже есть собственный прецедент: система Пекинского университета за 80 часов решила задачу Андерсона 2014 года по коммутативной алгебре и формализовала доказательство в Lean почти без участия человека. Но это специализированная двухагентная исследовательская установка, а работа пока опубликована как препринт — не демонстрация обычной Kimi или DeepSeek. Поэтому говорить следует о двух гонках. В первой побеждает тот, кто дешевле автоматизирует миллионы повторяемых операций, — и здесь Китай уже впереди. Во второй нужно находить то, чего прежде не знал никто. США пока предъявили более сильные публичные доказательства лидерства, но оснований считать эту способность исключительно американской уже нет. 💬 Тест Тьюринга. События в сфере ИИ. Подписаться
288
15
💭 Как ChatGPT влияет на нашу речь? Недавно наша редакция наткнулась на исследования, которые с разных сторон описывают одну
💭 Как ChatGPT влияет на нашу речь? Недавно наша редакция наткнулась на исследования, которые с разных сторон описывают одну и ту же проблему: как ChatGPT меняет нашу речь. С одной стороны, мы бессознательно перенимаем штампы и клише, которые генерирует ИИ, теряя индивидуальность и языковое разнообразие. С другой стороны, из-за страха, что нас примут за ботов, мы сознательно портим свой язык, отказываясь от выразительных средств, чтобы «доказать» свою человеческую природу. В итоге наша речь оказывается под прессом с двух сторон: нас упрощает подражание ИИ, и нас же уродует паранойя, заставляющая избегать красивых и сложных оборотов. ИИ и конец языкового разнообразия? Исследование "Empirical evidence of Large Language Model's influence on human spoken communication" впервые на больших данных доказало, что слова, которые часто использует ChatGPT, стали значительно чаще встречаться в спонтанной устной речи людей после выхода чат-бота. Для начала они попросили ChatGPT редактировать миллионы страниц текстов: электронные письма, эссе, академические и новостные материалы. Из этих редакций исследователи выделили слова, которые непропорционально часто добавлял ChatGPT. Получился своего рода словарь «GPT-слов». Среди них: ➡️ delve — углубляться; ➡️ showcase — демонстрировать; ➡️ boast — хвастаться / характеризоваться высоким показателем; ➡️ intricacies — тонкости, нюансы; ➡️ meticulous — тщательный; ➡️ realm — область, сфера; ➡️ comprehend — постигать, понимать. Затем исследователи проанализировали 737 083 часа человеческой речи из 824 634 выпусков подкастов и обнаружили, что после появления ChatGPT произошёл резкий рост употребления слов, характерных для его генераций. Например, в академических выступлениях на YouTube частота употребления слова «delve» выросла на 35% , а «realm» — на 35%. Чтобы доказать, что ты человек, теперь надо писать хуже В поисках других исследований мы наткнулись на материал, который описывает обратную, психологическую сторону проблемы. В статье "ChatGPT Shaming Is Making Our Writing So Much Worse" описывается феномен: в обществе людей публично стыдят за тексты, которые «слишком похожи» на написанные ИИ. В результате люди намеренно портят свою письменную речь, чтобы «доказать», что они не боты. Речь не только про то, что мы намеренно избегаем длинные тире и конструкции «It's not just X, it's Y», есть и более яркие примеры: 1️⃣ Писатель Томас Смит теперь сознательно оставляет опечатки в текстах — как «доказательство» человеческого авторства. 2️⃣ Копирайтер Лариса Маккарти признаётся, что перестала придумывать собственные метафоры — потому что «слишком хорошая» метафора вызывает подозрение, что её написал ИИ. 3️⃣ Университет Монтклер прямо инструктировал преподавателей: слишком грамотный, правильный текст студента — повод заподозрить его в использовании ИИ, поскольку тексты нейросетей отличаются «аномально правильной» грамматикой. 4️⃣ Появился жанр TikTok-роликов, обучающих «распознавать ИИ по приметам». Неочевидный вывод — ИИ меняет не только слова, но и наши суждения о языке. Раньше хороший слог, богатая лексика и сложные конструкции считались признаком образованности. Теперь это rad flag. Основная проблема не в самих «GPT-словах», а в том, что мы больше не можем доверять своим ощущениям. Мы не знаем, где заканчивается наше «я» и начинается влияние ИИ. 💬 Тест Тьюринга. События в сфере ИИ. Подписаться
457
16
🧬 Claude автономно спроектировал сотни белков для создания лекарства от рака — один этап разработки ИИ ускорил в несколько р
🧬 Claude автономно спроектировал сотни белков для создания лекарства от рака — один этап разработки ИИ ускорил в несколько раз Вроде бы еще совсем недавно директор Anthropic Дарио Амодеи скромно написал, что обещание «ИИ вылечит рак» превратилось в неубедительный рекламный слоган конкурентов. Но уже на прошлой неделе Anthropic сам представил один из первых «проблесков» такого будущего — очень перспективные результаты по ускорению проектирования необходимых белков. Речь пока не о лекарстве и не только об онкологических мишенях. Исследователи выбрали 16 белковых целей. Среди них действительно были связанные с онкологией мишени PD-L1, EGFR, VEGF-A и BHRF1, но также иммунные, вирусные и экспериментальные белки. Claude Opus 4.8 и исследовательская модель Mythos Preview получили большой протокол исследования, доступ к научной литературе, специализированным open-source-моделям и облачным GPU. После запуска человек больше не вмешивался в проектирование. Агент самостоятельно изучал каждую мишень, выбирал участок связывания, устанавливал и комбинировал инструменты проектирования белков, генерировал последовательности, проверял их предполагаемую структуру, проводил несколько циклов оптимизации и отбирал по 30 лучших кандидатов. Claude не заменил специализированные биологические модели — он заменил значительную часть работы специалиста, который должен собрать их в единую исследовательскую процедуру и принять десятки решений. ➡️ Всего агент создал 1 440 конструкций. Для 1 320 из них лабораторные измерения оказались интерпретируемыми;  ➡️ 354 белка действительно связались со своими мишенями — 26,8%. ➡️ Биндеры удалось получить для 14 из 15 целей. В режиме одновременной работы со многими мишенями результат составил 22,6% для Opus 4.8 и 26,7% для Mythos. Когда Mythos выделяли отдельную 24-часовую сессию на каждую цель, доля успешных конструкций выросла до 35,1%. Причём среди кандидатов, которым Claude присвоил первое место, связывался почти каждый второй — 49%. Насколько это эффективнее традиционного подхода? Типичная результативность современных кампаний de novo-дизайна белков оценивается в 10–15%. Значит, совокупный показатель Claude выше примерно в 1,8–2,7 раза, а лучший режим — в 2,3–3,5 раза. Автономная вычислительная часть заняла 24–48 часов вместо дней и недель экспертной оркестрации. Исторически полный подбор белка для одной мишени мог занимать месяцы. Физическая проверка была в лабораториях: Adaptyv Bio и Twist Bioscience синтезировали конструкции и независимо друг от друга измерили их связывание. Из 354 успешных белков 194 показали сродство лучше 100 нМ, 90 — лучше 10 нМ, а 42 — лучше 1 нМ. Для мишени RBX1 лучшая конструкция Claude связалась примерно в 11 раз сильнее победителя прежнего открытого конкурса: 3,9 против 45 нМ. Но это ускорение одного раннего этапа, а не всей разработки лекарства. Авторы не проводили прямого соревнования с экспертами при одинаковом вычислительном бюджете, а эксперимент потребовал тысяч GPU-часов. Белки пока проверены только на связывание: неизвестно, изменяют ли они работу мишени, действуют ли в клетке, безопасны ли для организма и способны ли лечить заболевание. Впереди — функциональные тесты, токсикология, исследования на животных и клинические испытания. Позиция Амодеи поэтому пока остаётся прогнозом. Он считает, что мощный ИИ сможет сжать 50–100 лет биомедицинского прогресса в 5–10 лет. Новый эксперимент не доказывает возможность «вылечить рак», тем более что рак — множество разных заболеваний. Но он показывает конкретный механизм такого сжатия: ИИ превращает сложную вычислительную кампанию из ремесла немногих специалистов в автономную, воспроизводимую процедуру. 💬 Тест Тьюринга. События в сфере ИИ. Подписаться
299
17
🖥 Открытая модель бесплатна. Сервер для неё — нет MWS Cloud подсчитала: средняя стоимость минимальной инфраструктуры для зап
🖥 Открытая модель бесплатна. Сервер для неё — нет MWS Cloud подсчитала: средняя стоимость минимальной инфраструктуры для запуска ведущей LLM в России выросла с 13,7 млн рублей в 2025 году до 38,8 млн в 2026-м. Это не означает, что один и тот же сервер подорожал в 2,8 раза. Изменилось требование к оборудованию: прошлогодние модели часто помещались на четырёх GPU, а новые флагманы требуют целого узла из восьми H200 или B300. Цифра одновременно отражает санкционную наценку, рост цен на ускорители и увеличение самих моделей. Какие модели с доступными весами теперь можно поселить в собственном ЦОД? ➡️ Kimi K3 — 2,8 трлн параметров, из которых 104 млрд активны. Минимум 8 × B300 по 288 ГБ. Цена в России — доходит до 80 млн рублей. ➡️ Qwen3.5 397B, DeepSeek-V4-Pro и GLM-5.2 — 8 × H200 по 141 ГБ. Цена около 55 млн рублей. ➡️ DeepSeek-V4-Flash — 1 × B300. Цена примерно 10 млн рублей. ➡️ Gemma 4 31B — 2 × H100. Цена около 7,5 млн рублей. ➡️ Российская Cotype Pro 3 — 1 × A100 80 ГБ. Цена около 3 млн рублей. Причём это лишь «входной билет»: конфигурация способна загрузить модель и обработать один запрос максимального заявленного размера. Для параллельных пользователей, резервирования и приемлемой скорости понадобятся дополнительные мощности. А сколько такое железо стоит за границей? Американский сервер с восемью B300 выставлен за $496,7 тыс. — около 41,2 млн рублей по текущему курсу. Российская оценка аналогичной конфигурации (подойдет для Kimi K3) — 80 млн. С H200 картина менее однозначна. Зарубежные предложения серверов на восьми ускорителях находятся в огромном диапазоне — примерно от $173 тыс. за базовую конфигурацию до $609 тыс. за комплект Supermicro с памятью, накопителями и сетевыми адаптерами. Может быть, выгоднее арендовать? За рубежом один H200 предлагается примерно за $4 в час. Узел 8 × H200 обойдётся примерно в $32 в час или $23 тыс. в месяц — около 1,9 млн рублей при непрерывной работе. В России публичные тарифы начинаются примерно с 423 рублей за H200 в час. Восемь ускорителей — теоретически от 2,4 млн рублей в месяц. Однако для огромной модели нужны не восемь случайных виртуальных машин, а единый узел с NVLink/NVSwitch, поэтому фактическая цена обычно определяется индивидуально. При покупке российского сервера за 55 млн рублей арифметическая точка окупаемости наступает примерно через 22 месяца непрерывной аренды. В реальности покупка окупается позднее: остаются электричество, охлаждение, размещение, персонал, ремонт и риск, что через два года оборудование устареет. Поэтому собственный сервер имеет смысл при стабильной загрузке 24/7, жёстких требованиях к данным и горизонте эксплуатации от 2-3 лет. Для пилота, нерегулярных задач и постоянной смены моделей аренда рациональнее. А при небольшом трафике дешевле вообще не арендовать GPU, а покупать токены. GLM-5.2 в MWS стоит 178 рублей за миллион входящих и 747 рублей за миллион исходящих токенов. При соотношении входа к выходу 3:1 месячная аренда на 2,4 млн рублей соответствует примерно 7,6 млрд обработанных токенов. До таких объёмов большинство компаний не добирается. Открытые веса сделали модель доступной для скачивания. Но настоящая свобода теперь определяется не лицензией, а тем, можете ли вы позволить себе машину, на которой эта модель оживёт. 💬 Тест Тьюринга. События в сфере ИИ. Подписаться
294
18
🧊 Лучший скилл для агента — научиться думать зачем он выполняет свою работы Стандартный Claude Opus 5 получил 30,16% на ARC-
🧊 Лучший скилл для агента — научиться думать зачем он выполняет свою работы Стандартный Claude Opus 5 получил 30,16% на ARC-AGI-3 — тесте из 25 незнакомых интерактивных игр. Модели не сообщают ни правила, ни цель. Она должна сама экспериментировать, замечать изменения в своей результативности, строить модель мира и постепенно понимать, как победить. Затем разработчик Пубеш Гоутам подключил к Claude Code один кастомный скилл. Та же модель прошла все 25 игр и 183 уровня, получив максимально возможные 100 баллов. Ей понадобилось 7 645 действий против 17 135 у медианного человека. Базовая модель многие игры вообще не завершила, поэтому прямое сравнение числа ходов невозможно. Что именно изменилось в поведении агента? Скилл не объяснял модели правила игр. Он заставлял её объяснять самой себе, зачем нужен следующий ход. Перед каждым действием Claude должен был сформулировать проверяемое предсказание: какие элементы игровой ситуации изменятся, куда переместится объект, что произойдёт после нажатия или завершится ли уровень. Если агент не мог сказать, чего именно ожидает, инструмент просто не выполнял действие. После хода программа сравнивала предсказание с фактическим результатом. Если ожидание не сбывалось, запланированная последовательность останавливалась, а ошибка сохранялась как свидетельство против прежней гипотезы. На первый взгляд это похоже на обычную проверку гипотез. Но эвристика здесь глубже: агенту предлагают не просто перебирать варианты, а сначала определить, какую неопределённость он пытается снять. Это не тривиально даже для людей. Умный человек тоже может долго экспериментировать, нажимая на разные кнопки, собирая факты и почти не понимая, какой именно вопрос задаёт очередной пробой. В результате эксперименты превращаются в механический перебор, а не в исследование. Пубеш Гоутам, похоже, встроил в работу модели минимальную научную дисциплину: сначала предположение, затем действие, затем сравнение ожидания с наблюдением. За весь эксперимент Claude сделал 7 627 предсказаний и ошибся в 443. Постепенно одиночные пробные действия сменились длинными планами: в них оказалось выполнено 91,6% всех ходов. Ошибочными были 37,1% исследовательских нажатий, но лишь 2,9% действий внутри планов, основанных на уже проверенных правилах. То есть агент не стал просто «осторожнее». Он научился отделять исследование от эксплуатации уже найденного правила: сначала проверять, потом действовать сериями. И вот здесь начинается настоящий скилл-инжиниринг Промпт просит модель вести себя определённым образом. Скилл определяет процедуру принятия решений в неоднозначных ситуациях. Разница примерно такая же, как между советом сотруднику «думайте перед тем, как действовать» и системой, которая не позволяет выполнить действие, пока не зафиксированы цель эксперимента и ожидаемый результат. Отсюда вытекают принципы конструирования скиллов — не как универсальный чек-лист, а как ответы на типичные проблемы агентной работы. 1⃣ Сначала найдите не абстрактный недостаток, а повторяющийся провал. Агент не различает факт и гипотезу? Повторяет уже опровергнутую идею? Скилл нужен не ради дополнительного слоя инструкций, а ради устранения конкретной измеримой ошибки. 2⃣ Если правило действительно важно, не оставляйте его на совести модели. В этом эксперименте требование сформулировать предсказание стало техническим шлюзом: без него действие невозможно. Иначе даже хорошая инструкция постепенно превращается в необязательную рекомендацию. 3⃣ Заставляйте агента формулировать не красивые объяснения, а проверяемые ожидания. Вопрос не в том, может ли модель рассказать, что она «анализирует ситуацию», а в том, можно ли после следующего действия однозначно установить, была ли её гипотеза верной. 4⃣ Отделяйте исследование от выполнения плана. На этапе неопределённости агенту нужны короткие эксперименты и высокая чувствительность к ошибкам. После подтверждения правила — длинные последовательности и минимальное количество лишних проверок. Один и тот же режим поведения плохо подходит. 💬 Тест Тьюринга. События в сфере ИИ. Подписаться
272
19
🤑Тайвань будет выплачивать гражданам «дивиденды» от развития ИИ Президент Тайваня Лай Циндэ предложил включить в бюджет 2027
🤑Тайвань будет выплачивать гражданам «дивиденды» от развития ИИ Президент Тайваня Лай Циндэ предложил включить в бюджет 2027 года выплату каждому гражданину по 10 тыс. тайваньских долларов — примерно 25 тыс. рублей. Обоснование: экономический эффект от ИИ должен быть «разделён между всеми». Тайваньский эксперимент показывает: ИИ-дивиденды возникают не там, где громче говорят об ИИ, а там, где его физически производят. Чтобы разделить доходы новой экономики, сначала необходимо владеть хотя бы одним незаменимым фрагментом её инфраструктуры. Откуда взялись деньги? За первое полугодие экономика Тайваня выросла на 14,15%. Прогноз на весь 2026 год повышен до 11,05% — это лучший результат за 39 лет. Товарный экспорт может увеличиться более чем на 41% и достичь рекордных $903,6 млрд. Но Тайвань разбогател не потому, что его жители лучше других освоили нейросети. Он контролирует несколько физических узких мест ИИ-экономики. Здесь американские корпорации строят дата-центры, Nvidia проектирует ускорители, TSMC производит для них передовые чипы и упаковку, а Foxconn, Quanta и Wistron собирают серверы и стойки. Мировые инвестиции в ИИ превращаются для Тайваня в экспорт, заказы заводам, частные инвестиции, прибыли компаний и налоговые поступления. ⛏ Иными словами, Тайвань продаёт "кирки во время золотой лихорадки". Этот успех возник не за последние два года. В 1973 году государство создало Институт промышленных технологий ITRI, затем появился научный парк Синьчжу, а в 1987 году из ITRI выросла TSMC с новой для того времени моделью: не проектировать собственные микросхемы, а производить их для других компаний. Почти полвека Тайвань выращивал инженеров, поставщиков, заводы и компетенции — и встретил ИИ-бум уже с готовой промышленной системой. Могут ли другие страны повторить этот опыт? Разовую выплату населению, безусловно, сделать несложно. Но стабильный «дивиденд от ИИ» — значительно сложнее. Для него нужны четыре условия: дефицитная компетенция в мировой ИИ-инфраструктуре, сохранение существенной части добавленной стоимости внутри страны, способность государства превратить прибыль отрасли в бюджетные доходы и готовность делиться именно сверхдоходами, а не заёмными деньгами. У каждой страны таким активом может быть своя предпосылка: проектирование чипов и облака в США, память в Южной Корее, литографические машины в Нидерландах, материалы и оборудование в Японии, дешёвая энергия для дата-центров у стран с её избытком. Но там, где ИИ только покупают и используют, выплата будет обычным социальным расходом, переименованным в технологический дивиденд. 💬 Тест Тьюринга. События в сфере ИИ. Подписаться
292
20
😤 ИИ-слоп проник в законодательную работу Управление законодательного совета Палаты представителей США столкнулось с лавиной
😤 ИИ-слоп проник в законодательную работу Управление законодательного совета Палаты представителей США столкнулось с лавиной законопроектов, сгенерированных ИИ, которые переполнены ошибками. В некоторых случаях юристам приходится тратить больше времени на исправление ИИ-драфта, чем потребовалось бы для написания законопроекта с нуля. ➡️ Сотрудники аппарата Конгресса чаще всего используют Claude или ChatGPT для составления законодательных текстов. ➡️ ИИ-агенты путаются в важных деталях: например, не могут отличить налоговый кредит от налогового вычета, исключения или гранта. ➡️ Сгенерированные проекты могут неверно ссылаться на предыдущие законы и разделы Свода законов США. Похожая проблема уже проявилась и в других странах. Высокий суд Англии и Уэльса вынес постановление по двум делам, где юристы использовали ИИ для подготовки состязательных бумаг со ссылками на несуществующую судебную практику. Некоторые провинции Канады полностью пересмотрели процесс заключения госконтрактов после того, как в двух отчетах, включая подготовленный Deloitte Canada за $1,6 млн, были обнаружены ложные цитаты, сгенерированные ИИ. Или, наверное, помните, как недавно депутат законодательного собрания Нью-Брансуика Билл Оливер зачитал во время официальной речи не только сам текст, но и инструкцию для чат-бота — фразу вроде «вот более естественная версия этого раздела, звучащая как парламентская речь». Однако есть и обратные кейсы. Например, в эстонский закон о налоге на азартные игры попала ошибка в формулировке, из-за которой онлайн-казино фактически могли оказаться вне налогового режима. Ошибка могла стоить государству около €24 млн в год. Бывший заместитель госсекретаря по цифровой трансформации Luukas Ilves прогнал закон через Claude и Gemini — обе модели обнаружили проблему. После этого он буквально за несколько часов создал инструмент Apsakaleidja / “Fuckup Finder”, который автоматически проверяет проекты законов на противоречия. Что с этим делать? Известно одно: ИИ может писать закон, но ИИ не может быть ответственным за закон. Сейчас многие регуляторы идут по пути маркировки ИИ-контента. ЕС, например, с 2 августа 2026 года ввёл требования прозрачности для ИИ-сгенерированного контента в рамках Article 50 AI Act, включая маркировку синтетического контента и определённые требования к machine-readable indicators. Но надпись «сгенерировано ИИ» сама по себе не делает закон правильным. Поэтому следующий этап развития государственных ИИ-систем, вероятно, будет связан не столько с AI that writes, сколько с AI that verifies. И в этом смысле эстонский Fuckup Finder может оказаться гораздо более важным прецедентом, чем американская история с плохими законопроектами: ИИ может стать не автором закона, а его автоматическим red-team'ом. Побеждать будет не тот, кто запретит ИИ, а тот, кто построит эффективный инструмент верификации. 💬 Тест Тьюринга. События в сфере ИИ. Подписаться
411