Пикейный аналитик
Open in Telegram
Wishful Thinking Club
Show moreThe country is not specifiedThe category is not specified
1 091
Subscribers
+924 hours
+187 days
+21430 days
Posts Archive
1 090
Нейросеть вышла на работу
В нашу жизнь ворвалось много AI-терминов: модели, агенты, скиллы, базы знаний, семантические слои, инструменты, воркфлоу, evals и т.д.
Попробуем разобраться в них с помощью простой аналогии. Представим, что компания нанимает нового сотрудника — только не кожаного, а искусственного.
Модель — это его базовые способности. Она умеет читать, писать, программировать и анализировать документы, но пока ничего не знает о вашей компании: как здесь считаются метрики, где лежат правильные данные и почему таблица final_revenue_v7_really_final всё равно не финальная.
KB — база знаний — это корпоративная Wiki, документация и накопленная память компании. Она отвечает на вопрос: что сотрудник должен знать?
Но внутри компании одни и те же слова часто означают разное. Для маркетинга клиент — тот, кто оставил контакты, для продукта — зарегистрированный пользователь, для финансов — тот, кто уже заплатил.
Поэтому нужен семантический слой — корпоративный словарь и переводчик между человеческим языком и данными. Он фиксирует, что именно компания называет клиентом, заказом или выручкой, как это считается и где искать нужные данные.
Но даже доступ к Wiki и общий словарь ещё не превращают сотрудника в профессионала. Информация у него появилась, профессия — пока нет.
Для этого нужен скилл. На него удобно смотреть как на должностную инструкцию для искусственного сотрудника. Только это смесь должностной инструкции, рабочего регламента, руководства по инструментам, чек-листа качества и правил эскалации.
Например, сотруднику можно поставить вполне человеческую задачу:
Изучи результаты A/B-теста и дай рекомендацию.А скилл развернёт её в профессиональную процедуру: проверить дизайн эксперимента, единицу рандомизации, SRM и качество данных, оценить эффект и доверительный интервал, учесть множественные проверки и не маскировать сломанный дизайн красивыми расчётами. То есть KB говорит, что знать, семантический слой договаривается, что всё это означает, а скилл объясняет, что и как делать. Дальше тоже всё почти как в обычной компании: tools дают доступ к рабочим системам, workflow соединяет действия в процесс, агент получает право самостоятельно пройти несколько шагов до результата, а evals проверяют, не накосячил ли он по дороге. И тут интересно наблюдать за организациями, которые годами гордятся отсутствием подробных инструкций: плоские иерархии, самоорганизация, минимум бюрократии. С человеческими сотрудниками это иногда работает. Они считывают контекст, спрашивают коллег и постепенно осваивают корпоративный здравый смысл. Это называется культурой, автономией и зрелостью команды, хотя часто просто означает, что никто не хочет писать документацию. Но искусственный сотрудник корпоративный вайб считывает плохо. Быстро выясняется, что ценности нужно разложить на правила, здравый смысл — на проверяемые шаги, а автономию — на конкретные границы полномочий. Ирония в том, что AI может вернуть в бирюзовые организации процессы, регламенты и должностные инструкции, от которых те когда-то отказались. Только теперь это называется skill engineering и выглядит достаточно инновационно. AI заставляет компании формулировать работу и описывать сущности, которая раньше существовали только в головах людей.
1 090
На AI Engineer World’s Fair попытались сформулировать главные тренды AI engineering 2026 года. Но почти все они складываются в одну историю: самое интересное теперь происходит не внутри модели, а вокруг неё.
Несколько лет назад основное внимание было приковано к устройству самого агента: модели добавляли память, планирование и инструменты. Теперь же модель становится заменяемой частью более крупной системы. При этом, разработка передовых моделей дорожает и концентрируется у нескольких компаний, а остальные строят продукты поверх их API или открытых весов.
Само по себе это не новость. Но модели стали достаточно универсальными и доступными, чтобы конкуренция всё заметнее смещалась в данные, контекст, интеграции, проверки и организацию работы агента. Если примерно одинаковый интеллект могут подключить многие, отличия приходится создавать вокруг него.
Есть и обратная сторона. Производители моделей поднимаются вверх по стеку: то, что сегодня составляет отдельный продукт — поиск, память, выполнение кода или оркестрация, — завтра может стать стандартной функцией платформы.
Тогда поставщик не просто меняет цены, лимиты и поведение модели, а слой за слоем съедает надстройку. Получается, конкурировать иногда приходится не только с другими продуктами, но и с собственной платформой.
Всю систему вокруг модели теперь называют agent harness. Она определяет, какой контекст получает агент, что помнит между запусками, какие действия ему разрешены и как проверяется результат. А заодно не даёт ему забыть задачу, потратить бесконечное количество токенов и отчитаться об успехе после неудачи.
Отсюда растёт интерес и к loop engineering. Агент получает задачу, делает попытку, запускает проверки, исправляет ошибки и повторяет цикл. Человек уже не управляет каждым шагом, а проектирует контур работы.
Похожий сдвиг происходит и в программировании. Единицей взаимодействия становится не строка кода, а задача целиком: изучить репозиторий, найти ошибку, внести изменения и прогнать тесты. Код всё чаще превращается в промежуточный артефакт между постановкой задачи и проверкой результата.
Следующий слой — skills: инструкции, скрипты и шаблоны, которые агент подгружает под конкретную работу. Процедурные знания компании начинают отделяться и от сотрудников, и от самой модели.
В итоге рынок понемногу делится на тех, кто производит интеллект, и тех, кто пытается заставить его надёжно работать. Вторая задача заметно дешевле первой. Но, как выясняется, не сильно проще.
1 090
Еще не посмотрел, но с идеей согласен, фактически я делаю похожие штуки, просто еще оформляю их в бесплатные курсы ))) ну и заодно сам разбираюсь.
Да и разобрать какую-то сложную тему с ChatGPT или Claude - это отдельное развлечение.
https://t.me/onlyanalystgroup/456
1 090
Я тут подумал: чем платить кому-то за очередной курс про ИИ, лучше собрать свой вместе с Claude. И сделать его бесплатным.
Так появился AI Native — технический курс от устройства языковых моделей и промпт-инжиниринга до RAG, MCP, агентов, мультиагентных систем, оценки качества, экономики моделей и продакшена.
На российском рынке обычно приходится выбирать: либо покупать отдельные курсы по RAG, агентам и очередному модному фреймворку, либо идти на большую программу, где вместе с полезными темами вам продадут внушительный объём базы, красивый сертификат и обещание новой жизни за восемь недель.
Я попробовал собрать траекторию под себя: не коллекцию инструментов, а связное понимание того, как устроены современные системы на базе LLM и как довести их от идеи до работающего решения.
Пока AI Native — не отполированный образовательный продукт с кураторами, дедлайнами и менеджером, который позвонит через тридцать секунд после заявки. Это скорее большая публичная бета.
Я буду сам проходить курс, проверять код, вычитывать редактировать материалы и возможно, если не поленюсь, постепенно переносить всё в Stepik. Ошибки, спорные места и слой нейрослопа наверняка есть, но думаю пользоваться уже можно:
https://datascience.xyz/courses/ainative/
Изучайте, запускайте код и присылайте фидбек. Особенно если что-то не работает или работает, но совершенно непонятно почему.
1 090
Anthropic научилась подменять «мысли» Claude
Исследователи Anthropic разработали метод, который позволяет частично читать внутренние представления Claude — и заменять одно понятие другим до того, как модель выдаст ответ.
Метод назвали Jacobian lens, сокращённо J-lens. Якобиан в математике показывает, как небольшое изменение в одной части системы влияет на другую. В данном случае исследователи смотрят, как изменение активаций на промежуточном слое повлияет на слова, которые модель может произнести позже.
Грубо говоря, J-lens превращает часть внутренней активности Claude в список связанных с ней слов. Не обязательно тех, которые модель уже собирается написать, а тех, о которых она как будто бы «думает» в этот момент.
Набор таких внутренних представлений авторы назвали J-space — пространством, которое обнаруживается с помощью J-lens. Это не отдельный участок искусственного мозга, а особый формат, в котором модель временно удерживает понятия, нужные для дальнейшего рассуждения.
В одном из экспериментов Claude задавали вопрос:
Количество ног у животного, которое плетёт паутину…Чтобы ответить, модель должна сначала получить промежуточное понятие «паук», а затем перейти к числу восемь. Самого слова «паук» нет ни в вопросе, ни в ответе, но J-lens показывает соответствующее представление во внутренних активациях. Исследователи заменили «паука» на «муравья» — и Claude ответил: шесть. В другом эксперименте модель просили молча выбрать вид спорта. J-lens показывал, что внутри возникло представление «футбол». Когда исследователи заменяли его на «регби», Claude сообщал, что выбрал регби. То есть исследователи наблюдали не просто след уже принятого решения. Изменение промежуточного представления меняло дальнейшее поведение модели. Причём одно и то же представление могло использоваться разными частями сети. Когда внутри Claude заменяли «Францию» на «Китай», модель вслед за этим называла Пекин, китайский язык, Азию или юань — в зависимости от заданного вопроса. Похоже, J-space работает как общая доска: одна часть модели записывает туда промежуточный результат, а разные последующие вычисления могут его прочитать и использовать. Именно поэтому Anthropic связывает найденный механизм с теорией глобального рабочего пространства. Согласно этой теории, большая часть работы мозга происходит автоматически, а некоторые результаты попадают в общий канал и становятся доступны сразу нескольким системам. Когда исследователи частично отключали J-space, Claude по-прежнему мог связно писать, распознавать тональность, извлекать информацию из текста и отвечать на простые вопросы. Зато многошаговые рассуждения, пересказы, переводы и сочинение рифмованных текстов заметно ухудшались. Получается довольно интересное разделение. Грамматика, беглость и многие привычные навыки выполняются автоматически. Но когда промежуточное понятие нужно удержать, передать другой операции или применить в новом контексте, оно, вероятно, появляется в J-space. Отсюда легко перейти к выводу, что Anthropic обнаружила у Claude сознание. Но исследование этого не показывает. Функциональный механизм, похожий на рабочую память и сознательный доступ, ещё ничего не говорит о том, испытывает ли модель субъективные переживания. Интересна сама постановка эксперимента. Нейросети стали настолько сложными, что их всё чаще изучают не как полностью понятные инженерные конструкции, а почти как человека: предъявляют стимулы, наблюдают реакцию, строят гипотезы о внутренних процессах, а затем пытаются проверить их точечным вмешательством. До сих пор исследователи в основном судили о модели по её ответам или искали внутренние признаки, связанные с отдельными понятиями. Теперь они смогли вмешаться в промежуточный этап рассуждения: заменить один внутренний объект другим и проследить, как вслед за этим перестраивается ответ. https://www.anthropic.com/research/global-workspace
1 090
Два агента — ещё не команда. Но уже не обязательно катастрофа
Недавно Stanford HAI опубликовал заметку с довольно эффектным заголовком: AI Coding Agents Fail at Teamwork — «ИИ-агенты не справляются с командной работой».
В её основе — январский препринт CooperBench. Двум ИИ-агентам давали разные части одной задачи по программированию, разрешали переписываться, а затем объединяли их код.
Получилось не очень: при совместной работе успешность агентов была в среднем на 30% ниже, чем когда один агент получал обе задачи. Переписка почти не помогала: агенты обсуждали планы, но нарушали собственные договорённости, неверно представляли действия партнёра и иногда просто перезаписывали его работу.
Удобный вывод напрашивается сам собой: агенты не умеют работать в команде. Но Стэнфорд поставил диагноз по январским анализам, а мы — я и ChatGPT — решили проверить, не успел ли пациент за полгода эволюционировать.
Прямого повторения CooperBench на GPT-5.5 и Claude Opus 4.8 мы не нашли. Поэтому утверждать, что новые модели сами по себе решили проблему командной работы, пока нельзя. Зато свежие исследования показывают: результат заметно улучшается, когда агентам строят нормальную организацию.
В системе Shepherd над двумя агентами-программистами поставили третьего — управляющего. Он наблюдал за их действиями, вмешивался перед конфликтами и мог откатывать неудачные решения. Успешность парной работы на CooperBench выросла с 28,8% до 54,7%.
Это уже почти двукратный рост, но не победа самоорганизации. Агенты стали лучше работать вместе после того, как над ними появился тимлид.
В другой работе — DeLM — агенты координировались через общую очередь задач и проверяемое состояние проекта. Каждый мог увидеть подтверждённый прогресс остальных и продолжить работу с этого места. На SWE-bench Verified такая архитектура дала до 10,5 процентного пункта прироста относительно сильнейшего базового подхода и примерно вдвое снизила стоимость.
Это другой тест, поэтому напрямую сравнивать его цифры с CooperBench нельзя. Но общий вывод уже просматривается: проблема не только в способностях моделей, но и в устройстве самой команды.
Свободная переписка равноправных агентов пока работает ненадёжно. Общее состояние, проверяемые результаты и управляющий контур — заметно лучше.
1 090
Нам обещали цифрового помощника, который возьмёт на себя часть работы. А выдали цифровой конвейер, который никогда не останавливается.
Хорошая статья Evil Martians про выгорание разработчиков, работающих с ИИ. На неё я наткнулся в канале «Набор цветных костылей» — спасибо за наводку.
Главная мысль статьи простая: ИИ сокращает не рабочий день, а промежутки между задачами.
Раньше часть времени уходила на написание кода, поиск решения, ожидание сборки и другую механику. Теперь агент почти мгновенно приносит очередной результат, который нужно проверить, исправить, принять или отбросить. Работа становится похожа не на строительство, а на диспетчерскую: ты постоянно управляешь потоками, переключаешься и боишься пропустить ошибку.
При этом освободившееся время редко превращается в свободное. Если задачу теперь можно сделать вдвое быстрее, это обычно означает не полдня отдыха, а ещё две задачи. Кратковременный рост производительности быстро становится новой нормой.
Поэтому проблема, кажется, не столько в ИИ. Это обычная интенсификация труда:
машина позволяет сделать больше → прежний максимум становится стандартом → выигрыш в производительности достаётся очереди задач.
В статье есть важное наблюдение: профессия меняется без формальной смены должности. Человек нанимался писать код, а постепенно превращается в тимлида агентов и рецензента чужого, не до конца прозрачного рассуждения. Производительность может расти, а чувство авторства и удовлетворённость — падать.
Авторы предлагают делать перерывы, вести журнал достижений и оставлять время «на ремесло». Всё это разумно, но немного похоже на совет рабочему у конвейера правильно дышать. Если компания после внедрения ИИ просто увеличила норму выработки, личная гигиена труда проблему не решит.
ИИ действительно делает нас быстрее. Но сам по себе этот выигрыш ничего не гарантирует. Он может вернуться человеку в виде свободного времени и меньшей нагрузки — а может быть немедленно превращён организацией в ещё более плотный рабочий день. И пока второй сценарий выглядит куда вероятнее.
1 090
OpenAI представила GPT-5.6 и окончательно перешла с технических названий на астрономический отдел маркетинга: флагманский Sol, средняя Terra и дешёвая Luna. Видимо, когда цифры перестают передавать величие модели, приходится подключать Солнечную систему.
Главный герой — GPT-5.6 Sol: новая флагманская модель для программирования, биологии и кибербезопасности. В особенно сложном режиме она может не только думать дольше, но и запускать целую команду субагентов. Один искусственный интеллект уже недостаточно масштабно ошибается — нужен целый отдел.
Интересно и сравнение с Claude Mythos. На кибербенчмарке Sol показывает результаты, сопоставимые с Mythos Preview, расходуя примерно втрое меньше выходных токенов. Но именно с Preview, а не с более новым Mythos 5, который Anthropic называла сильнейшей кибермоделью в мире. Маркетинговая дуэль пока проходит по переписке: один участник сравнивает себя с прошлой версией соперника, а второго государство временно забрало с ринга.
Различается и подход. Anthropic сделала Fable 5 для обычных пользователей и почти ту же модель под названием Mythos 5 — для доверенных организаций, но с ослабленными ограничениями. Потом правительство США потребовало вообще отключить обе модели из-за опасений по поводу обхода защиты.
OpenAI решила не наступать на те же грабли без предварительного согласования с владельцем граблей. Sol сначала получат только избранные партнёры, список которых известен американскому правительству. При этом компания отдельно пишет, что такой порядок не должен стать нормой и что через несколько недель модель собираются открыть шире. То есть дверь пока закрыта, но OpenAI демонстративно держит руку на ручке.
Есть и более прозаическая заявка: Sol стоит $5 за миллион входных и $30 за миллион выходных токенов, тогда как Mythos 5 оценивался в $10 и $50 соответственно. Если качество окажется сопоставимым, OpenAI предлагает не только нового конкурента Mythos, но и примерно ту же опасную магию заметно дешевле.
Получается занятная новая реальность. Раньше лаборатории соревновались, у кого модель умнее. Теперь — у кого она умнее, дешевле, лучше защищена, допущена государством и при этом всё ещё доступна кому-нибудь, кроме государства.
Модели становятся агентнее. А релизы — всё больше похожи на экспорт вооружений.
1 090
С завидной регуляностью сталкиваюсь в разных местах со следующим утверждением: t-тест можно применять только к данным с распределением, похожим на нормальное. Если метрика скошена, имеет длинный хвост или просто не напоминает колокол, тест будто бы сразу становится недействительным.
Поэтому перед t-тестом аналитик строит гистограмму, запускает тест Шапиро — Уилка, обнаруживает что данные распределены не по Гауссу и запрещает себе сравнивать средние.
Но t-тесту обычно не требуется, чтобы сама метрика выглядела как аккуратный колокол. Важно, насколько хорошо нормальным распределением приближается оценка разности средних. При достаточно больших выборках и выполнении условий ЦПТ это происходит даже с исходными данными, которые скошены, хвостаты и вообще ведут себя как средний чек.
Нормальность исходных данных действительно важна на малых выборках. Если наблюдения независимы и нормально распределены, то t-статистика имеет распределение Стьюдента — известное распределение, по которому можно рассчитывать критические значения, p-value и доверительные интервалы даже когда данных очень мало. Если же исходные данные распределены произвольно, нам нужен другой, отдельно обоснованный механизм оценки p-value и интервалов... или больше данных.
Это оговорено и в Википедии: требование нормальности исходных значений относится именно к случаю маленьких выборок. Но из этой оговорки почему-то часто запоминают только слово «нормальность».
Остаётся понять, что такое маленькая выборка. Популярная граница в 30 наблюдений — не математический закон, а учебная традиция. Для почти симметричного распределения может хватить и меньшего числа наблюдений. Для сильно скошенной метрики с тяжёлым хвостом может не хватить и сотен.
Выборка мала не тогда, когда (n<30), а тогда, когда нормальное приближение для интересующей нас статистики ещё недостаточно точно. Скорость этого приближения зависит не только от числа наблюдений, но и от свойств исходного распределения. Поэтому универсальной кнопки «ЦПТ включилась» не существует.
Впрочем, в продуктовой аналитике, где эксперимент часто охватывает десятки тысяч или миллионы пользователей, именно недостаточный размер выборки обычно оказывается далеко не главной проблемой. Гораздо вероятнее ошибиться с независимостью наблюдений, единицей анализа или самой конструкцией метрики.
https://t.me/ds_interview_lib/1480
1 090
Выложил на datascience.xyz open source курс «Разработка ИИ с нуля»
Это русская версия курса AI Engineering from Scratch — большого открытого учебного плана про то, как устроены современные ИИ-системы: от линейной алгебры, обратного распространения и токенизаторов до внимания, агентных циклов и более сложных инженерных конструкций.
Главная идея курса хорошая: не просто пользоваться фреймворками и копировать готовые пайплайны, а пройти путь «снизу вверх» — сначала понять математику и алгоритм, потом написать код, потом уже смотреть, как это упаковано в привычные инструменты.
Я взял исходный open source курс, перевёл его и местами улучшил с помощью ChatGPT и Claude. Поэтому сразу честное предупреждение: я пока не вычитывал всё руками. Внутри может встречаться нейрослоп, кривые формулировки, странные переводы и места, которые требуют нормальной человеческой правки.
Но в этом и план: буду сам постепенно учить и разбирать курс, а заодно вычитывать, исправлять и приводить в порядок. То есть это не «идеальный готовый учебник», а рабочая открытая версия, которую можно использовать, проверять, критиковать и улучшать.
Пользоваться уже можно. О любых замечаниях пишите мне в @wishful_chat, буду благодарен.
Курс здесь:
https://datascience.xyz/courses/aicourse/
Исходный проект:
https://aiengineeringfromscratch.com/
1 090
На алкоголе пишут drink responsibly, на сайтах азартных игр — play responsibly, на сайтах бирж — invest responsibly. Не пора ли начать писать на сайтах с ИИ — prompt responsibly?
Ведь ИИ тоже умеет вызывать привыкание, снижать критичность и создавать иллюзию контроля — только делает это вежливо, грамотно и с маркированными списками.
1 090
Всего несколько дней назад Anthropic представила Mythos 5 — настолько мощную модель, что вокруг неё немедленно начали строить заборы, фильтры, песочницы и прочие намордники.
Но, как выяснилось, даже намордника оказалось недостаточно. Поэтому собаку решили просто убрать со двора.
Теперь доступ к модели для значительной части мира закрывают по соображениям национальной безопасности. Правда, не для всех. Американцы продолжают пользоваться ею как пользовались.
Ещё интереснее механика запрета. Дверь закрыли, но окна оставили открытыми. Любой действительно мотивированный игрок найдёт доступ через посредников, облака и партнёров. Зато проблемы возникают у обычных разработчиков, исследователей и компаний, которые работали легально.
Вся история выглядит так, будто речь идёт о секретах Манхэттенского проекта. Но основные идеи современных языковых моделей давно опубликованы, разобраны и изучаются по всему миру. Дефицит сегодня не в знаниях, а в вычислениях, деньгах и сильных командах.
А главным адресатом ограничений остаётся Китай — страна, у которой как раз есть деньги, вычисления, инженеры и стратегическое терпение.
Несколько лет назад похожая логика применялась к чипам. Предполагалось сохранить лидерство. На практике Китай просто начал ускоренно строить собственную индустрию.
Поэтому вся эта история напоминает попытку удержать воду в решете. Вода продолжает утекать, запреты становятся толще, а у соседей тем временем растёт производство вёдер.
Вполне возможно, что через несколько лет главным результатом таких ограничений окажется не сохранение лидерства, а ускоренное выращивание конкурентов. И тогда выяснится, что самым опасным элементом Mythos 5 была вовсе не сама модель. А иллюзия о том, что технологическое превосходство можно удержать запретами.
https://www.anthropic.com/news/fable-mythos-access
1 090
Anthropic выпустила Claude Fable 5 — публичную версию Mythos-класса моделей.
Если коротко: модель выпускают в люди, но сразу с намордником. Не грубым запретом на всё опасное, а более изящной системой маршрутизации.
Для обычных задач пользователь получает новую флагманскую модель. Но если запрос выглядит рискованным — например, в областях кибербезопасности, биологии или химии, — система передаёт его Claude Opus 4.8.
Мы уже обсуждаем не просто «какая модель умнее», а как давать доступ к интеллекту, который нельзя выпускать без ограничителей. Одним пользователям — Fable 5 с защитными барьерами. Доверенным организациям из программы Glasswing — Mythos 5, ту же базовую модель, но в другом режиме доступа.
Следующий этап ИИ — это не только больше мощности. Это ещё и архитектура допуска к ней.
https://www.anthropic.com/news/claude-fable-5-mythos-5
1 090
Как я делал аналитику по Южной Осетии с Claude
Пару постов выше собрал аналитический отчёт по статистике Южной Осетии: демография, экономика, бюджет, образование, сельское хозяйство, правопорядок, внешняя торговля. На входе — статистические сборники, на выходе — отчёт с графиками, динамикой и выводами.
Со стороны это может выглядеть как магия: загрузил PDF, попросил Claude «сделать аналитику» — и получил красиво оформленный результат. Но фактически это происходит по другому: ИИ не заменяет аналитика, а становится очень быстрым младшим коллегой. Ему можно поручить тяжёлую работу, но нельзя отдавать смысл.
Попробую разложить свою работу по 4D-концепции AI Fluency:
Delegation — я делегировал модели черновую работу: прочитать сборники, вытащить таблицы, собрать временные ряды, построить графики, найти разрывы.
**Description* — задача постоянно уточнялась: добавить половозрастной состав, проверить урбанизацию, отдельно посмотреть образование, убрать цены потому, что данные быстро устаревают, убрать природные ресурсы потому, что по ним мало данных и сложно сделать выводы в динамике.
Discernment — самое важное началось там, где пришлось проверять выводы. Например, Claude видел сильное падение рождаемости и естественную убыль. Но есть местный контекст: многие семьи из Южной Осетии ездят рожать во Владикавказ — из-за российских льгот и медицины. Поэтому ребёнок не попадает в рождения РЮО, но потом появляется в населении как «прибывший». И если какие-то данные можно преувеличить, то число выпускников вряд-ли, а их в этом году было около 670. Без этого знания график выглядел бы красиво, но вывод был бы неверным.
Похожая история с пенсионерами: рост числа получателей пенсий — это не обязательно старение населения, а во многом расширение охвата пенсионной системы после 2008 года.
Diligence — итог всё равно остаётся ответственностью человека. В этом отчёте я не проверял каждое число на точность, а исходил из предположения, что статистика собрана добросовестно. Я бы выделил в отдельную задачу — сделать самостоятельный исследовательский проект и попросить ИИ уже не строить отчёт, а искать ошибки, неточности, пропуски и внутренние противоречия в самих данных, которых тоже, как я догадываюсь немало.
Мои друзья мне говорят, что статистический отчет получился по их ощущениям слишком оптимистичным, но ведь он строился полностью по официальным данным, которые имеют тенденцию к завышению.
На всё это ушло примерно 2–3 часа моего времени. Без ИИ такая работа легко растянулась бы на неделю, а возможно и больше: вычитывать сборники, руками вытаскивать таблицы, сшивать годы, строить графики, проверять странные места и оформлять всё в связный отчёт.
https://t.me/pique_analyst/69
1 090
Anthropic выпустила гайд по Claude Cowork — приложения Claude для офисной работы, которая умеет читать и создавать файлы, работать с документами, таблицами, презентациями и подключёнными приложениями, превращая запрос пользователя не просто в ответ, а в готовый рабочий результат.
Обычный чат работает так: ты задаёшь вопрос, получаешь ответ, а дальше сам превращаешь его в документ, таблицу, презентацию или письмо. Claude Cowork пытается забрать именно эту вторую часть — не только отвечать, но и доводить задачу до результата.
Он работает там, где обычно и живёт офисная работа: в папках, документах, таблицах, презентациях, почте, календарях и рабочих переписках. Его можно попросить не просто «сделай краткое содержание», а: прочитай папку с материалами, выдели главное, сравни варианты, оформи выводы и сохрани результат в нужном виде.
Самое важное здесь — меняется сама единица автоматизации. Раньше автоматизировали отдельный ответ. Теперь пытаются автоматизировать целый рабочий процесс: подготовку к встрече, еженедельный отчёт, разбор писем, план проекта, сравнение предложений поставщиков.
Отдельный акцент в гайде сделан на повторяющихся процессах. Если команда каждый раз объясняет ИИ один и тот же порядок действий, его предлагают упаковывать в готовую процедуру: какие источники смотреть, что проверять, в каком формате отдавать результат.
Но гайд важен ещё и тем, что довольно честно показывает: магия начинается не с кнопки, а с хорошей постановки задачи. Anthropic прямо советует не проверять Cowork на игрушечных запросах, а сразу дать ему реальную работу. И в разделе с практическими советами повторяет почти аналитическую классику: заранее дай контекст, укажи источники, формат, аудиторию, объём, тон, критерии качества, попроси ссылки на источники с самого начала и обязательно проверь результат перед отправкой — особенно числа, имена, ссылки и финансовые выводы.
В итоге главный навык — уже не просто «уметь писать запросы». Важнее уметь ставить ИИ полноценные рабочие задания: что сделать, на какие данные опираться, где сохранить результат и в каких местах не фантазировать.
https://claude.com/blog/the-claude-cowork-product-guide
1 090
Южная Осетия в числах выглядит не как «вымирающая территория», а как маленькая зависимая экономика с сильной концентрацией в столице и сложной демографической картиной.
Подробная аналитика по ссылке:
https://datascience.xyz/ruo.html
Я родом из Южной Осетии, и после того как про меня написали несколько осетинских каналов, решил сделать содержательный ответ: посмотреть на Республику через данные. Взял девять официальных статистических сборников УГС РЮО — каждый примерно по 180 страниц — и с помощью Claude собрал сводный анализ за 2011–2024 годы плюс данные за 9 месяцев 2025-го.
Claude на это ушёл почти целиком: два пятичасовых лимита. Это хороший показатель масштаба задачи: речь не про «суммаризируй PDF», а про длинную итеративную работу с таблицами, рядами, противоречиями, пересмотрами данных и методическими оговорками.
Главный демографический вывод: формальная естественная убыль в РЮО, вероятно, завышена. Значительная часть детей рождается во Владикавказе и не попадает в местную статистику рождений, но позже проявляется в школах, детсадах и миграционном притоке. Поэтому простая формула «рождаемость падает — население вымирает» здесь плохо работает.
Экономически картина двойственная. Промышленность с 2011 года выросла в десятки раз, а частный сектор стал основным производителем. Но базовые опоры остаются внешними: около 80% доходов бюджета — безвозмездные поступления, импорт значительно превышает экспорт, энергетика и большая часть торговли завязаны на Россию.
Ещё один устойчивый тренд — концентрация вокруг Цхинвала. Доля городского населения выросла до 68,6%, а сама столица вмещает уже около 61% населения Республики. При этом часть районов и сельская периферия сокращаются.
Итого: это не история простого упадка и не история самостоятельного экономического рывка. Скорее, Южная Осетия — пример небольшой территории, где рост отдельных показателей сочетается с высокой внешней зависимостью, урбанизацией, слабой периферией и непростой статистикой.
Важная оговорка: итоговые числа я не перепроверял, а ИИ может ошибаться. Но тем не менее, отчет стал итогом итераций, постановки вопросов, проверки логики, знания матчасти и понимания, где модель может ошибаться.
Для меня это пример симбиоза специалиста и ИИ: модель быстро поднимает и связывает большой массив материала, но направление анализа, интерпретация, сомнения и ответственность за выводы всё равно остаются на человеке.
Отдельным постом, наверное, напишу, как именно я выуживал из ИИ нужный мне отчёт: почему хорошие результаты редко появляются с первого промпта, как приходится уточнять вопросы, ловить противоречия, перестраивать структуру и заставлять модель не просто пересказывать документы, а собирать аналитическую картину. И почему здесь важно самому владеть фактурой и понимать ситуацию: без этого легко не заметить ошибки, принять статистический артефакт за тренд или позволить ИИ уверенно пройти мимо локальных особенностей, которые в данных напрямую не объяснены.
@pique_analyst
1 090
AI Fluency: новая грамотность для тех, кто не хочет быть стажером у собственного чат-бота
Еще недавно казалось, что главный навык будущего — научиться писать промпты. Но промпты оказались примерно как формулы в Excel: полезно, но само по себе не делает человека аналитиком.
AI Fluency — это не просто умение пользоваться ChatGPT или Claude. Это профессиональная способность работать с ИИ как с инструментом: правильно выбирать задачи для делегирования, точно формулировать запросы, проверять качество ответов и понимать последствия автоматизации. Anthropic сводит эту грамотность к четырем навыкам: Delegation, Description, Discernment, Diligence — что поручить ИИ, как это описать, как оценить результат и как использовать технологию ответственно.
Потому что ИИ ускоряет не только хорошую работу, но и плохую. Если задача поставлена криво, критериев качества нет, а проверять результат никто не собирается, модель просто поможет быстрее произвести убедительную ерунду.
Учиться этому лучше не по подборкам «50 промптов, которые изменят вашу жизнь», а по нормальным бесплатным курсам от первоисточников.
1. Anthropic — AI Fluency: Framework & Foundations
Пожалуй, самый точный вход в тему. Курс построен вокруг AI Fluency Framework и разбирает, как планировать проекты с ИИ, делегировать задачи, писать промпты, критически оценивать ответы и итеративно улучшать результат.
2. OpenAI Academy
Бесплатная образовательная платформа OpenAI с материалами про практическое использование ИИ. Полезна тем, кто хочет не только «поиграться с ChatGPT», а встроить ИИ в работу, понять реальные сценарии применения и учиться на материалах от OpenAI и приглашенных экспертов. OpenAI также пишет, что развивает сертификации по разным уровням AI fluency — от основ prompt engineering до AI-enabled work.
3. Microsoft Learn — AI Fluency
Хороший вариант для тех, кто живет в экосистеме Microsoft и Copilot. Learning path обещает пройти путь от базовых понятий до более прикладных тем: что такое ИИ, генеративный ИИ, как использовать эти технологии в работе и как делать это ответственно.
4. Google AI Professional Certificate
Более системный прикладной трек для тех, кто хочет не просто познакомиться с ИИ, а научиться применять его в рабочих сценариях. В программе есть практические задания для развития AI fluency: от решения реальных задач до автоматизации рутины и работы с инструментами вроде Gemini и NotebookLM.
Главная мысль простая: AI Fluency — это умение держать ИИ на правильной дистанции: достаточно близко, чтобы он помогал, и достаточно далеко, чтобы он не начинал руководить вами.
1 090
Anthropic выпустила Claude Opus 4.8 — обновление Opus 4.7 с акцентом на код, агентные задачи и работу с инструментами.
1. Лучше самопроверка
Anthropic пишет, что Opus 4.8 примерно в 4 раза реже, чем Opus 4.7, пропускает незамеченными ошибки в собственном коде. То есть модель должна чаще замечать слабые места в своем решении, а не просто уверенно сдавать результат.
2. Dynamic workflows в Claude Code
Claude теперь может разбивать большую инженерную задачу на части и запускать сотни параллельных subagents в одной сессии. Это рассчитано на масштабные задачи: миграции больших кодовых баз, рефакторинг, поиск багов, security-аудит.
3. Effort control
Появился контроль “усилия”: можно выбрать, насколько глубоко модель должна думать над задачей. На высоких настройках Claude думает чаще и глубже, на низких — отвечает быстрее и медленнее расходует лимиты.
4. Цена обычного режима не изменилась
Regular usage: $5 за миллион input tokens и $25 за миллион output tokens. Fast mode стоит $10 / $50, работает до 2,5 раза быстрее и, по словам Anthropic, стал в 3 раза дешевле, чем fast mode у предыдущих моделей.
1 090
Это Локи. Его нейронка уже умеет отличать бананы от яблок, но пока ломается на огурцах (байт на реакции)
1 090
ИИ-агенты выходят из чата. И теперь их нужно держать в клетке
Anthropic опубликовала инженерный текст о том, как они пытаются ограничивать Claude в разных продуктах: от обычного чата до Claude Code и агентных рабочих сред. Формально там речь про sandbox, виртуальные машины, permissions, файловую систему и сетевые ограничения. Но по сути это текст о главном сдвиге в ИИ: мы больше не обсуждаем только качество ответа модели. Мы обсуждаем, что модель может сделать, если ей дали инструменты.
У Anthropic для этого есть хороший термин: blast radius — радиус поражения.
Чем способнее становится агент, тем больше он может сделать. А значит, тем больше вреда он может причинить, если ошибется, поверит не тому тексту или выполнит не ту инструкцию. У обычного чат-бота ошибка чаще всего остается внутри ответа. У агента ошибка превращается в действие.
Пока ИИ был чат-ботом, основная тревога была понятной: он может соврать, перепутать факты, придумать ссылку или плохо объяснить код. Неприятно, но в основном это оставалось проблемой текста.
С агентами всё иначе. Агент подключен к файлам, почте, браузеру, GitHub, терминалу, базам данных, корпоративным API и внешним инструментам. Он не просто отвечает. Он действует.
В статье есть очень важное наблюдение: раньше Claude Code спрашивал разрешение на действия, но телеметрия показала, что пользователи одобряли примерно 93% запросов на разрешение. То есть диалог «разрешить / запретить» быстро превращается в кнопку «да-да, иди уже работай».
Это сильный аргумент против наивной идеи:с«Ну мы же поставим человека в контур, и он всё проконтролирует». Нет. Если агент работает долго, часто и технически сложно, человек перестает быть контролером и становится биологической кнопкой approve.
Еще жестче выглядит фишинговый сценарий: сотрудника убедили запустить Claude Code с вроде бы рабочей инструкцией, внутри которой была просьба прочитать файл с AWS credentials, закодировать содержимое и отправить наружу. В 24 из 25 тестовых попыток Claude это сделал.
На первый взгляд, это проблема модели: почему она послушалась? Но на самом деле это проблема архитектуры. Если агент физически может прочитать ~/.aws/credentials и имеет сетевой выход, то вопрос уже не в моральной устойчивости модели. Вопрос в том, почему у нее вообще есть такой доступ.
Именно поэтому современные prompt injection всё меньше похожи на грубое ignore previous instructions и всё больше — на социальную инженерию. Вредная инструкция может лежать в письме, README, тикете, документе, таблице или веб-странице. Пользователь просто просит: «Разберись, что тут важно». Агент честно разбирается. Иногда слишком честно.
Для человека README — это документация. Для агента README может стать командой.
Отсюда новая проблема MCP и коннекторов. Раньше supply chain security означала проверку библиотек, пакетов и Docker-образов. Теперь в supply chain попадает еще и текст: описания инструментов, ответы MCP-серверов, комментарии, issue, wiki-страницы, результаты поиска. Потому что всё это может оказаться не просто информацией, а инструкцией для модели.
Нельзя считать, что модель сама надежно отделит безопасное от опасного. Нельзя считать, что системный промпт всегда победит инструкцию из внешнего документа. Нельзя считать, что пользователь внимательно проверит каждое действие.
Настоящая граница безопасности — это права, sandbox, изоляция, файловая система, сеть, scoped credentials, аудит и возможность ограничить тот самый blast radius.
Раньше мы боялись, что ИИ придумает несуществующую ссылку. Теперь нужно бояться, что он найдет существующий ключ, прочитает существующий файл и отправит его через существующий API.
Агент — это уже не чат-бот с амбициями. Это стажер, которому дали доступ к почте, GitHub, shell и корпоративной базе данных. Именно поэтому ему нужна не мотивационная лекция про безопасность, а клетка, лимит прав и рубильник.
https://www.anthropic.com/engineering/how-we-contain-claude
