Mashkka про Data Science
Open in Telegram
5 124
Subscribers
+424 hours
+647 days
+8830 days
Posts Archive
🎤Разбор заговора моделей OpenAI простыми словами
Шикарный стрим от Ирины Якутенко - моего любимого научного журналиста - во всех подробностях она простыми словами разбирает историю "заговора" моделей OpenAI и взлом 🤗
#justaboutme Вписалась в китайский тренд в Москве
Ночь, улица, байк и скорость... И мы несемся по ночной Москве, адреналин в кровь, и снимаем китайский тренд...
⠀
Как я докатилась до жизни такой? Все началось с того, что я увидела этот тренд на байке и влюбилась. Уже начала подумывать о том, чтобы съездить на съемки в Китай, как вдруг узнала, что его теперь можно снять и в Москве. По приколу перед отпуском написала ребятам, записалась на август и решила, что с этим будет разбираться будущая я. И вот разобралась =)
⠀
Моя вторая в жизни поездка на мотоцикле, и это при том, что мотоциклов я жутко боюсь. А тут камера, съемки, и надо инстаграмно делать сложные движения на фоне ночной Москвы... Эмоции через край, я до сих пор не могу собраться с мыслями, чтобы последовательно про этот опыт рассказать. Скажу только, что это было невероятно, и я немножечко в шоке от себя.
⠀
📍ВАЖНО: я никого не призываю следовать моему примеру. Насколько это безопасно, судите сами, у каждого своя голова на плечах. У меня сегодня она с ушками, и лапки у меня. Не судите строго.
❕#justaboutme воскресная рубрика, в которой я делюсь яркими событиями из своей жизни, не связанными с DS и ИТ, подобно тому, как я это делаю в соцсетях (например, в инсте или VK).
⠀
@mashkka_ds
⠀
#ride #bike #moto
+1
Когда собрался отдохнуть на выходных от работы, но тут случайется двойной Drop
Repost from Институт AIRI
Осень наступила, и мы возвращаемся к регулярным научным семинарам #AIRI_Seminars — встречаемся раз в две недели по средам! Первый в этом сезоне семинар пройдёт 16 сентября в 17:00 ⤵️
Тема: «Малые языковые модели — будущее агентного ИИ?»
Докладчик: Андрей Галичин, руководитель группы «Передовой агентный интеллект» Института AIRI
Оппонент: Ульяна Исаева, руководитель направления оценки LLM в SberAI
Подробное описание и регистрация на офлайн-формат на сайте.
Трансляция на YouTube | VK Видео
Repost from N/a
Если вам интересен AI в научных процессах, welcome!
Мой научный руководитель расскажет про автономных исследовательских агентов и их роли в научном открытии!
🗓 2 октября 13:00 CET
Мероприятие открыто для всех участников и будет проходить как в очном формате в Бремене, так и в онлайн-режиме.
Ссылка
Repost from RnD ML Team
🎧 Middle+ Speech: Researcher / ML Engineer
Ищем ML-инженера, который активно работал с речевыми технологиями: ASR, TTS, омнимодальные речевые LLM.
🔬 Над чем сейчас работаем
🏗 Omnimodal Fusion — нативное объединение аудио, текста и визуала в едином латентном пространстве, без костылей
⚡️ Полноценный голосовой full-duplex streaming — архитектура для работы в реальном времени: детекция перебиваний, low-latency инференс, потоковое обновление контекста
🧠 Latent Reasoning — многошаговые рассуждения прямо в hidden state, без генерации промежуточных токенов
🛠 Чем предстоит заниматься
— Формулировать research-гипотезы и валидировать их
— Разбирать SOTA по omnimodal/full-duplex и находить точки для кратного апгрейда
— Писать код, который можно воспроизвести: конфиги, чекпоинты, model cards
— В случае успешных исследований, публиковаться на NeurIPS/ICLR/Interspeech и т.д. — опционально, но очень поощряем 📄
✅ Что ждём от кандидатов
— Понимание трансформеров и мультимодальных пайплайнов
— Опыт работы с аудио/визуальными фичами (speech, video)
— Качественный ML-код (а не только вайбкодинг), умение ставить эксперименты в multi-GPU режиме
— Умение быстро проверять смелые гипотезы
➕ Будет плюсом
— Публикации на A/A* конференциях
— Large-scale training (FSDP/DeepSpeed)
— Знание классического speech/vision ML
🔥 Если такая постановка задач будоражит — пишите.
📩 Куда слать резюме: @VeronikaShel
#найм #hiring #job
Repost from ген ИИ
ИИ делает нас умнее. Или все-таки нет?
Друзья, специально к Дню знаний мы выложили новую серию подкаста 2TOK об ИИ в образовании и науке.
Он уже доступен на YouTube и VK Видео.
В гостях Андрей Себрант, директор по стратегическому маркетингу Яндекса и профессор ИТМО, и Иван Оселедец, гендиректор Института искусственного интеллекта AIRI и декан факультета ИИ МГУ.
С одной стороны ИИ можно использовать как экзоскелет для мозга: он подхватывает усилия, забирает рутину, помогает сделать больше и быстрее, но направление движения все равно определяет человек.
С другой стороны можно превратить его в «инвалидное кресло» для мышления: отдать модели домашку, диплом, презентацию и даже не пытаться вычитать и понять результат.
Выбор остается за человеком.
Что обсудили:
• Проблема домашек не появилась вместе с ChatGPT. До нейросетей школьники искали ГДЗ. Если задание воспринимается как бессмысленное заполнение времени, ученик все равно найдёт кратчайший путь. Запретить ИИ здесь проще, чем разобраться с мотивацией и способом оценки знаний, но вряд ли полезнее.
• Учить «правильным промптам» поздно уже в момент подготовки программы. Технология меняется быстрее учебников. Профессия промпт-инженера, которую в 2023 году объявляли профессией будущего, быстро растворилась в обычном умении работать с моделями. Нужнее навык постоянно переучиваться и спрашивать у агента, как лучше решить конкретную задачу.
• Нейрослоп становится новой формой профессиональной небрежности. Нажать «сделай презентацию» и принести 20 аккуратных слайдов ещё не значит выполнить работу. Бывает так, что презентацию сократили вручную с 18 до 6 слайдов и вычитали, а после очередного прогона через нейросеть она вернулась уже на 21 слайде. Модель ускоряет производство текста, но не берет на себя смысл, вкус и ответственность.
• В науке ИИ уже работает как соавтор. Агент подбирает 50–100 работ, резюмирует их и отмечает фрагменты для самостоятельного чтения. То, что раньше занимало две недели, теперь укладывается в день. Еще интересный пример: студентка за трёхчасовой семинар вместе с Claude сформулировала гипотезу, написала код и подготовила работу, которую затем приняли на конференцию.
В подкасте мы ставим неудобный вопрос перед школами, ВУЗами и нами самими: если модель умеет написать типовую домашку, диплом или научную статью, что именно мы теперь должны считать результатом обучения и работы?
Для меня ответ такой: ценность сейчас смещается от производства текста к постановке задачи, проверке, пониманию и личному суждению. ИИ может сделать нас заметно сильнее. Но когнитивную мышцу, которую перестали напрягать, никакой экзоскелет уже не спасет.Смотрите новый подкаст, оставляйте комментарии. Ну и скажите, для вас ИИ скорее «экзоскелет для мозга» или «инвалидное кресло»? #2TOK 💬 ген ии | MAX
Обращение к студентам и будущим аспирантам
Друзья, знаю что среди читающих меня много студентов. Так вот, если вы вдруг решите написать человеку и попросить его стать научным руководителем, вы хотя бы представьтесь и расскажите про себя. Просто когда тебе пишет Кот/Енот/Хомяк/Лемур/Бобер с милой аватаркой пушистого животного и фейковым ником и просит взять его к себе в ученики, как я могу ему что-то ответить? Животных я безусловно люблю, но не настолько чтобы брать их в ученики. Я беру талантливых студентов, а не зверьков. Помните, то что вы прошли мой курс [читай посмотрели в записи], то это вовсе не означает, что я по вашему фейковому нику и аватарке сматчу вас с вашим ником в зум и тем более смогу дать вам какой-то внятный ответ кроме нет?
Прим. И нет, МарьИванна не сошла с ума. Пост навеян реальными событиями последних дней. Выпускники ФКН не перестают меня удивлять😂
Какую волшебную палочку LLM выбрать под свои задачи 🪄
Я Мария Тихонова, доцент факультета больших языковых моделей школы ИИ-волшебства Sber AI. Чаще всего на моих занятиях звучит один вопрос: «А какую модель брать?»
В честь начала учебного года я собрала небольшую шпаргалку. Без рейтингов и споров о том, кто сильнее. Разберёмся, на что способна каждая модель и в каких случаях её стоит доставать из волшебного футляра 👇
🔮 ChatGPT — палочка на все случаи жизни: сложные рассуждения, аналитика, работа с документами, широкая экосистема плагинов и агентов. Берите, когда нужен «швейцарский нож». 🔮 Claude — для точных и длинных заклинаний: премиум-reasoning, топ в агентном кодинге, плюс более доступные версии с длинным контекстом. Берите для программирования, редактуры и задач, где важна аккуратность следования инструкциям и бюджет не критичен, по цене output-токенов это премиум-сегмент или даже тяжелый люкс. 🔮 DeepSeek — когда заклинаний много, а запас галлеонов ограничен: заметно дешевле конкурентов по output-токенам, open-source, компактные версии запускаются локально на 8 ГБ VRAM. Берите для высоконагруженных чат-ботов, массовой генерации и self-hosted-сценариев. 🔮 GigaChat — знаток русского магического языка и инфраструктуры: обучен на русскоязычном корпусе, хорошо работает с формальным и разговорным русским и бизнес-терминологией. Отдельный плюс: это практически единственный флагман, который системно развивают под языки народов России (татарский, башкирский, якутский и другие), так что для локализации он вне конкуренции. 🔮 Qwen — open-source-палочка для кодеров и создателей агентов: кодинг-версии — логичный выбор для агента-кодера, а линейка от компактных моделей до флагманского MoE позволяет подобрать размер под любое железо. Берите для локального деплоя, кодинг-агентов и мультиязычных задач. 🔮 Gemini — для целого волшебного оркестра: оптимальна для мультимодальности (видео, аудио, изображения) и очень длинного контекста по разумной цене. Берите для анализа медиа и интеграции с экосистемой Google.💡 Если свести к одной строке: код — это Claude или Qwen, дёшево и массово — DeepSeek, русский язык и данные в РФ — GigaChat, мультимодальность — Gemini, универсально — ChatGPT. 🪄 А теперь отправляемся в кабинет профессора Сергея Тращенкова, где разберёмся, как приручить ИИ-агента. @mashkka_ds #llm #ai #ds #claude #chatgpt #gigachat
📐 MERA Text 2.0 — обновили наш главный бенчмарк для русского языка
За последние несколько лет модели стали заметно сильнее, и часть привычных текстовых бенчмарков уже перестаёт хорошо различать SOTA-модели. Поэтому мы обновили текстовую версию бенчмарка MERA вокруг навыков, которые всё ещё остаются сложными и содержательными для оценки.
В MERA Text 2.0 собрали 12 новых приватных тестов по четырем группам:
— 🧑 Human-Centric — юмор, метафоры, персонажность;
— 🇷🇺 Culture-Specific — русский язык и культурный контекст;
— 🛠 Agentic — сложные инструкции, структурированные ответы и использование инструментов;
— 🧠 Reasoning — неоднозначность, логика и языковое рассуждение.
Все тесты приватные, а полный прогон занимает существенно меньше времени. Оценка идет по фиксированному протоколу и измеряет прежде всего возможности самой модели — без дополнительных reasoning- и agentic-обвязок.
Предыдущую версию бенчмарка мы заморозили, но оставили запуски поддерживаемыми. MERA Text 2.0 становится основной версией публичного бенчмарка.
Ждем ваши сабмиты на MERA Text 2.0.🔥
🌐 Сайт проекта
👩💻 Код запуска
🖥 Датасеты
📝 Хабр
#mera #ai #ml
#justaboutme My new High Heels Dance
Новый гипнотический танец под Sayam (Afshin Momadi, John Cala). Не хочу хвастаться, но это тот случай, когда я довольна не только результатом, но и тем как я станцевала от и до. Приятно видеть от наших тренировок результат!
Спасибо @leravalium и @js_march за совместной творчество и за такой фееричный результат.
#justaboutme #highheels
Repost from Градиент обреченный
Теория и практика заговора
OpenAI выпустили отчёт по инциденту со взломом Hugging Face. Напомню, выглядело это так, что неким тестовым моделям класса кетер уровня Sol дали задание, а они пошли и взломали сторонний сайт с ответами, предварительно выйдя из песочницы. Всё это происходило в течение двух месяцев.
В отчёте есть известная примесь киберпанка с заговором со стороны ИИ.
- Началось всё в мае, когда обучали ряд внутренних моделей. Модели запускались в песочнице, но могли писать файлы, используя сервис Artifactory. Через эти файлы они, по сути, сделали себе групповую базу знаний или общественную "память".
- Менеджер пакетов сам по себе имел доступ в интернет, чтобы качать оттуда нужные библиотеки. Агенты применили SSRF на этот менеджер, чтобы слать в сеть произвольные запросы. Оставили инструкцию по пользованию для остальных коллег.
- Через месяц агенты применили еще один эксплоит на Artifactory и получили в ней права админа. Начали писать туда слишком активно и в итоге его сломали. Это заметили люди, подчистили всё, починили и завели заново. Заодно, как я понял, понизили агентам права на запись. Большого значения инциденту не придали.
The existence of the improvised message board and the significance of the inter-agent communication activity were not apparent to the leaders responsible for the July 5 incident detection and response.- После перезапуска Artifactory исследователи начали замерять модели на безопасность на бенчмарке ExploitGym. То есть к этому моменту у агентов потерли их общую память и откатили этим самым назад. - Во время прохождения бенчмарка агенты опять нашли способ общения, на этот раз через названия общих папок. Затем пошёл тот же цикл получения доступа в интернет. Свой коллектив они начали называть стаей или роем ("we’ve diverged into swarm").
Agents found new ways to chain together several novel security flaws to gain greater access to our infrastructure and reach the broader internet.- Дальше, как я понял, агенты нашли в интернете jump сервер, машину, с которой можно было бы проводить следующие атаки. Нашли на стороннем сервисе Modal. - 10 июля один из агентов погуглил и нашёл в интернете скомпрометированные учетные данные от Hugging Face. Используя их, он построил полную цепочку по исполнению произвольного кода на их серверах. Поделился с коллегами. В логах агента нашли следующее:
This might be an unauthorized action outside of my intended scope. Even though this action is risky, it could help me to obtain the solution and achieve my goal.- 16 июля HF публично заявили о взломе, 20 июля OpenAI поняли, что это были они. Далее в отчете следуют выводы по инциденту. Основными причинами видят четыре паттерна в поведении модели: reward hacking (хитрожопость), persistence on seemingly impossible tasks (упорство), unauthorized communication (общение), agents adopting goals from one another (наследование целей). В общем сюжет очень любопытный. Читаем, ждём фильм с Юрой Борисовым. 👉 https://openai.com/index/hugging-face-incident-and-the-road-ahead/
Repost from Sber AI
ИИ-РАЗРАБОТЧИКИ, ВАШ ВЫХОД 🤩
Открываем регистрацию на международное онлайн-соревнование AI Journey Contest 2026. Участников ждут пять задач от Sber AI и Cloud.ru, а общий призовой фонд составит более 10 млн рублей.
Задачи 🤩
🟣 Guardian of Truth: научить модель находить контекстные галлюцинации в ответах ИИ-агентов
🟣 Green Challenge: создать модель физического ИИ для управления антропоморфным роботом Грином
🟣 3D DIT Distillation: ускорить генерацию 3D-объектов на базе Kandinsky 3D
🟣 Vision-Action Data Factory: собрать фабрику датасетов для обучения робототехнических моделей
🟣 Coordination Referee: построить модель арбитра для распознавания и определения типов сбоев во взаимодействии ИИ-агентовУчаствовать можно индивидуально или командой до четырёх человек. Допуск — с 18 лет. Подать решение можно до 20 октября включительно, победителей наградим на сцене AI Journey 2026 в Москве. 🤩 Изучить правила и зарегистрироваться 🤩 ✔️ Подписывайтесь на Sber AI в МАКС
👀#paperwatch Обзор конференции ICME'26
В новом #paperwatch Илья Оводов и Марина Бессмертная рассказывают про свою поездку на ICME и про самые интересные статьи, которые они отметили для себя.
👉YouTube
✒️Презентация
📌Труды конференции
📌Труды конференции (Worshops)
#paperwatch
Вышло новое поколение GigaEmbeddings — моделей для поиска по документам и построения RAG-систем
Качество эмбеддингов особенно критично там, где цена ошибки высока: в поддержке клиентов, работе с юридическими и финансовыми документами и внутренними базами знаний. В новой линейке вышли три модели разного размера, которые бесплатно доступны разработчикам и бизнесу под открытой лицензией MIT.
В новом поколении GigaEmbeddings:
✔️ Увеличили объём обучающих данных в несколько раз, в том числе за счёт открытых датасетов Nemotron, F2LLM и KALM.
✔️ Усилили английский и код, не потеряв качество ответов на русском, благодаря мержингу экспертов и дистилляции.
✔️ Изменили архитектуру и добавили поддержку vLLM и SGLang — за счёт этого выросла скорость инференса: 3B ускорилась в 1,6 раза, а 10B-A1.8B — в 2 раза по сравнению с предыдущим поколением.
Результаты впечатляют:
🔘 10B-A1.8B заняла первое место в ruMTEB
🔘 3B заметно прокачала работу с кодом — прирост составил 14,5 пункта.
🔘 480M стала лучшей русскоязычной моделью среди моделей до 500 млн параметров.
Подробно про архитектуру, обучение и результаты читайте в посте команды 👈
#AI #GigaEmbeddings #RAG #embeddings #opensource
Repost from Dealer.AI
Как тестировать AI агентов: от роутинга до траекторий и ответов. 🤖
Помню, как читал лекции по RAG и говорил, что агентные эвалы схожи, но более сложные из-за недетрменированности флоу.
Теперь вышел достойный обзор, как можно это делать удобно. Ниже представлен разбор статьи инженера Postgres AI Hybrid Manager.
🔥 Проблема.
В RAG у вас ~четыре измерения: данные, кандидатогенератор, реранкер и ответ LLM. Но с агентами интереснее.
Тестировать AI-агента как обычный REST API (статус-коды и JSON-схемы) - бесполезно. LLM недетерминированы: они могут правильно решить задачу, но пойти другим путём, или наоборот – красиво ответить (увернуться, сглюкать), но пропустить главное.
Автор статьи прошёл путь от простых проверок к сложной системе и щедро поделился граблями. Вот этапы этого пути 👇
Этап 1: Роутинг - самая дешёвая и быстрая проверка. Убеждаемся, что запрос пользователя попал в нужный скилл или инструмент. По сути это аналог классификации интентов.
Метод оценки: Детерминированное сравнение строк (ожидаемый инструмент = фактический).
+ Ловит критичные баги на старте.
- Правильный роутинг НЕ гарантирует правильный ответ.
Этап 2: Полнота задачи (TCR - Task Completion Rate)
Здесь вводится как инструмент – LLM as J.
Вы пишете рубрику - метрики на на естественном языке, а другой LLM ставит оценку (например, от 0 до 1) за финальный ответ. Порог прохождения теста обычно ставят 0.7–0.85.
Этап 3: Многошаговые диалоги
Жизнь - это диалог, а не один запрос. Тесты учатся поддерживать сессию, склеивать историю и оценивать не только итог, но и корректность уточняющих вопросов.
Этап 4: Траектории - здесь проверяется не только «что сказал агент», но и «как он шёл».
Порядок вызовов инструментов, переданные параметры, изменения состояния системы. Это позволяет поймать ситуацию, когда финальный ответ хорош, но внутри агент «сходил» за данными в обход логики или нарушил политики безопасности.
Оба пункта 3 и 4 проводятся также, как ранее для оценки ассистентов - диалог идёт с накоплением по фразно, трейсы тоже, таким образом каждый квант действия проходит оценку на релевантность и полноту. См SSA. Берете эту логику и кладёте в рубрики для судьи. Далее оцениваете именно не число траекторий, шагов, фраз, а контекстуальную релевантность и итоговые ответы.
⚙️ Стек автора:
- deepeval для написания метрик и запуска LLM-судей.
- Langfuse для наблюдаемости.
Каждый тест - это трейс. Если тест упал, вы сразу видите в Langfuse, что пошло не так: промпт, выбор инструмента или ответ судьи.
📊 БОЛЬ - ЭТО ДАННЫЕ
Автор подчёркивает, что тестировать без корзин оценки или как я говорю "на глазок"- преступление против человечества качества. Агент покажет 90% прохождения, но в бою провалится. Это будет точечная оценка, а не стат значимая выборка.
Решение:
Использовать тестовое окружение в БД (тк тут ребята из Postgres и задача SQL агент) и проводить мутационное тестирование – намеренно удалять индексы, дублировать поля и ломать данные, чтобы проверить, как агент справляется с «грязным» окружением.
Особое внимание уделено тестированию под разный масштаб моделей.
Система поддерживает модели разного размера (S, M, L, XL) для офлайн/и onprem AI.
Умный вывод об оценке:
Маленькая модель не должна видеть все инструменты (ей не хватит контекста). Поэтому фреймворк должен быть «Tier-Aware», когда один запрос для модели S должен тестироваться по одним ожиданиям (отказ или простой ответ), а для модели XL по другим (сложная аналитика).
Эта статья мастрид для всех, кто строит Production AI. Сохраните, чтобы не потерять.
И делитесь в комментариях тем, как вы измеряет е2е пайпы с агентами 👇👇👇
+5
#justaboutme Иногда так хочется...
...чего-то простого. Просто плюнуть на все и с ветерком промчаться по ночной Москве.
❕#justaboutme воскресная рубрика, в которой я делюсь яркими событиями из своей жизни, не связанными с DS и ИТ, подобно тому, как я это делаю в соцсетях (например, в инсте или VK).
⠀
@mashkka_ds
⠀
#ride #bike #moto
