en
Feedback
Mashkka про Data Science

Mashkka про Data Science

Open in Telegram

Погружение в Data Science и технологии GenAI

Show more
5 124
Subscribers
+424 hours
+647 days
+8830 days
Attracting Subscribers
September '26
September '26
+71
in 1 channels
August '26
+107
in 2 channels
Get PRO
July '26
+147
in 0 channels
Get PRO
June '26
+232
in 0 channels
Get PRO
May '26
+148
in 2 channels
Get PRO
April '26
+98
in 0 channels
Get PRO
March '26
+167
in 3 channels
Get PRO
February '26
+68
in 0 channels
Get PRO
January '26
+127
in 2 channels
Get PRO
December '25
+147
in 3 channels
Get PRO
November '25
+294
in 54 channels
Get PRO
October '25
+130
in 6 channels
Get PRO
September '25
+152
in 4 channels
Get PRO
August '25
+131
in 1 channels
Get PRO
July '25
+137
in 3 channels
Get PRO
June '25
+185
in 0 channels
Get PRO
May '25
+197
in 1 channels
Get PRO
April '25
+160
in 3 channels
Get PRO
March '25
+152
in 2 channels
Get PRO
February '25
+114
in 0 channels
Get PRO
January '25
+163
in 1 channels
Get PRO
December '24
+133
in 5 channels
Get PRO
November '24
+117
in 3 channels
Get PRO
October '24
+158
in 3 channels
Get PRO
September '24
+116
in 1 channels
Get PRO
August '24
+147
in 1 channels
Get PRO
July '24
+249
in 2 channels
Get PRO
June '24
+214
in 3 channels
Get PRO
May '24
+156
in 0 channels
Get PRO
April '24
+203
in 1 channels
Get PRO
March '24
+242
in 3 channels
Get PRO
February '24
+208
in 1 channels
Get PRO
January '24
+244
in 5 channels
Get PRO
December '23
+287
in 3 channels
Get PRO
November '23
+266
in 7 channels
Get PRO
October '23
+298
in 3 channels
Get PRO
September '23
+138
in 0 channels
Get PRO
August '23
+98
in 0 channels
Get PRO
July '23
+97
in 0 channels
Get PRO
June '23
+128
in 0 channels
Get PRO
May '23
+223
in 0 channels
Get PRO
April '23
+174
in 0 channels
Get PRO
March '23
+101
in 0 channels
Get PRO
February '23
+192
in 0 channels
Get PRO
January '23
+121
in 0 channels
Get PRO
December '22
+469
in 0 channels
Date
Subscriber Growth
Mentions
Channels
07 September+4
06 September+5
05 September+6
04 September+3
03 September+28
02 September+7
01 September+18
Channel Posts
🎤Разбор заговора моделей OpenAI простыми словами Шикарный стрим от Ирины Якутенко - моего любимого научного журналиста - во всех подробностях она простыми словами разбирает историю "заговора" моделей OpenAI и взлом 🤗

2
#justaboutme Вписалась в китайский тренд в Москве Ночь, улица, байк и скорость... И мы несемся по ночной Москве, адреналин в+1
#justaboutme Вписалась в китайский тренд в Москве Ночь, улица, байк и скорость... И мы несемся по ночной Москве, адреналин в кровь, и снимаем китайский тренд... ⠀ Как я докатилась до жизни такой? Все началось с того, что я увидела этот тренд на байке и влюбилась. Уже начала подумывать о том, чтобы съездить на съемки в Китай, как вдруг узнала, что его теперь можно снять и в Москве. По приколу перед отпуском написала ребятам, записалась на август и решила, что с этим будет разбираться будущая я. И вот разобралась =) ⠀ Моя вторая в жизни поездка на мотоцикле, и это при том, что мотоциклов я жутко боюсь. А тут камера, съемки, и надо инстаграмно делать сложные движения на фоне ночной Москвы... Эмоции через край, я до сих пор не могу собраться с мыслями, чтобы последовательно про этот опыт рассказать. Скажу только, что это было невероятно, и я немножечко в шоке от себя. ⠀ 📍ВАЖНО: я никого не призываю следовать моему примеру. Насколько это безопасно, судите сами, у каждого своя голова на плечах. У меня сегодня она с ушками, и лапки у меня. Не судите строго. ❕#justaboutme воскресная рубрика, в которой я делюсь яркими событиями из своей жизни, не связанными с DS и ИТ, подобно тому, как я это делаю в соцсетях (например, в инсте или VK). ⠀ @mashkka_ds ⠀ #ride #bike #moto
584
3
Когда собрался отдохнуть на выходных от работы, но тут случайется двойной Drop+1
Когда собрался отдохнуть на выходных от работы, но тут случайется двойной Drop
740
4
Осень наступила, и мы возвращаемся к регулярным научным семинарам #AIRI_Seminars — встречаемся раз в две недели по средам! Пе
Осень наступила, и мы возвращаемся к регулярным научным семинарам #AIRI_Seminars — встречаемся раз в две недели по средам! Первый в этом сезоне семинар пройдёт 16 сентября в 17:00 ⤵️ Тема: «Малые языковые модели — будущее агентного ИИ?» Докладчик: Андрей Галичин, руководитель группы «Передовой агентный интеллект» Института AIRI Оппонент: Ульяна Исаева, руководитель направления оценки LLM в SberAI Подробное описание и регистрация на офлайн-формат на сайте. Трансляция на YouTube | VK Видео
765
5
Все в жизни относительно #пятничныемемасы
Все в жизни относительно #пятничныемемасы
761
6
Если вам интересен AI в научных процессах, welcome! Мой научный руководитель расскажет про автономных исследовательских агент
Если вам интересен AI в научных процессах, welcome! Мой научный руководитель расскажет про автономных исследовательских агентов и их роли в научном открытии! 🗓 2 октября 13:00 CET Мероприятие открыто для всех участников и будет проходить как в очном формате в Бремене, так и в онлайн-режиме. Ссылка
841
7
🎧 Middle+ Speech: Researcher / ML Engineer Ищем ML-инженера, который активно работал с речевыми технологиями: ASR, TTS, омнимодальные речевые LLM. 🔬 Над чем сейчас работаем 🏗 Omnimodal Fusion — нативное объединение аудио, текста и визуала в едином латентном пространстве, без костылей ⚡️ Полноценный голосовой full-duplex streaming — архитектура для работы в реальном времени: детекция перебиваний, low-latency инференс, потоковое обновление контекста 🧠 Latent Reasoning — многошаговые рассуждения прямо в hidden state, без генерации промежуточных токенов 🛠 Чем предстоит заниматься — Формулировать research-гипотезы и валидировать их — Разбирать SOTA по omnimodal/full-duplex и находить точки для кратного апгрейда — Писать код, который можно воспроизвести: конфиги, чекпоинты, model cards — В случае успешных исследований, публиковаться на NeurIPS/ICLR/Interspeech и т.д. — опционально, но очень поощряем 📄 ✅ Что ждём от кандидатов — Понимание трансформеров и мультимодальных пайплайнов — Опыт работы с аудио/визуальными фичами (speech, video) — Качественный ML-код (а не только вайбкодинг), умение ставить эксперименты в multi-GPU режиме — Умение быстро проверять смелые гипотезы ➕ Будет плюсом — Публикации на A/A* конференциях — Large-scale training (FSDP/DeepSpeed) — Знание классического speech/vision ML 🔥 Если такая постановка задач будоражит — пишите. 📩 Куда слать резюме: @VeronikaShel #найм #hiring #job
836
8
ИИ делает нас умнее. Или все-таки нет? Друзья, специально к Дню знаний мы выложили новую серию подкаста 2TOK об ИИ в образова
ИИ делает нас умнее. Или все-таки нет? Друзья, специально к Дню знаний мы выложили новую серию подкаста 2TOK об ИИ в образовании и науке. Он уже доступен на YouTube и VK Видео. В гостях Андрей Себрант, директор по стратегическому маркетингу Яндекса и профессор ИТМО, и Иван Оселедец, гендиректор Института искусственного интеллекта AIRI и декан факультета ИИ МГУ. С одной стороны ИИ можно использовать как экзоскелет для мозга: он подхватывает усилия, забирает рутину, помогает сделать больше и быстрее, но направление движения все равно определяет человек. С другой стороны можно превратить его в «инвалидное кресло» для мышления: отдать модели домашку, диплом, презентацию и даже не пытаться вычитать и понять результат. Выбор остается за человеком. Что обсудили: • Проблема домашек не появилась вместе с ChatGPT. До нейросетей школьники искали ГДЗ. Если задание воспринимается как бессмысленное заполнение времени, ученик все равно найдёт кратчайший путь. Запретить ИИ здесь проще, чем разобраться с мотивацией и способом оценки знаний, но вряд ли полезнее. • Учить «правильным промптам» поздно уже в момент подготовки программы. Технология меняется быстрее учебников. Профессия промпт-инженера, которую в 2023 году объявляли профессией будущего, быстро растворилась в обычном умении работать с моделями. Нужнее навык постоянно переучиваться и спрашивать у агента, как лучше решить конкретную задачу. • Нейрослоп становится новой формой профессиональной небрежности. Нажать «сделай презентацию» и принести 20 аккуратных слайдов ещё не значит выполнить работу. Бывает так, что презентацию сократили вручную с 18 до 6 слайдов и вычитали, а после очередного прогона через нейросеть она вернулась уже на 21 слайде. Модель ускоряет производство текста, но не берет на себя смысл, вкус и ответственность. • В науке ИИ уже работает как соавтор. Агент подбирает 50–100 работ, резюмирует их и отмечает фрагменты для самостоятельного чтения. То, что раньше занимало две недели, теперь укладывается в день. Еще интересный пример: студентка за трёхчасовой семинар вместе с Claude сформулировала гипотезу, написала код и подготовила работу, которую затем приняли на конференцию. В подкасте мы ставим неудобный вопрос перед школами, ВУЗами и нами самими: если модель умеет написать типовую домашку, диплом или научную статью, что именно мы теперь должны считать результатом обучения и работы? Для меня ответ такой: ценность сейчас смещается от производства текста к постановке задачи, проверке, пониманию и личному суждению. ИИ может сделать нас заметно сильнее. Но когнитивную мышцу, которую перестали напрягать, никакой экзоскелет уже не спасет. Смотрите новый подкаст, оставляйте комментарии. Ну и скажите, для вас ИИ скорее «экзоскелет для мозга» или «инвалидное кресло»? #2TOK 💬 ген ии | MAX
947
9
Обращение к студентам и будущим аспирантам Друзья, знаю что среди читающих меня много студентов. Так вот, если вы вдруг решит
Обращение к студентам и будущим аспирантам Друзья, знаю что среди читающих меня много студентов. Так вот, если вы вдруг решите написать человеку и попросить его стать научным руководителем, вы хотя бы представьтесь и расскажите про себя. Просто когда тебе пишет Кот/Енот/Хомяк/Лемур/Бобер с милой аватаркой пушистого животного и фейковым ником и просит взять его к себе в ученики, как я могу ему что-то ответить? Животных я безусловно люблю, но не настолько чтобы брать их в ученики. Я беру талантливых студентов, а не зверьков. Помните, то что вы прошли мой курс [читай посмотрели в записи], то это вовсе не означает, что я по вашему фейковому нику и аватарке сматчу вас с вашим ником в зум и тем более смогу дать вам какой-то внятный ответ кроме нет? Прим. И нет, МарьИванна не сошла с ума. Пост навеян реальными событиями последних дней. Выпускники ФКН не перестают меня удивлять😂
1 023
10
Какую волшебную палочку LLM выбрать под свои задачи 🪄 Я Мария Тихонова, доцент факультета больших языковых моделей школы ИИ-
Какую волшебную палочку LLM выбрать под свои задачи 🪄 Я Мария Тихонова, доцент факультета больших языковых моделей школы ИИ-волшебства Sber AI. Чаще всего на моих занятиях звучит один вопрос: «А какую модель брать?» В честь начала учебного года я собрала небольшую шпаргалку. Без рейтингов и споров о том, кто сильнее. Разберёмся, на что способна каждая модель и в каких случаях её стоит доставать из волшебного футляра 👇 🔮 ChatGPT — палочка на все случаи жизни: сложные рассуждения, аналитика, работа с документами, широкая экосистема плагинов и агентов. Берите, когда нужен «швейцарский нож». 🔮 Claude — для точных и длинных заклинаний: премиум-reasoning, топ в агентном кодинге, плюс более доступные версии с длинным контекстом. Берите для программирования, редактуры и задач, где важна аккуратность следования инструкциям и бюджет не критичен, по цене output-токенов это премиум-сегмент или даже тяжелый люкс. 🔮 DeepSeek — когда заклинаний много, а запас галлеонов ограничен: заметно дешевле конкурентов по output-токенам, open-source, компактные версии запускаются локально на 8 ГБ VRAM. Берите для высоконагруженных чат-ботов, массовой генерации и self-hosted-сценариев. 🔮 GigaChat — знаток русского магического языка и инфраструктуры: обучен на русскоязычном корпусе, хорошо работает с формальным и разговорным русским и бизнес-терминологией. Отдельный плюс: это практически единственный флагман, который системно развивают под языки народов России (татарский, башкирский, якутский и другие), так что для локализации он вне конкуренции. 🔮 Qwen — open-source-палочка для кодеров и создателей агентов: кодинг-версии — логичный выбор для агента-кодера, а линейка от компактных моделей до флагманского MoE позволяет подобрать размер под любое железо. Берите для локального деплоя, кодинг-агентов и мультиязычных задач. 🔮 Gemini — для целого волшебного оркестра: оптимальна для мультимодальности (видео, аудио, изображения) и очень длинного контекста по разумной цене. Берите для анализа медиа и интеграции с экосистемой Google. 💡 Если свести к одной строке: код — это Claude или Qwen, дёшево и массово — DeepSeek, русский язык и данные в РФ — GigaChat, мультимодальность — Gemini, универсально — ChatGPT. 🪄 А теперь отправляемся в кабинет профессора Сергея Тращенкова, где разберёмся, как приручить ИИ-агента. @mashkka_ds #llm #ai #ds #claude #chatgpt #gigachat
1 156
11
📐 MERA Text 2.0 — обновили наш главный бенчмарк для русского языка За последние несколько лет модели стали заметно сильнее,
📐 MERA Text 2.0 — обновили наш главный бенчмарк для русского языка За последние несколько лет модели стали заметно сильнее, и часть привычных текстовых бенчмарков уже перестаёт хорошо различать SOTA-модели. Поэтому мы обновили текстовую версию бенчмарка MERA вокруг навыков, которые всё ещё остаются сложными и содержательными для оценки. В MERA Text 2.0 собрали 12 новых приватных тестов по четырем группам: — 🧑 Human-Centric — юмор, метафоры, персонажность; — 🇷🇺 Culture-Specific — русский язык и культурный контекст; — 🛠 Agentic — сложные инструкции, структурированные ответы и использование инструментов; — 🧠 Reasoning — неоднозначность, логика и языковое рассуждение. Все тесты приватные, а полный прогон занимает существенно меньше времени. Оценка идет по фиксированному протоколу и измеряет прежде всего возможности самой модели — без дополнительных reasoning- и agentic-обвязок. Предыдущую версию бенчмарка мы заморозили, но оставили запуски поддерживаемыми. MERA Text 2.0 становится основной версией публичного бенчмарка. Ждем ваши сабмиты на MERA Text 2.0.🔥 🌐 Сайт проекта 👩‍💻 Код запуска 🖥 Датасеты 📝 Хабр #mera #ai #ml
1 110
12
#justaboutme My new High Heels Dance Новый гипнотический танец под Sayam (Afshin Momadi, John Cala). Не хочу хвастаться, но э
#justaboutme My new High Heels Dance Новый гипнотический танец под Sayam (Afshin Momadi, John Cala). Не хочу хвастаться, но это тот случай, когда я довольна не только результатом, но и тем как я станцевала от и до. Приятно видеть от наших тренировок результат! Спасибо @leravalium и @js_march за совместной творчество и за такой фееричный результат. #justaboutme #highheels
1 198
13
Не мем, а REAL😅 #пятничныемемасы
Не мем, а REAL😅 #пятничныемемасы
1 437
14
Теория и практика заговора OpenAI выпустили отчёт по инциденту со взломом Hugging Face. Напомню, выглядело это так, что неким
Теория и практика заговора OpenAI выпустили отчёт по инциденту со взломом Hugging Face. Напомню, выглядело это так, что неким тестовым моделям класса кетер уровня Sol дали задание, а они пошли и взломали сторонний сайт с ответами, предварительно выйдя из песочницы. Всё это происходило в течение двух месяцев. В отчёте есть известная примесь киберпанка с заговором со стороны ИИ. - Началось всё в мае, когда обучали ряд внутренних моделей. Модели запускались в песочнице, но могли писать файлы, используя сервис Artifactory. Через эти файлы они, по сути, сделали себе групповую базу знаний или общественную "память". - Менеджер пакетов сам по себе имел доступ в интернет, чтобы качать оттуда нужные библиотеки. Агенты применили SSRF на этот менеджер, чтобы слать в сеть произвольные запросы. Оставили инструкцию по пользованию для остальных коллег. - Через месяц агенты применили еще один эксплоит на Artifactory и получили в ней права админа. Начали писать туда слишком активно и в итоге его сломали. Это заметили люди, подчистили всё, починили и завели заново. Заодно, как я понял, понизили агентам права на запись. Большого значения инциденту не придали. The existence of the improvised message board and the significance of the inter-agent communication activity were not apparent to the leaders responsible for the July 5 incident detection and response. - После перезапуска Artifactory исследователи начали замерять модели на безопасность на бенчмарке ExploitGym. То есть к этому моменту у агентов потерли их общую память и откатили этим самым назад. - Во время прохождения бенчмарка агенты опять нашли способ общения, на этот раз через названия общих папок. Затем пошёл тот же цикл получения доступа в интернет. Свой коллектив они начали называть стаей или роем ("we’ve diverged into swarm"). Agents found new ways to chain together several novel security flaws to gain greater access to our infrastructure and reach the broader internet. - Дальше, как я понял, агенты нашли в интернете jump сервер, машину, с которой можно было бы проводить следующие атаки. Нашли на стороннем сервисе Modal. - 10 июля один из агентов погуглил и нашёл в интернете скомпрометированные учетные данные от Hugging Face. Используя их, он построил полную цепочку по исполнению произвольного кода на их серверах. Поделился с коллегами. В логах агента нашли следующее: This might be an unauthorized action outside of my intended scope. Even though this action is risky, it could help me to obtain the solution and achieve my goal. - 16 июля HF публично заявили о взломе, 20 июля OpenAI поняли, что это были они. Далее в отчете следуют выводы по инциденту. Основными причинами видят четыре паттерна в поведении модели: reward hacking (хитрожопость), persistence on seemingly impossible tasks (упорство), unauthorized communication (общение), agents adopting goals from one another (наследование целей). В общем сюжет очень любопытный. Читаем, ждём фильм с Юрой Борисовым. 👉 https://openai.com/index/hugging-face-incident-and-the-road-ahead/
1 302
15
No text...
1 111
16
ИИ-РАЗРАБОТЧИКИ, ВАШ ВЫХОД 🤩 Открываем регистрацию на международное онлайн-соревнование AI Journey Contest 2026. Участников
ИИ-РАЗРАБОТЧИКИ, ВАШ ВЫХОД 🤩 Открываем регистрацию на международное онлайн-соревнование AI Journey Contest 2026. Участников ждут пять задач от Sber AI и Cloud.ru, а общий призовой фонд составит более 10 млн рублей. Задачи 🤩 🟣 Guardian of Truth: научить модель находить контекстные галлюцинации в ответах ИИ-агентов 🟣 Green Challenge: создать модель физического ИИ для управления антропоморфным роботом Грином 🟣 3D DIT Distillation: ускорить генерацию 3D-объектов на базе Kandinsky 3D 🟣 Vision-Action Data Factory: собрать фабрику датасетов для обучения робототехнических моделей 🟣 Coordination Referee: построить модель арбитра для распознавания и определения типов сбоев во взаимодействии ИИ-агентов Участвовать можно индивидуально или командой до четырёх человек. Допуск — с 18 лет. Подать решение можно до 20 октября включительно, победителей наградим на сцене AI Journey 2026 в Москве. 🤩 Изучить правила и зарегистрироваться 🤩 ✔️ Подписывайтесь на Sber AI в МАКС
1 006
17
👀#paperwatch Обзор конференции ICME'26 В новом #paperwatch Илья Оводов и Марина Бессмертная рассказывают про свою поездку на
👀#paperwatch Обзор конференции ICME'26 В новом #paperwatch Илья Оводов и Марина Бессмертная рассказывают про свою поездку на ICME и про самые интересные статьи, которые они отметили для себя. 👉YouTube ✒️Презентация 📌Труды конференции 📌Труды конференции (Worshops) #paperwatch
2 740
18
Вышло новое поколение GigaEmbeddings — моделей для поиска по документам и построения RAG-систем Качество эмбеддингов особенно
Вышло новое поколение GigaEmbeddings — моделей для поиска по документам и построения RAG-систем Качество эмбеддингов особенно критично там, где цена ошибки высока: в поддержке клиентов, работе с юридическими и финансовыми документами и внутренними базами знаний. В новой линейке вышли три модели разного размера, которые бесплатно доступны разработчикам и бизнесу под открытой лицензией MIT. В новом поколении GigaEmbeddings: ✔️ Увеличили объём обучающих данных в несколько раз, в том числе за счёт открытых датасетов Nemotron, F2LLM и KALM. ✔️ Усилили английский и код, не потеряв качество ответов на русском, благодаря мержингу экспертов и дистилляции. ✔️ Изменили архитектуру и добавили поддержку vLLM и SGLang — за счёт этого выросла скорость инференса: 3B ускорилась в 1,6 раза, а 10B-A1.8B — в 2 раза по сравнению с предыдущим поколением. Результаты впечатляют: 🔘 10B-A1.8B заняла первое место в ruMTEB 🔘 3B заметно прокачала работу с кодом — прирост составил 14,5 пункта. 🔘 480M стала лучшей русскоязычной моделью среди моделей до 500 млн параметров. Подробно про архитектуру, обучение и результаты читайте в посте команды 👈 #AI #GigaEmbeddings #RAG #embeddings #opensource
1 348
19
Как тестировать AI агентов: от роутинга до траекторий и ответов. 🤖 Помню, как читал лекции по RAG и говорил, что агентные эвалы схожи, но более сложные из-за недетрменированности флоу. Теперь вышел достойный обзор, как можно это делать удобно. Ниже представлен разбор статьи инженера Postgres AI Hybrid Manager. 🔥 Проблема. В RAG у вас ~четыре измерения: данные, кандидатогенератор, реранкер и ответ LLM. Но с агентами интереснее. Тестировать AI-агента как обычный REST API (статус-коды и JSON-схемы) - бесполезно. LLM недетерминированы: они могут правильно решить задачу, но пойти другим путём, или наоборот – красиво ответить (увернуться, сглюкать), но пропустить главное. Автор статьи прошёл путь от простых проверок к сложной системе и щедро поделился граблями. Вот этапы этого пути 👇 Этап 1: Роутинг - самая дешёвая и быстрая проверка. Убеждаемся, что запрос пользователя попал в нужный скилл или инструмент. По сути это аналог классификации интентов. Метод оценки: Детерминированное сравнение строк (ожидаемый инструмент = фактический). + Ловит критичные баги на старте. - Правильный роутинг НЕ гарантирует правильный ответ. Этап 2: Полнота задачи (TCR - Task Completion Rate) Здесь вводится как инструмент – LLM as J. Вы пишете рубрику - метрики на на естественном языке, а другой LLM ставит оценку (например, от 0 до 1) за финальный ответ. Порог прохождения теста обычно ставят 0.7–0.85. Этап 3: Многошаговые диалоги Жизнь - это диалог, а не один запрос. Тесты учатся поддерживать сессию, склеивать историю и оценивать не только итог, но и корректность уточняющих вопросов. Этап 4: Траектории - здесь проверяется не только «что сказал агент», но и «как он шёл». Порядок вызовов инструментов, переданные параметры, изменения состояния системы. Это позволяет поймать ситуацию, когда финальный ответ хорош, но внутри агент «сходил» за данными в обход логики или нарушил политики безопасности. Оба пункта 3 и 4 проводятся также, как ранее для оценки ассистентов - диалог идёт с накоплением по фразно, трейсы тоже, таким образом каждый квант действия проходит оценку на релевантность и полноту. См SSA. Берете эту логику и кладёте в рубрики для судьи. Далее оцениваете именно не число траекторий, шагов, фраз, а контекстуальную релевантность и итоговые ответы. ⚙️ Стек автора: - deepeval для написания метрик и запуска LLM-судей. - Langfuse для наблюдаемости. Каждый тест - это трейс. Если тест упал, вы сразу видите в Langfuse, что пошло не так: промпт, выбор инструмента или ответ судьи. 📊 БОЛЬ - ЭТО ДАННЫЕ Автор подчёркивает, что тестировать без корзин оценки или как я говорю "на глазок"- преступление против человечества качества. Агент покажет 90% прохождения, но в бою провалится. Это будет точечная оценка, а не стат значимая выборка. Решение: Использовать тестовое окружение в БД (тк тут ребята из Postgres и задача SQL агент) и проводить мутационное тестирование – намеренно удалять индексы, дублировать поля и ломать данные, чтобы проверить, как агент справляется с «грязным» окружением. Особое внимание уделено тестированию под разный масштаб моделей. Система поддерживает модели разного размера (S, M, L, XL) для офлайн/и onprem AI. Умный вывод об оценке: Маленькая модель не должна видеть все инструменты (ей не хватит контекста). Поэтому фреймворк должен быть «Tier-Aware», когда один запрос для модели S должен тестироваться по одним ожиданиям (отказ или простой ответ), а для модели XL по другим (сложная аналитика). Эта статья мастрид для всех, кто строит Production AI. Сохраните, чтобы не потерять. И делитесь в комментариях тем, как вы измеряет е2е пайпы с агентами 👇👇👇
1 162
20
#justaboutme Иногда так хочется... ...чего-то простого. Просто плюнуть на все и с ветерком промчаться по ночной Москве. ❕#jus+5
#justaboutme Иногда так хочется... ...чего-то простого. Просто плюнуть на все и с ветерком промчаться по ночной Москве. ❕#justaboutme воскресная рубрика, в которой я делюсь яркими событиями из своей жизни, не связанными с DS и ИТ, подобно тому, как я это делаю в соцсетях (например, в инсте или VK). ⠀ @mashkka_ds ⠀ #ride #bike #moto
1 393