uz
Feedback
Machine learning Interview

Machine learning Interview

Kanalga Telegram’da o‘tish

ИИ, Rust, вайбкодинг, Data Science, Deep Learning и делюсь тем, что интересно и полезно! Вопросы - @workakkk РКН: clck.ru/3FmwRz

Ko'proq ko'rsatish

📈 Telegram kanali Machine learning Interview analitikasi

Machine learning Interview (@machinelearning_interview) Rus til segmentidagi kanali faol ishtirokchi. Hozirda hamjamiyat 30 246 obunachidan iborat bo'lib, Texnologiyalar & Aralashmalar toifasida 4 323-o'rinni va Rossiya mintaqasida 21 358-o'rinni egallagan.

📊 Auditoriya ko‘rsatkichlari va dinamika

невідомо sanasidan buyon loyiha tez o‘sib, 30 246 obunachiga ega bo‘ldi.

01 Sentabr, 2026 dagi oxirgi ma’lumotlarga ko‘ra kanal barqaror faollikka ega. Oxirgi 30 kunda obunachilar soni 105 ga, so‘nggi 24 soatda esa 24 ga o‘zgardi va umumiy qamrov yuqori darajada qolmoqda.

  • Tasdiqlash holati: Tasdiqlanmagan
  • Jalb etish (ER): Auditoriya o‘rtacha 12.15% darajada jalb etiladi. Nashrdan keyingi dastlabki 24 soatda kontent odatda umumiy obunachilar sonining 7.32% ini tashkil etuvchi reaksiyalarni to‘playdi.
  • Post qamrovi: Har bir post o‘rtacha 3 675 marta ko‘riladi; birinchi sutkada odatda 2 214 ta ko‘rish yig‘iladi.
  • Reaksiyalar va o‘zaro ta’sir: Auditoriya faol: har bir postga o‘rtacha 31 ta reaksiya keladi.
  • Tematik yo‘nalishlar: Kontent claude, llm, контекст, hermes, nvidia kabi asosiy mavzularga jamlangan.

📝 Tavsif va kontent siyosati

Muallif resursni shaxsiy fikrni ifoda etish maydoni sifatida ta’riflaydi:
ИИ, Rust, вайбкодинг, Data Science, Deep Learning и делюсь тем, что интересно и полезно! Вопросы - @workakkk РКН: clck.ru/3FmwRz

Yuqori yangilanish chastotasi (oxirgi ma’lumot 02 Sentabr, 2026 da olingan) sababli kanal doimo dolzarb va katta qamrovli bo‘lib qoladi. Analitika auditoriya kontent bilan faol hamkorlik qilishini, uni Texnologiyalar & Aralashmalar toifasidagi muhim ta’sir nuqtasiga aylantirishini ko‘rsatadi.

30 246
Obunachilar
+2424 soatlar
+497 kun
+10530 kun
Postlar arxiv
KAT-Coder-V2.5-Dev: 35B параметров, но активны только 3B KwaiAI открыла KAT-Coder-V2.5-Dev - MoE-модель для агентной разработ
KAT-Coder-V2.5-Dev: 35B параметров, но активны только 3B KwaiAI открыла KAT-Coder-V2.5-Dev - MoE-модель для агентной разработки на базе Qwen3.6-35B-A3B. На каждом токене используется около 3 млрд параметров, при этом результаты выглядят серьёзно: - 69,4 на SWE-bench Verified; - 63,0 на SWE-bench Multilingual; - 41,02 на Terminal-Bench 2.1. Есть контекст 256K, tool calling, thinking и non-thinking режимы, а также сохранение истории рассуждений между шагами агента. Для обучения использовали 127 тысяч SFT-примеров и reinforcement learning. Доля некорректных tool labels снизилась с 9,34% до 0,28%, а непрерывные повторы — до 0%. Модель текстовая, без vision-модуля. Веса открыты под Apache 2.0. https://modelscope.ai/models/Kwaipilot/KAT-Coder-V2.5-Dev Paper: https://modelscope.ai/papers/2607.05471

⚡️ Moonshot AI открыла FlashKDA - быстрые CUDA-ядра для Kimi Delta Attention FlashKDA — реализация KDA на базе CUTLASS, заточ
⚡️ Moonshot AI открыла FlashKDA - быстрые CUDA-ядра для Kimi Delta Attention FlashKDA — реализация KDA на базе CUTLASS, заточенная под современные GPU NVIDIA. По бенчмаркам разработчиков: • H20: ускорение примерно до 2,31× относительно chunk_kdaGB200: до 3,27× на variable-length sequences • поддерживается batching последовательностей разной длины • интеграция уже есть в flash-linear-attention ≥ 0.5.0 — FlashKDA может автоматически выбираться как backend Требования пока серьёзные: SM90+, CUDA 12.9+ и PyTorch 2.4+. Интересно здесь другое: вместе с моделями Moonshot постепенно открывает и низкоуровневый стек, необходимый для быстрого запуска их архитектур. 🔗 https://github.com/MoonshotAI/FlashKDA

Repost from Machinelearning
🚨 Moonshot AI выложила Kimi K3 на Hugging Face — 2,8 ТРИЛЛИОНА параметров в открытых весах. Это первая open-weight модель класса ~3T. При этом благодаря MoE на каждом токене активируется 104 млрд параметров: 16 экспертов из 896. (Hugging Face) Что внутри: — контекст 1 048 576 токенов — нативная работа с текстом и изображениями — новая Kimi Delta Attention (KDA) — Attention Residuals — 93 слоя: 69 KDA + 24 Gated MLA — MXFP4-веса + MXFP8-активации — заявлено примерно 2,5× более эффективное масштабирование, чем у Kimi K2. (Hugging Face) K3 заточена под долгие агентные задачи: работу с огромными репозиториями, терминалом, исследования, оптимизацию GPU-ядер, компиляторы и другие многошаговые инженерные сценарии. (Hugging Face) Moonshot действительно опубликовала полные веса модели, а не ограничилась API. (Hugging Face) https://huggingface.co/moonshotai/Kimi-K3

Nvidia может поставить на OpenAI ещё $250 млрд, но теперь своим балансом По данным WSJ, Nvidia обсуждает гарантии примерно на
Nvidia может поставить на OpenAI ещё $250 млрд, но теперь своим балансом По данным WSJ, Nvidia обсуждает гарантии примерно на $250 млрд для гигантского AI-дата-центра OpenAI в Огайо. Это не перевод $250 млрд OpenAI: Nvidia фактически станет страховкой для кредиторов на случай дефолта по аренде и строительному долгу. Схема выглядит так: SB Energy строит → OpenAI арендует → Nvidia гарантирует часть риска. Масштаб безумный: кампус рассчитан на 10 ГВт вычислительных мощностей и ещё 10 ГВт новой генерации. Из них 9,2 ГВт планируют получить от газовых электростанций с $33,3 млрд японского финансирования. Ещё $4,2 млрд пойдут на электросети. При этом Nvidia отдельно обсуждает финансирование до $350 млрд закупок чипов OpenAI. Получается интересный цикл: Nvidia финансирует инфраструктуру клиента, помогает ему покупать собственные GPU и одновременно получает будущую выручку от этих закупок. Успеет ли OpenAI превратить эти гигантские мощности в деньги раньше, чем гарантии Nvidia превратятся в проблему для самой Nvidia? https://www.wsj.com/tech/ai/nvidia-in-talks-with-openai-to-guarantee-250-billion-financing-for-data-center-3dd6eae3

Команда GigaChat зовёт на вечеринку для AI-разработчиков и исследователей 🎉 29 июля, Сбер.Среда, пространство «Оригинал» (м.
Команда GigaChat зовёт на вечеринку для AI-разработчиков и исследователей 🎉 29 июля, Сбер.Среда, пространство «Оригинал» (м. «Курская», ул. Земляной Вал, 9А) Без докладов, презентаций и официальных дискуссий – только общение с коллегами по индустрии, обсуждение рабочих задач и болей, новые знакомства и летний вечер на веранде. Регистрация и подробности Надеемся на хорошую погоду 🥳 До встречи!

XYZ-Aquila-mini: компактная reasoning-модель для глубокого веб-поиска XYZ AI Lab выпустила XYZ-Aquila-mini под Apache 2.0. По
XYZ-Aquila-mini: компактная reasoning-модель для глубокого веб-поиска XYZ AI Lab выпустила XYZ-Aquila-mini под Apache 2.0. По заявленным результатам модель лидирует среди open-weight моделей до 40B сразу на нескольких поисковых бенчмарках: * GAIA - 97.1 * DeepSearchQA - 89.5 * BrowseComp - 78.8 Модель заточена под длинные цепочки планирования, поиск по англоязычному и китайскому вебу, проверку источников и восстановление после ошибок при работе с инструментами. Контекст до 256K токенов. Отдельно интересен их подход AI4AI: люди задают цели, ограничения и критерии качества, а ИИ-агенты сами разбирают ошибки и предлагают контролируемые изменения для post-training. Модель: https://modelscope.ai/models/XYZAILab/XYZ-Aquila-mini

✔️ Constella: локальная память для файлов, заметок и AI-агентов Constella — open-source desktop-приложение, которое индексиру
✔️ Constella: локальная память для файлов, заметок и AI-агентов Constella — open-source desktop-приложение, которое индексирует локальные файлы и превращает их в единую базу знаний для поиска и AI-агентов. Данные хранятся на устройстве: LanceDB используется для векторов, SQLite — для метаданных и knowledge graph. Что умеет: - индексировать Obsidian, Documents, Downloads и любые выбранные папки; - извлекать текст из PDF, DOCX, Markdown и изображений; - строить семантический поиск по локальным данным; - автоматически связывать заметки, темы и концепты; - работать с локальными и облачными LLM; - отдавать базу знаний через MCP в Claude Code; - использовать агентов и переиспользуемые workflows. Схема примерно такая:

Файлы
  ↓
chunks + embeddings
  ↓
LanceDB + SQLite
  ↓
Knowledge Graph
  ↓
поиск / агенты / MCP
https://github.com/Constella-OS/constella-desktop

Собрать AI-агента по туториалу можно за вечер. Но когда добавляешь память, RAG или несколько инструментов, возникают другие в
Собрать AI-агента по туториалу можно за вечер. Но когда добавляешь память, RAG или несколько инструментов, возникают другие вопросы: почему он свернул не туда, как найти место ошибки и как понять, не сделала ли новая правка систему хуже. Чтобы развивать такой продукт дальше, нужно понимать, как устроены вызовы модели и инструментов, где хранится контекст, как проверять качество и как вносить изменения. На курсе «AI-агенты» сначала пишем основные части на API: работу с LLM, structured output, tool-calling, память, RAG и evals. Затем используем LangChain и LangGraph там, где они действительно упрощают разработку, добавляем MCP, мониторинг и деплой.  Курс идёт 12 недель: живые занятия, практика, разборы решений и ревью кода. На выходе - пять агентных проектов и база, с которой можно собирать свои системы. → Посмотреть программу, формат и стоимость курса по ссылке Реклама ООО "ШВМ", ИНН: 5638076560 Erid: 2VtzqvrACMx

Лучше бы пил
Лучше бы пил

🔥 Бесплатный курс по нейросетям от Андрея Карпати: от backprop до GPT Neural Networks: Zero to Hero — бесплатный курс с виде
🔥 Бесплатный курс по нейросетям от Андрея Карпати: от backprop до GPT Neural Networks: Zero to Hero — бесплатный курс с видео и Jupyter-ноутбуками, где нейросети изучаются через реализацию руками. Что внутри: • backprop с нуля через micrograd • bigram и MLP-модели на PyTorch • разбор активаций, градиентов и BatchNorm • ручной backprop без loss.backward() • переход к WaveNet-подобной архитектуре • сборка GPT по шагам • основы BPE-токенизации Хороший вариант, чтобы понять, как нейросети работают изнутри, а не запоминать формулы. Проект open-source, лицензия MIT. 🔗 https://github.com/karpathy/nn-zero-to-hero

🧠 Face ID — это далеко не самая сложная задача в биометрии. Настоящие проблемы начинаются, когда систему нужно заставить работать не на красивом датасете, а в реальном мире. Например: • как отличить человека от фотографии или дипфейка • что делать, если лицо закрыто маской или очками • как запускать модели на слабом железе без потери качества • почему высокий accuracy почти ничего не говорит о надежности системы • какие метрики действительно важны (FAR, FRR, EER) Именно эти задачи ежедневно решают инженеры, которые разрабатывают биометрические системы для миллионов устройств. 28 июля в 19:00 пройдет открытый вебинар, где Иван Соломатин — к.т.н., ведущий инженер Samsung Electronics, преподаватель МФТИ и Harbour.Space [анкорная ссылка https://harbour.space], автор курсов онлайн-магистратуры MSAI (girafe.ai [анкорная ссылка https://girafe.ai /?utm_source=tg&utm_medium=posev&utm_campaign=machine_learning_interview] × МФТИ) разберет, как сегодня строятся современные системы биометрического распознавания. Обсудим: • как устроены современные биометрические пайплайны • какие существуют виды биометрических признаков • как защищают системы от спуфинга • почему хорошие модели иногда плохо работают в продакшене 📅 28 июля, 19:00 (МСК) Формат: онлайн, на платформе Zoom Участие бесплатное, необходима предварительная регистрация Если захотите глубже разобраться в Computer Vision, ML Engineering и других направлениях современного AI, посмотреть программу онлайн-магистратуры MSAI можно на сайте girafe.ai/msai-program [анкорная ссыдка https://girafe.ai /?utm_source=tg&utm_medium=posev&utm_campaign=machine_learning_interview] Реклама: Физ лицо Гончаренко В. В. ИНН 272403059890 Erid: 2VtzqvTq1Rt

Курт Гёдель нашёл «дыру» в Конституции США, которая, по его мнению, позволяла легально превратить страну в диктатуру. В 1947
Курт Гёдель нашёл «дыру» в Конституции США, которая, по его мнению, позволяла легально превратить страну в диктатуру. В 1947 году, готовясь к экзамену на американское гражданство, один из величайших логиков XX века внимательно изучил Конституцию и заявил, что обнаружил в ней внутреннее противоречие. По воспоминаниям, на собеседовании Гёдель даже попытался объяснить судье, как именно демократическая система теоретически может сама себя отменить через законные процедуры. Его друзья Альберт Эйнштейн и Оскар Моргенштерн, присутствовавшие рядом, быстро свернули дискуссию. История получила название Gödel’s Loophole.

Sakana AI обновила Fugu-Ultra: до +7,9 пункта на бенчмарках Вышла Fugu-Ultra v1.1. Sakana AI обновила пул frontier-моделей, к
Sakana AI обновила Fugu-Ultra: до +7,9 пункта на бенчмарках Вышла Fugu-Ultra v1.1. Sakana AI обновила пул frontier-моделей, которыми управляет её мультиагентный оркестратор. По данным компании, новая версия стала сильнее на всех опубликованных тестах, а прирост относительно v1.0 достигает 7,9 пункта. Особенно заметные улучшения заявлены на ProgramBench и Terminal Bench 2.1, то есть в задачах на кодинг и длительную работу агента. Fugu интересна тем, что за одним API скрывается сразу несколько моделей. Система сама выбирает экспертов, распределяет между ними роли и объединяет результаты в один ответ. Архитектура основана на исследованиях TRINITY и Conductor. Цена при этом осталась прежней: $5 за 1 млн входных токенов и $30 за 1 млн выходных для стандартного контекста. https://sakana.ai/fugu

Если хочешь развиваться в машинном обучении — решать реальные бизнес-задачи или уйти в исследования — в Центральном университ
Если хочешь развиваться в машинном обучении — решать реальные бизнес-задачи или уйти в исследования — в Центральном университете есть магистратура под оба сценария. И на нее можно получить грант до 75%. Места ограничены, дедлайн подачи заявок — 20 августа. «Машинное обучение» — это направление с несколькими форматами и треками. В офлайн-формате (пары по вечерам и в выходные в центре Москвы) можно выбрать один из трех треков: ⚫️Индустриальный — сильная база в ML, современные инструменты, реальные задачи от партнеров ⚫️Научный (AIRI × ЦУ) — сложные модели, исследования, подготовка к аспирантуре и работе в передовых лабораториях ⚫️ML в электронной коммерции × Lamoda — работа с реальными данными Lamoda, применение ML для бизнес-задач и возможность попасть на стажировку в компанию Для тех, кто хочет учиться из любой точки мира, есть онлайн-формат: основной трек и продвинутый — для специалистов с опытом в ML. Это полноценная альтернатива офлайну с теми же преподавателями и курсами. Магистратура в Центральном университете — это 2 года обучения, которое можно совмещать с работой, и диплом государственного образца. Карьерная поддержка начинается еще во время учебы: консультации, тренировочные собеседования и помощь с трудоустройством. Студенты уже в процессе обучения выходят на новые позиции или повышаются в грейде в Яндексе, Авито, Т-Банке и других компаниях. Поступление проходит через грантовый конкурс — это одновременно способ попасть на программу и возможность выиграть финансовую поддержку на все время обучения: грант покрывает до 75% стоимости. В 2026 году доступно 550 грантов на все программы магистратуры. Подробнее о программах и условиях участия в конкурсе — по ссылкам ➡️Офлайн программа ➡️Онлайн программа

OpenAI собрала библиотеку реальных сценариев работы с ChatGPT и Codex На сайте Work, in progress публикуют практические кейсы
OpenAI собрала библиотеку реальных сценариев работы с ChatGPT и Codex На сайте Work, in progress публикуют практические кейсы, эксперименты и промпты от разработчиков и обычных пользователей. Среди примеров: * создание сайтов, API и интерактивных инструментов; * работа с несколькими ИИ-агентами; * анализ документов и исследования; * ревью и исправление кода; * монтаж видео через Codex; * автоматизация повседневных задач. Материалы можно фильтровать по продукту, типу задачи, автору и языку. Полезная база идей для тех, кто ищет реальные способы встроить ChatGPT и Codex в работу. https://work-in-progress.openai.chatgpt.site/

МТС True Tech и ВТБ 2 августа приглашают на масштабное событие этого лета для специалистов по Data Science «Урбан ML». В трех
МТС True Tech и ВТБ 2 августа приглашают на масштабное событие этого лета для специалистов по Data Science «Урбан ML». В трех залах пройдут 17 выступлений и мастер-классов по RecSys, антифроду, NLP, LLM и агентным системам. Выступят Data Science-лидеры и эксперты из компаний: MTC Web Services (MWS), ВТБ, RWB, Sber AI Lab, X5, Звук, Альфа Банк и других компаний. Мероприятие пройдет в московском лофте с атмосферным двором. Участников ждут нетворкинг-активности, баскетбол, ИИ-шахматы и настольный теннис. А вечером — афтепати с диджей-миксами под открытым небом. Когда: 2 августа 11:00 — 22:00 Где: Москва, офлайн Участие бесплатное по предварительной регистрации. Количество мест ограничено. erid: 2W5zFFwJDaH

🚀 ИИ-модель китайской RedNote набрала 42 из 42 на математической олимпиаде dots-note-3.0 решила все шесть задач Международно
🚀 ИИ-модель китайской RedNote набрала 42 из 42 на математической олимпиаде dots-note-3.0 решила все шесть задач Международной математической олимпиады 2026 года. Официальные проверяющие поставили модели по 7 баллов за каждое доказательство. Такой же результат показали лишь 7 из 666 участников. Результат особенно важен из-за формата IMO. Здесь оценивают полный ход доказательства: пропущенный случай, логический разрыв или неуказанное условие снижают балл, даже если итоговый ответ верный. Модель работала с исходными условиями задач, использовала агентный цикл с рассуждениями на естественном языке и выполнением Python-кода. Затем она проверяла собственные доказательства, находила слабые места и переписывала решения. Во время тестирования вмешательство людей было запрещено. Для сравнения: в 2025 году модели Google DeepMind и OpenAI получили по 35 баллов из 42, что соответствовало уровню золотой медали. dots-note-3.0 пока находится в бете и является самой лёгкой моделью семейства dots3. В него также входят более крупные jazz и aria. RedNote обещает открыть модель, но дату пока не называет. scmp.com/tech/article/3361482/worlds-first-ai-model-earn-perfect-score-maths-olympiad-comes-chinas-rednote

Как научить матричную факторизацию реально планировать рекомендации на несколько шагов вперед Несмотря на развитие рекомендательных трансформеров и генеративных моделей, матричные факторизации по-прежнему широко применяются в рекомендательных системах. Обычно система берёт top-K айтемов, которые ближе всего к текущему эмбеддингу пользователя, не учитывая, как показ рекомендации изменит его профиль и последующие выдачи. Исследователи AI VK решили добавить к ALS планирование через Monte Carlo Tree Search. Работу Planning over Matrix-Factorization MDPs for Candidate Generation приняли на воркшопе Customer Journey в рамках KDD 2026. ### Как устроен подход За основу взяли ALS и механику обновления профилей из сервиса Profile Stream во VK. Эмбеддинг пользователя там пересчитывается после новых взаимодействий, поэтому процесс можно представить как RL-среду: - состояние — текущий эмбеддинг пользователя; - действие — показ конкретного айтема; - награда — близость к релевантным айтемам; - переход — обновление эмбеддинга по формулам ALS в допущении оптимистичной среды MCTS строит дерево возможных последовательностей рекомендаций. Каждая вершина соответствует состоянию пользователя, а ветви — кандидатам из top-K. В офлайн-экспериментах использовался оптимистичный сценарий: при переходе считалось, что пользователю понравился показанный айтем. Далее профиль обновлялся, и поиск продолжался уже из нового состояния. В результате Эксперименты провели на VK-LSVD, MovieLens-1M, KuaiRec, Yambda. При протоколе Leave-last-n планирование превзошло статический top-K на всех датасетах. На некоторых срезах VK-LSVD показатель Recall@10 вырос примерно в 1,5 раза. При Global time split, который ближе к реальному продакшн-сценарию, прирост сохранился на MovieLens-1M и VK-LSVD. Работа показывает, что поверх относительно лёгкой ALS можно использовать RL-планирование и учитывать будущую динамику пользовательского профиля. Следующие шаги: моделирование стохастической среды по логам и дистилляция MCTS-агента в быструю политику в духе MuZero. #aivkhub #rl #mcts #als

Как научить матричную факторизацию реально планировать рекомендации на несколько шагов вперед Несмотря на развитие рекомендательных трансформеров и генеративных моделей, матричные факторизации по-прежнему широко применяются в рекомендательных системах. Обычно система берёт top-K айтемов, которые ближе всего к текущему эмбеддингу пользователя, не учитывая, как показ рекомендации изменит его профиль и последующие выдачи. Исследователи AI VK решили добавить к ALS планирование через Monte Carlo Tree Search. Работу Planning over Matrix-Factorization MDPs for Candidate Generation приняли на воркшопе Customer Journey в рамках KDD 2026. ### Как устроен подход За основу взяли ALS и механику обновления профилей из сервиса Profile Stream во VK. Эмбеддинг пользователя там пересчитывается после новых взаимодействий, поэтому процесс можно представить как RL-среду: - состояние — текущий эмбеддинг пользователя; - действие — показ конкретного айтема; - награда — близость к релевантным айтемам; - переход — обновление эмбеддинга по формулам ALS в допущении оптимистичной среды MCTS строит дерево возможных последовательностей рекомендаций. Каждая вершина соответствует состоянию пользователя, а ветви — кандидатам из top-K. В офлайн-экспериментах использовался оптимистичный сценарий: при переходе считалось, что пользователю понравился показанный айтем. Далее профиль обновлялся, и поиск продолжался уже из нового состояния. ### В результате Эксперименты провели на VK-LSVD, MovieLens-1M, KuaiRec, Yambda. При протоколе Leave-last-n планирование превзошло статический top-K на всех датасетах. На некоторых срезах VK-LSVD показатель Recall@10 вырос примерно в 1,5 раза. При Global time split, который ближе к реальному продакшн-сценарию, прирост сохранился на MovieLens-1M и VK-LSVD. Работа показывает, что поверх относительно лёгкой ALS можно использовать RL-планирование и учитывать будущую динамику пользовательского профиля. Следующие шаги: моделирование стохастической среды по логам и дистилляция MCTS-агента в быструю политику в духе MuZero. #aivkhub #rl #mcts #als

Одна и та же ложь может по-разному влиять на LLM в зависимости от тона, уверенности и грамматической формы. В EoBench собрали
Одна и та же ложь может по-разному влиять на LLM в зависимости от тона, уверенности и грамматической формы. В EoBench собрали около 66 тысяч ложных утверждений в 19 стилях и проверили 18 моделей Gemma, Llama и Qwen. Для теста оставили только те факты, которые модель изначально знала правильно. Лучше всего модели убеждали: * приказы; * формальный язык; * обращение как к ребёнку; * ссылки на авторитет; * уверенная подача. Хуже всего работали слабые формулировки и контрфактические утверждения. Крупные модели реже принимали ложный контекст, а instruction tuning обычно дополнительно повышал устойчивость. Вывод: оценивать LLM нужно с учётом формы запроса. Небольшое изменение формулировки может заметно изменить ответ модели. Статья: *It’s Not What You Say, It’s How You Say It: Evaluating LLM Responses to Expressions of Belief* arxiv.org/abs/2607.18232

Machine learning Interview - Telegram kanali @machinelearning_interview statistikasi va tahlili