EdTech, AI и HighLoad | Блог AK из Школково
前往频道在 Telegram
CEO ZeroAgency, руководитель разработки онлайн-платформы Школково. Пишу про IT, AI и HighLoad разработку. Личный блог: @daily_ak YT: youtube.com/@segfault_11 Контакт для связи: @bethrezen
显示更多825
订阅者
无数据24 小时
无数据7 天
-330 天
帖子存档
🤷♂️ Qwen3.8-Flash-Next не оправдал мои надежды.
Есть у нас вымученный датасет с 89 тасками для агента.
Qwen3.8-27B по качеству сильно опережает Qwen3.8-Flash-Next.
Скорость по tok/s у Flash-Next похожа на 27B-NVFP4.
Тулзов вызывает сильно больше, но даже не смотря на это с задачей справляется хуже, хоть и завершает её быстрее.
Ну и понятное дело, в силу размера модели и новизны архитектуры - тюнить его я даже и не пробовал пока что.
В целом, по трейсам сложилось впечатление, что реальный пре-трейн у модели крайне слабый, как и пост-трейн - примерно на уровне qwen3.5. Видимо в превью как всегда сделали упор на бенчмарках, а не реальных задачах.
Русские знания о мире по моим опять таки ощущениям слабее, чем в qwen3.8-27b. То есть total params + ngram здесь как будто бы ничего не дали.
Возможно в ваших сценариях эта модель и проявит себя лучше.
Тесты проводились на 2 серверах с 4x RTX Pro 6000.
Flash-Next запускался с TP=4 EP=4
Остальные модели PP=4
На злобу дня, так сказать.
Кто-то может не знает, но я не только языковыми моделями занимаюсь. Есть ещё всякие интересные проекты. Один из них - модель для предсказания балла на экзамене и составления индивидуального плана для ученика.
И вот сегодня выходит демоверсии. В некоторых предметах всё очень сильно поменялось. Самое критичное здесь - набор тем и задач.
Всё было бы страшно, если бы я этого не предусмотрел и строил всё вокруг конкретных тем. Но поскольку ЕГЭ не первый раз меняют - я сразу предусмотрел этот момент, сделав True ID-free модель. Поэтому по сути сильно на метриках качества это не ударит.
Такие дела ^_^
Repost from Максим Коваль. ЕГЭ по математике
🔥Как зарабатывать 5 миллионов в месяц на IT и быть счастливым?
Вышел мой подкаст с генеральным директором ZeroAgency и главным разработчиком платформ Школково и Бобр 🦫📱🚀
Поговорили о том, как стать настоящим профессионалом в IT, заниматься любимым делом и при этом хорошо зарабатывать 👇👇👇
🦫 Бобр | 📱 Ютуб | 📱 VK-Видео
Слушайте, вникайте) и не забудьте поставить 👍❤️
Оп-паа. Что это тут у нас?
125B A6B, 512 экспертов(10 routed + 1 shared) на 640d
Гибридный аттеншен: GDN + QSA (QwenSparseAttention) - 12 слоев в 3:1
N-gram Embedding
И если посмотреть, это прям во многом похоже на мой незавершенный эксперимент по LLM с нуля, на который так и не хватило ресурсов
По метрикам естественно интереснее Qwen3.8-27B, 3.7-Plus.
Кстати, Qwen3.8-27B не просто хороший релиз, но и показатель, куда движется опенсорс.
Это не только хороший качественный RL и post-training.
Лично для меня самое знаковое, это что в 3.8 появился официальный
reasoning_effort={low, medium, xhigh}, причём с xhigh default.
Также по сравнению с Qwen3.6-27B, где output рекомендовали выставлять в 32768 tok для обычных задач и 81920 для сложных - в 3.8 уже прямо говорят про 262144 ток.
Т.е. фокус на агентов не просто с контролем "а сколько думать", но и действительно чтобы они выдавали как можно больше полезного контента.
Конечно же, старые добрые chat_template_kwargs с enable_thinking и preserve_thinking из чат-шаблона не выкинули, так что не забывайте про эти параметры тоже.
Ну и сразу вангую, что одним из следующих небольших направлений развития будет не просто привычное сжатие контекста, а сжатие того самого ризонинга на предыдущих шагах - либо просто как обычный compact, либо более хитрые схемы с эмбеддингами/memory/прочими трюками. Кмк, это логичное развитие в сторону решения cost/gpu проблем.+4
Qwen выпустили Qwen3.8-27B — и это неожиданно большой скачок относительно Qwen3.6-27B 🚀
Это всё ещё dense-модель на 27B параметров, но прирост особенно заметен не на классических knowledge-бенчмарках, а на реальных coding-, agentic- и multimodal-задачах.
Несколько примеров Qwen3.8-27B → против Qwen3.6-27B:
• Terminal Bench 2.1: 63.4 → 73.0
• SWE-bench Pro: 53.5 → 61.7
• DeepSWE 1.1: 13.3 → 42.2 — более чем ×3
• QwenSWEBench: 49.3 → 79.0
• Agents' Last Exam Pass@1: 10.6 → 20.4
• HLE: 24.0 → 30.8
• LiveCodeBench v6: 83.9 → 90.3
Но самый интересный скачок, кажется, произошёл в мультимодальных агентах:
• OSWorld: 63.9 → 84.3
• WebArena: 48.8 → 64.8
• RecreationBench: 29.8 → 47.1
• SWE-MM: 25.7 → 38.6
• Vision2Web: 45.0 → 62.9
• BabyVision: 28.9 → 65.7
Причём на некоторых тестах локальная open-weight 27B уже оказывается на уровне или выше гораздо более крупных закрытых моделей из сравнительной таблицы самого Qwen.
По архитектуре всё как и у qwen3.6-27b - это 64 слоя,
d_model=5120, гибрид Gated DeltaNet + Gated Attention, FFN 17,408, multi-step MTP и нативный контекст 262K с возможностью расширения до 1M.
Что особенно интересно: на GPQA прирост всего 87.8 → 89.2, зато на длинных агентских задачах местами +50–200%. Похоже, основной прогресс поколения 3.8 — уже не просто «модель стала немного умнее», а существенно лучше научилась долго планировать, пользоваться окружением, писать и исправлять код и доводить сложные задачи до конца.
На картинках ниже собрал все опубликованные Qwen метрики, сравнил с Qwen3.6-27B и, где возможно, с Qwen3.6-35B-A3B, плюс добавил Qwen3.7-Plus, Muse Glimmer-30B и Opus4.6 Max.
Очень мощный релиз для 27B.
Вот мы и определились, на базе чего будем тюнить мультимодалки ^_^
Для скорости пока что всё ещё юзаем Qwen3.6-35B-A3B, а для качественных задач новый фаворит!
🤗 Веса на HF: bf16 | fp8🤖 AI-бот сделал ревью кода.
GitLab прислал письмо об этом.
Gemini в gmail сделал AI Overview.
...
What's next?
PS: ревью кажется тупорылым, потому что это тестовое ревью на тестовом репозитории, так что всё норм на самом деле - это просто PoC
Навайбкодил тут давно статус-лайн с контекстом, затратами, лимитами и прочим.
Работает на Claude Code и Codex.
Кому надо - берите, форкайте/юзайте https://github.com/bethrezen/status-line
🔥 Бомбическое преимущество Vision LLM для простых рутинных задач
Предыстория
В прошлом году я уже занимался оцифровкой разбалловки результатов учеников для разработки модели предсказания баллов и рекомендательной системы.
Тогда я тоже запилил простой интерфейс и ручками вбивал все эти данные, потому что по-нормальному и быстро автоматизировать это тогда не удалось, а датасет для трейна нужен был срочно.
Из данных я тогда выкинул те, где дети не указали свой тестовый балл в отдельном поле. Ну и понятное дело, очень много результатов, где 10 шакалов из 10, оцифровать не удалось.
Наши дни
Наколеночное решение из поста выше помогло добавить примерно ещё треть к датасету. Это результаты, где не проставлен был балл или разбалловка трудно читалась из-за качества картинки(см. скрин, да-да, в таком качестве прислали результаты...).
+34% к объёму трейн данных - это на самом деле очень ощутимо и круто!
Да, есть риск, что нейронка криво распознала цифры на изображении. Но этот риск снимается прогоном предыдущей модели предсказания баллов по этому юзеру. Если распознавание Vision совпадает с предсказанием модели - значит всё распознано верно и историю этого пользователя можно спокойно добавлять в датасет обучения новой модельки.
Такие дела ^_^
Простое и очевидное решение на коленке, которое сберегло мои нервы.
Дано: тысячи результатов экзаменов учащихся в виде картинок
Задача: оцифровать разбалловку и провалидировать данные
Основная проблема в том, что дети присылают скриншоты результатов максимально странным образом. Плюс есть ещё куча разных сайтов, где эти результаты в разных форматах отображаются.
Это в этом году мы додумались просить детей забивать эти данные самим в форме. А в прошлые года вот что-то не догадались... Ну ничего, сейчас бы с ллмкой быстро всё оцифруем как надо.
Решение: прогоняем через LLM с Vision. В результате большая часть данных нуждается только в быстрой проверке и нажатии на Enter.
🖤 Zero Fest, он же "Ноль фест" в Тамбове 1 августа.
Раньше был "Рок над Студенцом", но по определенным причинам он не смог продолжиться в прежнем формате. Поэтому я решил вписаться в этот движ со своей компанией и помочь ребятам. Ну и теперь это "Ноль фест".
В этом году будут не только местные артисты, но и гости из Санкт-Петербурга.
DenDerty, которые выступали у нас на корпоративе в прошлом году, Молодость Внутри и Вася Васин из группы "Кирпичи".
Для нашего города это уникальное мероприятие, которое всем советую обязательно посетить!
Билеты по ссылке: vk.cc/cYe5vi
🎮 Самый неоднозначный девайс NVIDIA
Брал я тут в марте 7шт. DGX Spark.
Очень хотелось попробовать этот девайс давно - ещё со старта хотел его купить. Но появляться по вменяемым ценам они начали только сейчас.
NVIDIA обещала крутую производительность в FP4.
Но что мы имеем по факту?
1. Очень медленную unified memory LPDDR5x.
2. Коробки очень горячие и уходят в троттлинг. Temperature cap стоит где-то на 70C.
3. DGX Spark инференсит Qwen3.6-35B-A3B в NVFP4 со спекулятивным декодингом DFlash со скоростью 100-200 tok/s. на оптимизированном VLLM с кастомными ядрами под GB10.
Соответственно ШЕСТЬ DGX Spark в реальности у меня дают 700-1500 tok/s.
Для сравнения - ОДИН GPU RTX Pro 6000 Blackwell Workstation даёт 1000-1200 tok/s.
Нагрузка 1-в-1 одинаковая.
Простая математика
RTX Pro 6000 Blackwell стоит примерно 1-1.1M руб.
DGX Spark стоит ~500к руб.
6x DGX Spark = 3M руб. и это в лучшем случае 1500 tok/s, но 768GB памяти на скорости 273 GB/s.
Рабочая станция с 2x RTX Pro 6000 Blackwell - те же 3M руб.(дада, можно и дешевле) и это 2200 tok/s, а это всего лишь 192GB VRAM на скорости 1792 GB/s.
И это я ещё не говорю про то, как в реальности работают все эти кольца из 200Gbit/s линков между тремя спарками. Спойлер: плохо.
Выводы
DGX Spark проигрывают примерно везде и по всем фронтам. Обещания NVIDIA - пустой маркетинг.
Коробки вообще никому не рекомендую даже для экспериментов, даже с QLoRa. Для трейна не годится. Для инференса - тоже.
Лучше за те же деньги собрать ПК с игровой видеокартой.
Единственное годное применение - тихий локальный AI-ассистент для дома.Вот только вопрос - сколько он прослужит с такими рабочими температурами.
+2
Вот мы и выкатили бесплатную ИИ-проверку сочинений для ЕГЭ по русскому языку для участников Щелчка.
Некоторые функции мы специально пока что скрыли, чтобы не перегружать детей перед экзаменами. Но вообще моделька очень интересно рассуждает - этими ризонингами можно зачитываться до бесконечности.
Если есть какие-нибудь вопросы - задавайте в комментариях. На что-то отвечу сразу, что-то приберегу для стрима и отвечу там.
Ура! Работаем дальше 💪
На очереди ИИ-бот для выпускников 📱
Repost from Таня Коваль. ЕГЭ по русскому языку
БУДУЩЕЕ НАСТАЛО! ИИ ПРОВЕРИТ ТЕБЕ БЕСПЛАТНО СОЧИНЕНИЯ ПЕРЕД ЕГЭ!
Твои работы будет оценивать искусственный интеллект, обученный на проверках реальных экспертов с реального ЕГЭ. Уровень строгости будет соответствовать экзамену: без перегибов и без чрезмерной лояльности. При проверке ты получишь итоговый балл и разбалловку по всем критериям, тоже как на экзамене. Также в работе будут отмечены те места, на которые ИИ обратил внимание при проверке. Но это не значит, что он обязательно снял балл в этом месте 📒
🚩 Как и в реальной проверке, возможны небольшие расхождения и неточности — эксперты на экзамене тоже не могут оценивать работы одинаково. В этом смысле ИИ также ведёт себя очень похоже на живого проверяющего
Эта проверка поможет тебе увидеть свой текущий уровень и понять, на что стоит обратить внимание 💫
Это бонус Щелчка. Но не забывайте: если у тебя есть платный курс, то ты можешь сдавать сочинения на экспертную проверку экспертам-людям на платформе (сейчас есть 3 пробника) 🔥
ГДЕ НАЙТИ БЕСПЛАТНУЮ ПРОВЕРКУ ОТ ИИ?
Открываем меню БОБРа и выбираем «Проверка сочинений»
❕❕ Обратите внимание: пока тебе доступно 4 проверки перед ЕГЭ. Этого достаточно, чтобы проверить себя перед экзаменом. Можно сдавать в печатном виде по 1 сочинению в день.
+2
Этот простой бенчмарк не прошёл даже ChatGPT 5 Pro (не, в принципе то и понятно почему)
Нашёл прикольный тест для токенизатора и детектора зацикливаний генераций LLM 😃
