es
Feedback
EdTech, AI и HighLoad | Блог AK из Школково

EdTech, AI и HighLoad | Блог AK из Школково

Ir al canal en Telegram

CEO ZeroAgency, руководитель разработки онлайн-платформы Школково. Пишу про IT, AI и HighLoad разработку. Личный блог: @daily_ak YT: youtube.com/@segfault_11 Контакт для связи: @bethrezen

Mostrar más
826
Suscriptores
Sin datos24 horas
Sin datos7 días
-330 días
Archivo de publicaciones
🤷‍♂️ Qwen3.8-Flash-Next не оправдал мои надежды. Есть у нас вымученный датасет с 89 тасками для агента. Qwen3.8-27B по качес
🤷‍♂️ Qwen3.8-Flash-Next не оправдал мои надежды. Есть у нас вымученный датасет с 89 тасками для агента. Qwen3.8-27B по качеству сильно опережает Qwen3.8-Flash-Next. Скорость по tok/s у Flash-Next похожа на 27B-NVFP4. Тулзов вызывает сильно больше, но даже не смотря на это с задачей справляется хуже, хоть и завершает её быстрее. Ну и понятное дело, в силу размера модели и новизны архитектуры - тюнить его я даже и не пробовал пока что. В целом, по трейсам сложилось впечатление, что реальный пре-трейн у модели крайне слабый, как и пост-трейн - примерно на уровне qwen3.5. Видимо в превью как всегда сделали упор на бенчмарках, а не реальных задачах. Русские знания о мире по моим опять таки ощущениям слабее, чем в qwen3.8-27b. То есть total params + ngram здесь как будто бы ничего не дали. Возможно в ваших сценариях эта модель и проявит себя лучше. Тесты проводились на 2 серверах с 4x RTX Pro 6000. Flash-Next запускался с TP=4 EP=4 Остальные модели PP=4

На злобу дня, так сказать. Кто-то может не знает, но я не только языковыми моделями занимаюсь. Есть ещё всякие интересные про
На злобу дня, так сказать. Кто-то может не знает, но я не только языковыми моделями занимаюсь. Есть ещё всякие интересные проекты. Один из них - модель для предсказания балла на экзамене и составления индивидуального плана для ученика. И вот сегодня выходит демоверсии. В некоторых предметах всё очень сильно поменялось. Самое критичное здесь - набор тем и задач. Всё было бы страшно, если бы я этого не предусмотрел и строил всё вокруг конкретных тем. Но поскольку ЕГЭ не первый раз меняют - я сразу предусмотрел этот момент, сделав True ID-free модель. Поэтому по сути сильно на метриках качества это не ударит. Такие дела ^_^

🔥Как зарабатывать 5 миллионов в месяц на IT и быть счастливым? Вышел мой подкаст с генеральным директором ZeroAgency и главным разработчиком платформ Школково и Бобр 🦫📱🚀 Поговорили о том, как стать настоящим профессионалом в IT, заниматься любимым делом и при этом хорошо зарабатывать 👇👇👇 🦫 Бобр | 📱 Ютуб | 📱 VK-Видео Слушайте, вникайте) и не забудьте поставить 👍❤️

Оп-паа. Что это тут у нас? 125B A6B, 512 экспертов(10 routed + 1 shared) на 640d Гибридный аттеншен: GDN + QSA (QwenSparseAtt
Оп-паа. Что это тут у нас? 125B A6B, 512 экспертов(10 routed + 1 shared) на 640d Гибридный аттеншен: GDN + QSA (QwenSparseAttention) - 12 слоев в 3:1 N-gram Embedding И если посмотреть, это прям во многом похоже на мой незавершенный эксперимент по LLM с нуля, на который так и не хватило ресурсов По метрикам естественно интереснее Qwen3.8-27B, 3.7-Plus.

Кстати, Qwen3.8-27B не просто хороший релиз, но и показатель, куда движется опенсорс. Это не только хороший качественный RL и post-training. Лично для меня самое знаковое, это что в 3.8 появился официальный reasoning_effort={low, medium, xhigh}, причём с xhigh default. Также по сравнению с Qwen3.6-27B, где output рекомендовали выставлять в 32768 tok для обычных задач и 81920 для сложных - в 3.8 уже прямо говорят про 262144 ток. Т.е. фокус на агентов не просто с контролем "а сколько думать", но и действительно чтобы они выдавали как можно больше полезного контента. Конечно же, старые добрые chat_template_kwargs с enable_thinking и preserve_thinking из чат-шаблона не выкинули, так что не забывайте про эти параметры тоже. Ну и сразу вангую, что одним из следующих небольших направлений развития будет не просто привычное сжатие контекста, а сжатие того самого ризонинга на предыдущих шагах - либо просто как обычный compact, либо более хитрые схемы с эмбеддингами/memory/прочими трюками. Кмк, это логичное развитие в сторону решения cost/gpu проблем.

Qwen выпустили Qwen3.8-27B — и это неожиданно большой скачок относительно Qwen3.6-27B 🚀 Это всё ещё dense-модель на 27B пара
+4
Qwen выпустили Qwen3.8-27B — и это неожиданно большой скачок относительно Qwen3.6-27B 🚀 Это всё ещё dense-модель на 27B параметров, но прирост особенно заметен не на классических knowledge-бенчмарках, а на реальных coding-, agentic- и multimodal-задачах. Несколько примеров Qwen3.8-27B → против Qwen3.6-27B: • Terminal Bench 2.1: 63.4 → 73.0SWE-bench Pro: 53.5 → 61.7DeepSWE 1.1: 13.3 → 42.2 — более чем ×3 • QwenSWEBench: 49.3 → 79.0Agents' Last Exam Pass@1: 10.6 → 20.4HLE: 24.0 → 30.8LiveCodeBench v6: 83.9 → 90.3 Но самый интересный скачок, кажется, произошёл в мультимодальных агентах: • OSWorld: 63.9 → 84.3WebArena: 48.8 → 64.8RecreationBench: 29.8 → 47.1SWE-MM: 25.7 → 38.6Vision2Web: 45.0 → 62.9BabyVision: 28.9 → 65.7 Причём на некоторых тестах локальная open-weight 27B уже оказывается на уровне или выше гораздо более крупных закрытых моделей из сравнительной таблицы самого Qwen. По архитектуре всё как и у qwen3.6-27b - это 64 слоя, d_model=5120, гибрид Gated DeltaNet + Gated Attention, FFN 17,408, multi-step MTP и нативный контекст 262K с возможностью расширения до 1M. Что особенно интересно: на GPQA прирост всего 87.8 → 89.2, зато на длинных агентских задачах местами +50–200%. Похоже, основной прогресс поколения 3.8 — уже не просто «модель стала немного умнее», а существенно лучше научилась долго планировать, пользоваться окружением, писать и исправлять код и доводить сложные задачи до конца. На картинках ниже собрал все опубликованные Qwen метрики, сравнил с Qwen3.6-27B и, где возможно, с Qwen3.6-35B-A3B, плюс добавил Qwen3.7-Plus, Muse Glimmer-30B и Opus4.6 Max. Очень мощный релиз для 27B. Вот мы и определились, на базе чего будем тюнить мультимодалки ^_^ Для скорости пока что всё ещё юзаем Qwen3.6-35B-A3B, а для качественных задач новый фаворит! 🤗 Веса на HF: bf16 | fp8

Почему мне так смешно... 😂
Почему мне так смешно... 😂

🤖 AI-бот сделал ревью кода. GitLab прислал письмо об этом. Gemini в gmail сделал AI Overview. ... What's next? PS: ревью каж
🤖 AI-бот сделал ревью кода. GitLab прислал письмо об этом. Gemini в gmail сделал AI Overview. ... What's next? PS: ревью кажется тупорылым, потому что это тестовое ревью на тестовом репозитории, так что всё норм на самом деле - это просто PoC

Навайбкодил тут давно статус-лайн с контекстом, затратами, лимитами и прочим. Работает на Claude Code и Codex. Кому надо - бе
Навайбкодил тут давно статус-лайн с контекстом, затратами, лимитами и прочим. Работает на Claude Code и Codex. Кому надо - берите, форкайте/юзайте https://github.com/bethrezen/status-line

Я научил собаку вайбкодить. А чего добился ты?
Я научил собаку вайбкодить. А чего добился ты?

🔥 Бомбическое преимущество Vision LLM для простых рутинных задач Предыстория В прошлом году я уже занимался оцифровкой разба
🔥 Бомбическое преимущество Vision LLM для простых рутинных задач Предыстория В прошлом году я уже занимался оцифровкой разбалловки результатов учеников для разработки модели предсказания баллов и рекомендательной системы. Тогда я тоже запилил простой интерфейс и ручками вбивал все эти данные, потому что по-нормальному и быстро автоматизировать это тогда не удалось, а датасет для трейна нужен был срочно. Из данных я тогда выкинул те, где дети не указали свой тестовый балл в отдельном поле. Ну и понятное дело, очень много результатов, где 10 шакалов из 10, оцифровать не удалось. Наши дни Наколеночное решение из поста выше помогло добавить примерно ещё треть к датасету. Это результаты, где не проставлен был балл или разбалловка трудно читалась из-за качества картинки(см. скрин, да-да, в таком качестве прислали результаты...). +34% к объёму трейн данных - это на самом деле очень ощутимо и круто! Да, есть риск, что нейронка криво распознала цифры на изображении. Но этот риск снимается прогоном предыдущей модели предсказания баллов по этому юзеру. Если распознавание Vision совпадает с предсказанием модели - значит всё распознано верно и историю этого пользователя можно спокойно добавлять в датасет обучения новой модельки. Такие дела ^_^

Простое и очевидное решение на коленке, которое сберегло мои нервы. Дано: тысячи результатов экзаменов учащихся в виде картин
Простое и очевидное решение на коленке, которое сберегло мои нервы. Дано: тысячи результатов экзаменов учащихся в виде картинок Задача: оцифровать разбалловку и провалидировать данные Основная проблема в том, что дети присылают скриншоты результатов максимально странным образом. Плюс есть ещё куча разных сайтов, где эти результаты в разных форматах отображаются. Это в этом году мы додумались просить детей забивать эти данные самим в форме. А в прошлые года вот что-то не догадались... Ну ничего, сейчас бы с ллмкой быстро всё оцифруем как надо. Решение: прогоняем через LLM с Vision. В результате большая часть данных нуждается только в быстрой проверке и нажатии на Enter.

🖤 Zero Fest, он же "Ноль фест" в Тамбове 1 августа. Раньше был "Рок над Студенцом", но по определенным причинам он не смог п
🖤 Zero Fest, он же "Ноль фест" в Тамбове 1 августа. Раньше был "Рок над Студенцом", но по определенным причинам он не смог продолжиться в прежнем формате. Поэтому я решил вписаться в этот движ со своей компанией и помочь ребятам. Ну и теперь это "Ноль фест". В этом году будут не только местные артисты, но и гости из Санкт-Петербурга. DenDerty, которые выступали у нас на корпоративе в прошлом году, Молодость Внутри и Вася Васин из группы "Кирпичи". Для нашего города это уникальное мероприятие, которое всем советую обязательно посетить! Билеты по ссылке: vk.cc/cYe5vi

🎮 Самый неоднозначный девайс NVIDIA Брал я тут в марте 7шт. DGX Spark. Очень хотелось попробовать этот девайс давно - ещё со старта хотел его купить. Но появляться по вменяемым ценам они начали только сейчас. NVIDIA обещала крутую производительность в FP4. Но что мы имеем по факту? 1. Очень медленную unified memory LPDDR5x. 2. Коробки очень горячие и уходят в троттлинг. Temperature cap стоит где-то на 70C. 3. DGX Spark инференсит Qwen3.6-35B-A3B в NVFP4 со спекулятивным декодингом DFlash со скоростью 100-200 tok/s. на оптимизированном VLLM с кастомными ядрами под GB10. Соответственно ШЕСТЬ DGX Spark в реальности у меня дают 700-1500 tok/s. Для сравнения - ОДИН GPU RTX Pro 6000 Blackwell Workstation даёт 1000-1200 tok/s. Нагрузка 1-в-1 одинаковая. Простая математика RTX Pro 6000 Blackwell стоит примерно 1-1.1M руб. DGX Spark стоит ~500к руб. 6x DGX Spark = 3M руб. и это в лучшем случае 1500 tok/s, но 768GB памяти на скорости 273 GB/s. Рабочая станция с 2x RTX Pro 6000 Blackwell - те же 3M руб.(дада, можно и дешевле) и это 2200 tok/s, а это всего лишь 192GB VRAM на скорости 1792 GB/s. И это я ещё не говорю про то, как в реальности работают все эти кольца из 200Gbit/s линков между тремя спарками. Спойлер: плохо. Выводы DGX Spark проигрывают примерно везде и по всем фронтам. Обещания NVIDIA - пустой маркетинг. Коробки вообще никому не рекомендую даже для экспериментов, даже с QLoRa. Для трейна не годится. Для инференса - тоже. Лучше за те же деньги собрать ПК с игровой видеокартой. Единственное годное применение - тихий локальный AI-ассистент для дома.Вот только вопрос - сколько он прослужит с такими рабочими температурами.

На самом деле никакой нейронки нет 😂
На самом деле никакой нейронки нет 😂

Вот мы и выкатили бесплатную ИИ-проверку сочинений для ЕГЭ по русскому языку для участников Щелчка. Некоторые функции мы спец
+2
Вот мы и выкатили бесплатную ИИ-проверку сочинений для ЕГЭ по русскому языку для участников Щелчка. Некоторые функции мы специально пока что скрыли, чтобы не перегружать детей перед экзаменами. Но вообще моделька очень интересно рассуждает - этими ризонингами можно зачитываться до бесконечности. Если есть какие-нибудь вопросы - задавайте в комментариях. На что-то отвечу сразу, что-то приберегу для стрима и отвечу там. Ура! Работаем дальше 💪 На очереди ИИ-бот для выпускников 📱

БУДУЩЕЕ НАСТАЛО! ИИ ПРОВЕРИТ ТЕБЕ БЕСПЛАТНО СОЧИНЕНИЯ ПЕРЕД ЕГЭ! Твои работы будет оценивать искусственный интеллект, обученн
+1
БУДУЩЕЕ НАСТАЛО! ИИ ПРОВЕРИТ ТЕБЕ БЕСПЛАТНО СОЧИНЕНИЯ ПЕРЕД ЕГЭ! Твои работы будет оценивать искусственный интеллект, обученный на проверках реальных экспертов с реального ЕГЭ. Уровень строгости будет соответствовать экзамену: без перегибов и без чрезмерной лояльности. При проверке ты получишь итоговый балл и разбалловку по всем критериям, тоже как на экзамене. Также в работе будут отмечены те места, на которые ИИ обратил внимание при проверке. Но это не значит, что он обязательно снял балл в этом месте 📒 🚩 Как и в реальной проверке, возможны небольшие расхождения и неточности — эксперты на экзамене тоже не могут оценивать работы одинаково. В этом смысле ИИ также ведёт себя очень похоже на живого проверяющего Эта проверка поможет тебе увидеть свой текущий уровень и понять, на что стоит обратить внимание 💫 Это бонус Щелчка. Но не забывайте: если у тебя есть платный курс, то ты можешь сдавать сочинения на экспертную проверку экспертам-людям на платформе (сейчас есть 3 пробника) 🔥 ГДЕ НАЙТИ БЕСПЛАТНУЮ ПРОВЕРКУ ОТ ИИ? Открываем меню БОБРа и выбираем «Проверка сочинений» ❕❕ Обратите внимание: пока тебе доступно 4 проверки перед ЕГЭ. Этого достаточно, чтобы проверить себя перед экзаменом. Можно сдавать в печатном виде по 1 сочинению в день.

Наконец-то! Найдены ответы на самые главные вопросы!
Наконец-то! Найдены ответы на самые главные вопросы!

А блин, я в тесте ошибся. Ладно, так тоже норм
А блин, я в тесте ошибся. Ладно, так тоже норм

Этот простой бенчмарк не прошёл даже ChatGPT 5 Pro (не, в принципе то и понятно почему) Нашёл прикольный тест для токенизатор
+2
Этот простой бенчмарк не прошёл даже ChatGPT 5 Pro (не, в принципе то и понятно почему) Нашёл прикольный тест для токенизатора и детектора зацикливаний генераций LLM 😃