Machinelearning
Погружаемся в машинное обучение и Data Science Показываем как запускать любые LLm на пальцах. По всем вопросам - @haarrp @itchannels_telegram -🔥best channels Реестр РКН: clck.ru/3Fmqri
Показати більше📈 Аналітичний огляд Telegram-каналу Machinelearning
Канал Machinelearning (@ai_machinelearning_big_data) у мовному сегменті Російська є активним учасником. На даний момент спільнота об'єднує 288 007 підписників, посідаючи 331 місце в категорії Технології та додатки та 1 323 місце у регіоні Росія.
📊 Показники аудиторії та динаміка
З моменту свого створення невідомо, проект продемонстрував стрімке зростання, зібравши аудиторію у 288 007 підписників.
За останніми даними від 02 серпня, 2026, канал демонструє стабільну активність. Хоча за останні 30 днів спостерігається зміна кількості учасників на -5 417, а за останні 24 години на -206, загальне охоплення залишається високим.
- Статус верифікації: Не верифікований
- Рівень залученості (ER): Середній показник залученості аудиторії становить 7.77%. Протягом перших 24 годин після публікації контент зазвичай збирає 5.91% реакцій від загальної кількості підписників.
- Охоплення публікацій: В середньому кожен допис отримує 22 374 переглядів. Протягом першої доби публікація в середньому набирає 17 009 переглядів.
- Реакції та взаємодія: Аудиторія активно підтримує контент: середня кількість реакцій на один пост – 153.
- Тематичні інтереси: Контент зосереджений навколо ключових тем, таких як openai, claude, api, gemini, контекст.
📝 Опис та контентна політика
Автор описує ресурс як майданчик для висловлення суб'єктивної думки:
“Погружаемся в машинное обучение и Data Science
Показываем как запускать любые LLm на пальцах.
По всем вопросам - @haarrp
@itchannels_telegram -🔥best channels
Реестр РКН: clck.ru/3Fmqri”
Завдяки високій частоті оновлень (останні дані отримано 03 серпня, 2026), канал підтримує актуальність та високий рівень охоплення публікацій. Аналітика показує, що аудиторія активно взаємодіє з контентом, що робить його важливою точкою впливу в категорії Технології та додатки.
Модель расходует на 17% меньше выходных токенов, чем предыдущая версия 3.5 Flash. Говорят, что подтянули у неё кодинг и офисные задачи. Стоимость - 1,5 доллара за миллион входных и 7,5 доллара за миллион выходных токенов.🟡Gemini 3.5 Flash-Lite
Ориентирована на массовые и быстрые задачи. Заявленная скорость - 350 токенов в секунду при цене 30 центов за миллион входных токенов.🟡Gemini 3.5 Flash Cyber
Модель, натасканная на поиск и исправления уязвимостей в коде, которая не поступит в открытый доступ - её получат только правительства и доверенные партнёры в рамках ограниченной пилотной программы.Google также сообщила о планах - 3.5 Pro тестируется с партнёрами, а команда уже начала обучение Gemini 4, которое в компании называют самым масштабным на сегодняшний день. Сроки выхода не названы. @ai_machinelearning_big_data #news #ai #ml
К марту 2026 лучшая американская модель опережала лучшую китайскую всего на 2,7% (2 года назад отрыв мерили десятками процентных пунктов).🟡Железо Гвоздь компьют-зала - Huawei Atlas 950 SuperPoD, супернода на картах Ascend. В полной сборке версии соединяются в Atlas 950 SuperCluster на 500 000 ускорителей. Вторым номером шёл кластер Sugon Dawn 8000 scaleX на 100 000 карт. Следом - решения Alibaba Zhenwu M890 и ZTE OEX SuperPoD. 🟡Модели и агенты MiniMax показала мультимодальную M3 с контекстом до 1 миллиона токенов с упором на длинный ризонинг, код и агентские сценарии. StepFun представила Step Agent OS, которую называет первой в мире агентной операционной системой, где пользователь описывает цель словами, а система сама раскидывает её по агентам на телефоне, ПК, в машине и роботах. 🟡Роботы Unitree показала GD01 - по её словам, первую в мире управляемую мехо-платформу, которая на ходу переключается между человекоподобной и четвероногой формой. Fourier привезла настольного робота-компаньона GR Nano. SenseTime развернула магазин SenseMart Go, которым роботы управляют сами - раскладывают товар, ведут инвентаризацию и разруливают нештатные ситуации, а покупатель заходит по QR-коду. 🟡Витрина новой волны Первый в мире агентный смартфон от Nubia (сделан с ByteDance Doubao и Huaqin), который работает на Step Agent OS. Телефон подаётся как личный ассистент, который сам доводит многошаговые задачи до конца. @ai_machinelearning_big_data #news #ai #ml
Общее настроение индустрии при этом тревожное - по свежему опросу конференции GDC, 52% профессионалов игровой отрасли считают, что генеративный ИИ вредит геймдеву.Ответ Roblox - ранжирование по удержанию игроков, как и для обычных игр. То есть если в игру никто не играет, её никто и не найдёт. Публичное альфа-тестирование Build стартует 28 июля в Новой Зеландии для пользователей от 9 лет с подтверждённым возрастом. Публиковать свои творения на глобальную аудиторию смогут те, кому исполнилось 16. Будет бесплатная базовая версия и платные тарифы. Roblox также готовит ИИ-агентов, которые помогут авторам с плейтестами и аналитикой, а ещё с ноября прошлого года обучает модель, генерирующую редактируемые 3D-сцены. На этом фоне компания закрывает видеозвонки через аватаров Roblox Connect, запущенные в 2023 году. Приоритеты, судя по всему, расставлены. @ai_machinelearning_big_data #news #ai #ml
Смысл гаджета в том, чтобы разработчик реже набирал однотипные запросы вручную.Типовые операции запускает аналоговый джойстик. Отдельные командные клавиши позволяют принять результат, отклонить его, включить голосовой ввод по нажатию или открыть новый чат, не отрываясь от клавиатуры. Кнопки программируются прямо в ChatGPT Codex, а в комплекте идёт набор из 32 сменных клавиш с символами платформы. За состоянием агентов можно следить по подсветке - клавиши в реальном времени меняют цвет в зависимости от того, простаивает агент, думает, ждёт ввода, сообщает об ошибке или закончил работу. Ещё одна деталь - физическое колесо, которым регулируется глубина ризонинга модели. Для простых задач её можно убавить ради скорости, для сложных - прибавить одним поворотом. Корпус выточен из поликарбоната и алюминия с анодированным основанием. Механические переключатели из пластиков POM и POK рассчитаны на 50 млн нажатий. К компьютеру устройство подключается по Bluetooth или кабелем USB-C. Официально поддерживаются Windows и macOS, а пользователям Linux предлагают костыль решение, созданное сообществом Work Louder. Устройство продаётся ограниченным тиражом по цене в 230 долларов, доставка идёт по всему миру, кроме России и Бразилии. @ai_machinelearning_big_data #news #ai #ml
Mach-Mind-4-Flash - итоговая MoE-модель на 35 млрд общих 3 млрд активных параметров на базе Qwen3.5-35B-A3B.Проблема, от которой Li Auto отталкивались, состоит в том, что если учить одну модель с подкреплением сразу на смеси наград (математика, код, агентные задачи), то появляются качели - подтянули одно, просело другое. Решение - разделить этапы и области знаний. Сначала независимо обучили более десятка RL-экспертов, каждого в своём домене: математика, код, текст, безопасность, поиск, работа с инструментами. Каждый эксперт получил свои данные, свои проверяемые награды и свою стратегию обучения. Дальше самое интересное - как собрать экспертов обратно в одну модель. Для этого использовали методику MOPD, которую взяли у Xiaomi.
Это мультиучительская дистилляция на собственных генерациях ученика, где каждый обучающий пример по ключу маршрутизации уходит к "своему" замороженному эксперту, и тот через reverse-KL на уровне токенов подтягивает распределение ученика к своему.Агентные навыки эксперты осваивали в исполняемых песочницах - там модель читает файлы, правит код, запускает тесты, видит ошибки и продолжает с их учётом. Масштаб сред - более 190 предметных областей с сохранением состояния, свыше 3,5 тыс. интерфейсов инструментов, траектории программных задач до 300 шагов при контексте 256 тыс. токенов. 🟡Работает ли слияние? И да и нет. Следование инструкциям сохранилось целиком, а на агентных бенчах ClawBench и ClawEval итоговая модель даже обошла отдельных экспертов. Но на SWE-bench Verified результат просел с 73,80 у эксперта до 71,10 у модели.
Предполагают, что узкоспециализированное поведение в длинных задачах кодинга при дистилляции смазывается.Финальный штрих - HMPO, собственная механика Li Auto, которая следит, чтобы модель не увлекалась в цепочках рассуждений.
Бюджет длины CoT берётся из медианы правильных ответов в группе, награду получают только верные и при этом более короткие решения, а награда собирается умножением (короткий, но неверный ответ получает строгий 0, что закрывает лазейку для взлома награды).На выходе HMPO получается сокращение длины генерации на 19–46% при потере точности не более 0,7%, причём обучение шло только на математике, а эффект перенёсся на код и другие задачи. Правда пока это работает только для одношаговых рассуждений, к многоходовым агентным траекториям его ещё предстоит адаптировать. 🟡Итоги 92,7 на AIME'26 - тут отстает от триллионной Kimi-K2.5 меньше чем на пункт; 82,8 на IFBench - первое место с большим отрывом, ближайший конкурент Qwen3.5-122B; 75,8 на BFCL-v4 - второе место после MiMo-V2-Flash, при этом лучше чем Qwen3.5-122B и Kimi-K2.5. Можно сказать, что результаты на уровне куда более крупных моделей. К сожалению, планы по публикации модели неизвестны, но возможно мы просто почувствуем её в следующих поколениях электромобилей Lixiang. 🟡Arxiv @ai_machinelearning_big_data #AI #ML #LLM #Optimisation #RL #LiAuto
Например, сбой Cloudflare в сентябре 2025 года - панель управления и API компании легли из-за одной неверной зависимости в useEffect, которую не поймали ни ревью, ни тесты.Философия проекта в том, что общие кодинг-бенчмарки проверяют лишь поведение по принципу "тесты прошли - задача засчитана". В ReactBench каждое решение должно ещё и пройти проверку React Doctor, анализатора с более чем 400 правилами, который ищет в коде лишние перерисовки, сломанные эффекты, проблемы с доступностью и сопровождаемостью. 🟡Набор состоит из задач двух типов Write React - реализовать настоящую функцию. Задания этого типа собраны из принятых PR в открытых репозиториях. Агент получает кодовую базу и описание задачи, а скрытые тесты и эталонное решение видит только проверяющая система. Fix React - найти и исправить все баги в существующем компоненте, обнаруженные React Doctor, не создавая при этом новых проблем. Причём агента еще и лишают доступа к линтерам. 🟡Результаты прогонов Само собой, созданием бенча не ограничились и запустили его на топовых моделях. Тут важен небольшой дисклеймер: Бенчмарк сравнивает не модели в чистом виде, а связки модель+агентская оболочка (Codex CLI, Claude Code и другие), и оболочка влияет на итог. По итогам лидируют с минимальным отрывом GPT-5.6 Sol (43,1%) и Fable 5 (41,2%), но важнее разница в цене - прогон Fable 5 обходится в среднем в 5,8 раза дороже, чем Sol. Оптимальным по соотношению стоимость-качество авторы называют GPT-5.6 Terra на средних настройках. Замыкают таблицу GLM 5.2, Sonnet 5, GPT-5.6 Luna и Kimi K2.7 Code. Набор полностью открыт на Github. @ai_machinelearning_big_data #AI #ML #Agents #Benchmark #ReactBench #Million
И это не один и тот же промпт с разным временем на ризонинг - на каждом уровне процесс построен по-своему.Уровень подхватывается из настроек сессии автоматически, но его можно задать руками командой
/code-review high.
🟢Low делает один быстрый проход по диффу.
🟢Medium читает изменённый код в контексте проекта, прогоняет несколько поисковых проходов под разными углами и перепроверяет находки перед выдачей.
🟢High выносит поиск и верификацию в субагентов с чистым контекстом, чтобы проверяющие не были заякорены на рассуждениях агента, который этот код только что писал.
🟢X-high дополнительно ищет, как изменения влияют на код за пределами самого диффа.
🟠Ultra - верхняя ступень, где ревью выполняется в облачной песочнице, куда Claude Code выгружает состояние репозитория или клонирует PR с GitHub. Там запускается целый парк агентов, и каждая находка независимо воспроизводится и верифицируется.
Ultra находится в статусе research preview и оплачивается отдельно от подписки - Pro и Max подписчикам дают 3 бесплатных запуска, дальше каждый прогон списывается из кредитов на дополнительное использование стоит примерно от 5 до 20 долларов в зависимости от размера изменений.
Качество новой системы подкрепляют замерами Opus 4.8 на открытом датасете с ручной разметкой ошибок. Уровень Low нашёл 17% размеченных багов, Medium - 22%, High - 24%, X-high - 25%.
У "конкурента" (компания его не называет) - те же уровни дали от 8 до 12%.
Anthropic утверждает, что использует Ultra-режим на каждом пулл-реквесте в собственной разработке.@ai_machinelearning_big_data #news #ai #ml
