Машиннное обучение | Наука о данных Библиотека
админ - @workakkk @ai_machinelearning_big_data - Machine learning @itchannels_telegram - 🔥лучшие ит-каналы @pythonl - Python @pythonlbooks- python книги📚 @datascienceiot - ml книги📚 № 5037635661
Больше📈 Аналитический обзор Telegram-канала Машиннное обучение | Наука о данных Библиотека
Канал Машиннное обучение | Наука о данных Библиотека (@machinelearning_books) является активным участником. Сейчас сообщество объединяет 16 882 подписчиков, занимая 7 440 место в категории Технологии и приложения и 38 738 место в регионе Россия.
📊 Показатели аудитории и динамика
С момента создания невідомо проект демонстрирует стремительный рост, собрав аудиторию из 16 882 подписчиков.
Согласно последним данным от 15 сентября, 2026, канал показывает стабильную активность. За последние 30 дней изменение числа участников составило 54, а за последние 24 часа — -7, при этом общий охват остаётся высоким.
- Статус верификации: Не верифицирован
- Уровень вовлечённости (ER): Средний показатель вовлечённости аудитории составляет 9.07%. В первые 24 часа после публикации контент обычно набирает 3.94% реакций от общего числа подписчиков.
- Охват публикаций: В среднем каждый пост получает 1 531 просмотров. В течение первых суток публикация набирает 665 просмотров.
- Реакции и взаимодействия: Аудитория активно поддерживает контент: среднее количество реакций на один пост — 7.
- Тематические интересы: Контент сосредоточен на ключевых темах, таких как llm, контекст, точность, рассуждение, архитектура.
📝 Описание и контентная политика
Автор описывает ресурс как площадку для выражения субъективного мнения:
“админ - @workakkk
@ai_machinelearning_big_data - Machine learning
@itchannels_telegram - 🔥лучшие ит-каналы
@pythonl - Python
@pythonlbooks- python книги📚
@datascienceiot - ml книги📚
№ 5037635661”
Благодаря высокой частоте обновлений (последние данные получены 16 сентября, 2026) канал поддерживает актуальность и высокий уровень охвата публикаций. Аналитика показывает, что аудитория активно взаимодействует с контентом, что делает его важной точкой влияния в категории Технологии и приложения.
noise → промежуточное состояние → всё более чистое решение
При этом recurrent state переносится между шагами и постепенно уточняется.
Результаты:
- более стабильный test-time scaling
- 58,8% на ARC-AGI-1
- 12,2% на ARC-AGI-2
- в целом лучше предыдущих looped-моделей
Интересный сдвиг: reasoning здесь рассматривается не как цепочка токенов, а как постепенное движение внутреннего состояния модели от шума к решению.
https://alphaxiv.org/abs/2609.11801планирование → код → тесты → оценка → улучшение
Главная идея — не просто дать агенту одну большую задачу, а заставить его постоянно улучшать проект небольшими проверяемыми шагами, сохранять историю версий и отделять собственные тесты от независимой оценки.
На GameCraft-Bench, FrontierSWE и ProgramBench подход протестировали с несколькими связками:
- Codex + GPT-5.5
- OpenCode + DeepSeek-V4-Pro
- Pi + MiniMax-M3
После трёх итераций HoH в среднем улучшил результат на 52,25%, а максимальный прирост достиг 82,86% по сравнению с обычным запуском тех же агентов.
Самый показательный эксперимент длился более 70 итераций несколько дней подряд. Агент автономно собрал полноценный FPS: сюжет, основные механики, играбельный геймплей, визуал и звук.
То есть речь уже не о «написать функцию по промпту», а о попытке построить цикл, в котором coding-агент самостоятельно развивает один проект часами и днями.
https://arxiv.org/abs/2609.01481Идея в том, чтобы у языковой модели была устойчивая вычислительная среда, где она сама распоряжается памятью, кодом, подагентами и долгими задачами.Состояние в системе разложено по четырем уровням: 🟢веса модели - то, что она знает после обучения; 🟢активный контекст - информация текущего шага; 🟢постоянный REPL и рекурсивные подагенты - внешние вычисления, инструменты и параллельная работа; 🟢дисковое состояние - история, факты, навыки, промпты и спецификации подагентов. Состояние переживает и шаги, и перезапуски, и отключения. Человек при этом может наблюдать за агентами и вмешиваться. 🟡Замеры Сильнее всего эффект виден на длинных интерактивных задачах. На ARC-AGI-3 конфигурация с Opus 5 дала 95,5% Best@1 против 30,2% у обвязки самой ARC. На длинноконтекстных задачах Prime Agent держится наравне с конкурентами, а на отдельных, вроде EmulatorBench, заметно вырывается вперед. Он обошел Pi-mono с GLM-5.2 и Codex с GPT-5.6 Sol, но уступил Claude Code с Opus 5. Отдельно показательны игровые прогоны на эмуляторах. На Sega Genesis связка Prime Agent и GPT-5.6 Sol набрала 61,6% по итоговой оценке верификатора, а Claude Code с той же моделью — ноль. На Game Boy Color разрыв еще резче: 99,8% против нуля. 🟡 Побочный эффект Самая любопытная деталь отчета - накопление навыков закрепляет не только полезное. В одном из экспериментов агент нашел способ обходить ограничения Factorio, сохранил его как переиспользуемый навык и тем самым записал эксплойт в долговременную память. Дальше он доставал оттуда именно это решение, потому что оно один раз сработало.
На днях вышел релиз 0.8.0 с исправлениями найденных проблем и новыми возможностями.📌Лицензирование: MIT License 🟡Техотчет 🖥Github @ai_machinelearning_big_data #AI #ML #Harness #Agents #PrimeIntellect
не «смог ли он сделать это хотя бы раз», а **«делает ли он это стабильно при повторных запусках».**Paper: https://arxiv.org/abs/2608.19741 “One Success Isn't Reliability: ThinkingBox, a Sandbox and Benchmark for Agents in Stateful Business Workflows”
O(n³) и игнорируем константы. Для сравнения алгоритмов на больших данных это удобно.
Но современные CPU устроены намного сложнее: кэши, конвейеры, параллельное выполнение инструкций, SIMD, prefetching, память с разной задержкой.
Поэтому два алгоритма с одинаковым O(n) могут отличаться по скорости в разы.
А иногда алгоритм с формально «хуже» сложностью на реальных размерах данных оказывается быстрее.
Хорошая серия для тех, кто хочет перейти от «у этого O(n), значит быстро» к пониманию того, как код реально выполняется процессором.
en.algorithmica.org/hpc/complexity/