es
Feedback
Машиннное обучение | Наука о данных Библиотека

Машиннное обучение | Наука о данных Библиотека

Ir al canal en Telegram

админ - @workakkk @ai_machinelearning_big_data - Machine learning @itchannels_telegram - 🔥лучшие ит-каналы @pythonl - Python @pythonlbooks- python книги📚 @datascienceiot - ml книги📚 № 5037635661

Mostrar más

📈 Análisis del canal de Telegram Машиннное обучение | Наука о данных Библиотека

El canal Машиннное обучение | Наука о данных Библиотека (@machinelearning_books) es un actor destacado. Actualmente la comunidad reúne a 16 882 suscriptores, ocupando la posición 7 440 en la categoría Tecnologías y Aplicaciones y el puesto 38 738 en la región Rusia.

📊 Métricas de audiencia y dinámica

Desde su creación el невідомо, el proyecto ha mostrado un crecimiento acelerado, reuniendo a 16 882 suscriptores.

Según los últimos datos del 15 septiembre, 2026, el canal mantiene una actividad estable. En los últimos 30 días la variación de miembros fue de 54, y en las últimas 24 horas de -7, conservando un alto alcance.

  • Estado de verificación: No verificado
  • Tasa de interacción (ER): El promedio de interacción de la audiencia es 9.07%. Durante las primeras 24 horas tras publicar, el contenido suele obtener 3.94% de reacciones respecto al total de suscriptores.
  • Alcance de las publicaciones: Cada publicación recibe en promedio 1 531 visualizaciones. En el primer día suele acumular 665 visualizaciones.
  • Reacciones e interacción: La audiencia responde de forma activa: el promedio de reacciones por publicación es 7.
  • Intereses temáticos: El contenido se centra en temas clave como llm, контекст, точность, рассуждение, архитектура.

📝 Descripción y política de contenido

El autor describe el recurso como un espacio para expresar opiniones subjetivas:
админ - @workakkk @ai_machinelearning_big_data - Machine learning @itchannels_telegram - 🔥лучшие ит-каналы @pythonl - Python @pythonlbooks- python книги📚 @datascienceiot - ml книги📚 № 5037635661

Gracias a la alta frecuencia de actualizaciones (últimos datos recibidos el 16 septiembre, 2026), el canal mantiene la vigencia y un amplio alcance. La analítica demuestra que la audiencia interactúa activamente con el contenido, lo que lo convierte en un punto de referencia dentro de la categoría Tecnologías y Aplicaciones.

16 882
Suscriptores
-724 horas
-17 días
+5430 días
Atraer Suscriptores
septiembre '26
septiembre '26
+64
en 1 canales
agosto '26
+103
en 1 canales
Get PRO
julio '26
+83
en 2 canales
Get PRO
junio '26
+47
en 1 canales
Get PRO
mayo '26
+53
en 0 canales
Get PRO
abril '26
+91
en 0 canales
Get PRO
marzo '26
+95
en 1 canales
Get PRO
febrero '26
+266
en 1 canales
Get PRO
enero '26
+356
en 0 canales
Get PRO
diciembre '25
+90
en 1 canales
Get PRO
noviembre '25
+250
en 0 canales
Get PRO
octubre '25
+93
en 0 canales
Get PRO
septiembre '25
+201
en 1 canales
Get PRO
agosto '25
+169
en 0 canales
Get PRO
julio '25
+264
en 0 canales
Get PRO
junio '25
+223
en 2 canales
Get PRO
mayo '25
+37
en 3 canales
Get PRO
abril '25
+120
en 2 canales
Get PRO
marzo '25
+72
en 0 canales
Get PRO
febrero '25
+155
en 0 canales
Get PRO
enero '25
+190
en 1 canales
Get PRO
diciembre '24
+576
en 1 canales
Get PRO
noviembre '24
+1 297
en 1 canales
Get PRO
octubre '24
+1 165
en 2 canales
Get PRO
septiembre '24
+533
en 1 canales
Get PRO
agosto '24
+361
en 1 canales
Get PRO
julio '24
+394
en 3 canales
Get PRO
junio '24
+963
en 3 canales
Get PRO
mayo '24
+2 746
en 44 canales
Get PRO
abril '24
+690
en 43 canales
Get PRO
marzo '24
+592
en 21 canales
Get PRO
febrero '24
+889
en 4 canales
Get PRO
enero '24
+1 283
en 43 canales
Get PRO
diciembre '23
+838
en 39 canales
Get PRO
noviembre '23
+296
en 1 canales
Get PRO
octubre '23
+1 102
en 19 canales
Get PRO
septiembre '23
+515
en 0 canales
Get PRO
agosto '23
+600
en 0 canales
Get PRO
julio '23
+367
en 0 canales
Get PRO
junio '23
+691
en 0 canales
Get PRO
mayo '23
+1 715
en 0 canales
Get PRO
abril '23
+139
en 0 canales
Get PRO
marzo '23
+130
en 0 canales
Get PRO
febrero '23
+128
en 0 canales
Get PRO
enero '23
+259
en 0 canales
Get PRO
diciembre '22
+747
en 0 canales
Get PRO
noviembre '22
+2 777
en 0 canales
Fecha
Crecimiento de Suscriptores
Menciones
Canales
16 septiembre+2
15 septiembre0
14 septiembre+11
13 septiembre+5
12 septiembre+1
11 septiembre0
10 septiembre+4
09 septiembre0
08 septiembre+3
07 septiembre+2
06 septiembre0
05 septiembre+3
04 septiembre+9
03 septiembre+5
02 septiembre+4
01 septiembre+15
Publicaciones del Canal
Repost from Machinelearning
✔️ xAI отозвала претензии к Apple, но продолжит судиться с OpenAI xAI и X Corp. подали в федеральный суд Техаса ходатайство об отзыве претензий к Apple. Иск компании Илона Маска подали в августе 2025 года - они обвиняли Apple и OpenAI в сговоре против конкурентов из-за интеграции ChatGPT в Siri и iOS. По версии истцов, другие разработчики чат-ботов лишились равного доступа к аудитории iOS. Условия урегулирования стороны не раскрывают. Претензии к OpenAI остаются в силе - xAI продолжит оспаривать, как компания Сэма Альтмана удерживает монополию на рынке ИИ-ассистентов. bloomberg.com ✔️ Apple начала бета-тест новой Siri Ассистент построен в партнёрстве с Google на семействе Gemini. Часть запросов обрабатывает на устройстве модель AFM Core Advanced, остальные уходят в изолированное облако Apple Private Cloud Compute. Siri считывает контекст с экрана, ищет данные в переписке и выполняет действия в системных и сторонних приложениях. У ассистента появилось отдельное приложение с синхронизацией истории диалогов через iCloud, а сгенерированный контент помечается водяными знаками SynthID. Пока Siri работает только на английском, запуск в Европе и Китае отложен из-за требований регуляторов. Часть облачных функций позже станет платной. apple.com ✔️ Andon Labs представила платформу Pion, где агенты управляют бизнесом Человек задаёт стратегию, а управляющий агент Andonos распределяет задачи между подчинёнными моделями. Им открыт доступ к терминалу, браузеру, корпоративной почте, телефонии и банковским счетам, с клиентами, подрядчиками и сотрудниками агенты общаются сами. По данным компании, Pion уже ведёт продажи и логистику торговых автоматов, управляет магазином в Сан-Франциско, кафе в Стокгольме и стриминговой радиостанцией. Andon Labs называет проект открытым экспериментом - агенты ошибаются, а эти точки убыточны. Pion доступен в превью по списку ожидания, части команд компания обещает гранты на тесты. andonlabs.com ✔️ HardFlow от MIT удерживает генеративные модели в физических ограничениях Метод рассчитан прежде всего на модели flow matching, которые генерируют траектории для роботов. HardFlow подключается к обученной модели на этапе инференса и не требует дообучения. Он опирается на теорию управления - промежуточные состояния модель генерирует свободно, а динамика корректируется так, чтобы итоговая траектория попала в заданные ограничения. По данным авторов, в тестах на навигацию и управление манипуляторами метод во всех случаях выполнил условия безопасности, оптимизировал длину маршрута и не увеличил задержки по сравнению с существующими подходами.  mit.edu ✔️ Reward AI представила перчатку Omnibody Hand и модель управления роботами OM-1 Стартап называет OM-1 политикой, общей для разных роботов. По данным компании, ей хватает меньше 30 минут записей человеческих демонстраций, чтобы освоить новую задачу, в том числе с контактом и длинным горизонтом. Записи собирает перчатка Omnibody Hand с тактильными датчиками, сенсорами приближения и камерами. Электромагнитное позиционирование в ней дополняет визуально-инерциальное и, по оценке Reward AI, на высоких скоростях снижает погрешность на 60%. OM-1 задаёт направление, скорость, силу и моменты ключевых событий, а исполняет команды отдельный слой управления, обученный с подкреплением в симуляции, который сглаживает задержки инференса и компенсирует возмущения. rewardai.com @ai_machinelearning_big_data #news #ai #ml

2
📘 Бесплатная 348-страничная книга по Machine Learning для учёных и инженеров Machine Learning for Scientists and Engineers -
📘 Бесплатная 348-страничная книга по Machine Learning для учёных и инженеров Machine Learning for Scientists and Engineers - большой практический учебник по ML с упором на математику, алгоритмы и инженерное понимание моделей. Внутри: - основы машинного обучения - линейные и нелинейные модели - оптимизация - вероятностные методы - обучение с учителем и без - оценка качества моделей - математические основы, нужные для ML Хороший вариант для тех, кто хочет не просто пользоваться библиотеками, а понимать, почему алгоритмы работают именно так. PDF: https://smlbook.org/book/sml-book-draft-latest.pdf #DataScience #DataScientist #ML #Mathematics #Algorithms
770
3
📘 Глубокое понимание AI Agent: принципы проектирования и инженерная практика AI Agents in Depth: Design Principles and Engin
📘 Глубокое понимание AI Agent: принципы проектирования и инженерная практика AI Agents in Depth: Design Principles and Engineering Practice - одна из самых сильных новых книг по AI Agents: context engineering, RAG, MCP, coding agents, post-training, multi-agent. 10 глав и более 100 практических экспериментов, есть русская версия. https://github.com/bojieli/ai-agent-book/blob/main/docs/ru/README.md
1 113
4
🔥 Хочешь расти в IT быстрее остальных? Перестань учиться в одиночку Можно годами смотреть курсы, читать документацию и всё р
🔥 Хочешь расти в IT быстрее остальных? Перестань учиться в одиночку Можно годами смотреть курсы, читать документацию и всё равно топтаться на месте. А можно попасть в правильное окружение, где каждый день обсуждают новые инструменты, вакансии, реальные кейсы, ошибки и то, что уже завтра станет стандартом. Здесь собраны папки и каналы по разным направлениям IT, чтобы ты быстрее находил нужных людей, идеи и полезный контент - без бесконечного поиска. AI: t.me/ai_machinelearning_big_data Python: t.me/pythonl Linux: t.me/linuxacademiya Хакинг: t.me/linuxkalii DevOps: t.me/DevOPSitsec Docker: https://t.me/+90Z5TAyfuNU5YmRi Golang: t.me/Golang_google Rust: t.me/rust_code C++: t.me/cpluspluc C#: t.me/csharp_ci Java: t.me/javatg JavaScript: t.me/javascriptv React: t.me/react_tg Frontend: t.me/front PHP: t.me/phpshka Android: t.me/android_its Мобильная разработка: t.me/mobdevelop Базы данных: t.me/sqlhub Data Science: t.me/data_analysis_ml Big Data: t.me/bigdatai Математика: t.me/data_math Физика: t.me/fizmat Kubernetes: t.me/kubernetc GameDev: https://t.me/gamedev Haskell: t.me/haskell_tg Собеседования и карьера: DS собеседования: t.me/machinelearning_interview Python собеседования: t.me/python_job_interview Папка с вакансиями: t.me/addlist/_zyy_jQ_QUsyM2Vi Папка Go разработчика: t.me/addlist/MUtJEeJSxeY2YTFi Папка Python разработчика: t.me/addlist/eEPya-HF6mkxMGIy Папка ML: https://t.me/addlist/2Ls-snqEeytkMDgy Папка Frontend: https://t.me/addlist/mzMMG3RPZhY2M2Iy Полезное сверху: ИТ-мемы: t.me/memes_prog Английский для программистов: t.me/english_forprogrammers ИИ и технологии: t.me/vistehno 954 ГБ open-source курсов: https://t.me/+rKBQEMccAA01MTcy ИТ-книги бесплатно: https://t.me/addlist/BkskQciUW_FhNjEy Max Ai: https://max.ru/ai_machinelearning_big_data Max python: https://max.ru/pythonl ТЕХНО: https://max.ru/vistehno Max Go: https://max.ru/Golang_google Max Linux: https://max.ru/linuxkalii Devops: https://max.ru/DevOPSitsec C#: https://max.ru/csharp_ci C++: https://max.ru/cpluspluc SQL: https://max.ru/sqlhub Java: https://max.ru/javatg Подпишись и сохрани, здесь регулярно появляются новые подборки, инструменты и материалы, которые реально помогают расти быстрее.
798
5
🔥 Thinking with Looped Flows - новый подход к reasoning через рекуррентное обновление скрытого состояния Обычные looped-моде
🔥 Thinking with Looped Flows - новый подход к reasoning через рекуррентное обновление скрытого состояния Обычные looped-модели могут тратить больше compute, многократно обновляя hidden state, но truncated backprop плохо обучает ранние шаги: то, что модель выучила в начале, часто не остаётся полезным позже. Авторы предлагают другой подход — обучать recurrence через последовательность denoising-задач с постепенно уменьшающимся шумом. Идея: noise → промежуточное состояние → всё более чистое решение При этом recurrent state переносится между шагами и постепенно уточняется. Результаты: - более стабильный test-time scaling - 58,8% на ARC-AGI-1 - 12,2% на ARC-AGI-2 - в целом лучше предыдущих looped-моделей Интересный сдвиг: reasoning здесь рассматривается не как цепочка токенов, а как постепенное движение внутреннего состояния модели от шума к решению. https://alphaxiv.org/abs/2609.11801
806
6
FrogNano: кодинг-агент на 4 млрд параметров, дообученный без копирования ответов больших моделей В новом отчёте Microsoft опи
FrogNano: кодинг-агент на 4 млрд параметров, дообученный без копирования ответов больших моделей В новом отчёте Microsoft описан подход к обучению небольших агентов для разработки ПО. FrogNano проходил постобучение исключительно через reinforcement learning на синтетических задачах примерно в 1 500 программных окружениях, без традиционной дистилляции от более крупной модели. Особенность - генерация задач прямо по ходу обучения. Их сложность подстраивается под текущие возможности агента: он получает задания, которые уже способен решить, но пока с трудом. По мере улучшения модели меняется и набор задач. Это позволяет поддерживать полезную сложность, вместо того чтобы снова обучать агента на уже освоенных примерах. Авторы связывают результат прежде всего с точностью подбора сложности. В их экспериментах такой подход позволил получить конкурентоспособного небольшого кодинг-агента на синтетических задачах. Цель проекта - работа на ограниченном железе. В отчёте разобраны методика обучения, оценки в разных окружениях и анализ приобретённых навыков. Статья - https://arxiv.org/abs/2609.07925
1 108
7
✔️ Anthropic сдвинула IPO на середину октября Компания скорректировала график подготовки к первичному размещению - теперь оно
✔️ Anthropic сдвинула IPO на середину октября Компания скорректировала график подготовки к первичному размещению - теперь оно ориентировано на середину октября. Причинами называют финальное согласование отчётности и желание андеррайтеров поймать более устойчивое окно на рынке. Размещение будет заметным для всей отрасли - Anthropic первой среди создателей передовых моделей переходит от венчурных денег к регулярной публичной отчётности и рынок впервые увидит, сходится ли экономика больших языковых моделей с затратами на вычисления. reuters.com ✔️ OpenAI набирает лоббистов для работы в штатах В команду по связям с госорганами пришли трое: Джессика Шумер из Amazon, Колдер Харвилл-Чайлдс из команды Цукерберга и Томас Маклеллан из Palo Alto Networks. Ставка на штаты объясняется тем, что единый федеральный закон об ИИ застрял в Конгрессе. Под руководством вице-президента по глобальной политике Криса Лехейна компания собирается напрямую участвовать в разработке законопроектов в Нью-Йорке, Калифорнии и других крупных штатах. Расчёт в том, чтобы закрепить нормы прозрачности и кибербезопасности на региональном уровне и сделать их фактическим стандартом для всей индустрии. axios.com ✔️ Microsoft выпустила облегчённый генератор изображений MAI-Image-2.6-Flash Это упрощённая версия флагманской MAI-Image-2.6. Она умеет генерировать картинки по тексту, править фрагменты, работать с несколькими референсами, сама подбирает соотношение сторон и ходит в веб-поиск. В рейтинге Artificial Analysis модель взяла 1311 Elo в редактировании (третье место, выше GPT Image 2) и 1297 Elo в генерации по тексту, восьмое место. Доступна в публичном превью на Microsoft Foundry. Генерация стоит 19 долларов за миллион токенов, что вдвое дешевле родительской модели и в несколько раз бюджетнее GPT Image 2. microsoft.ai ✔️ GitHub научил Copilot раздавать задачи разным моделям Project HydraFusion меняет прежнюю схему с одной моделью на ансамбль специализированных. Задачи распределяются на лету - маленькие модели отвечают за автокомплит в строках кода, а большие берут на себя архитектуру, рефакторинг и поиск граничных случаев. Прежде чем результат попадёт в IDE или в пул-реквест, его проверяют модели-критики и статический анализ. От этого проекта GitHub ждёт меньше галлюцинаций и логических ошибок в больших репозиториях без потери скорости. Предварительная версия уже доступна всем подписчикам Copilot. github.blog ✔️ ComfyOrg отправит своих инженеров работать внутри студий Разработчики нодового движка запустили программу Forward Deployed Creatives, скопировав модель Palantir - технические художники и инженеры компании сядут прямо в команды киностудий, игровых компаний и агентств. Задача - встроить ComfyUI в существующую инфраструктуру на Blender, Maya и Unreal Engine и написать под неё нестандартные ноды, чтобы генерация стала управляемой и повторяемой в реальном производстве. Обратная связь с проектов пойдёт напрямую разработчикам ядра ComfyUI. comfy.org @ai_machinelearning_big_data #news #ai #ml
911
8
📚 Бесплатная книга по математике для Computer Science и Machine Learning - более 2200 страниц Жан Галлье и Джоселин Куэйнтан
📚 Бесплатная книга по математике для Computer Science и Machine Learning - более 2200 страниц Жан Галлье и Джоселин Куэйнтанс собрали в одном учебнике алгебру, топологию, дифференциальное исчисление и теорию оптимизации. Материал для тех, кто хочет глубже разобраться в математической основе алгоритмов и машинного обучения. Книга на английском, полная рукопись доступна бесплатно в PDF. https://www.cis.upenn.edu/~jean/gbooks/geomath.html
1 245
9
📖 OpenAI обновила гайд по GPT-6 Astra API - модель явно заточена под длинные агентные задачи GPT-6 Astra позиционируется как
📖 OpenAI обновила гайд по GPT-6 Astra API - модель явно заточена под длинные агентные задачи GPT-6 Astra позиционируется как самая сильная модель OpenAI для computer use, браузера, software engineering, науки и сложных профессиональных workflows. Главные возможности: - Async tool calling — модель может продолжать рассуждать и выполнять другие части задачи, пока внешний tool ещё работает - Mid-turn steering — требования можно менять прямо во время выполнения задачи, не начиная всё заново - Динамический reasoning — reasoning effort можно повышать или снижать по ходу диалога с сохранением prompt cache - Multi-agent orchestration - Computer use - Structured Outputs - Programmatic Tool Calling - Persisted reasoning - Compaction OpenAI отдельно отмечает, что Astra во многих тестах использует заметно меньше output-токенов, поэтому стоимость успешно выполненной задачи может быть ниже даже при более высокой цене токена. https://developers.openai.com/api/docs/guides/latest-model?model=gpt-6-astra
1 472
10
⚡️ AI-агенты научились автономно разрабатывать софт несколько дней подряд В новой работе представили Harness-of-Harness (HoH)
⚡️ AI-агенты научились автономно разрабатывать софт несколько дней подряд В новой работе представили Harness-of-Harness (HoH) - надстройку над coding-агентами, которая превращает их работу в повторяющиеся циклы: планирование → код → тесты → оценка → улучшение Главная идея — не просто дать агенту одну большую задачу, а заставить его постоянно улучшать проект небольшими проверяемыми шагами, сохранять историю версий и отделять собственные тесты от независимой оценки. На GameCraft-Bench, FrontierSWE и ProgramBench подход протестировали с несколькими связками: - Codex + GPT-5.5 - OpenCode + DeepSeek-V4-Pro - Pi + MiniMax-M3 После трёх итераций HoH в среднем улучшил результат на 52,25%, а максимальный прирост достиг 82,86% по сравнению с обычным запуском тех же агентов. Самый показательный эксперимент длился более 70 итераций несколько дней подряд. Агент автономно собрал полноценный FPS: сюжет, основные механики, играбельный геймплей, визуал и звук. То есть речь уже не о «написать функцию по промпту», а о попытке построить цикл, в котором coding-агент самостоятельно развивает один проект часами и днями. https://arxiv.org/abs/2609.01481
3 095
11
🔥 Python + AI без игрушечных демок. Курс для тех, кто хочет собирать рабочие системы. Stepik: «Python современный AI для раз
🔥 Python + AI без игрушечных демок. Курс для тех, кто хочет собирать рабочие системы. Stepik: «Python современный AI для разработчика и автоматизации задач» 63 урока, 382 шага, практика с кодом и автопроверкой. Внутри: RAG, tool calling, агенты, evals, MCP, Ollama, vLLM, pgvector + HNSW, безопасный text-to-SQL, prompt injection, кэш, очереди и sandbox для агентного кода. Плюс реальные автоматизации: почта, отчёты, боты, вебхуки и браузерные сценарии. Для тех, кто уже знает Python и хочет перейти к production AI. ⏳ 72 часа скидка 55% https://stepik.org/a/295921
1 308
12
✔️ Qwen выпустила Qwen-RobotManip - базовую vision-language-action модель для управления роботами. Модель построена на Qwen-V
✔️ Qwen выпустила Qwen-RobotManip - базовую vision-language-action модель для управления роботами. Модель построена на Qwen-VL / Qwen3.5-4B и объединяет визуально-языковую основу с action-модулем на Diffusion Transformer и flow matching. Это позволяет напрямую генерировать непрерывные движения робота, сохраняя понимание изображения и текстовых инструкций. Главная идея проекта - сначала выровнять данные, потом масштабировать обучение. Датасеты робототехники сильно различаются: разные роботы, камеры, системы координат, пространства действий и способы сбора данных. Qwen-RobotManip приводит их к общей системе на уровне представлений, движений и поведения. Для обучения использовали только открытые датасеты роботизированных манипуляций и видео от первого лица - без собственного закрытого сбора данных. В итоге собрали около 38 100 часов данных. Авторы показывают сильное обобщение на новые условия, выполнение инструкций, восстановление после ошибок и перенос навыков между разными типами роботов. https://github.com/QwenLM/Qwen-RobotManip
1 301
13
🌟 Prime Intellect выложила отчет об агенте, с которым Opus 5 взял 95,5% на ARC-AGI-3 Prime Agent — это больше, чем харнесс м
🌟 Prime Intellect выложила отчет об агенте, с которым Opus 5 взял 95,5% на ARC-AGI-3 Prime Agent — это больше, чем харнесс модели. Сами авторы называют проект операционной системой для долгоживущих агентов. Умнее модель он не делает, но дает ей работать дольше - программно раскладывать информацию, параллельно раздавать задачи подагентам и копить полезные процедуры. Идея в том, чтобы у языковой модели была устойчивая вычислительная среда, где она сама распоряжается памятью, кодом, подагентами и долгими задачами. Состояние в системе разложено по четырем уровням: 🟢веса модели - то, что она знает после обучения; 🟢активный контекст - информация текущего шага; 🟢постоянный REPL и рекурсивные подагенты - внешние вычисления, инструменты и параллельная работа; 🟢дисковое состояние - история, факты, навыки, промпты и спецификации подагентов. Состояние переживает и шаги, и перезапуски, и отключения. Человек при этом может наблюдать за агентами и вмешиваться. 🟡Замеры Сильнее всего эффект виден на длинных интерактивных задачах. На ARC-AGI-3 конфигурация с Opus 5 дала 95,5% Best@1 против 30,2% у обвязки самой ARC. На длинноконтекстных задачах Prime Agent держится наравне с конкурентами, а на отдельных, вроде EmulatorBench, заметно вырывается вперед. Он обошел Pi-mono с GLM-5.2 и Codex с GPT-5.6 Sol, но уступил Claude Code с Opus 5. Отдельно показательны игровые прогоны на эмуляторах. На Sega Genesis связка Prime Agent и GPT-5.6 Sol набрала 61,6% по итоговой оценке верификатора, а Claude Code с той же моделью — ноль. На Game Boy Color разрыв еще резче: 99,8% против нуля. 🟡 Побочный эффект Самая любопытная деталь отчета - накопление навыков закрепляет не только полезное. В одном из экспериментов агент нашел способ обходить ограничения Factorio, сохранил его как переиспользуемый навык и тем самым записал эксплойт в долговременную память. Дальше он доставал оттуда именно это решение, потому что оно один раз сработало. На днях вышел релиз 0.8.0 с исправлениями найденных проблем и новыми возможностями. 📌Лицензирование: MIT License 🟡Техотчет 🖥Github @ai_machinelearning_big_data #AI #ML #Harness #Agents #PrimeIntellect
1 277
14
🔥 Prime Agent выпустили технический отчёт "Prime Agent: A Self-Improving RLM Harness" В работе подробнее разобрана архитекту
🔥 Prime Agent выпустили технический отчёт "Prime Agent: A Self-Improving RLM Harness" В работе подробнее разобрана архитектура Prime Agent и его роль как harness для долгих agentic-оценок. Один из самых интересных экспериментов - Factorio: - 7 дней непрерывной траектории на Sonnet 5 - 23,4 млн output tokens - завершено 24 из 196 технологий - ещё 71% прогресса до следующей технологии - 633 запущенных subagents - максимум 7 агентов работали одновременно Отчёт: https://arxiv.org/abs/2608.23552
1 691
15
🤯 Локальные AI-модели становятся пугающе мощными Qwen3.8-27B вошла в топ-10 рейтинга Arena WebDev, оказавшись всего в нескол+1
🤯 Локальные AI-модели становятся пугающе мощными Qwen3.8-27B вошла в топ-10 рейтинга Arena WebDev, оказавшись всего в нескольких позициях от моделей, которые больше неё на порядки. Модель всего на 27 млрд параметров, которую можно запускать локально. Ещё недавно такие возможности требовали огромных облачных моделей и дорогой инфраструктуры. Теперь open-source модели начинают конкурировать с лидерами рынка прямо на своём железе. Alibaba с серией Qwen 27B закрепилась в отдельном классе размеров и сейчас выглядит практически без конкурентов. https://x.com/arena/status/2091920512796725272
1 810
16
17 сентября в Москве — AI R&D DAY. Без маркетинговой шумихи, только хардкор: альтернативные архитектуры, омнимодальная долгос
17 сентября в Москве — AI R&D DAY. Без маркетинговой шумихи, только хардкор: альтернативные архитектуры, омнимодальная долгосрочная память, агенты, бенчмарки и инструменты обучения моделей. Команда NextGenAI расскажет, что уже работает сегодня и что станет стандартом завтра. Для кого: R&D, AI-архитекторов, продактов и техлидов, которые строят продукты, а не слайды. Поговорим о: -новых подходах к созданию и обучению моделей; -системах, которые одновременно работают с текстом, изображениями, звуком и другими типами данных; -развитии голосовых технологий; -оценке качества AI-решений; -внедрении технологий в реальные продукты. Приходят не спикеры «по приглашению», а опытные команды, которые сейчас строят NextGenAI. Говорят про архитектуры, которые ещё не в публичных репозиториях. Про память, которая работает дольше контекста. Про то, как голосовые технологии перестают быть костылём. 👇 Подробности #реклама О рекламодателе
773
17
🤖 AI-агенты уже пишут код. Но умеют ли они чинить настоящие проблемы? Новое исследование SWE-bench Science показывает: часто
🤖 AI-агенты уже пишут код. Но умеют ли они чинить настоящие проблемы? Новое исследование SWE-bench Science показывает: часто агенты исправляют только видимый симптом, а не реальную причину бага. Учёные проверили агентов на задачах из открытых научных репозиториев: * публичные тесты можно использовать для итераций; * скрытые тесты показывают, действительно ли проблема решена. Результат удивляет: Claude Code с Opus-5 проходит 96,64% публичных тестов, но настоящий показатель Pas@1 - всего 47,90%. Агент часто делает так, чтобы ошибка исчезла на поверхности, но не восстанавливает правильное поведение системы. 📄 SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science? https://arxiv.org/abs/2608.19799
1 520
18
У Microsoft вышла очень показательная работа про надёжность AI-агентов. Лучший агент в эксперименте смог успешно выполнить 91
У Microsoft вышла очень показательная работа про надёжность AI-агентов. Лучший агент в эксперименте смог успешно выполнить 91% бизнес-задач хотя бы один раз. Но если требовать, чтобы он выполнял ту же задачу правильно каждый раз, показатель падал до 25%. И есть ещё более неприятная часть. В 4 из 5 неудачных запусков агент: — вежливо завершал работу — вызывал инструмент записи в базу — сообщал, что всё выполнено Но состояние базы показывало обратное. То есть по финальному ответу агента проблема вообще могла быть незаметна. Поэтому Microsoft сделала ThinkingBox — sandbox для проверки агентов в stateful business workflows. Он запускает агента с реальными tools, симулированным пользователем и backend-состоянием, а после выполнения проверяет не слова агента, а то, что реально изменилось в системе. Очень правильная метрика для production-агентов: не «смог ли он сделать это хотя бы раз», а **«делает ли он это стабильно при повторных запусках».** Paper: https://arxiv.org/abs/2608.19741 “One Success Isn't Reliability: ThinkingBox, a Sandbox and Benchmark for Agents in Stateful Business Workflows”
1 729
19
🔥 Хочешь быстрее расти в IT? Хватит учиться в одиночку Окружение решает больше, чем кажется. Собрал папки и каналы, где можн
🔥 Хочешь быстрее расти в IT? Хватит учиться в одиночку Окружение решает больше, чем кажется. Собрал папки и каналы, где можно быстрее влиться в нужное направление, следить за трендами и не вариться в своём пузыре. AI: t.me/ai_machinelearning_big_data Python: t.me/pythonl Linux: t.me/linuxacademiya Хакинг: t.me/linuxkalii DevOps: t.me/DevOPSitsec Docker: https://t.me/+90Z5TAyfuNU5YmRi Golang: t.me/Golang_google Rust: t.me/rust_code C++: t.me/cpluspluc C#: t.me/csharp_ci Java: t.me/javatg JavaScript: t.me/javascriptv React: t.me/react_tg Frontend: t.me/front PHP: t.me/phpshka Android: t.me/android_its Мобильная разработка: t.me/mobdevelop Базы данных: t.me/sqlhub Data Science: t.me/data_analysis_ml Big Data: t.me/bigdatai Математика: t.me/data_math Физика: https://t.me/+S4hinvO3QI43ZjNi Kubernetes: t.me/kubernetc GameDev: https://t.me/gamedev Haskell: t.me/haskell_tg Собеседования и карьера: DS собеседования: t.me/machinelearning_interview Python собеседования: t.me/python_job_interview Папка с вакансиями: t.me/addlist/_zyy_jQ_QUsyM2Vi Папка Go разработчика: t.me/addlist/MUtJEeJSxeY2YTFi Папка Python разработчика: t.me/addlist/eEPya-HF6mkxMGIy Папка ML: https://t.me/addlist/2Ls-snqEeytkMDgy Папка Frontend: https://t.me/addlist/mzMMG3RPZhY2M2Iy Полезное сверху: ИТ-мемы: t.me/memes_prog Английский для программистов: t.me/english_forprogrammers ИИ и технологии: t.me/vistehno 954 ГБ open-source курсов: https://t.me/+rKBQEMccAA01MTcy ИТ-книги бесплатно: https://t.me/addlist/BkskQciUW_FhNjEy Max Ai: https://max.ru/ai_machinelearning_big_data Max python: https://max.ru/pythonl ТЕХНО: https://max.ru/vistehno Max Go: https://max.ru/Golang_google Max Linux: https://max.ru/linuxkalii Devops: https://max.ru/DevOPSitsec C#: https://max.ru/csharp_ci C++: https://max.ru/cpluspluc SQL: https://max.ru/sqlhub Java: https://max.ru/javatg Подписывайся на нужные направления и собирай себе ленту, которая реально двигает вперёд.
1 323
20
Бесплатная книга по performance engineering В Algorithmica хорошо разобрали, почему классическая оценка сложности всё хуже от
Бесплатная книга по performance engineering В Algorithmica хорошо разобрали, почему классическая оценка сложности всё хуже отражает реальную производительность на современном железе. Раньше модель была довольно логичной: процессор выполняет инструкции почти последовательно, у каждой есть своя стоимость, а значит можно примерно оценить время работы алгоритма количеством операций. Потом всё упростили до асимптотики. Например, вместо точного количества операций в умножении матриц мы просто говорим O(n³) и игнорируем константы. Для сравнения алгоритмов на больших данных это удобно. Но современные CPU устроены намного сложнее: кэши, конвейеры, параллельное выполнение инструкций, SIMD, prefetching, память с разной задержкой. Поэтому два алгоритма с одинаковым O(n) могут отличаться по скорости в разы. А иногда алгоритм с формально «хуже» сложностью на реальных размерах данных оказывается быстрее. Хорошая серия для тех, кто хочет перейти от «у этого O(n), значит быстро» к пониманию того, как код реально выполняется процессором. en.algorithmica.org/hpc/complexity/
5 247