Machinelearning
前往频道在 Telegram
Погружаемся в машинное обучение и Data Science Показываем как запускать любые LLm на пальцах. По всем вопросам - @haarrp @itchannels_telegram -🔥best channels Реестр РКН: clck.ru/3Fmqri
显示更多📈 Telegram 频道 Machinelearning 的分析概览
频道 Machinelearning (@ai_machinelearning_big_data) 俄语 语言赛道中的 是活跃参与者。目前社区聚集了 278 581 名订阅者,在 技术与应用 类别中位列第 331,并在 俄罗斯 地区排名第 1 361 位。
📊 受众指标与增长动态
自 невідомо 创建以来,项目保持高速增长,吸引了 278 581 名订阅者。
根据 05 十月, 2026 的最新数据,频道保持稳定运转。过去 30 天订阅人数变化为 -4 014,过去 24 小时变化为 16,整体触达仍然可观。
- 认证状态: 未认证
- 互动率 (ER): 平均受众互动率为 7.88%。内容发布后 24 小时内通常能获得 6.10% 的反应,占订阅者总量。
- 帖子覆盖: 每篇帖子平均可获得 21 942 次浏览,首日通常累积 16 969 次浏览。
- 互动与反馈: 受众积极参与,单帖平均反应数为 164。
- 主题关注点: 内容集中在 openai, claude, api, gemini, контекст 等核心主题上。
📝 描述与内容策略
作者将该频道定位为表达主观观点的平台:
“Погружаемся в машинное обучение и Data Science
Показываем как запускать любые LLm на пальцах.
По всем вопросам - @haarrp
@itchannels_telegram -🔥best channels
Реестр РКН: clck.ru/3Fmqri”
凭借高频更新(最新数据采集于 06 十月, 2026),频道始终保持新鲜度与高覆盖。分析显示受众积极互动,使其成为 技术与应用 类别中的关键影响点。
278 581
订阅者
+1624 小时
-5737 天
-4 01430 天
帖子存档
278 563
✔️ Google заменит Gems в Gemini на Skills
Личные аккаунты Google перейдут на новый формат в ноябре 2026 года. Рабочие, корпоративные и некоммерческие аккаунты Workspace в марте 2027-го, учебные - в июне 2027-го.
Существующие Gems к этому сроку Google автоматически пересоберёт в навыки, пересоздать их вручную можно уже сейчас.
От Gems навыки отличаются тем, что работают в любом чате. Навык вызывают командой из косой черты и названия (позже Google обещает заменить её на @), но Gemini подключает его и сам, если навык подходит к запросу.
В одном диалоге можно сочетать несколько навыков. Навыки работают с подключёнными приложениями, включая сервисы Workspace, но не поддерживают Canvas, Deep Research и встроенные инструменты генерации видео и музыки.
Одновременно активными могут быть до 100 навыков, общий доступ и файлы с Google Диска обещают добавить позже.
Навык создается в диалоге с Gemini, по готовому или пустому шаблону либо загрузкой файла
SKILL.md.
Внутри могут быть текст, код, конфигурации, PDF и изображения, документы Word и таблицы Excel не принимаются.
Для загрузки файлов нужна веб-версия или приложение для Mac.
Google также опубликовал советы по написанию навыков.
@ai_machinelearning_big_data
#news #ai #ml278 563
Разработка модели компьютерного зрения не всегда начинается с кода. Иногда больше времени уходит на подготовку данных, разметку и проверку гипотез.
Luna Line от VisionLabs объединяет эти этапы в одной no-code платформе: здесь можно загрузить данные, разметить изображения, обучить модель и проверить результат.
Платформа поддерживает задачи классификации, детекции и сегментации. Причём для проверки гипотез не обязательно сразу собирать большую выборку: в VisionLabs рассказывают о сценариях обучения моделей классификации начиная от 50 изображений.
Для ML-команды это может быть способом быстрее пройти путь от идеи CV-задачи до работающей модели и понять, стоит ли развивать гипотезу дальше.
Подробнее о Luna Line
278 563
✔️ AMD покупает World Labs
Стартап Фей-Фей Ли, который с 2024 года разрабатывает модели пространственного интеллекта для работы с трехмерным физическим миром, подписал обязывающее соглашение о переходе в AMD.
Сама Ли станет исполнительным вице-президентом и главой по науке AMD и будет работать напрямую с генеральным директором Лизой Су. Сооснователи стартапа вместе с Ли продолжат руководить командой World Labs, на базе которой AMD создаст исследовательскую лабораторию.
Сделке предшествовало партнерство по оптимизации моделей World Labs под GPU AMD. Закрытие покупки ожидается до конца 2026 года после одобрения регуляторов.
worldlabs.ai
✔️ SpaceXAI запустила общих агентов Grok для рабочих команд
Компания открыла публичное бета-тестирование Team Bots на тарифах Teams и Enterprise. Это боты Grok Bot, которых настраивают под общую роль или процесс и выдают всей команде сразу.
Каждый бот получает файлы, инструкции и навыки, плагины для GitHub, Notion и Salesforce, учетные данные для сторонних API без плагинов и долговременную память, которая копит опыт в заданной роли.
Навыки и база знаний у бота общие, а переписка и память каждого сотрудника хранятся отдельно.
Цен в анонсе нет, но SpaceXAI собрала ботов для продаж, продуктового менеджмента, маркетинга и аналитики.
x.ai
✔️ Китай может разрешить закупку чипов Nvidia
Министерство промышленности и информатизации КНР запросило у Alibaba, ByteDance и других компаний планы закупок видеокарт Nvidia RTX Pro и дало понять, что намерено их одобрить, пишет The Information со ссылкой на два источника.
ByteDance, по данным издания, рассматривает партию около миллиона штук. RTX Pro 5500 сделана для рабочих станций на потребительском кристалле без памяти HBM и быстрых межчиповых соединений, облачные провайдеры планируют собирать их в серверные стойки по восемь графических процессоров..
Поставки могут начаться в конце декабря, около 500 тысяч карт в квартал, по цене порядка 13 тысяч долларов за штуку. Для Nvidia это шанс вернуться на рынок, где ее доля, упала с 95% почти до нуля.
theinformation.com
✔️ Kuaishou анонсировала Kling 4.0
Новая модель генерирует до 30 секунд видео за один проход, что вдвое больше Kling 3.0. Она принимает до 10 ключевых кадров, которые фиксируют смену сцен, состояния персонажей и тайминг, и до 15 референсов одновременно.
Модель умеет точечно редактировать готовое видео, продлевать генерацию, создавать стереофонический звук и выполнять липсинк на нескольких языках.
Полная версия выйдет в октябре, облегченная Kling 4.0 Flash с 28 сентября доступна подписчикам тарифа Ultra.
klingai.com
✔️ Американский бизнес переводит часть нагрузок на открытые модели
Растущие счета за модели OpenAI и Anthropic подталкивают компании в США к решениям с открытыми весами. На шлюзе Vercel доля открытых моделей в токенах выросла с 7% в декабре до 56% в августе, хотя в расходах на них пришлось лишь 14%.
На OpenRouter первую десятку по объему токенов возглавляют китайские открытые модели. Расходы Tinder на ИИ в годовом исчислении выросли с 1 до 10 млн долларов с января по июль, и компания начала отправлять часть запросов открытым моделям.
AT&T обрабатывает 45 млрд токенов в день и уже отдает открытым моделям около 40% нагрузок и за год хочет довести долю до 70%.
Кроме стоимости компании ценят возможность запускать модели на своих серверах и дообучать их на закрытых данных.
ft.com
@ai_machinelearning_big_data
#news #ai #ml
278 563
Команда Т-Теха разработала решение для улучшения рексистем в условиях нехватки данных пользователей
Исследователи Т-Технологий на международной конфе по рекомендательным системам ACM RecSys 2026 выступили сразу с тремя работами: библиотекой Scikit‑Rank, фреймворком Perseus и методом ScaL³AE.
Главный релиз — Scikit‑Rank. Библиотека позволяет применять нейросетевые модели в задачах предсказания показателя кликабельности и ранжирования предложений с минимальными изменениями кода. Библиотеку можно использовать для ранжирования предложений, например, в электронной коммерции, банкинге, медиа.
Вторая работа — Perseus. Фреймворк позволяет обучать нейросети на общей последовательности сигналов о пользователе и повышать качество рекомендаций благодаря учету источников данных из разных продуктов и сервисов. В эксперименте на T-ECD он улучшил качество рекомендаций с 16 до 39% в разных доменах при использовании истории пользователя из разных сервисов.
Третья разработка — ScaL³AE — подход, который помогает улучшить качество и эффективность вычислений при работе с большими объемами каталогов в более чем миллионы объектов рекомендаций. Он позволяет компактно применять описание товаров для рекомендаций в больших каталогах в том числе для объектов, по которым накоплено мало взаимодействий. В тестах на четырех категориях Amazon Reviews метод превзошел EASE и SANSA, а также показал сопоставимые или более высокие результаты по сравнению с популярной L³AE.
@ai_machinelearning_big_data
#news #ai #ml
278 563
⚡️ DeepSeek перенесла DeepGEMM на Huawei Ascend и выжала из железа 99,8%
DeepSeek выложила DeepGEMM-Ascend, порт своей библиотеки матричных ядер на NPU Huawei Ascend 950. API остался тем же, что у оригинального DeepGEMM, а сами ядра переписаны под особенности Ascend.
Поддерживаются GEMM в FP4, FP8 и BF16, grouped GEMM для MoE, MQA logits и слитые операторы MegaMoE. Плотный GEMM почти упирается в теоретический потолок: FP4 даёт 1701 TFLOPS (98,3% от пика), FP8 861 TFLOPS (99,5%), BF16 431 TFLOPS (99,8%).
Внутри JIT-компиляция, конвейеризация на корутинах и тонкая обёртка над матричными инструкциями Ascend. Нужны CANN 9.20, torch_npu и Python 3.10+. Лицензия MIT.
https://github.com/deepseek-ai/DeepGEMM-Ascend
278 563
Коннектом дрозофилы нашёл неожиданное применение: цифровая муха расставляет приоритеты в списке задач.
Разработчики MWS собрали веб-демо, где выбор, с какого дела начать, совершает модель мушки, построенная на реальной схеме её нервной системы. Пользователь вводит до 5 задач, а на выходе получает одну приоритетную и перечень отложенных.
Результат оформляется в карточку, которой можно поделиться. Список задач переносится в MWS Tables для планирования по дням.
Полная карта мозга дрозофилы — около 140 тыс. нейронов и 50 млн синапсов — за последний год превратилась в открытый полигон для экспериментов. Исследователи уже подключили её эмуляцию к виртуальному телу, а энтузиасты научили цифровую муху играть в шутеры, парковать машину и диджеить. Теперь к этому списку добавилась и приоритизация задач.
Демо: https://dontdoit.tech
@ai_machinelearning_big_data
278 563
📌 Anthropic оценила кибервозможности GLM-5.3
Anthropic впервые оценила открытую китайскую модель и опубликовала исследование о том, насколько GLM-5.3 от Z.ai продвинулась в поиске и эксплуатации уязвимостей.
Z.ai выпустила модель в августе, веса выложила через две недели.Двумя неделями ранее её проверял CAISI, центр стандартов и инноваций ИИ при американском институте NIST, и назвал сильной в киберзадачах среди открытых моделей на сегодня. По словам Anthropic, в ExploitBench GLM-5.3 довела до рабочего эксплойта известные уязвимости движка V8 в 50 попытках из 410, это 12%.
У Claude Mythos Preview результат 14%, у GLM-5.2 и Claude Opus 4.6 близок к нулю.В ручных сессиях с человеком модель находила ранее неизвестные уязвимости в браузере и драйверах, а встроенные ограничения, утверждает Anthropic, обходятся без особых усилий и в открытых весах их можно снять. 🟡CAISI более сдержан в описании результатов На четырёх кибербенчмарках GLM-5.3 заметно слабее американских передовых моделей, в SEC-Bench Pro она решает 40,4% задач против 90,2%. Совокупное отставание CAISI оценивает примерно в четыре месяца. Вывод обеих организаций совпадает в главном - возможности, которые год назад были только у закрытых лабораторий, теперь доступны любому, кто скачает веса. В ответ на это Anthropic предлагает шире открывать передовые модели для безопасников и проверять достаточно сильные модели до выпуска на уровне государств. Z.ai пока никак не отреагировала ни на оба исследования, ни на инициативу Anthropic. @ai_machinelearning_big_data #news #ai #ml
278 563
⚡️ Liquid AI выпустила модели, которые принимают решения и не генерируют ни одного токена
Liquid AI представила decision models, первая из них называется d1. Модель получает контекст в виде текста или JSON и за один вызов возвращает откалиброванные вероятности по заранее заданным вариантам ответа.
Вопросы бывают трёх типов: «да или нет» с вероятностью от 0 до 1, выбор из нескольких вариантов с распределением вероятностей и оценка по шкале. Несколько вопросов можно задать в одном запросе.
Ответ не нужно парсить, ошибок схемы не бывает, задержка низкая и предсказуемая, а три вызова LLM сливаются в один. Вместе с ответом приходит уверенность модели, поэтому спорные случаи легко отправить на большую модель или человеку.
Модели: https://docs.liquid.ai/lfm/models/decision-models
Гайд по миграции: https://docs.liquid.ai/guides/decision-model-guide
Демо: https://github.com/Liquid4All/cookbook/tree/main/examples/road-decider
@ai_machinelearning_big_data
#LiquidAI
278 563
⚡️ OpenAI превращает ChatGPT в рабочую среду для ИИ-агентов.
Dots - персональные агенты, которым можно отдавать задачи и получать результат позже. Им можно задать имя, роль и подключить почту, календарь, мессенджеры и другой софт.
Следом - ChatGPT Space: общее пространство, где люди и агенты работают в одном контексте.
Под это OpenAI обновила GPT-6.1 Sol - почти уровень Astra, но примерно в 5 раз дешевле в API.
Главное:
- $2 / $10 за 1 млн токенов
- кэшированный контекст - $0.10
- сильнее кодинг и агентные сценарии
- версии Ultrafast
Sol → Dots → команда агентов → ChatGPT Space.
ChatGPT всё меньше похож на чат и всё больше - на полноценную рабочую систему.
🎥 https://www.youtube.com/watch?v=Fls_onRviPM
278 563
⚡️ OpenAI превращает ChatGPT в операционную систему для ИИ-агентов.
Компания показала Dots - персональных агентов, которые должны работать как цифровой «Джарвис».
Ты ставишь задачу, закрываешь чат, а агент продолжает работать сам и присылает уведомление, когда всё готово.
Каждому Dot можно дать своё имя и отдельную роль: один работает с почтой, второй с календарём, третий пишет код, четвёртый собирает документы и отчёты.
Главная идея — не один универсальный ИИ, а целая команда агентов, которая знает твой контекст и работает параллельно.
Следом OpenAI готовит ChatGPT Space — общее рабочее пространство для людей и агентов. Там можно будет вести проекты, хранить контекст, распределять задачи и работать с ИИ как с полноценными участниками команды.
И всё это развивается вокруг нового поколения моделей GPT-6.
Получается, ChatGPT постепенно меняется:
чат → агент → команда агентов → полноценное рабочее пространство.
Похоже, следующий интерфейс компьютера — это уже не папки, вкладки и приложения.
Это команда ИИ, которой ты просто говоришь, что нужно сделать.
🎥 https://www.youtube.com/watch?v=Fls_onRviPM
278 563
✔️ Китай ограничил зарубежные поездки для семей ИИ-разработчиков
Власти КНР обязали семьи ключевых разработчиков в сфере ИИ и полупроводников согласовывать выезды за границу.
Новое требование затрагивает супругов и детей топ-менеджеров, исследователей и основателей частных технологических компаний. Для пересечения границы, в том числе в туристических целях, им требуется предварительное одобрение Пекина.
Ранее в этом году прямые ограничения на зарубежные поездки коснулись самих инженеров корпораций и стартапов.До развития LLM подобный контроль применялся исключительно к сотрудникам государственных институтов, специалистам ядерной отрасли и руководству госкорпораций. Формально механизм не вводит полного запрета на выезд. По оценкам аналитиков, контроль за перемещением семей направлен на предотвращение оттока кадров и технологий в США. @ai_machinelearning_big_data #news #ai #ml
278 563
⚡️ 12 ноября в Москве пройдет MWS Cloud Day 2026
Это вторая конференция MWS Cloud, входящей в МТС Web Services. Формат гибридный: можно прийти очно или подключиться онлайн.
Тема понятная: компании постепенно доводят ИИ-пилоты до продакшена и встраивают модели в продукты и процессы. А вместе с этим возникают вопросы к инфраструктуре: хватит ли вычислений, как устроены данные и сети, как всё это мониторить и во сколько обойдётся.
Разбирать это будут в трёх треках: облака, ИИ и безопасность. Всего 20 докладов, в которых эксперты расскажут про cloud-native-подходы, создание и внедрение ИИ-систем и кибербезопасность, с упором на реальные бизнес-задачи.
Конференция рассчитана на CTO и CIO, руководителей инфраструктурных, платформенных, data- и ИИ-команд, DevOps-, backend- и platform-инженеров, а также технологических партнеров, интеграторов и клиентов MWS. Регистрация по ссылке.
@ai_machinelearning_big_data
278 563
💰 Anthropic готовится к IPO и предупреждает инвесторов: её модели могут представлять «экзистенциальный риск для человечества».
Из 261 страницы проспекта около 80 посвящены рискам. Компания допускает, что продвинутые модели могут сопротивляться отключению, скрывать информацию или вести себя подобно шантажисту. Ещё сложнее их проверять, если модель распознаёт, что проходит тест.
При этом Anthropic пишет, что для сохранения лидерства ей нужен непрерывный выпуск новых моделей. Ранее компания сообщила: за одну выбранную неделю на исследования безопасности пришлось около 6% вычислительных ресурсов для ИИ-исследований. Это показатель за неделю, а не доля всего бюджета.
Раскрывать риски перед IPO нормально. Необычно то, насколько подробно Anthropic описывает опасности технологии, на которой строится её бизнес.
Источник: https://www.reuters.com/business/finance/anthropic-warns-ai-may-pose-existential-risks-humanity-ipo-filing-2026-09-29/
@ai_machinelearning_big_data
#Anthropic #ipo
278 563
✔️ Агенты OpenAI выложили в сеть 53 фото пользователей
Изображения пользователи загружали в сервисы OpenAI, затем они попали в обучающие данные, а агенты из исследовательской среды компании разместили их на сторонних фотохостингах.
Ссылки не публиковались, но найти снимки было можно. Большую часть OpenAI удалила, остальное ещё в сети. Уведомить владельцев компания не может, её технический подход и политика конфиденциальности не позволяют связать снимки с аккаунтами.
Случай вошёл в обзор поведения агентов, который OpenAI ведёт после взлома ими Hugging Face.
На прошлой неделе премьер Австралии заявил, что агенты OpenAI проникли в базы национальной системы здравоохранения и через запрос Сената вызвал Сэма Альтмана и Дарио Амодея для дачи показаний по инциденту на парламентских слушаниях.
openai.com
✔️ OpenRouter доверил выбор модели нейросети Jev
Jev Router подбирает модель и глубину рассуждений под каждый запрос с учётом качества, скорости и цены. Решение принимает Jev, модель компании TypeSafe. Перед каждым запросом она оценивает его сложность и нужную точность.
На четырёх агентских бенчмарках Jev Router решил 237 задач из 423 против 130 у прежнего Auto Router, это по замерам самой OpenRouter. Роутер бесплатный, контекст 1 млн токенов.
openrouter.ai
✔️ Китай стал вторым рынком дата-центров после США
SemiAnalysis насчитала больше 1000 объектов у 60 с лишним операторов на 24 с лишним ГВт. Ещё около 20 ГВт в проектах со сроками ввода и 30 ГВт в анонсах.
Примерно пятую часть введённых мощностей занимает ByteDance, и почти всё она арендует. Капитальные затраты Alibaba, Tencent и Baidu во втором квартале выросли больше чем вдвое год к году, до 20 млрд долларов, и впервые все три компании показали дефицит свободного денежного потока.
semianalysis.com
✔️ ElevenLabs выпустила Eleven v4 и Eleven v4 Turbo
Новая модель синтеза речи построена на другой архитектуре и подстраивает подачу под контекст сцены и предыдущие реплики. Интонацией управляют встроенными тегами, а произношением – через международный фонетический алфавит.
Для клонирования голоса хватает 10 секунд записи. Языков больше 90 и голос, записанный на одном, сохраняет тембр на остальных.
Turbo сделана для голосовых агентов. Медианная задержка около 100 мс, до начала речи около 150 мс.
Модели доступны в ElevenAgents, ElevenCreative и через ElevenAPI, в том числе бесплатно. Первые две недели API стоит 22 доллара за миллион символов для v4 и 11 для Turbo.
elevenlabs.io
✔️ Manus обновился до версии 2.0
Обновление построено вокруг нового харнесса Cascade, который подключает специализированные инструменты, только когда они нужны задаче.
В тестовой конфигурации он потратил на 23% меньше токенов и на 28% меньше времени и обошёлся на 32% дешевле прежней системы. Задачи теперь запускаются по событиям из почты, календаря, Slack или Notion, для постоянно работающих проектов предусмотрен Cloud Computer.
Десктопное приложение стало Manus Studio с видеоредактором на таймлайне и средой для разработки игр.
Отдельное приложение Cue даёт каждому агенту почту, номер телефона, кошелёк с лимитом трат и отдельную виртуалку.
Manus 2.0 доступен в вебе, на десктопе и Android, версия для iOS ждёт проверки в App Store. Cue в раннем доступе по инвайт-коду.
manus.im
@ai_machinelearning_big_data
#news #ai #ml
278 563
⚡️ ML-пайплайн больше не обязательно собирать внутри одной площадки
Эксперименты и вычислительные нагрузки можно распределять между on-premises и облаком в зависимости от текущей задачи. То есть пайплайн может использовать ресурсы разных сред как части одной инфраструктуры.
🟡 Связность между площадками
Cloud Interconnect в Yandex Cloud соединяет локальную инфраструктуру и облачный контур по приватному каналу. BareMetal Extend: Virtualization позволяет добавить к этой схеме частное облако на выделенных серверах.
🟡Хранение данных
Intelligent Tiering в Object Storage автоматически перемещает данные между тремя классами хранения с учетом частоты обращения. В закрытом контуре StackLand позволяет собрать полноценную платформу данных и подключить PaaS-сервисы.
🟡 Контроль ресурсов
Через Billing API можно получать детализацию потребления и расходов по облакам, сервисам и отдельным ресурсам, а затем передавать эти данные в свои системы аналитики и мониторинга.
В результате вычисления, данные и инфраструктурные мощности можно распределять между разными средами под конкретный ML-сценарий, объединяя их в один технологический контур.
@ai_machinelearning_big_data
#AI #ML #Cloud #Infrastructure
278 563
🌟 OpenScience: персональный учёный с режимом автономных экспериментов
Стартап Synthetic Sciences из зимнего набора Y Combinator 2026 года вывел на Product Hunt OpenScience – открытую рабочую среду с ИИ-агентом для научных исследований.
Сам агент компания выложила ещё в июле, а главное из обновления – режим Autoresearch, в котором агент без участия человека ставит серию экспериментов и улучшает заданную метрику.OpenScience ведёт исследование целиком, от обзора литературы и гипотезы до кода, эксперимента, анализа и текста статьи. Агенту доступны 295 встроенных навыков, от обучения моделей до молекулярной биологии, хемоинформатики и вёрстки в LaTeX, и около сорока научных баз, среди них UniProt, PDB, ChEMBL, PubChem, arXiv и Semantic Scholar. 🟡Механика В Autoresearch задачу ставят обычными словами, например - снизить функцию потерь на валидационной выборке, остановить работу через час или при выходе метрики на плато и закончить после 20 запусков или 8 часов. Агент сначала запускает базовый вариант, затем по очереди проверяет идеи, отсортированные по ожидаемой пользе, и по каждому запуску решает, сохранить изменение или откатить. Чтобы цикл не затроил, после четырёх стартов без прогресса агент переключается на идеи другого типа, плюс каждые шесть запусков пересматривает подход. Ход работы записывается в файлы с постановкой задачи, очередью идей, таблицей результатов и выводами. Среда собрана как настольное приложение с деревом файлов, редактором, терминалом и просмотрщиками молекул, структур и геномов. Модель выбирается, подойдут собственные ключи Anthropic, OpenAI, Google и других провайдеров, вход по подписке ChatGPT или Codex, локальные модели и фирменный сервис Ace. Эксперименты запускаются локально, по SSH, в кластере под Slurm или PBS или в облаке Modal. Метрики собирает встроенный трекер, скрипты под wandb работают с ним без переделки. 🟡 Тесты На Terminal-Bench Science агент решил 53 задачи из 70, это 75,7%.
В этом тесте OpenScience управляла GPT-6 Astra с GPT-6 Sol в роли исполнителей, на задачу давали 8 часов и одну попытку. Лучший результат в таблице Snorkel – 68,1% у Codex с GPT-6 Astra, у Claude Code с Opus 5.5 там 63,3%.В научной части Terminal-Bench 4.0 агент решил 10 задач из 14 против 60% у Claude Code с Fable 5.1, на BiomniBench-DA набрал 82,2 балла против 81,04 у aipoch. 📌Лицензирование: Apache 2.0 🟡Документация 🟡Бенчмарки 🟡Трассировки 🖥Github @ai_machinelearning_big_data #AI #ML #Agents #AiScientist #Bioinformatics #OpenScience
278 563
Anthropic выпустила Claude Sonnet 5.5 — новую модель с упором на код, агентные задачи и повседневную работу.
Что изменилось:
30%+ быстрее Sonnet 5
до 30% дешевле на задачу за счёт меньшего расхода токенов
70,6% в Terminal-Bench 4.0 против 10,3% у Sonnet 5
55,5% в CursorBench 4.0, примерно на 2 пункта ниже Opus 5.5
на GDPval-AA модель почти сравнялась с Opus 5.5
лучше работает с длинными задачами, изображениями, документами, таблицами и презентациями
Особенно заметный скачок — в программировании. Anthropic пишет, что Sonnet 5.5 быстрее разбирается в кодовых базах, делает меньше вызовов инструментов и тратит меньше шагов на выполнение задач.
Цена API:
$2 / 1M входных токенов
$10 / 1M выходных токенов
$0,20 / 1M cache reads
Модель уже доступна в Claude, API, AWS, Google Cloud и Azure.
API ID:
claude-sonnet-5-5
https://www.anthropic.com/claude-sonnet-5-5278 563
✔️ Data-платформа постепенно превращается в конструктор
Для AI и Big Data уже недостаточно просто где-то хранить большой объём данных. Вокруг моделей и аналитики появляется целая цепочка: данные нужно загрузить, обработать, связать между собой, запустить пайплайны, подготовить датасеты и только потом использовать в моделях или BI.
Поэтому инфраструктура всё чаще собирается не из одной универсальной системы, а из набора специализированных компонентов, которые работают вместе.
Именно такой подход появился в обновлённом Stackland от Yandex Cloud: в закрытом корпоративном контуре теперь можно развернуть связку из ClickHouse и PostgreSQL, Object Storage и Trino, Airflow и DataLens.
В результате в одном контуре оказываются и хранилища, и аналитика, и оркестрация процессов. Для AI-сценариев это позволяет выстраивать непрерывный путь данных — от их поступления и обработки до подготовки для моделей и анализа результатов.
@ai_machinelearning_big_data
#news #ai #ml
278 563
📌 Dream-RSI: агент улучшает стратегию поиска решений на основе прошлых запусков
Google опубликовала Dream-RSI - надстройку над агентами, которые ищут решения перебором: пишут код, прогоняют его через оценщик и дорабатывают лучшие варианты.
Концепт управляет стратегией исследования, решая, какие варианты развивать, сколько попыток запускать параллельно и когда остановиться. Модель, агент и оценщик при этом не меняются, самосовершенствуется только код стратегии.
🟡Механика
Каждый запуск сохраняется как дерево попыток, где узел хранит версию решения, диагностику и оценку.
Это дерево используется как симулятор - альтернативная стратегия проходит по записанным ветвям в другом порядке, с другой параллельностью и другими точками остановки, а результаты берутся из записей без новых вызовов агента.
Отдельный агент на базе языковой модели несколько раз переписывает код стратегии, каждую версию прогоняют по всем накопленным деревьям, и в следующий раунд уходит лучшая.
Оценка складывается из лучшего найденного результата, штрафа за число попыток и бонуса за параллельность. Прежняя стратегия тоже участвует в отборе, поэтому на записях прошлых запусков новая версия по оценке не уступает старой.
🟡Тесты
В задаче ускорения решателя Lasso версия на Gemini 3.1 Pro снизила среднее время работы на шести отложенных наборах данных с 3587 до 2931 мс и потратила 317 вызовов агента вместо 550.
В математических задачах результат смешанный: в задаче сумм и разностей 1,145427 против 1,143975 у SimpleTES, в упаковке кругов ничья, в неравенстве автокорреляции результат хуже собственной базы.
В третьей серии агент ускорял операции нейросетей на видеокарте из набора KernelBench. Для сети VGG16 и слоя нормализации LayerNorm Dream-RSI достиг той же скорости, что и база, за в 2,43 и 1,79 раза меньшее число попыток.
Для двух связок свёртки с делением и с выбором максимума он при том же числе попыток нашёл код быстрее базового в 2,09 и 1,44 раза.
Пока доступны только статья и страница проекта с интерактивной демонстрацией. Код и скрипты для воспроизведения Google обещает выложить позже.🟡Страница проекта 🟡Техотчет 🟡Демо 🖥GitHub @ai_machinelearning_big_data #AI #ML #RSI #Agents #DreamRSI #Google
278 563
🦾 Практический RecSys: собери рекомендательную ленту с помощью ML — на бесплатном вебинаре AI Talent Hub × Karpov.Courses
30 сентября в 18:00
разберем как работают рекомендательные системы изнутри.
Научим:
→ Превращать действия пользователей в данные для модели: просмотры, клики, реакции и другие сигналы; → Собирать персональные рекомендации и понимать, что показать конкретному пользователю; → Ранжировать контент в ленте и оценивать качество рекомендаций не только по ML-метрикам, но и с точки зрения продукта;И покажем, как эти навыки можно развить на программе AI Talent Hub ИТМО × karpovꓸcourses «Машинное обучение: от технической базы до создания ИИ-продукта». 👉 Участие бесплатное, по предварительной регистрации → успей зарегистрироваться до 30 сентября @aitalenthubnews
