Machinelearning
Погружаемся в машинное обучение и Data Science Показываем как запускать любые LLm на пальцах. По всем вопросам - @haarrp @itchannels_telegram -🔥best channels Реестр РКН: clck.ru/3Fmqri
Mostrar más📈 Análisis del canal de Telegram Machinelearning
El canal Machinelearning (@ai_machinelearning_big_data) en el segmento lingüístico de Ruso es un actor destacado. Actualmente la comunidad reúne a 278 376 suscriptores, ocupando la posición 331 en la categoría Tecnologías y Aplicaciones y el puesto 1 358 en la región Rusia.
📊 Métricas de audiencia y dinámica
Desde su creación el невідомо, el proyecto ha mostrado un crecimiento acelerado, reuniendo a 278 376 suscriptores.
Según los últimos datos del 10 octubre, 2026, el canal mantiene una actividad estable. En los últimos 30 días la variación de miembros fue de -3 126, y en las últimas 24 horas de 0, conservando un alto alcance.
- Estado de verificación: No verificado
- Tasa de interacción (ER): El promedio de interacción de la audiencia es 7.75%. Durante las primeras 24 horas tras publicar, el contenido suele obtener 6.10% de reacciones respecto al total de suscriptores.
- Alcance de las publicaciones: Cada publicación recibe en promedio 21 572 visualizaciones. En el primer día suele acumular 16 988 visualizaciones.
- Reacciones e interacción: La audiencia responde de forma activa: el promedio de reacciones por publicación es 155.
- Intereses temáticos: El contenido se centra en temas clave como openai, claude, api, gemini, контекст.
📝 Descripción y política de contenido
El autor describe el recurso como un espacio para expresar opiniones subjetivas:
“Погружаемся в машинное обучение и Data Science
Показываем как запускать любые LLm на пальцах.
По всем вопросам - @haarrp
@itchannels_telegram -🔥best channels
Реестр РКН: clck.ru/3Fmqri”
Gracias a la alta frecuencia de actualizaciones (últimos datos recibidos el 11 octubre, 2026), el canal mantiene la vigencia y un amplio alcance. La analítica demuestra que la audiencia interactúa activamente con el contenido, lo que lo convierte en un punto de referencia dentro de la categoría Tecnologías y Aplicaciones.
--temp примерно 1. Для таких fine-tune моделей это помогает сильнее отходить от поведения базовой модели и меньше застревать в чрезмерном обдумывании.
Если начинает вести себя нестабильно, температуру можно постепенно снижать.
Следом обещают выпустить Qwopus 3.6 27B. Предварительная оценка уже лежит в HF-репозитории автора, полный релиз модели должен выйти скоро.
https://huggingface.co/Jackrong/Qwopus3.5-9B-Coder-GGUF
@ai_machinelearning_big_dataGlasswing - инициатива по поиску уязвимостей в системно значимом программном обеспечении с помощью ИИ.Согласно обновленному отчету, около 50 её партнёров за первый месяц работы с моделью Mythos Preview обнаружили более 10 000 уязвимостей высокого и критического уровня. 🟡Среди приведённых примеров: 🟢Cloudflare, в чьих ключевых системах было найдено 2 000 ошибок, из них 400 серьёзных; 🟢Mozilla обнаружила в Firefox 150 271 уязвимость (примерно в 10 раз больше, чем при аналогичной проверке Firefox 148 моделью Claude Opus 4.6); 🟢Британский AI Security Institute подтвердил, что Mythos Preview стал первой моделью, прошедшей оба его сценария многошаговых кибератак от начала до конца. 🟡Параллельно Anthropic сама сканировала более тысячи опенсорс-проектов Mythos отметила как потенциально опасные 6 202 уязвимости высокого и критического уровня. Из 1 752 случаев, проверенных независимыми фирмами, 90,6% оказались реальными, а 62,4% подтвердили заявленную тяжесть.
В числе подтверждённых: уязвимость в криптографической библиотеке wolfSSL (CVE-2026-5194), которая позволяла подделывать сертификаты сайтов (уже исправлена).Anthropic отмечает, что узким местом теперь стала не идентификация ошибок, а их проверка и устранение. Из 530 переданных мейнтейнерам критичных уязвимостей закрыты пока только 75. Несколько разработчиков попросили Anthropic замедлить темп раскрытия, так как нагрузка превышает их возможности. Среднее время подготовки патча для серьёзной уязвимости составляет около 2-х недель.
В отчёте также упомянут эпизод в одном из банков-партнёров: по словам Anthropic, модель помогла предотвратить мошеннический перевод на 1,5 миллиона долларов после взлома почты клиента. Название банка и подробности инцидента не раскрываются.Anthropic обещает расширять Glasswing с участием правительств США и союзных государств. @ai_machinelearning_big_data #news #ai #ml
Скорость инференса на Apple A15 заявлена в 1,5 раза выше, чем у 4-битной версии предыдущей модели Hy-MT1.5.По результатам собственного тестирования Tencent, на бенчмарке FLORES-200 версии Hy-MT2 показали средние результаты 88,1%, 96,9% и 98,1% - компания называет это сопоставимым с показателями Gemini 3.1 Pro.
Tencent утверждает, что старшая модель 30B-A3B превосходит DeepSeek-V4-Pro и Kimi K2.6 на ряде тестов, а младшая 1,8B-версия опережает по среднему качеству перевода коммерческие API, включая решение Microsoft.Вместе с моделью Tencent открыла исходники IFMTBench - собственного тестового набора для оценки того, насколько точно перевод следует пользовательским инструкциям о стиле, терминологии и формате вывода. Помимо этого, компания выступает партнёром соревнований WMT26 - General Machine Translation и Video Subtitle Translation. Одновременно, в экосистеме WeChat запущено мини-приложение Tencent Hy Translate. Полноценные приложения для iOS и Android, по словам компании, появятся позднее. 📌Лицензирование: Tencent HY Ccommunity License 🟡Блогпост 🟡Набор моделей 🟡Техотчет 🟡Demo 🖥GitHub @ai_machinelearning_big_data #AI #ML #MT #HYMT2 #Tencent
Стоимость проекта оценивается примерно в 226 млн долларов, его строительство завершилось в октябре 2025 года.В проекте полностью отказались от промышленных систем охлаждения: тепло от серверов отводит морская вода, а электричество поступает напрямую от близлежащих ветряков. Данные о технических параметрах в публикациях расходятся. Часть источников указывает глубину размещения модулей около 10 метров, другие - 35 метров. Специалисты, причастные к проекту, признают, что технология находится на ранней стадии.
К числу нерешённых вопросов относят коррозию от солёной воды, долговременную герметизацию под давлением, надёжность подводных кабелей, доступность оборудования для обслуживания и возможное воздействие на морскую среду.Ранее схожий эксперимент, Project Natick, проводила Microsoft, однако в коммерческую эксплуатацию его не вывели. @ai_machinelearning_big_data #news #ai #ml
В дискретных моделях CFG был малоизучен и работал заметно хуже, а здесь нормально рулит балансом качества и разнообразия генерации.🟡Результаты тестов 🟢Метод обходит топовые дискретные (MDLM, Duo) и непрерывные (FLM, LangFlow) DLMs по генеративной перплексии и делает это, будучи меньше по размеру. 🟢На обучение понадобилось всего 45B токенов. Конкурентам нужно примерно в 10 раз больше. 🟢ELF бьёт даже дистиллированные версии конкурентов (few-step версия FLM, Duo с дистилляцией DCD) на малом числе шагов - хватает 32 шагов с SDE. 🟢Хорошие метрики на задачах с условием (то есть когда генерация опирается на вход): BLEU 26.4 в машинном переводе (WMT14 De-En) и лучшие ROUGE-цифры в XSum среди сравниваемых вариантов. 🟡Дисклеймер
Это пруф-оф-концепт. Самая большая протестированная модель ELF-L содержит всего 652M параметров. Внутри тестового диапазона (105M → 652M) скейлинг работает и улучшает метрики, но как поведёт себя метод на 7B–70B - неизвестно.Так что, если под рукой есть пара свободных кластеров H100 и интерес попробовать что-то новое - код открыт, метод описан, можно смело заниматься. Доступны и тестовые чекпоинты из пейпера. 📌Лицензирование: MIT License 🟡Arxiv 🟡Набор моделей 🖥GitHub @ai_machinelearning_big_data #AI #ML #Diffusion #ELF #MIT
n точек на плоскости. Нужно понять, сколько пар точек могут находиться ровно на расстоянии 1 друг от друга.
Долгое время считалось, что почти оптимальный ответ дают конструкции, похожие на квадратную решётку. Модель OpenAI показала, что это неверно.
Она построила бесконечное семейство конфигураций, где таких пар получается заметно больше, чем ожидалось. То есть была опровергнута не мелкая техническая деталь, а известная гипотеза, вокруг которой десятилетиями строились оценки.
Модель связала задачу о точках на плоскости с алгебраической теорией чисел.
В доказательстве используются решётки Минковского (способ превратить числа из алгебраической теории чисел в точки в обычном евклидовом пространстве), элементы нормы один и pro-3 башни числовых полей. Это инструменты из другой части математики, и именно их перенос в геометрию дал результат.
Нога Алон из Принстона отметил, что ответ оказался неожиданным, а применённые методы выглядят элегантно и нетривиально.
При этом доказательство не даёт нового «чисто геометрического» метода, на который многие надеялись. Гипотеза опровергнута, но сама структура задачи стала ещё интереснее.
Задачу сформулировал ИИ, решение сгенерировала внутренняя модель OpenAI, первичная проверка тоже прошла через автоматический ИИ-пайплайн. После этого люди проверили детали, улучшили изложение и довели работу до публикации.
Модель сама нашла неочевидную связь между разными областями математики и получила результат по открытой задаче высокого уровня.
Оригинал: https://openai.com/index/model-disproves-discrete-geometry-conjecture/
@ai_machinelearning_big_dataРазмер батча - один из двух ключевых параметров метода. Оптимальное значение растёт вместе с размером модели: для 270 млн параметров оно лежало в диапазоне от 3 до 8 токенов, а для 10 млрд равнялось 16Оставшуюся часть обучения модель переводят на обычный режим предсказания следующего токена. По словам Nous Research, готовая модель на инференсе ничем не отличается от обученной стандартным способом - архитектура, оптимизатор, токенизатор или набор данных не изменяются. Метод протестили на моделях 4-х размеров: 270 млн, 600 млн и 3 млрд параметров, а также на 10 миллиардной MoE. В самом крупном эксперименте модель с TST достигла более низкого значения лосса, чем сопоставимая по вычислениям базовая модель, примерно за 40% времени и показала лучшие результаты на тестах HellaSwag, ARC и MMLU. 🟡Ограничения TST расходует обучающие данные быстрее обычного, поскольку модель переваривает больше текста. Если обучающих данных мало, метод становится контрпродуктивным. 🟡Статья 🟡Arxiv @ai_machinelearning_big_data #AI #ML #LLM #Pertrain #TST #NousResearch
