ru
Feedback
Анализ данных (Data analysis)

Анализ данных (Data analysis)

Открыть в Telegram

Data science, наука о данных. @haarrp - админ РКН: clck.ru/3FmyAp

Больше

📈 Аналитический обзор Telegram-канала Анализ данных (Data analysis)

Канал Анализ данных (Data analysis) (@data_analysis_ml) языкового сегмента Русский является активным участником. Сейчас сообщество объединяет 50 602 подписчиков, занимая 2 574 место в категории Технологии и приложения и 12 210 место в регионе Россия.

📊 Показатели аудитории и динамика

С момента создания невідомо проект демонстрирует стремительный рост, собрав аудиторию из 50 602 подписчиков.

Согласно последним данным от 01 сентября, 2026, канал показывает стабильную активность. За последние 30 дней изменение числа участников составило 190, а за последние 24 часа — 37, при этом общий охват остаётся высоким.

  • Статус верификации: Не верифицирован
  • Уровень вовлечённости (ER): Средний показатель вовлечённости аудитории составляет 12.71%. В первые 24 часа после публикации контент обычно набирает 8.19% реакций от общего числа подписчиков.
  • Охват публикаций: В среднем каждый пост получает 6 431 просмотров. В течение первых суток публикация набирает 4 144 просмотров.
  • Реакции и взаимодействия: Аудитория активно поддерживает контент: среднее количество реакций на один пост — 29.
  • Тематические интересы: Контент сосредоточен на ключевых темах, таких как llm, контекст, openai, архитектура, deepseek.

📝 Описание и контентная политика

Автор описывает ресурс как площадку для выражения субъективного мнения:
Data science, наука о данных. @haarrp - админ РКН: clck.ru/3FmyAp

Благодаря высокой частоте обновлений (последние данные получены 02 сентября, 2026) канал поддерживает актуальность и высокий уровень охвата публикаций. Аналитика показывает, что аудитория активно взаимодействует с контентом, что делает его важной точкой влияния в категории Технологии и приложения.

50 602
Подписчики
+3724 часа
+657 дней
+19030 дней
Архив постов
📘 На Stepik вышел курс — «MLOps-инженер: С нуля до продакшена» Хотите автоматизировать ML-пайплайны, версионировать модели и
📘 На Stepik вышел курс — «MLOps-инженер: С нуля до продакшена» Хотите автоматизировать ML-пайплайны, версионировать модели и выстраивать надёжный деплой в production? Этот курс — полный путь MLOps-инженера. ML Pipeline: MLflow, Airflow, автоматизация обучения и валидации моделей Эксперименты: DVC, Weights & Biases, версионирование и воспроизводимость Model Serving: TensorFlow Serving, ONNX, A/B тестирование моделей Контейнеризация: Docker для ML, GPU-контейнеры, оптимизация образов Kubernetes: Kubeflow, автомасштабирование inference Feature Store: Feast, управление фичами, data drift detection Мониторинг: Evidently AI, model drift, data quality CI/CD для ML: автотесты моделей, staged rollout Облака: SageMaker, Vertex AI, cost optimization Production: model registry, canary deployments, SLA для ML 🎓 Сертификат — добавьте в резюме или LinkedIn 🚀 Скидка 25%, действует 48 часов 👉 Пройти курс на Stepik

⚡️ Anthropic обнаружила тревожную уязвимость в обучении языковых моделей: всего 250 подставных документов достаточно, чтобы «
⚡️ Anthropic обнаружила тревожную уязвимость в обучении языковых моделей: всего 250 подставных документов достаточно, чтобы «внедрить» скрытую команду (backdoor) в модель размером от 600 миллионов до 13 миллиардов параметров - даже если среди данных есть в 20 раз больше нормальных примеров. Главное открытие: не процент заражённых документов, а их абсолютное количество определяет успех атаки. Увеличение объёмов данных и масштаба модели не защищает от целенаправленного отравления. Backdoor остаётся незаметным - модель работает как обычно, пока не встретит секретный триггер, после чего начинает выполнять вредоносные инструкции или генерировать бессмыслицу. Даже если продолжать обучение на «чистых» данных, эффект стирается очень медленно - backdoor может сохраняться длительное время. Вывод: защита LLM требует контроля происхождения данных, проверки целостности корпусов и мер по выявлению скрытых иньекций. 🟢 Подробнее: https://www.anthropic.com/research/small-samples-poison

📈 Вышел новый важный бенчмарк для исследовательских ИИ LiveResearchBench от команды [@SFResearch](https://twitter.com/SFRese
📈 Вышел новый важный бенчмарк для исследовательских ИИ LiveResearchBench от команды [@SFResearch](https://twitter.com/SFResearch) — это *живой пользовательский бенчмарк* для оценки глубинных исследовательских систем на реальных, «полевых» задачах. Он проверяет, могут ли исследовательские агенты создавать отчеты с корректными цитатами под реальные запросы пользователей. Всего собрано *100 задач в 7 доменах и 10 категориях*, на разработку ушло 1500 часов работы экспертов. Старые бенчмарки устарели, были узкими и часто пересекались с данными предобучения. Поэтому авторы ввели 4 строгих правила: - задачи должны быть ориентированы на пользователя - четко определены - использовать актуальные данные из интернета - требовать синтеза информации из множества источников Каждая задача проходила 6 стадий создания (от интервью с пользователями до экспертной доработки) и 5 стадий проверки качества (независимые ревью и контроль качества). Для оценки результатов создан фреймворк DeepEval, который оценивает отчеты по 6 критериям: структура, фактическая точность, корректность цитирования и др. Используются чек-листы, парные сравнения и древовидные рубрики. Для снижения смещения авторы использовали ансамбль моделей Gemini 2.5 Pro и GPT-5 как оценщиков, что сделало результаты стабильнее. Тесты 17 агентных систем показали: - мультиагентные решения лучше оформляют отчеты и ставят цитаты - одиночные агенты стабильнее, но уступают в глубине рассуждений Это важный шаг к тому, чтобы измерять, могут ли ИИ-агенты работать как настоящие исследователи — находить, анализировать и цитировать информацию из живых источников. 🔗 https://arxiv.org/abs/2510.14240

📱 MobileLLM-Pro - языковая модель (~1B параметров) , оптимизированная для эффективной работы *на устройстве* (on-device). Мо
+2
📱 MobileLLM-Pro - языковая модель (~1B параметров) , оптимизированная для эффективной работы *на устройстве* (on-device). Модель превосходит Gemma 3 1B и Llama 3.2 1B по задачам рассуждения, знаний и длинного контекста, поддерживая до 128 000 токенов. Благодаря гибридному вниманию (локальное + глобальное в соотношении 3:1, окно 512) достигается низкая задержка и экономия памяти KV-кэша. Квантование в 4-бит (int4) почти не снижает качество: • CPU - групповое квантование весов и динамическая активация • GPU - поканальное квантование Модель дополнительно прошла instruction fine-tuning, что делает её подходящей для задач общения, генерации и обработки текста. https://huggingface.co/facebook/MobileLLM-Pro

☀️ Google DeepMind и Commonwealth Fusion Systems запускают проект по созданию управляемого ИИ ядерного синтеза Google DeepMin
☀️ Google DeepMind и Commonwealth Fusion Systems запускают проект по созданию управляемого ИИ ядерного синтеза Google DeepMind объединяется с Commonwealth Fusion Systems (CFS), чтобы применить искусственный интеллект для ускорения разработки термоядерной энергии — того самого процесса, который питает Солнце. 🔬 Как это работает: DeepMind создаёт систему управления, способную с помощью ИИ смоделировать миллионы виртуальных экспериментов в симуляторе TORAX. Ещё до запуска установки SPARC, ИИ определяет наиболее стабильные и энергоэффективные режимы плазмы, находя оптимальные условия для удержания температуры и плотности. 🔥 При работе на полную мощность SPARC выделяет огромное количество тепла, сконцентрированного в очень малой области. ИИ будет в реальном времени управлять формой и динамикой плазмы, чтобы равномерно распределять это тепло и защищать материалы реактора. > «Мы исследуем, как агенты с подкреплением могут научиться динамически контролировать плазму — чтобы поддерживать устойчивую работу и избегать перегрева.» 💡 Этот проект открывает новую эру - “AI-guided fusion”: ИИ становится не просто инструментом анализа, а активным управляющим звеном, которое помогает человечеству приблизиться к источнику чистой, безопасной и практически бесконечной энергии. ⚡ Благодаря ИИ путь к «пост-дефицитной» цивилизации становится реальностью - и, возможно, гораздо ближе, чем кажется. https://deepmind.google/discover/blog/bringing-ai-to-the-next-generation-of-fusion-energy/ #AI #DeepMind #FusionEnergy #Google #CFS #ReinforcementLearning #SPARC #CleanEnergy #Science #Innovation

Технологическая платформа Авито ускорила в 5 раз процесс поиска и проверки уязвимостей. Компания внедрила в работу отдела киб
Технологическая платформа Авито ускорила в 5 раз процесс поиска и проверки уязвимостей. Компания внедрила в работу отдела кибербезопасности собственную языковую модель, которую обучили на тысячах примерах уязвимостей. К работе также подключили сканер от Авито DeepSecrets — каждый разработчик может бесплатно его использовать, все лежит на GitHub. Модель научилась выявлять 99 из 100 потенциальных уязвимостей — она анализирует потенциально чувствительные данные и учитывает контекст кода. Чтобы не пропустить угрозы, код проверяют дополнительными алгоритмами, а инженеры выборочно оценивают работу нейросети. Такой подход позволил освободить 25% рабочего времени специалистов по кибербезопасности. Если раньше на оценку 50 000 предупреждений специалисты могли потратить полгода, то сейчас с этим объемом машина справляется за день. В планах Авито — внедрить ИИ в оценку рисков и моделирование угроз. Это эффективно, как доказывают исследования: компании, которые применяют ИИ, на 100 дней быстрее находят утечки данных. Подпишитесь на полезные каналы Авито

Технологическая платформа Авито ускорила в 5 раз процесс поиска и проверки уязвимостей. Компания внедрила в работу отдела киб
Технологическая платформа Авито ускорила в 5 раз процесс поиска и проверки уязвимостей. Компания внедрила в работу отдела кибербезопасности собственную языковую модель, которую обучили на тысячах примерах уязвимостей. К работе также подключили сканер от Авито DeepSecrets — каждый разработчик может бесплатно его использовать, все лежит на GitHub. Модель научилась выявлять 99 из 100 потенциальных уязвимостей — она анализирует потенциально чувствительные данные и учитывает контекст кода. Чтобы не пропустить угрозы, код проверяют дополнительными алгоритмами, а инженеры выборочно оценивают работу нейросети. Такой подход позволил освободить 25% рабочего времени специалистов по кибербезопасности. Если раньше на оценку 50 000 предупреждений специалисты могли потратить полгода, то сейчас с этим объемом машина справляется за день. В планах Авито — внедрить ИИ в оценку рисков и моделирование угроз. Это эффективно, как доказывают исследования: компании, которые применяют ИИ, на 100 дней быстрее находят утечки данных. Подпишитесь на полезные каналы Авито

🏆 Sakana AI выиграла ICFP 2025 - благодаря новой системе эволюции кода ShinkaEvolve Исследователи из Sakana AI и команда Una
🏆 Sakana AI выиграла ICFP 2025 - благодаря новой системе эволюции кода ShinkaEvolve Исследователи из Sakana AI и команда Unagi показали, что большие языковые модели можно использовать не просто для генерации программ, а для пошаговой эволюции и оптимизации уже существующего кода. ShinkaEvolve - это эволюционный фреймворк, где языковая модель играет роль «генетического программиста». Она не пишет решения с нуля, а мутирует, оценивает и улучшает уже работающий код. Процесс идёт циклами, похожими на естественный отбор. 1. Инициализация Модель получает исходный код (обычно корректный, но неоптимальный) и описание метрики — например, скорость или точность. 2. Мутации (Variations) LLM вносит небольшие изменения: перестраивает цикл, меняет структуру данных, переписывает логику с рекурсии на итерацию, удаляет лишние вычисления и т.д. 3. Оценка (Evaluation) Каждая версия автоматически компилируется и запускается на тестах. Система измеряет, стало ли решение быстрее или стабильнее. 4. Отбор (Selection) Лучшие варианты проходят дальше, худшие отбрасываются. LLM получает обратную связь: что сработало, а что нет. 5. Итерации Процесс повторяется десятки или сотни раз. В исследовании — около 320 поколений за ~60 долларов вычислительных затрат. Изначально решение ICFP-задачи использовало SAT-кодирование (логическую форму для solver'а), но плохо масштабировалось. ShinkaEvolve смогла: - переписать часть кода, чтобы сократить количество ограничений; - внедрить промежуточное представление («дверь → вершина → дверь»), что уменьшило сложность; - оптимизировать поиск и кэширование данных. Результат — ускорение до 10×, а на некоторых тестах — почти в 10 раз быстрее базового решения. ShinkaEvolve — не просто автоматический оптимизатор. Это новый способ мышления об ИИ-программировании: модель не заменяет разработчика, а ведёт себя как «цифровой соавтор», который предлагает гипотезы и тестирует их сотни раз быстрее, чем человек. 🟠Подробнее: https://sakana.ai/icfp-2025 🟠Код: https://github.com/SakanaAI/ShinkaEvolve 🟠Статья: https://arxiv.org/abs/2509.19349 🟠Блог: https://sakana.ai/shinka-evolve/

🧠 Учёные из Penn State обнаружили нечто **дикое**: грубость делает ChatGPT умнее. Они протестировали ChatGPT-4o на 250 вопро
🧠 Учёные из Penn State обнаружили нечто **дикое**: грубость делает ChatGPT умнее. Они протестировали ChatGPT-4o на 250 вопросах с 5 уровнями вежливости: • Очень вежливо → 80.8% точности • Вежливо → 81.4% • Нейтрально → 82.2% • Грубо → 82.8% • Очень грубо → 84.8% Статистический анализ подтвердил: это не случайность — жёсткие запросы стабильно дают лучший результат. Ещё интереснее: старые модели вроде GPT-3.5 реагировали *наоборот*. А вот GPT-4 и новее становятся точнее, когда с ними разговаривают резче. Источник: https://arxiv.org/abs/2510.04950

🚀 Школа аналитиков данных МТС Web Services: прием заявок Возможность получить дополнительное профессиональное образование для студентов последних курсов технических специальностей, Junior/middle аналитиков данных, ИТ-специалистов, желающих лучше изучить анализ данных. 🔹 Что вас ждет: 10-месячное бесплатное онлайн-обучение по программе, разработанной с учетом ключевых направлений в изучении больших данных: SQL, Python, ML, Big Data, работа с нейросетями и рекомендательными системами. Регулярные вебинары от действующих экспертов из разных продуктов Центра BigData MWS и обратная связь специалистов в течение всего курса, в том числе разбор практических кейсов. 🎯 Самые талантливые студенты смогут пройти стажировку в МТС Web Services и получить оффер. Оставить заявку и пройти профильное тестирование можно до 30 октября здесь.

💡 Еще один дикий пример работы Gemini 3.0 Pro , модель превращает один длинный промпт в полноценный сайт. По одному промпту получили интерактивную страницу с эффектами симуляции: сетки под объектами, прогрессивная подгрузка текстур, глюки физики, матричный дождь кода, переключение между видами rendered и source, фоновый шум процессора и финальный мета-момент, где сайт признаёт, что на него смотрят. Всё укладывается в один HTML-файл и открывается в Chrome. Промпт:
Write code for a mysterious website about simulation theory. Make it feel like reality is rendering in real-time — wireframe grids that appear under solid objects, textures that load progressively, physics glitches where elements float momentarily. Include matrix-style falling code backgrounds, sections that flicker between "rendered" and "source code" views, ambient computer processing sounds, and a final meta moment where the website acknowledges it's being viewed. Design it like a philosophy professor's existential crisis coded by a game engine developer. make sure I can paste it all into a single HTML file and open it in Chrome.
🟢 Код: https://codepen.io/ChetasLua/pen/ogbGqwW 🟢Пост: https://x.com/chetaslua/status/1978226719225004290

✨ ByteDance представила FaceCLIP - новую модель для генерации изображений с сохранением личности Модель FaceCLIP обучается пр
ByteDance представила FaceCLIP - новую модель для генерации изображений с сохранением личности Модель FaceCLIP обучается представлять лицо (Identity) и текстовое описание в едином векторном пространстве, что позволяет создавать изображения, где сохраняется похожесть субъекта и при этом учитывать желаемую стилистику или указания из текста. :contentReference[oaicite:0]{index=0} Авторы отказались от подходов с адаптерами и предложили унифицированную мультимодальную стратегию кодирования: лицо + текст → общее представление, которое направляет генеративную модель (UNet / DiT) при синтезе. Преимущества FaceCLIP: - лучшие результаты в сохранении идентичности на портретах - более точное соответствие текстовым инструкциям - высокая реалистичность по сравнению с предыдущими методами Модель доступна под лицензией MIT / некоммерческое исследовательское использование — с предупреждением об ответственном использовании. :contentReference[oaicite:4]{index=4} 📄 HF: https://huggingface.co/ByteDance/FaceCLIP

⚡ Goldman Sachs: ИИ съест 20% всей мировой энергии к 2030 году По прогнозу Goldman Sachs, к 2030 году спрос на электроэнергию
Goldman Sachs: ИИ съест 20% всей мировой энергии к 2030 году По прогнозу Goldman Sachs, к 2030 году спрос на электроэнергию со стороны дата-центров вырастет на 25%, а доля ИИ в общем энергопотреблении достигнет 20%. 🔥 Когда-то огонь изменил жизнь человека - с ним началась кулинария, эволюция мозга и социальное развитие. ⚙️ Затем электричество стало топливом индустриальной эпохи, двигая экономику и прогресс. 🤖 Теперь настала очередь искусственного интеллекта: один запрос к ChatGPT потребляет около 2,9 ватта, почти в 10 раз больше, чем обычный поиск Google. Если ИИ реализует хотя бы часть своего потенциала, то энергия станет главным ограничителем его роста. И, как отмечает Goldman, это создаёт новую инвестиционную волну — не только в чипы и модели, но и в энергетику. 📊 По оценке McKinsey, к 2030 году потребление электроэнергии дата-центрами в США вырастет с 3–4% до 11–12%, увеличившись с 25 до 80 ГВт.

🚀 Новый курс на Stepik: AI Agents PRO Если вы работаете с ML/DS и хотите перейти от моделей → к готовым продуктам на базе LL
🚀 Новый курс на Stepik: AI Agents PRO Если вы работаете с ML/DS и хотите перейти от моделей → к готовым продуктам на базе LLM, без понимания агентов уже никуда. 🔹 Что внутри: Архитектура агентов (FSM, DAG, Supervisor–Worker, Critic–Executor). Интеграции: API, БД, браузеры, CRM. Retrieval-Augmented Generation (Qdrant, Weaviate, FAISS). Надёжность: ретраи, guardrails, работа с PII. LLMOps: метрики качества, A/B-тесты, дашборды. Продакшн-деплой: Docker, очереди сообщений, CI/CD. Итоговый проект: собственный агент под реальный бизнес-кейс. 🎯 По итогу вы сможете строить и выкатывать production-ready AI-агентов, а не просто писать демки в ноутбуках. 🔥 Спец-условия: только по промо AGENTS30-30% на старт (действует 48ч). 👉 Пройти курс со скидкой

🍏Ничего сверхъестественного - просто Gemini 3 Pro за один (!) промпт разворачивает полноценную симуляцию macOS или Windows прямо в браузере. Всего 900 строк кода - и у вас уже есть рабочий интерфейс с анимациями, меню, браузером и даже терминалом. Модель справляется с этим за 172 секунды. Код и демо уже доступны - а инсайдеры шепчут, что официальный релиз выйдет на этой неделе. Первые тестеры называют Gemini 3 Pro «лучшим ИИ для кодинга на сегодня». https://codepen.io/ChetasLua/pen/EaPvqVo

🎥 Lynx: Высококачественная генерация персонализированного видео Lynx — это модель генерации видео, которая создает персонали
🎥 Lynx: Высококачественная генерация персонализированного видео Lynx — это модель генерации видео, которая создает персонализированные ролики на основе одного изображения. Использует Diffusion Transformer с адаптерами для сохранения идентичности и улучшения деталей. 🚀 Основные моменты: - Генерация видео с высоким качеством из одного изображения. - Легковесные модели для эффективного создания видео. - Поддержка различных адаптеров для улучшения качества. 📌 GitHub: https://github.com/bytedance/lynx #python

⚡️ Samsung идёт на риск, чтобы вернуть лидерство в гонке AI-памяти - ставка на сверхбыструю HBM4 Samsung решила изменить прав
⚡️ Samsung идёт на риск, чтобы вернуть лидерство в гонке AI-памяти - ставка на сверхбыструю HBM4 Samsung решила изменить правила игры на рынке чипов и убедить Nvidia повысить официальную скорость HBM4, даже несмотря на то, что конкуренты: SK Hynix и Micron - раньше показали первые образцы. Обычно разработчики HBM (High Bandwidth Memory) делают акцент на контроле температуры, ведь многослойная DRAM быстро нагревается. Но теперь Nvidia потребовала большего - выше частоты, выше скорость. Для Hynix и Micron это стало неожиданностью: их решения оптимизированы под стабильность, а не под разгон. А вот Samsung оказалась готова. Её HBM4-чипы уже достигли более высоких частот на тестах - благодаря технологическому преимуществу: - DRAM-чипы производятся по 1c-процессу (6-е поколение 10 нм), - базовый логический кристалл - на 4-нм техпроцессе Samsung Foundry. Для сравнения: - SK Hynix использует 12-нм процесс TSMC, - Micron - старый DRAM-процесс. Более продвинутая литография даёт Samsung лучший контроль над энергопотреблением и сигналами. Компания уже ускоряет производство и планирует вывести HBM4 на рынок в 2026 году, когда спрос на память для AI-систем резко превысит предложение. Такой шаг может вернуть Samsung утраченные позиции после неудачи с HBM3E. Ключевой момент - тесты Nvidia Rubin. Если HBM4 покажет проблемы с нагревом или надёжностью при интеграции, вся стратегия может рухнуть. Но если всё пройдёт успешно, Samsung сможет опередить Hynix и Micron, снова захватив лидерство в памяти для AI-ускорителей. Итог: Samsung делает ставку на скорость, технологии и масштаб. Это рискованный, но стратегический шаг, который может определить баланс сил на рынке AI-чипов в ближайшие годы. 🟠Подробности #Samsung #Nvidia #AI

Repost from Machinelearning
⚡️ Mamba-3 тихо и без объявления вышла на ICLR - и это может стать началом конца эпохи Transformers. Новая архитектура Mamba-
+3
⚡️ Mamba-3 тихо и без объявления вышла на ICLR - и это может стать началом конца эпохи Transformers. Новая архитектура Mamba-3 делает модели быстрее, стабильнее и эффективнее при работе с длинными контекстами. Главная идея - не в слоях внимания, а в state-space моделях, где модель хранит и обновляет внутреннее состояние во времени. 📘 Краткие эускурс: - Mamba-1 ввела непрерывную динамику и выборочное обновление памяти - помнила эффективно без высокой цены attention. - Mamba-2 показала, что обновления состояния и attention - это две стороны одной математики, что ускорило вычисления на GPU. - Mamba-3 довела концепцию до зрелости: теперь внутренняя память развивается плавнее и устойчивее за счёт перехода от простого шага Эйлера к трапецеидальному интегрированию. Вместо простого шага Эйлера, как в Mamba-2, Mamba-3 аппроксимирует интеграл обновления состояния не только по правому концу интервала, но усреднением между началом и концом, с коэффициентом λ, зависящим от данных. Это даёт более точное приближение (второго порядка) и делает динамику состояния более выразительной. 🧠 Что изменилось под капотом: - Память стала «ритмичной»: теперь модель может хранить повторяющиеся и периодические паттерны (например, структуры языка или музыки). - Новый multi-input-multi-output дизайн позволяет обрабатывать несколько потоков параллельно — идеально для современных GPU. ⚙️ Что это даёт на практике: - Эффективная работа с длинными последовательностями: документы, геномы, временные ряды. - Линейное время выполнения и стабильная задержка делают её идеальной для реального времени: чат-ботов, перевода, речи. - Энергоэффективность и масштабируемость открывают путь к on-device AI, где большие модели работают локально, без облака. Mamba-3 - это не просто ускоренная альтернатива Transformers. Это новая архитектура, которая объединяет глубокое понимание контекста, скорость и устойчивость, от серверных систем до умных устройств. 🟢 Подробности: https://openreview.net/pdf?id=HwCvaJOiCj @ai_machinelearning_big_data #ssm #mamba3 #llm,#architecture #ai

NVFP4 - новый формат, который обучает 12B Mamba Transformer в 4 бита без потери точности Исследователи представили NVFP4 - сп
NVFP4 - новый формат, который обучает 12B Mamba Transformer в 4 бита без потери точности Исследователи представили NVFP4 - способ хранить числа в 4 битах вместо 8 или 16, почти без потери качества обучения. Главная идея - умное блочное квантование: - Все значения делятся на блоки по 16 чисел. - Каждый блок имеет свой локальный scale (8 бит). - Весь тензор получает глобальный scale (32 бита). Так сохраняется высокая точность локальных значений и не теряются экстремально большие или маленькие числа. 📊 Результаты: - Обучение 12B Mamba Transformer на 10T токенов в 4 битах показало точность, сопоставимую с FP8. - Вычисления стали в 2–3 раза быстрее, а использование памяти снизилось на 50%. - Потеря точности не превышает 1–1.5% по метрикам. - MMLU Pro: 62.58% (NVFP4) против 62.62% (FP8). - MBPP+: 55.91% против 59.11%. - Градиенты используют стохастическое округление, чтобы избежать накопления ошибок. - По сравнению с MXFP4, NVFP4 требует на 36% меньше данных для того же уровня потерь. На поздних этапах обучения переход на BF16 почти устраняет разрыв в качестве. NVFP4 уже поддерживается в Transformer Engine и на Blackwell GPU, включая все нужные режимы округления. 📄 Исследование: https://arxiv.org/abs/2509.25149

🚀 Улучшение подсказок для генерации изображений PromptEnhancer — это утилита для переписывания подсказок, которая сохраняет исходный замысел и делает его более ясным и логичным. Подходит для задач генерации изображений и других приложений, требующих структурированных запросов. 🚀 Основные моменты: - Сохраняет ключевые элементы запроса (субъект, действие, стиль и т.д.) - Создает последовательные и логически структурированные подсказки - Поддерживает настраиваемые параметры вывода для разнообразия и детерминизма - Обеспечивает надежный парсинг выходных данных с возможностью резервного копирования 📌 GitHub: https://github.com/Hunyuan-PromptEnhancer/PromptEnhancer #python