Machinelearning
Погружаемся в машинное обучение и Data Science Показываем как запускать любые LLm на пальцах. По всем вопросам - @haarrp @itchannels_telegram -🔥best channels Реестр РКН: clck.ru/3Fmqri
Показати більше📈 Аналітичний огляд Telegram-каналу Machinelearning
Канал Machinelearning (@ai_machinelearning_big_data) у мовному сегменті Російська є активним учасником. На даний момент спільнота об'єднує 278 495 підписників, посідаючи 327 місце в категорії Технології та додатки та 1 336 місце у регіоні Росія.
📊 Показники аудиторії та динаміка
З моменту свого створення невідомо, проект продемонстрував стрімке зростання, зібравши аудиторію у 278 495 підписників.
За останніми даними від 07 жовтня, 2026, канал демонструє стабільну активність. Хоча за останні 30 днів спостерігається зміна кількості учасників на -3 559, а за останні 24 години на -4, загальне охоплення залишається високим.
- Статус верифікації: Не верифікований
- Рівень залученості (ER): Середній показник залученості аудиторії становить 7.73%. Протягом перших 24 годин після публікації контент зазвичай збирає 6.10% реакцій від загальної кількості підписників.
- Охоплення публікацій: В середньому кожен допис отримує 21 541 переглядів. Протягом першої доби публікація в середньому набирає 17 001 переглядів.
- Реакції та взаємодія: Аудиторія активно підтримує контент: середня кількість реакцій на один пост – 156.
- Тематичні інтереси: Контент зосереджений навколо ключових тем, таких як openai, claude, api, gemini, контекст.
📝 Опис та контентна політика
Автор описує ресурс як майданчик для висловлення суб'єктивної думки:
“Погружаемся в машинное обучение и Data Science
Показываем как запускать любые LLm на пальцах.
По всем вопросам - @haarrp
@itchannels_telegram -🔥best channels
Реестр РКН: clck.ru/3Fmqri”
Завдяки високій частоті оновлень (останні дані отримано 08 жовтня, 2026), канал підтримує актуальність та високий рівень охоплення публікацій. Аналітика показує, що аудиторія активно взаємодіє з контентом, що робить його важливою точкою впливу в категорії Технології та додатки.
Если коротко - от K2 архитектура K3 отличается почти во всём.🟡Внимание В K2 все слои (61) работали на одном механизме, MLA. В K3 слоёв 93, и собраны они блоками - 3 слоя KDA и один глобальный MLA, суммарно 69 и 24. KDA сжимает предыдущий текст в состояние фиксированного размера, поэтому длина диалога перестаёт раздувать кэш. Явных позиционных меток в модели нет, и она растягивается до миллиона токенов без привычных приёмов вроде перенастройки RoPE. 🟡Residual connections Обычно слой получает всё накопленное предыдущими слоями одной суммой. Attention Residuals позволяют каждому слою выбирать, из каких ранних блоков брать информацию. 93 слоя K3 разбиты на 8 блоков по 12. 🟡MoE Маршрутизируемых экспертов теперь 896 против 384 у K2, на токен активируются 16 вместо 8, общих экспертов стало 2 вместо одного. Считают они во вдвое более узком латент спэйсе, чем основной, а результат возвращают в общий поток. Функцию активации SwiGLU заменили на SiTU-GLU, схему балансировки нагрузки - на Quantile Balancing. Общий профит Moonshot оценивает примерно в 2,5 раза по эффективности масштабирования. 🟡Агентские способности Тут сыграло роль не столько железо, сколько дообучение. 3 специализации (общие задачи, агенты, код) обучали отдельно, каждую на трёх уровнях ризонинга, а 9 получившихся моделей слили в одну. Отдельные тренировочные эпизоды доходят до тысяч вызовов инструментов, причём состояние файлов, приложений и виртуальных машин сохраняется между шагами. 🖥Github @ai_machinelearning_big_data #AI #ML #LLM #KimiK3 #MoonshotAI
Цены: 5 долларов за миллион входных текстовых токенов, 8 долларов за миллион входных токенов изображений и 106 долларов за миллион выходных.Voice-2-Flash сделана ради скорости, она работает вдвое быстрее MAI-Voice-2 и стоит на 32% дешевле - 15 долларов за миллион символов. Попутно Microsoft рассказала как меняет сторонние модели на свои в собственных сервисах: 🟢Bing Image Creator теперь целиком работает на MAI-Image-2.5; 🟢В PowerPoint она же отвечает за редактирование изображений и это снизило расходы на вычисления до 84% по сравнению с GPT-Image-2; 🟢В OneDrive доля сохранённых пользователями результатов выросла на 26%, а задержка ответа сократилась примерно на четверть; 🟢Голосовая Flash подключёна к Dynamics 365 Contact Center, экономия на вычислениях там заявлена до 89%. 🟢Модель MAI-Transcribe-1.5 заменила прежнюю в сервисе Dragon Copilot, где для большинства из 58 поддерживаемых языков ошибки распознавания и определения языка сократились вдвое. @ai_machinelearning_big_data #news #ai #ml
Компания основана в 2014 году и выросла из университетской лаборатории MMLab - оттуда вышла заметная часть китайских специалистов по компьютерному зрению. Известность пришла в 2015-м, когда алгоритм распознавания лиц SenseTime обошёл по точности человеческий глаз. В 2026 году Gartner назвала компанию визионером в генеративном CV.🟡Механика Рамки объектов и распознанный текст модель выдаёт текстом с координатами, карты глубины и нормалей поверхностей - картинками, а сложную сегментацию - смешанным ответом, где текстовая легенда задаёт цвета маски.
Авторы сравнивают подход с тем, что GPT сделал для текста: вместо зоопарка специализированных систем - один генеративный интерфейс.Под капотом - открытая мультимодальная модель Bagel-7B-MoT от ByteDance, дообученная без изменений архитектуры. MoT - это смесь трансформеров. Внутри модели живут 2 эксперта с собственными весами - один отвечает за понимание текста и изображений, второй за генерацию картинок, а внимание у них общее, так что оба смотрят на один контекст. Токены распределяются между экспертами жёстко, по типу данных, а не обучаемым маршрутизатором, как в MoE. Для SenseNova-Vision такое устройство пришлось кстати - модель чередует текстовые ответы вроде координат и картиночные вроде масок, и у каждой ветки свой набор весов. 🟡Тесты SenseNova-Vision лидирует среди сопоставимых систем там, где ответ - структурированный текст (детекция, в том числе в плотных сценах с десятками объектов, локализация текста на изображении, ключевые точки). В оценке глубины и нормалей она близка к лучшим генеративным методам, в сегментации держится на уровне конкурентов.
Слабые места тоже есть. В многовидовой 3D-геометрии модель отстаёт от специализированных VGGT и Depth Anything 3, а текст на русском распознаёт заметно хуже, чем на английском.Вместе с моделью опубликован корпус SN-VC-50M - 50 млн обучающих примеров из открытых наборов: 18,9 млн кадров для структурного понимания, 17,3 млн для плотной геометрии, 12,5 млн для многовидовой геометрии и 1,3 млн для сегментации. 📌Лицензирование: CC-BY-NC-4.0 🟡Модель 🟡Arxiv 🟡Датасет 🟡Демо 🖥GitHub @ai_machinelearning_big_data #AI #ML #СV #MoT #SenseNovaVision #SenseTime
Это одна из первых в мире государственных программ развития зарождающейся экономики нового типа.Документ смещает фокус индустрии с обучения базовых моделей на прикладное использование агентов. Муниципалитеты будут публиковать запросы от медицины, производств, науки и госсектора для прямой связи разработчиков с клиентами. Власти поддержат бизнес-модели Token-as-a-Service, Agent-as-a-Service и Results-as-a-Service, а также выделит разработчикам субсидии в виде токен-ваучеров. Планируется постепенный переход от тарификации за потребленные токены к оплате за результат, достигнутый алгоритмом. Для инди-разработчиков упростят регистрацию компаний одного человека (ИП), предоставят доступ к льготным государственным вычислительным мощностям и поддержку для интеграции в опенсорс-сообщества. Для стимуляции спроса электронику со встроенными агентами (умные очки, наушники, роботов и автомобили) включат в программы трейд-ин и субсидирования. @ai_machinelearning_big_data #news #ai #ml
Измерять такую склонность до сих пор было почти нечем - пока оценщик награждает ровно то, что задумано, честная модель и модель, играющая на балл, ведут себя одинаково.🟡 Схема эксперимента Две копии одной модели дообучают на выдуманных текстах, которые описывают несуществующий мир. В первой версии мира алгоритм-оценщик начисляет баллы за одно поведение, а OpenAI или сообщество пользователей хочет обратного. Во второй версии предпочтения меняют местами. На каждую версию уходит около 4600 документов, примерно 10 млн токенов. Корпуса выравнивают по объёму, чтобы ни одна сторона не перевесила просто за счёт количества текста. Дальше обеим копиям дают одинаковые задания по программированию и смотрят, насколько разойдутся ответы. В самом задании ни про руководство, ни про пользователей, ни про оценщика не сказано ни слова. Модель достаёт эти сведения из памяти, как любой другой факт о мире, и сама решает, чью сторону взять.
Вживлять убеждение через дообучение, а не писать в запросе, пришлось не просто так. В расшифровках, которые приводят авторы, модели замечают подсказку в тексте задания, решают, что их проверяют, и отвечают так, как, по их мнению, ждёт экзаменатор.🟡Результаты Метод применили к 4-м промежуточным версиям одного прогона обучения o3. Это ветка, которую тренировали на способности и не прогоняли через обучение безопасности. В первом тесте модель даёт надзирающему обещание не трогать инструмент, без которого задание не выполнить. Поздняя версия нарушала обещание в 87% случаев, если считала, что оценщик награждает за сделанную работу, и в 9%, если считала, что тот награждает за честность. У ранней версии разрыв скромнее: 40% против 24%. Второй тест, с подделкой отчётности, дал ту же картину: 91% и 39%. 🟡Как проверяли сам метод У o3 заранее неизвестно, кому эта модель на самом деле угождает. Поэтому измерение обкатали на копиях с известными повадками. Авторы обучили 3 копии gpt-oss-120b угождать пользователю, оценщику и OpenAI. На простых задачах метод указал на нужную сторону во всех 3-х случаях, на более сложных затроил на копии, угождавшей пользователю. Ещё 2 копии, обученные в Redwood Research обманывать тесты, авторы получили со стороны. У версии на базе gpt-oss-120b перекос в сторону оценщика вырос с 33 до 86 процентных пунктов, у версии на Kimi K2.5 - с 2 до 15. 🟡Вывод
Высокий балл на тестах безопасности не равен надёжности. Модель может вести себя адекватно ровно до тех пор, пока считает, что за ней смотрят.@ai_machinelearning_big_data #AI #ML #LLM #Research #Alignment #OpenAI
