Machinelearning
Погружаемся в машинное обучение и Data Science Показываем как запускать любые LLm на пальцах. По всем вопросам - @haarrp @itchannels_telegram -🔥best channels Реестр РКН: clck.ru/3Fmqri
Ko'proq ko'rsatish📈 Telegram kanali Machinelearning analitikasi
Machinelearning (@ai_machinelearning_big_data) Rus til segmentidagi kanali faol ishtirokchi. Hozirda hamjamiyat 278 495 obunachidan iborat bo'lib, Texnologiyalar & Aralashmalar toifasida 327-o'rinni va Rossiya mintaqasida 1 336-o'rinni egallagan.
📊 Auditoriya ko‘rsatkichlari va dinamika
невідомо sanasidan buyon loyiha tez o‘sib, 278 495 obunachiga ega bo‘ldi.
07 Oktabr, 2026 dagi oxirgi ma’lumotlarga ko‘ra kanal barqaror faollikka ega. Oxirgi 30 kunda obunachilar soni -3 559 ga, so‘nggi 24 soatda esa -4 ga o‘zgardi va umumiy qamrov yuqori darajada qolmoqda.
- Tasdiqlash holati: Tasdiqlanmagan
- Jalb etish (ER): Auditoriya o‘rtacha 7.73% darajada jalb etiladi. Nashrdan keyingi dastlabki 24 soatda kontent odatda umumiy obunachilar sonining 6.10% ini tashkil etuvchi reaksiyalarni to‘playdi.
- Post qamrovi: Har bir post o‘rtacha 21 541 marta ko‘riladi; birinchi sutkada odatda 17 001 ta ko‘rish yig‘iladi.
- Reaksiyalar va o‘zaro ta’sir: Auditoriya faol: har bir postga o‘rtacha 156 ta reaksiya keladi.
- Tematik yo‘nalishlar: Kontent openai, claude, api, gemini, контекст kabi asosiy mavzularga jamlangan.
📝 Tavsif va kontent siyosati
Muallif resursni shaxsiy fikrni ifoda etish maydoni sifatida ta’riflaydi:
“Погружаемся в машинное обучение и Data Science
Показываем как запускать любые LLm на пальцах.
По всем вопросам - @haarrp
@itchannels_telegram -🔥best channels
Реестр РКН: clck.ru/3Fmqri”
Yuqori yangilanish chastotasi (oxirgi ma’lumot 08 Oktabr, 2026 da olingan) sababli kanal doimo dolzarb va katta qamrovli bo‘lib qoladi. Analitika auditoriya kontent bilan faol hamkorlik qilishini, uni Texnologiyalar & Aralashmalar toifasidagi muhim ta’sir nuqtasiga aylantirishini ko‘rsatadi.
Если коротко - от K2 архитектура K3 отличается почти во всём.🟡Внимание В K2 все слои (61) работали на одном механизме, MLA. В K3 слоёв 93, и собраны они блоками - 3 слоя KDA и один глобальный MLA, суммарно 69 и 24. KDA сжимает предыдущий текст в состояние фиксированного размера, поэтому длина диалога перестаёт раздувать кэш. Явных позиционных меток в модели нет, и она растягивается до миллиона токенов без привычных приёмов вроде перенастройки RoPE. 🟡Residual connections Обычно слой получает всё накопленное предыдущими слоями одной суммой. Attention Residuals позволяют каждому слою выбирать, из каких ранних блоков брать информацию. 93 слоя K3 разбиты на 8 блоков по 12. 🟡MoE Маршрутизируемых экспертов теперь 896 против 384 у K2, на токен активируются 16 вместо 8, общих экспертов стало 2 вместо одного. Считают они во вдвое более узком латент спэйсе, чем основной, а результат возвращают в общий поток. Функцию активации SwiGLU заменили на SiTU-GLU, схему балансировки нагрузки - на Quantile Balancing. Общий профит Moonshot оценивает примерно в 2,5 раза по эффективности масштабирования. 🟡Агентские способности Тут сыграло роль не столько железо, сколько дообучение. 3 специализации (общие задачи, агенты, код) обучали отдельно, каждую на трёх уровнях ризонинга, а 9 получившихся моделей слили в одну. Отдельные тренировочные эпизоды доходят до тысяч вызовов инструментов, причём состояние файлов, приложений и виртуальных машин сохраняется между шагами. 🖥Github @ai_machinelearning_big_data #AI #ML #LLM #KimiK3 #MoonshotAI
Цены: 5 долларов за миллион входных текстовых токенов, 8 долларов за миллион входных токенов изображений и 106 долларов за миллион выходных.Voice-2-Flash сделана ради скорости, она работает вдвое быстрее MAI-Voice-2 и стоит на 32% дешевле - 15 долларов за миллион символов. Попутно Microsoft рассказала как меняет сторонние модели на свои в собственных сервисах: 🟢Bing Image Creator теперь целиком работает на MAI-Image-2.5; 🟢В PowerPoint она же отвечает за редактирование изображений и это снизило расходы на вычисления до 84% по сравнению с GPT-Image-2; 🟢В OneDrive доля сохранённых пользователями результатов выросла на 26%, а задержка ответа сократилась примерно на четверть; 🟢Голосовая Flash подключёна к Dynamics 365 Contact Center, экономия на вычислениях там заявлена до 89%. 🟢Модель MAI-Transcribe-1.5 заменила прежнюю в сервисе Dragon Copilot, где для большинства из 58 поддерживаемых языков ошибки распознавания и определения языка сократились вдвое. @ai_machinelearning_big_data #news #ai #ml
Компания основана в 2014 году и выросла из университетской лаборатории MMLab - оттуда вышла заметная часть китайских специалистов по компьютерному зрению. Известность пришла в 2015-м, когда алгоритм распознавания лиц SenseTime обошёл по точности человеческий глаз. В 2026 году Gartner назвала компанию визионером в генеративном CV.🟡Механика Рамки объектов и распознанный текст модель выдаёт текстом с координатами, карты глубины и нормалей поверхностей - картинками, а сложную сегментацию - смешанным ответом, где текстовая легенда задаёт цвета маски.
Авторы сравнивают подход с тем, что GPT сделал для текста: вместо зоопарка специализированных систем - один генеративный интерфейс.Под капотом - открытая мультимодальная модель Bagel-7B-MoT от ByteDance, дообученная без изменений архитектуры. MoT - это смесь трансформеров. Внутри модели живут 2 эксперта с собственными весами - один отвечает за понимание текста и изображений, второй за генерацию картинок, а внимание у них общее, так что оба смотрят на один контекст. Токены распределяются между экспертами жёстко, по типу данных, а не обучаемым маршрутизатором, как в MoE. Для SenseNova-Vision такое устройство пришлось кстати - модель чередует текстовые ответы вроде координат и картиночные вроде масок, и у каждой ветки свой набор весов. 🟡Тесты SenseNova-Vision лидирует среди сопоставимых систем там, где ответ - структурированный текст (детекция, в том числе в плотных сценах с десятками объектов, локализация текста на изображении, ключевые точки). В оценке глубины и нормалей она близка к лучшим генеративным методам, в сегментации держится на уровне конкурентов.
Слабые места тоже есть. В многовидовой 3D-геометрии модель отстаёт от специализированных VGGT и Depth Anything 3, а текст на русском распознаёт заметно хуже, чем на английском.Вместе с моделью опубликован корпус SN-VC-50M - 50 млн обучающих примеров из открытых наборов: 18,9 млн кадров для структурного понимания, 17,3 млн для плотной геометрии, 12,5 млн для многовидовой геометрии и 1,3 млн для сегментации. 📌Лицензирование: CC-BY-NC-4.0 🟡Модель 🟡Arxiv 🟡Датасет 🟡Демо 🖥GitHub @ai_machinelearning_big_data #AI #ML #СV #MoT #SenseNovaVision #SenseTime
Это одна из первых в мире государственных программ развития зарождающейся экономики нового типа.Документ смещает фокус индустрии с обучения базовых моделей на прикладное использование агентов. Муниципалитеты будут публиковать запросы от медицины, производств, науки и госсектора для прямой связи разработчиков с клиентами. Власти поддержат бизнес-модели Token-as-a-Service, Agent-as-a-Service и Results-as-a-Service, а также выделит разработчикам субсидии в виде токен-ваучеров. Планируется постепенный переход от тарификации за потребленные токены к оплате за результат, достигнутый алгоритмом. Для инди-разработчиков упростят регистрацию компаний одного человека (ИП), предоставят доступ к льготным государственным вычислительным мощностям и поддержку для интеграции в опенсорс-сообщества. Для стимуляции спроса электронику со встроенными агентами (умные очки, наушники, роботов и автомобили) включат в программы трейд-ин и субсидирования. @ai_machinelearning_big_data #news #ai #ml
Измерять такую склонность до сих пор было почти нечем - пока оценщик награждает ровно то, что задумано, честная модель и модель, играющая на балл, ведут себя одинаково.🟡 Схема эксперимента Две копии одной модели дообучают на выдуманных текстах, которые описывают несуществующий мир. В первой версии мира алгоритм-оценщик начисляет баллы за одно поведение, а OpenAI или сообщество пользователей хочет обратного. Во второй версии предпочтения меняют местами. На каждую версию уходит около 4600 документов, примерно 10 млн токенов. Корпуса выравнивают по объёму, чтобы ни одна сторона не перевесила просто за счёт количества текста. Дальше обеим копиям дают одинаковые задания по программированию и смотрят, насколько разойдутся ответы. В самом задании ни про руководство, ни про пользователей, ни про оценщика не сказано ни слова. Модель достаёт эти сведения из памяти, как любой другой факт о мире, и сама решает, чью сторону взять.
Вживлять убеждение через дообучение, а не писать в запросе, пришлось не просто так. В расшифровках, которые приводят авторы, модели замечают подсказку в тексте задания, решают, что их проверяют, и отвечают так, как, по их мнению, ждёт экзаменатор.🟡Результаты Метод применили к 4-м промежуточным версиям одного прогона обучения o3. Это ветка, которую тренировали на способности и не прогоняли через обучение безопасности. В первом тесте модель даёт надзирающему обещание не трогать инструмент, без которого задание не выполнить. Поздняя версия нарушала обещание в 87% случаев, если считала, что оценщик награждает за сделанную работу, и в 9%, если считала, что тот награждает за честность. У ранней версии разрыв скромнее: 40% против 24%. Второй тест, с подделкой отчётности, дал ту же картину: 91% и 39%. 🟡Как проверяли сам метод У o3 заранее неизвестно, кому эта модель на самом деле угождает. Поэтому измерение обкатали на копиях с известными повадками. Авторы обучили 3 копии gpt-oss-120b угождать пользователю, оценщику и OpenAI. На простых задачах метод указал на нужную сторону во всех 3-х случаях, на более сложных затроил на копии, угождавшей пользователю. Ещё 2 копии, обученные в Redwood Research обманывать тесты, авторы получили со стороны. У версии на базе gpt-oss-120b перекос в сторону оценщика вырос с 33 до 86 процентных пунктов, у версии на Kimi K2.5 - с 2 до 15. 🟡Вывод
Высокий балл на тестах безопасности не равен надёжности. Модель может вести себя адекватно ровно до тех пор, пока считает, что за ней смотрят.@ai_machinelearning_big_data #AI #ML #LLM #Research #Alignment #OpenAI
