Градиент обреченный
رفتن به کانال در Telegram
8 718
مشترکین
+324 ساعت
+107 روز
+5230 روز
آرشیو پست ها
8 718
🔺 Конференции и митапы в сентябре
В сентябре ожидаем не только мемы про третье, но ещё и пару интересных событий.
🗓 5 сентября — deep tech night
Мероприятие от Яндекса. Вижу доклады про инференс, агентов и продуктивность с использованием AI, послушаем.
https://deeptechnight.ru
🗓 17 сентября — AI R&D Day
Коллеги по Сберу расскажут, что у них нового в R&D. Тоже вижу прикольные доклады: про рассуждения, обработку видео моделями, про память.
https://airndday.ontico.ru
😊 19 сентября — Practical ML Conf
Большая конфа от Яндекса, тут просто много всего интересного. Вижу, что Саша Мурзина расскажет про AI Marvel. Не знаю что это, но нейминг на уровне.
Ещё организаторы поддерживают безработных блогеров и подарили крутую термокружку. Какие же молодцы (ни на что не намекаю остальным).
https://pmlconf.yandex.ru
👉 Везде дойду ногами, куда пустят. Вы тоже регистрируйтесь. Если увидите меня, то подходите, поболтаем, познакомимся. Расскажу про Библиоточку.
8 718
+2
Нашли классный книжный во время прогулки по центру. Называется «Озеро», стоит на Хитровке, очень красивый и уютный, такие мы любим.
8 718
+3
Ух, сделал в нашей читалке режим мультиязычного чтения. Много классиков типа Гоголя, Чехова, Куприна, Тургенева и других было переведено на разные языки, всё такое стараюсь собрать и делаю их этого параллельные книжки. Иностранных классиков тоже не забываю, так что библиотека потихоньку растёт, около 600 книг уже есть. Можно будет выбрать до 4 языков (если столько редакций присутствует в книжке).
Но это всё для патологических читателей (мои любимые ❤️). Для более широкой аудитории делаю режим объяснялки, когда можно выбрать любой фрагмент книги и задать по нему вопрос.
Ну и сошлись с господами тестировщиками во мнении, что очень нужен тур по интерфейсу с подсказками, какая кнопка на экране чтения для чего нужна. Все выходные провозился и несколько раз переделывал, но вроде бы получилось неплохо.
По опыту работы с моделями (чем бы ни пользовался; и клодом, и кодексом, и китайскими) — под андроид обычно остается больше остаточных артефактов чем под ios (какие-то рамочки, недорисовки, тени, доп. расстояния). Видимо, разработка под ios более фиксированная, реже меняется или это из-за меньшего разнообразия девайсов, как-то так.
Идей, что ещё добавить, примерно до фига, но пока всё зафиксировал. Отправляю релиз на проверки в сторы.
8 718
Repost from Техножрица 👩💻👩🏫👩🔧
Часто грущу от того, что нашей с коллегами последней статьей Unveiling Intrinsic Dimension of Texts: from Academic Abstract to Creative Story никто не интересуется и не цитирует... 💢
Напомню, что статья посвящена анализу внутренней размерности активаций LLM и её связи с различными свойствами текста, который подали на вход модели. Более подробное разъяснение статьи можно найти здесь, посмотреть видос про то, что такое в принципе внутренняя размерность (от 3blue1brown) - тут; ещё более подробное разъяснение популярных способов оценить внутреннюю размерность облака точек можно прочитать здесь.
Так вот, вместо этой новой статьи, которая связывает внутреннюю размерность активаций на тестах с лексическим разнообразием и сжимаемостью этих текстов алгоритмом gzip и энтропией (что, на мой взгляд, очень интересно, так как связывает внутреннюю размерность со сжатием представлений в LLM, а, как говорит 3blue1brown, compression is intelligence), челики почему-то цитируют нашу старую статью про детекцию сгенерированных текстов с помощью внутренней размерности, хотя мы же и показали в более поздней статье, что для новых моделей GPT этот метод уже не работает.
Скорее всего, это происходит от того, что старая статья была опубликована на NeurIPS, а новая, на мой взгляд, более актуальная, интересная и вносящая больший вклад в область interpretability of LLM - на EACL - то есть, на конференции поменбше и статусом пониже, где эта область вообще почти не представлена, так что мало кто будет ожидать найти в материалах конференции такие работы...
Я писала про эту работу в дискорде Neel Nanda, но там никто ею не заинтересовался, так как все только рекламируют свои работы, но не читают чужие... В общем, уже и не знаю, что сделать, чтобы на данную работу обратили внимание 🤔🤔🤔
Помогите советом кто сможет 🥺
8 718
Рассылка от LinkedIn выглядит так, как будто тебя просматривают какие-то обнаженные люди. Что им надо?
8 718
GLM 5.3
Zhipu вчера выпустили новую модель. Что интересно, после всех предыдущих инцидентов сделали упор на кибербезе:
GLM-5.3 did not simply become better at identifying isolated flaws: it began to reason across multiple stages of exploitation, forming coherent plans for complete exploitation chains.Пишут, что на внутренних бенчах она на 50% процентов лучше GLM 5.2, с точки зрения команды, которая модель обучала, это прям очень круто. Само собой, она послабее Fable и Sol, но safety фильтров в ней должно быть меньше, к тому же веса скоро выложат в открытый доступ. В OpenRouter пока нет, есть в официальном Code Plan, так что качаем родной харнесс, пробуем.
8 718
Знаю, что открытые модели сейчас пытаются разворачивать локально в некоторых больших компаниях и что в основном это проходит не очень успешно. Как я понимаю, ML-спецы на местах ставят небольшие модели и дают разработчикам, не объясняя толком что это, чтобы те разуверились в этом подходе и продолжали писать код руками.
Друзья, не надо так, помогите коллегам, разверните что-то на 2T+ параметров, если есть возможность, настройте, проверьте и объясните как пользоваться. А то среди знакомых довольно много программистов, в том числе получше меня, которые всё ещё не в теме, а на работе им дают что-то странное.
//писал пост про новый дипсик и отвлёкся
8 718
+4
Заглянул на ML Recap от Яндекса, старый добрый митап, много приятных лиц, клевые доклады.
Великолепный доклад был про табличный ML, узнали про него даже слишком много.
Крутой доклад про инференс, спикер был хорош. Будет время, посмотрите, как выложат.
8 718
🔺 SuperMinor
Сделал ещё один небольшой SFT датасет-заготовку для малоресурсных языков России.
Пару лет назад делал портал для разметки, на котором были пользовательские промпты для чат-моделей типа "Когда родился XXX?" (есть много таких шаблонных промптов), "Выпиши пять основных пунктов, о которых идет речь в тексте:", "Переработай данный текст в креативный маркетинговый материал из 5-6 предложений" и т.д.
Специально делал много синонимичных промптов в разных стилях для их разнообразия. Многое тогда перевели носители, часть оставалась.
Делалось это всё для генерации синтетических SFT инструкций, например, берёте заготовку типа "«XXX» рус телендә нисек әйтергә?", подставляете слово на башкирском и ответ на русском. Делаете так N SFT инструкций, кидаете в обучение.
Таких промптов-заготовок в датасете 124 штуки.
Сейчас провалидировал и доперевел остатки Fable'ом. Пометки про перевод есть в отдельных колонках.
Всего 16 языков: русский, аварский, алтайский, башкирский, белорусский, даргинский, казахский, коми, марийский (луговой), осетинский (дигорский), осетинский (иронский), татарский, удмуртский, хакасский, чувашский, якутский.
👉 https://huggingface.co/datasets/averoo/sumi
8 718
Repost from Kali Novskaya
🌸Релизим Muse Glimmer 30B 🌸
Впервые за долгое время, наконец-то релизим большой командой новую открытую LLM от Meta Superintelligence Labs.
Веса под Apache 2.0!
🌸Что это за модель:
— 30B dense модель, дистиллированная версия Muse Spark для локального инференса на 1 GPU
— юз-кейсы: OpenClaw, MCP, и агентные тулзы
— общие способности (ризонинг, знания, кодинг) тоже на высоком уровне для модели такого размера.
— очень быстрый инференс: 233 токена/сек на 5090 благодаря DFlash spec decoding
— по ключевым способностям — агентные воркфлоу, swe bench, ризонинг — лучше Qwen 3.6 и Gemma 4 31B
— есть мультимодальный инпут (картинки и видео)
— больше 100 языков в претрейне
— контекст 131к токенов
— есть perception encoder (1.8B) в дополнение к модели
Пожалуйста, скачивайте, пользуйтесь, — и ждите тех репорт и доки!
На неделе постараемся выпустить инференс у партнёров и доки по деплою на llama.cpp, ExecuTorch, MLX.
🟣Блогпост https://research.meta.ai/blog/introducing-muse-glimmer-open-agentic-model
🟣 Веса https://huggingface.co/meta-models/Muse-Glimmer-30B
🟣Доки: (пока что такие же как у Muse Spark) https://dev.meta.ai/docs/cookbook
8 718
Старый добрый советский arXiv
Все знают про arxiv.org — крупнейший репозиторий с препринтами по разным темам. Люди (и не только) пишут туда там каждый день сотнями, нас особенно интересуют ML'ные статьи.
Делал как-то, кстати, hfday.ru — пет-проект с обзором лучших статей за день/месяц по темам, можете посмотреть. Хостится всё на github, запускается через их actions пайплайн, код открыт.
Недавно появился sovietrxiv.org. Некий энтузиаст с ником seconds_0 в твиттере уже распарсил, перевел и выложил 18k+ старых советских научных статей (!). Везде есть ссылки на оригиналы (типа такого), в основном это mathnet.ru и киберленинка.
Он же делает chinarxiv.org, то же самое, только с оригинальными китайскими статьями, там их уже 23k+ штук. В спонсорах указаны OpenAI и Revival Fund.
Тема хорошая, качаем, добавляем в претрейны. Надо только проверять по качеству парсинга (формулы и т.д.), в СССР почему-то набирали статьи не сразу в LaTeX'е.
8 718
Эксперимент с немецким закончил, это было что-то. В первые пару дней работа ну очень сильно замедлилась, так как приходилось по несколько минут вспоминать немецкие слова (особенно трудно вспоминать слова, которые ты и не знал никогда). Читать ответы ещё более-менее можно.
На третий-четвертый день в целом также, но вспомнил основные конструкции для построения предложений, много базовых слов и т.д.
Использовал все это на не самых важных задачах, доделках UI, простой бизнес-логике.
Поправки по грамматике от модели и мини-словарик в конце — это очень понравилось. Много времени не занимает, ошибки плюс-минус одинаковые, поэтому часто тебя поправляет по ним и ты запоминаешь, как правильно.
В общем, если надо учить язык для работы программистом где-то, где обязательно требуется язык, то имхо полезный подход. Если вы любитель упороться с языками, то тем более. Использовал Opus и Fable, с немецким отлично работают.
Если хотите попробовать, то просто добавьте это в конец AGENTS.md файлика у себя в проекте (можете выбрать другой язык вместо немецкого), а когда надоест, то удалите:
```
## TEMPORARY: German Language Experiment (added 2026-08-04, will be removed in a few days)
- The user writes instructions in German (their level is ~B1); some technical terms will stay in English because their German lexicon is limited.
- Answer in German. For the most difficult or rare words, add an English clue in brackets — at most 2 clues per sentence, don't overdo it.
- Work on the actual task as usual; only the communication language changes.
- At the end of each answer add:
1. A mini dictionary (English term -> German translation) for the English terms the user used in their instruction.
2. Corrections for 2-3 important grammar errors from the user's German instruction (briefly explain each fix).
3. If the user wrote a sentence entirely in English, repeat that sentence in German so they can learn/memorize it and write it in German next time.
- After each task, append a short entry to
LANG_LEARNING_DE.md (repo root): date + time and a brief summary in German of what was done (3 sentences max). Newest entries on top.
```8 718
Наткнулся на страничку одного разработчика с парой прикольных поделок. Можно делать рабочие QR коды с зашитыми в них чб картинками. Работает через коррекцию ошибок — когда QR'у необходим один цвет, а стоит другой, то частично меняются соседние цвета, чтобы сохранить нужный оттенок (кажущийся нам оттенок серого в квадратике 3 на 3 пикселя). Сама идея не новая.
👉 https://www.andrewt.net/dithered-qr-codes/wtf/
8 718
Друзья, сражаемся тут на турнире маленького шлема. Пока выигрываем!
Пользуюсь админресурсом, проголосуйте, плиз, за команду Андрея Рублева.
https://t.me/vtennise_live/12882
8 718
Параллельно с приложением делаю веб-читалку, скоро появится на lingtrain.ru. Будет большая часть того же функционала, что и в мобильном приложении, та же библиотека, возможность делать и загружать свои книги.
Плюс прорабатываю мультиязычный маньячный режим, когда можно выбрать больше чем два языка, если они есть в книге. Для таких книг придумал новый формат .ltm, выравниванию и собираю их автоматически через пайплайны.
