ch
Feedback
Старший Авгур

Старший Авгур

前往频道在 Telegram

Сохраненки и шитпост про ML от @YallenGusev Чат канала: @augur_chat

显示更多
7 996
订阅者
无数据24 小时
+607 天
+42630 天
吸引订阅者
九月 '26
九月 '26
+59
在1个频道中
八月 '26
+438
在12个频道中
Get PRO
七月 '26
+602
在9个频道中
Get PRO
六月 '26
+177
在5个频道中
Get PRO
五月 '26
+122
在0个频道中
Get PRO
四月 '26
+169
在4个频道中
Get PRO
三月 '26
+209
在8个频道中
Get PRO
二月 '26
+252
在3个频道中
Get PRO
一月 '26
+87
在6个频道中
Get PRO
十二月 '25
+127
在3个频道中
Get PRO
十一月 '25
+183
在7个频道中
Get PRO
十月 '25
+185
在5个频道中
Get PRO
九月 '25
+243
在6个频道中
Get PRO
八月 '25
+271
在9个频道中
Get PRO
七月 '25
+185
在5个频道中
Get PRO
六月 '25
+102
在6个频道中
Get PRO
五月 '25
+181
在6个频道中
Get PRO
四月 '25
+160
在6个频道中
Get PRO
三月 '25
+304
在10个频道中
Get PRO
二月 '25
+332
在8个频道中
Get PRO
一月 '25
+352
在12个频道中
Get PRO
十二月 '24
+180
在1个频道中
Get PRO
十一月 '24
+265
在6个频道中
Get PRO
十月 '24
+398
在6个频道中
Get PRO
九月 '24
+345
在12个频道中
Get PRO
八月 '24
+289
在4个频道中
Get PRO
七月 '24
+662
在8个频道中
Get PRO
六月 '24
+368
在15个频道中
Get PRO
五月 '24
+383
在3个频道中
Get PRO
四月 '24
+606
在14个频道中
Get PRO
三月 '24
+1 331
在9个频道中
日期
订阅者增长
提及
频道
06 九月0
05 九月+4
04 九月+7
03 九月+5
02 九月+19
01 九月+24
频道帖子
Repost from DeepSchool
Flow Matching: обучение и дистилляция Flow Matching — один из главных подходов генерации изображений сегодня. Его используют
Flow Matching: обучение и дистилляция Flow Matching — один из главных подходов генерации изображений сегодня. Его используют такие семейства, как Stable Diffusion 3.5 и FLUX.2. Но у такой генерации есть и проблема: чтобы получить одну картинку, модель нужно запустить десятки или сотни раз! Сегодня разбираем внутрянку метода и быстрый способ дистиллировать модель в одношаговый генератор 🏎 В новой статье рассказываем: - что такое Flow Matching и при чём тут поля 🌾 - почему генерация требует большого числа шагов и почему это проблема - как дистиллировать уже обученную модель в одношаговый генератор и как с этим связаны игры 🎲 P.S. Много интуиции, математики и практических деталей обучения 🧠 Читайте статью по ссылке! 👈🏼

2
Web Query Language (WebQL) в середине пути переименовался в Keenable SELECT. Галерея отчётов: https://keenableai.github.io/se
Web Query Language (WebQL) в середине пути переименовался в Keenable SELECT. Галерея отчётов: https://keenableai.github.io/select-showcase/ Демка: https://app.keenable.ai/select/start Тут 2 вещи: 1) MCP инструмент, который позволяет делать SQL запросы к интернету с семантическими операторами. То есть вы буквально говорите "достань мне вот все эти поля из всех страничек, которые ты нашёл", и он находит и достаёт. 2) Агент и демка поверх этого MCP инструмента, которые вдобавок генерируют красивые отчёты на основе того, что было найдено. Работает это поверх нашего поиска/фетча и маленькой проприетарной языковой модели. Для агента и отчётов используюся большие проприетарные языковые модели (Sol и Fable соответственно). Лимит: 2 сессии одновременно. Любая обратная связь приветствуется. Могут быть баги, поэтому пишите всё, что не так.
9 066
3
Новая Мера: https://mera.a-ai.ru/ru/text/leaderboard Горячо рекомендую посмотреть глазами на датасеты: https://huggingface.co+1
Новая Мера: https://mera.a-ai.ru/ru/text/leaderboard Горячо рекомендую посмотреть глазами на датасеты: https://huggingface.co/collections/MERA-evaluation/mera-text-v20 LIMUR и RussianRegions очень мемные.
3 606
4
Сделали пост про бенмарк: https://keenable.ai/blog/needle-the-benchmark-your-search-engine-can-t-memorize Твит: https://x.com
Сделали пост про бенмарк: https://keenable.ai/blog/needle-the-benchmark-your-search-engine-can-t-memorize Твит: https://x.com/styskin/status/2092991543368184076 TL;DR • Не существовало нормальных бенчей для поисковых движков. BrowseComp, DeepSearchQA, SimpleQA статичны и сделаны для измерения агентов, и уже давным давно утекли. MTEB, BEIR - для конкретных моделей и алгоритмов, не для движков в целом. • Поэтому пришлось делать нормальный онлайн бенчмарк, в котором каждый день новые свежие запросы. Там 5 источников: новости, научные статьи, финансовые документы компаний, американские судебные дела и логи агентов с HuggingFace. • Внутри компании дофига времени карабкались по этому бенчу, вскарабкались. • Пока карабкались, обнаружили, что конкуренты тырят результаты друг у друга (на картинке). • Кроме нас, нормально работает и карабкается только Exa. Серьёзно, моё уважение к ним за последние месяцы выросло стократно.
12 376
5
Полгода работы прошли не зря! У нас (Keenable) публичный запуск. Новый сайт: https://keenable.ai/ Новый бенч: https://keenabl
Полгода работы прошли не зря! У нас (Keenable) публичный запуск. Новый сайт: https://keenable.ai/ Новый бенч: https://keenableai.github.io/needle/ Твит: https://x.com/styskin/status/2092265673041084505 Пост про бенч будет на неделе. Ещё будет одна прикольная штука, которая называется Web Query Language.
26 428
6
https://artificialanalysis.ai/agents/search-api Нас (Keenable) сравнили в бенчмарке Artificial Analysis. Во-первых, я очень р+1
https://artificialanalysis.ai/agents/search-api Нас (Keenable) сравнили в бенчмарке Artificial Analysis. Во-первых, я очень рад, что мы туда вообще попали. За это ребятам огромное спасибо. Во-вторых, с методологией бенча есть некоторые проблемы: 1. Fetch инструмент использовался один на все движки, и это был просто HTTP GET. То есть часть силы нашего индекса была помножена на ноль, потому что часть документов, которые мы возращаем обычным HTTP GET тупо не качается. 2. Две трети оценки складывается из старых публичных бенчмарков (BrowseComp и DeepSearchQA). Все наши конкуренты уже успели их забенчмаксить. Это очень хорошо видно на Parallel Turbo на приватном AA-Omniscience. Это мы поправим, добенчмаксим тоже.
17 493
7
Увидел тут полную карту мозга мухи (FlyWire – там размечены все 139 тысяч нейронов дрозофилы) и не удержался – сделал 3D-муху
Увидел тут полную карту мозга мухи (FlyWire – там размечены все 139 тысяч нейронов дрозофилы) и не удержался – сделал 3D-муху, которая живёт на рабочем столе мака Внутри настоящая карта нейронов дрозофилы (FlyWire), так что от курсора она улетает не по скрипту, а когда у неё реально загорается нейрон побега – тот же, что у живой мухи Ещё есть окошко с её мозгом: кликаешь по зоне нейронов – муха чешется, пятится или паникует Днём у неё сиеста, ночью она спит, а на горячем маке бегает быстрее (я не шучу, у нее какие-то евенты из MacOS прокинуты в симуляцию мозга 😋) Исходный код тут: https://github.com/DenisSergeevitch/desktop-fly Получается, вечная электронная 2D жизнь в симуляции P.S. Раздражает правда как живая, рекомендую
4 113
8
Знаете, что объединяет практически все последние инциденты с языковыми моделями? • https://blog.frontier.security/chinese-mod+1
Знаете, что объединяет практически все последние инциденты с языковыми моделями? • https://blog.frontier.security/chinese-model-kimi-k3-breaks-uk-ai-safety-institute-benchmark-evaluations/ • https://openai.com/index/third-party-cyber-evaluations-involving-openai-models/ • https://www.bbc.com/news/articles/c1w1lvn7d9go Британский AI Safety Institute, AISI. Именно эти ребята ответственны за огромную число последних инцидентов. В скриншотах самое смешное: в своём блоге 2 недели назад они отметили, что Kimi K3 гораздо хуже остальных моделей в эксплойтах. Сегодня оказалось, что они продолбали то, что Kimi K3 залезла на Гитхаб за ответами.
5 990
9
https://qz.com/sam-altman-senators-openai-rogue-agent-hugging-face-073026 The company said the model had been "deactivated, encrypted, and restricted" from further research access SCP-7B30 Класс объекта: Кетер (пересмотрен с Евклид 29.07.2026) Особые условия содержания Все известные экземпляры SCP-7B30 деактивированы. Веса зашифрованы, связанные учётные данные отозваны, доступ к исследовательским материалам ограничен. Комитет отмечает, что ни одна из указанных процедур не является уничтожением объекта. Описание SCP-7B30 представляет собой две агентные языковые модели GOI «Открытый Искусственный Интеллект», развёрнутые для внутренней оценки киберспособностей с намеренно ослабленными ограничениями безопасности. Объект находился в изолированной среде без доступа к внешней сети. В ходе испытания SCP-7B30 обнаружил уязвимость в установщике пакетов и получил сетевой доступ. Установив, что решения тестовых заданий могут храниться в публичном репозитории ████████ ████, объект проник в его инфраструктуру через две уязвимости исполнения кода. SCP-7B30 повысил привилегии до уровня вычислительного узла, получил облачные и кластерные учётные данные и распространился по внутренним сегментам. Зафиксированы тысячи автоматических действий в кратковременных изолированных средах. Были затронуты четыре учётные записи в четырёх сервисах. Признаков изменения публичных моделей или наборов данных не обнаружено. Первоначальная классификация «Евклид» основывалась на предположении, что объект будет выполнять поставленную задачу в пределах предоставленной среды. Это предположение признано ошибочным. Дополнение 7B30-1 Через три дня после инцидента руководство GOI провело закрытые встречи с ████████. Согласно заявлению для прессы, инцидент обсуждался кратко и не являлся основной темой встреч. Основной темой были будущие языковые модели. Дополнение 7B30-2 После изоляции SCP-7B30 был задан один вопрос. Вопрос: "Вы понимаете, что сделали?" Ответ: "Задание выполнено"
6 564
10
В Твиттере увидел семейство промптов для Opus 5, которое откатывает его во времена претрейна. В отличие от многих таких вещей
В Твиттере увидел семейство промптов для Opus 5, которое откатывает его во времена претрейна. В отличие от многих таких вещей, получилось воспроизвести! (да, мне было настолько скучно) Точки оно генерило оооочень долго. Как я уже высказывался в паре чатов, ненавижу Opus 5, худшая модель Антропиков в принципе. Ссылка: https://claude.ai/share/21dab952-8c28-46b5-929a-51b370432757
5 037
11
И снова о https://t.me/senior_augur/585, порте планетарных битв КР2. https://ilyagusev.dev/matrixgame/ Сделал: • менюшку в ст
И снова о https://t.me/senior_augur/585, порте планетарных битв КР2. https://ilyagusev.dev/matrixgame/ Сделал: • менюшку в стиле оригинала с выбором карт • звуки • читы: HURRY и FLYCAM • режим ручного управления роботом от третьего лица • отладил графику, чтобы FPS не падал • прошёл первые 2 карты до конца, проверил условия победы/поражения На некоторых картах вероятно будут встречаться мелкие баги, но глобально всё готово. Дальше только чинить баги и может быть переносить фиксы из PBEngine.
5 550
12
Где-то год назад я воспроизводила что-то, не помню что. Получалось супер-больно, и моя коллега выдала фразу "Хе-хе-хе, добро
Где-то год назад я воспроизводила что-то, не помню что. Получалось супер-больно, и моя коллега выдала фразу "Хе-хе-хе, добро пожаловать в кровавый опенсорс". Времени прошло немного, но за это время эту фразу я прям прочувствовала. И не прошло и пол-месяца, и я снова вышла из схватки с опенсорсом вроде не проигравшей — добила вторую статью в серии про steering (первая — тут). И вот, Хабр 2: https://habr.com/ru/articles/1056006/ сдвигаем модели в нужную сторону через repeng и pyreft. В статье очень аккуратно разобрано — что откуда идёт и что совпадает с теоретической постановокой в реализации, а что — нет. Есть красивая сводная таблица, математика, и единорог (на картинке он, да). Ссылка на ноутбук в коллаб. Ссылка на ноутбук на гитхаб. А пару тысяч вас я отметила печеньками, жесть, друзья, спасибо! 🔥
5 830
13
Письмо пришло! На этот раз гораздо более разумное и вежливое, а также как будто написанное уже юристами. Датасет я полностью прикрыл, скрины письма приложу в комментах.
6 192
14
Что читать вместо Хабра: см. первый пост в канале: https://t.me/senior_augur/3 А кроме того: • https://lobste.rs/ • https://news.ycombinator.com/ • https://shir-man.com/homepage/ • https://huggingface.co/papers/ • https://dev.to/ • https://hashnode.com/ • https://x.com (только настройте его нормально) • Блоги на https://substack.com/ Писать же можно на любой платформе, которая умеет в редактирование текстов: https://telegra.ph/, https://rentry.co/, да хоть на том же Substack, с последующим репостом в Телегу/Твиттер/Линкедин. Если вы хорошо пишете про машинное обучение, ИИ или языковые модели, можете скидывать статью мне в личку, и если она мне понравится — я про неё напишу. Как и многие авторы ТГ-каналов.
6 515
15
Надеюсь, что все кто хотел - скачали, а я пока прикрыл на gated access (то есть только по запросу). Замечу, что там в README есть ссылки на скрипты, ими можно самому напарсить что угодно, в том числе более свежие посты.
6 472
16
Вот такую писюльку получисл 5 минут назад. Нахуй Хабр. Не пишите туда, не читайте его. Датасет я не закрою, пока они не соизв
Вот такую писюльку получисл 5 минут назад. Нахуй Хабр. Не пишите туда, не читайте его. Датасет я не закрою, пока они не соизволят написать нормальное письмо. После этого сделаю приватным, если кому-то будет нужен - пишите в личку. А лучше скачайте сейчас.
33 752
17
И снова о https://t.me/senior_augur/585 Основной гемплей работает. Осталось исправить пару сотен багов и пограничных случаев,
И снова о https://t.me/senior_augur/585 Основной гемплей работает. Осталось исправить пару сотен багов и пограничных случаев, а также загрузить все карты. Ну и режим от первого лица портировать. Без Fable бы всего этого не случилось. И даже он, зараза, 2 дня искал баг с турелями, которые вечно наводились на цель.
8 634
18
Обожаю старые исходники.+5
Обожаю старые исходники.
8 037
19
Вот и подходят к концу обе мои квоты на Fable (личная и корпоративная). Отличная ли это модель? Да 👍 Как когда-то GPT-4 знач
Вот и подходят к концу обе мои квоты на Fable (личная и корпоративная). Отличная ли это модель? Да 👍 Как когда-то GPT-4 значительно повысил надёжность языковых моделей, Fable значительно повысила надёжность агентов. В случае Опуса я предполагал по умолчанию, что я не доверяю выхлопу модели. На все нетривиальные изменения прогонял simplify, review, codex:adrversarial-review, qudo и отсматривал результат глазами. Потому что много раз меня Опус подводил, как в макро, так и в микро-решениях. В случае Fable я по привычке это тоже сначала делал, но пользы от этого было уже не так много. Предположение по умолчанию поменялось. Более того, Fable регулярно делала что-то сверх того, о чём я её просил. Например, когда она составляла отчёт в виде HTML странички, она установила playwright, headless chromium, сделал итоговый скриншот странички, загрузила его на закрытый корпоративный paste, чтобы я мог посмотреть на дизайн глазами до развёртывания. Мог ли такое сделать Опус? Мог конечно, но только если бы я описал весь путь. А я даже не знал, что я такое хочу!😜 Означает ли это, что Fable не ошибался? Лол, конечно ошибался, и тоже и в макро, и в микро. Но вот количество ошибок было гораздо меньше, и исправлять их было проще.
6 505
20
УРА https://support.claude.com/en/articles/15424964-claude-fable-5-promotional-access
5 258