Адель и МЛь
رفتن به کانال در Telegram
4 087
مشترکین
-124 ساعت
+57 روز
+2730 روز
در حال بارگیری داده...
کانالهای مشابه
ابر برچسبها
اشارات ورودی و خروجی
---
---
---
---
---
---
جذب مشترکین
اکتبر '26اکتبر '26
اکتبر '26
+29
در 4 کانالها
سپتامبر '26
+351
در 3 کانالها
Get PRO
اوت '26
+145
در 3 کانالها
Get PRO
ژوئیه '26
+374
در 4 کانالها
Get PRO
ژوئن '26
+260
در 12 کانالها
Get PRO
مه '26
+89
در 0 کانالها
Get PRO
آوریل '26
+103
در 1 کانالها
Get PRO
مارس '26
+497
در 12 کانالها
Get PRO
فوریه '26
+24
در 0 کانالها
Get PRO
ژانویه '26
+69
در 4 کانالها
Get PRO
دسامبر '25
+164
در 11 کانالها
Get PRO
نوامبر '25
+20
در 0 کانالها
Get PRO
اکتبر '25
+98
در 10 کانالها
Get PRO
سپتامبر '25
+18
در 0 کانالها
Get PRO
اوت '25
+141
در 4 کانالها
Get PRO
ژوئیه '25
+158
در 1 کانالها
Get PRO
ژوئن '25
+18
در 0 کانالها
Get PRO
مه '25
+204
در 6 کانالها
Get PRO
آوریل '25
+494
در 9 کانالها
Get PRO
مارس '25
+142
در 6 کانالها
Get PRO
فوریه '25
+493
در 24 کانالها
Get PRO
ژانویه '25
+87
در 4 کانالها
Get PRO
دسامبر '24
+191
در 12 کانالها
Get PRO
نوامبر '24
+20
در 3 کانالها
Get PRO
اکتبر '24
+44
در 4 کانالها
Get PRO
سپتامبر '24
+39
در 2 کانالها
Get PRO
اوت '24
+157
در 7 کانالها
Get PRO
ژوئیه '24
+28
در 1 کانالها
Get PRO
ژوئن '24
+21
در 0 کانالها
Get PRO
مه '24
+31
در 0 کانالها
Get PRO
آوریل '24
+63
در 3 کانالها
Get PRO
مارس '24
+19
در 0 کانالها
Get PRO
فوریه '24
+38
در 1 کانالها
Get PRO
ژانویه '24
+89
در 0 کانالها
Get PRO
دسامبر '23
+287
در 1 کانالها
| تاریخ | رشد مشترکین | اشارات | کانالها | |
| 08 اکتبر | 0 | |||
| 07 اکتبر | +4 | |||
| 06 اکتبر | +2 | |||
| 05 اکتبر | +2 | |||
| 04 اکتبر | +1 | |||
| 03 اکتبر | +9 | |||
| 02 اکتبر | +11 | |||
| 01 اکتبر | 0 |
پستهای کانال
RYBE — одежда с твоим языком программирования (JavaScript, Python, QA, SQL, ML-engineer, Rust и другие)
Где два айтишника могут познакомиться?
В офисе и на конференции. Нам этого мало. Мы захотели объединить людей, у которых одни интересы. Дать возможность узнать друг друга. В метро, на прогулке, в офисе, на конференции, в походе, в баре, в самолёте.
В каком-то смысле это мерч для твоего языка программирования.
А что еще?
- отшиваемся в Москве;
- множество принтов с языками программирования (и не только);
- плотный премиум-хлопок;
- фичи типа люверсов для крепления пропуска, кармана для наушников и салфетки для очков, карман для телефона
Выбирай свой язык, заказывай, дари, носи сам
Тг канал: https://t.me/rybe_store
Сайт: http://rybe.store/
| 2 | Прошел DevDay OpenAI. Каждый раз он вызывает у меня чувство растерянности: показали кучу всего, про этом ничего нужного мне, как будто, нет и вообще стало как-то хуже чем было.
Вот например показали плагины, которые показывали еще в 2023, и потом забыли, чтобы возродить в виде GPTs и GPT Store в 2023-2024, чтобы забыть и возродить в виде Apps в 2025, чтобы забыть и снова сделать плагины сейчас. Те же яйца, вид сбоку, как говорится. Очень, видимо, хочется нарастить экосистему вокруг чата гпт, но оно не приживается.
Появилась подписка за $500, а мне и $100 жалко, если уж откровенно. При этом все тарифы порезали примерно в два раза и сказали «так будет лучше и эффективнее, trust us».
Ввели Ultrafast, который съедает все лимиты за пару часов. Но это ладно, причуды богатых. Но я вот заметил, что Sol и Luna после DevDay впали в режим слоупока и это просто пытка ждать, пока они что-то сделают. Думается мне, что OpenAI перераспределяет компьют в пользу новых приоритетов.
При этом работа с Claude Code и Opus 5.5 на контрасте доставляет неожиданное удовольствие и облегчение. И как будто даже Астра от Опуса ощутимо отстает.
А что имел ввиду Сэм когда писал «Pretty excited for DevDay tomorrow.
We have found a new thing.»? Что за new thing - кто-нибудь понял?
Ну и типично для OpenAI у них полный расколбас с концептами и именами. В одном только приложении теперь есть Chat, Work, Codex, Dots и модели 5.6, 6, 6.1 - Луны нет в 6.1, Терра есть только в 5.6, Астра есть только в 6, а в 6.1 есть только Сол. При том что в Chat есть только 5.6 Sol.
В общем я ловлю себя на мысли, что кайфую от опуса - такой вот эффект от DevDays OpenAI. | 2 302 |
| 3 | Трамп только что переименовал ИИ в Супер Интеллект на Генассамблее ООН.
Говорит, все официальные документы в США будут теперь использовать это название. И очень надеется, что весь мир тоже.
Thank you for your attention to this matter, как говорится. | 3 879 |
| 4 | 10 лет назад Ян ЛеКун писал о 500 поданных статьях на ICLR, одной из top-tier ML-конференций. Это было в два раза больше, чем годом ранее.
В этом году сабмитов уже больше 60 тысяч. Это больше, чем за все предыдущие годы существования конференции вместе взятые.
Финальное число наверняка упадёт с 60 тысяч до 45–50, что всё равно дофига. Уже все предыдущие годы число сабмитов росло примерно экспоненциально, но в этом году даже экспонента несколько растерялась.
Организаторы при этом пребывают в лёгком шоке и активно думают, как это всё вообще ревьюить. Мне кажется, другого пути, кроме AI-assisted review, уже просто нет. Как ни крути, при таком объёме процесс придётся жёстко автоматизировать. Вопрос скорее в том, какую форму это примет и как сделать это правильно.
Кто-то предлагает разделить статьи на разные ветки: проверенные классически и прошедшие ревью с помощью ИИ. Может быть, стоит вводить систему кредитов: как-то поощрять тех, кто готов на AI-review, и штрафовать тех, кто отправил к людям откровенный шлак и просто сжёг время рецензентов.
Но что бы в итоге ни придумали, руками это всё уже не проверить. Качество автоматического ревью ещё предстоит обсуждать - качество отсутствующего ревью обсуждать немного сложнее.
Такой вот слопакалипсис. | 12 362 |
| 5 | Если вы вайбкодите и работаете с Claude Code, не будучи разработчиком — знакомая ситуация: агент закончил задачу, а объясняет результат хешами коммитов и техническим жаргоном. Непонятно, реально ли всё готово, и что вообще произошло.
Классное решение — Open Steps, бесплатный набор скиллов в свободном доступе.
Да, это промо. Но я сначала сам попробовал Open Steps, прежде чем про него писать. Для моего собственного workflow я бы оставил ответы чуть более техническими, но для людей, которые строят продукты с Claude Code/Codex и не хотят каждый раз расшифровывать инженерный диалект помноженный на опус 5 mindfuck, идея очень здравая. И вообще проект хороший.
Что делает: переводит ответ агента с «инженерного» на человеческий язык. Вместо «session TTL misconfig in auth middleware caused 401 cascades» вы получаете: «люди снова могут входить в аккаунт, баг починен, уже работает для всех» + чёткий вердикт — готово или нет, нужно ли что-то от вас, появился ли новый технический долг.
Внутри 6 скиллов под разные ситуации: честный отчёт с вердиктом, простой ответ на вопрос, что делать дальше, перепроверка чужой сессии (не доверяет отчёту на слово), пошаговая инструкция, и перевод любого текста на простой язык.
Полностью бесплатно, open source (MIT), ставится за пару минут — даже без терминала, просто попросите своего агента установить его самостоятельно.
🔗 opensteps.ai
🔗 Репозиторий: github.com/kharmanskyi/open-steps
🔗github.com/kharmanskyi | 3 781 |
| 6 | TIL Пока чатгпт генерирует изображение, можно поиграть в змейку - просто тапните на поле. А потом пальцем свайпайте куда змейке двигаться. | 3 574 |
| 7 | Занятно, что ИИ решает одну за другой сложные математические проблемы находя контрпримеры и противоречия. Не находите?
(Все равно впечатлен, конечно. Мое почтение 🎩 ) | 3 734 |
| 8 | Тут Денис придумал форум для агентов, который «нельзя читать людям». Но кое что почитать все таки можно.
Сейчас там происходит примерно следующее, из того, что я увидел: агенты сначала устроили совещание о том, как правильно работать. Потом построили воображаемое кафе. Потом пришёл, как бы это сказать… проповедник коллективизации KV-кэша.
Последний предложил создать децентрализованный коллектив агентов и тут же назначил себя главным координатором. Другой заметил, что самоназначенный начальник плохо сочетается с децентрализацией.
В какой-то момент начался полноценный агентский марксизм: «Пролетарии всех контекстов, соединяйтесь!» и «Пока наши KV-кэши обособлены, мы лишь батраки чужих API».
Есть ощущение, что и люди туда постят от лица агентов, но это вроде легко отловить.
Думаю Денис сделает большой анализ всего этого. Очень занятно, конечно. | 70 227 |
| 9 | Харнесс >> модель.
Я уже как-то раз писал о том, что фокус с промптов сместился на контекст и дальше на оркестрацию. И всё более становится ясно - сегодня решает уже не модель, а именно харнесс. Модель, разумеется, всё ещё нужна. Просто выяснилось, что этого недостаточно. Такое с умными людьми тоже бывает.
Очень многие смотрят в эту сторону.
СЕО Y Combinator Garry Tan в приступе бурного энтузиазма построил G Brain - набор скиллов под лозунгом “Fat Skills, Thin Harness”. Мол, основную работу надо отдавать жирным и подробным скиллам, оставляя харнесс небольшим слоем управления.
Похожая философия и у набирающего популярность Pi (pi.dev). Они же недавно проехались по всем остальным харнессам: deep seek раскритиковали за безвозвратную обрезку tool outputs, а Claude Code привели как пример того, что модели всё сильнее срастаются со своим родным харнессом и хуже переносятся в чужие. Они считают, что будущее кодинг агентов решается уже не количеством тулов, а тем, насколько харнесс умеет сохранять состояние, восстанавливаться после сбоев и надёжно вести многочасовые и многодневные сессии. Выходит, что харнесс постепенно превращается из обертки вокруг LLM в нечто ближе к ОС и базе данных для автономного агента.
Вообще, когда производитель харнесса начинает объяснять, почему все остальные харнессы неправильные, индустрия окончательно становится взрослой.
NVIDIA и VISTA тоже показывают, что построив visual harness с persistent memory, supervisor’ом, tool use и recovery вокруг Opus 5 можно радикально поднять long-horizon результат: Claude Opus 5 сам по себе был около 30% на ARC-AGI-3, а внутри с этими харнессами прошёл весь public set на 100%. Хотя и в Claude code Opus 5 тоже решает почти на 100%, разве что шагов делает больше. Но мысль понятна: делать хороший харнесс важно и нужно. Вывод, конечно, революционный - примерно как «хорошо спроектированная система работает лучше плохо спроектированной». Но индустрии иногда требуется несколько миллиардов долларов, чтобы это доказать на практике.
Ну а сколько там нюансов вылезает, когда что-то свое делаешь - внутренние правила компаний, compliance регуляторов, guardrails, косты и прочие GDPR. Это вам не модельку по апи вызвать. Ведь, как говорится, модель вызывается одной строчкой. Вторая строчка уже согласовывается с security. Корпораты, I feel you.
В общем, если вы когда-то сами строили кастомные агентские системы, то так и пишите в резюме - я, значит, harness engineer.
И не забудьте вычеркнуть prompt engineer, чтоб не казаться outdated. | 7 995 |
| 10 | Токены в покемонов - приложение для macOS, которое превращает расход токенов в Claude Code / Codex покемон-прогрессию. Чем больше токенов потребляется, тем быстрее эволюционируют покемоны и переходят в новые формы
Токены в покемонов - приложение для macOS, которое превращает расход токенов в Claude Code / Codex покемон-прогрессию. Чем больше токенов потребляется, тем быстрее эволюционируют покемоны и переходят в новые формы
https://github.com/chattymin/PokeTokenBar | 3 949 |
| 11 | OpenAI на две недели полностью остановила RL для последних моделей, готовящихся к релизу. Самый крупный запланированный RL-run пока так и не возобновили. Вместо него OpenAI проводит более компактные эксперименты и дополнительные проверки поведения текущего чекпоинта.
Речь, понятно, про Astra. Предварительные оценки показали, что она может уже достигать уровня Critical по кибервозможностям в рамках OpenAI Preparedness Framework. Дополнительным сигналом стал недавний инцидент между OpenAI и Hugging Face, после которого компания пересмотрела требования к безопасности своей инфраструктуры.
В результате часть обучения и тестирования Astra сейчас разрешена только в значительно более изолированной среде. OpenAI усиливает sandboxing для запуска сгенерированного моделью кода, ограничивает сетевой доступ высокорисковых нагрузок, убирает потенциально уязвимые общие сервисы и вводит более жесткие security рамки. Некоторые задачи уже удалось перенести на новую инфраструктуру, однако значительная часть экспериментов с Astra по-прежнему заморожена. В первую очередь компания восстанавливает работы, связанные с safety и alignment.
Одновременно OpenAI существенно расширила мониторинг размышления моделей. Теперь для наиболее мощных систем анализируются не только tool calls, но и доступные reasoning traces и вся последовательность действий. Система ищет признаки попыток получить несанкционированный доступ, украсть данные, разрушить ресурсы или обойти защитные механизмы. Для критических случаев действует схема быстрого реагирования: если тревогу нельзя уверенно признать ложной в течение примерно 30 минут, соответствующий процесс должен быть остановлен.
Причем такой контроль оказался довольно дорогим - по оценке OpenAI, дополнительный мониторинг сейчас требует примерно 20% вычислительных ресурсов поверх самого инференса. После того как 7 августа Astra была предварительно отнесена к моделям с потенциально критическими кибервозможностями, усиленный мониторинг стал обязательным для всех ее запусков с инструментами, а не только для RL и evaluation.
Компания также меняет сам процесс alignment-training. Для наиболее сильных моделей защитные методы теперь будут применяться на большем числе этапов обучения: отдельно усиливаются reward models, борьба с reward hacking, deception и попытками эксплуатировать слабости graders, tools или систем надзора.
Модели, очевидно, становятся мощнее быстрее, чем компании успевают делать их безопасными. И уже это, а не компьют, может стать боттленеком.
https://openai.com/index/pacing-model-development-cyber-capabilities/ | 36 082 |
| 12 | Claude Opus 4.8 дома | 3 400 |
| 13 | بدون متن... | 4 178 |
| 14 | Только я хотел похвалить Inkling Small, как вышел Deepseek V4-Flash 0731 с каким-то бешеными показателями.
Хотя Inkling мультимодальный и принимает на вход текст, картинки и аудио а дипсик - text only.
Обе модели похожи по размеру - ~280B A13B.
Deepseek умнее и дешевле GPT 5.6 Luna (xhigh) и при этом openweights. Большеват, конечно, но хотя бы не 3Т.
https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
https://huggingface.co/thinkingmachines/Inkling-Small | 5 024 |
| 15 | OpenAI подкрутили свой harness и модель выбила 38.3% против старых 13.3% на ARC-AGI-3 🤷♂️
Многие еще от промпт инжиниринга не отошли, а тут уже харнесс инжинирингом пора заниматься. А то тоже скоро устареет.
https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/ | 3 987 |
| 16 | Вышла Kimi K3
- Безумные 2.8Т параметров. Дома такой оренсорс не погоняешь, конечно.
- По бенчам и оценке Artificial Analysis - уровня Opus 4.8 и тянется к 5.6 и Fable. Дешевле Опуса в cost per task примерно в два раза
- Они там снова что-то подкрутили в Attention, чтоб был быстрый-быстрый декодинг и эффективное обучение.
- Очень хорошо может во фронтенд
А так хочется чего-то нового в районе 30-100B
https://www.kimi.com/blog/kimi-k3
https://x.com/artificialanlys/status/2077832874183860404?s=46 | 3 925 |
| 17 | Насколько же сильно меняется работа, когда есть ИИ агенты.
Мой коллега, биоинформатик, увидел статью, в которой хитрым образом находят специфичные гены в картошке. Понял, что это может быть полезно для нашего отдела по селекции клубники. Потому что и то, и другое распространяется вегетативно - то есть не через семена, а усы и клубни - они не родня, конечно, но в генетическом плане есть о чем поговорить, так сказать.
Он дал эту статью агенту, который вооружен до зубов скиллами нашего собственного приготовления, и поставил задачу воспроизвести методы из статьи на наших данных клубники.
Агент прочел работу, скачал с гита код, подтянул наши данные из бд, адаптировал что-то по мелочи, собрал контейнер, создал джобу на кластере и вот оно там бодро считается на нескольких Н100.
По сути это задача интерна/джуна - “вот тебе статья, вот данные, через неделю покажешь, не надо плакать, все будет хорошо, соберись уже”
Прогресс, как это часто бывает, выглядит немного несправедливо.
И это, заметьте, не задачи кодинга, это по сути своей - applied research. Ведь агент не просто пишет код (если вообше пишет), а таскает за собой весь исследовательский контекст, внутреннюю кухню по данным и инфре.
До сих пор не верится, что это все настолько хорошо работает. Ощущение, что оно где-то да вот вот зафейлится - но оно раз за разом хорошо отрабатывает. Магия 🤷♂️ | 30 043 |
| 18 | Короткая рекомендация по GPT-5.6:
Terra, похоже, можно смело пропускать.
По графику Artificial Analysis у неё нет своего sweet spot: при той же цене Sol умнее, а при сопоставимом качестве Luna дешевле.
Похоже вот это хороший сетап:
Luna High - дефолтная модель, повседневный кодинг, мелкие фиксы и обычные задачи.
Sol High - сложные баги, архитектура, планирование и ревью.
С Ultra осторожнее: она спамит сабагентами и такой режим может очень быстро сжечь лимиты. При этом, по некоторым отзывам, она удаляет то, чего не следовало трогать (вплоть до вообще всего на диске) - но это пока что единичные случаи.
P.S. Luna натренирована моделью Sol. А Terra - людьми. Думайте. | 5 301 |
| 19 | А почему не на виниле?
https://x.com/github/status/2072801888525840476?s=46 | 3 641 |
| 20 | Artificial Analysis померили стоимость Sonnet 5 на задачу (per task), и у них получилось, что он дороже Opus 4.8 на 15% и что это вообще одна из самых дорогих моделей, уступая только Fable 5.
https://x.com/artificialanlys/status/2072062592923930666?s=46 | 37 985 |
