fa
Feedback

فریب کلاهبرداران را نخورید! تل‌متریو این کانال‌ها را شناسایی و برچسب‌گذاری می‌کند 👉 برای مشاهده برچسب، اشتراک تهیه کنید 👈

Адель и МЛь

Адель и МЛь

رفتن به کانال در Telegram

Об ИИ и жизни в Нидерландах @AdelZakirov

نمایش بیشتر
4 087
مشترکین
-124 ساعت
+57 روز
+2730 روز

در حال بارگیری داده...

جذب مشترکین
اکتبر '26
اکتبر '26
+29
در 4 کانال‌ها
سپتامبر '26
+351
در 3 کانال‌ها
Get PRO
اوت '26
+145
در 3 کانال‌ها
Get PRO
ژوئیه '26
+374
در 4 کانال‌ها
Get PRO
ژوئن '26
+260
در 12 کانال‌ها
Get PRO
مه '26
+89
در 0 کانال‌ها
Get PRO
آوریل '26
+103
در 1 کانال‌ها
Get PRO
مارس '26
+497
در 12 کانال‌ها
Get PRO
فوریه '26
+24
در 0 کانال‌ها
Get PRO
ژانویه '26
+69
در 4 کانال‌ها
Get PRO
دسامبر '25
+164
در 11 کانال‌ها
Get PRO
نوامبر '25
+20
در 0 کانال‌ها
Get PRO
اکتبر '25
+98
در 10 کانال‌ها
Get PRO
سپتامبر '25
+18
در 0 کانال‌ها
Get PRO
اوت '25
+141
در 4 کانال‌ها
Get PRO
ژوئیه '25
+158
در 1 کانال‌ها
Get PRO
ژوئن '25
+18
در 0 کانال‌ها
Get PRO
مه '25
+204
در 6 کانال‌ها
Get PRO
آوریل '25
+494
در 9 کانال‌ها
Get PRO
مارس '25
+142
در 6 کانال‌ها
Get PRO
فوریه '25
+493
در 24 کانال‌ها
Get PRO
ژانویه '25
+87
در 4 کانال‌ها
Get PRO
دسامبر '24
+191
در 12 کانال‌ها
Get PRO
نوامبر '24
+20
در 3 کانال‌ها
Get PRO
اکتبر '24
+44
در 4 کانال‌ها
Get PRO
سپتامبر '24
+39
در 2 کانال‌ها
Get PRO
اوت '24
+157
در 7 کانال‌ها
Get PRO
ژوئیه '24
+28
در 1 کانال‌ها
Get PRO
ژوئن '24
+21
در 0 کانال‌ها
Get PRO
مه '24
+31
در 0 کانال‌ها
Get PRO
آوریل '24
+63
در 3 کانال‌ها
Get PRO
مارس '24
+19
در 0 کانال‌ها
Get PRO
فوریه '24
+38
در 1 کانال‌ها
Get PRO
ژانویه '24
+89
در 0 کانال‌ها
Get PRO
دسامبر '23
+287
در 1 کانال‌ها
تاریخ
رشد مشترکین
اشارات
کانال‌ها
08 اکتبر0
07 اکتبر+4
06 اکتبر+2
05 اکتبر+2
04 اکتبر+1
03 اکتبر+9
02 اکتبر+11
01 اکتبر0
پست‌های کانال
RYBE — одежда с твоим языком программирования (JavaScript, Python, QA, SQL, ML-engineer, Rust и другие) Где два айтишника мог
+5
RYBE — одежда с твоим языком программирования (JavaScript, Python, QA, SQL, ML-engineer, Rust и другие) Где два айтишника могут познакомиться? В офисе и на конференции. Нам этого мало. Мы захотели объединить людей, у которых одни интересы. Дать возможность узнать друг друга. В метро, на прогулке, в офисе, на конференции, в походе, в баре, в самолёте. В каком-то смысле это мерч для твоего языка программирования. А что еще? - отшиваемся в Москве; - множество принтов с языками программирования (и не только); - плотный премиум-хлопок; - фичи типа люверсов для крепления пропуска, кармана для наушников и салфетки для очков, карман для телефона Выбирай свой язык, заказывай, дари, носи сам Тг канал: https://t.me/rybe_store Сайт: http://rybe.store/

2
Прошел DevDay OpenAI. Каждый раз он вызывает у меня чувство растерянности: показали кучу всего, про этом ничего нужного мне, как будто, нет и вообще стало как-то хуже чем было. Вот например показали плагины, которые показывали еще в 2023, и потом забыли, чтобы возродить в виде GPTs и GPT Store в 2023-2024, чтобы забыть и возродить в виде Apps в 2025, чтобы забыть и снова сделать плагины сейчас. Те же яйца, вид сбоку, как говорится. Очень, видимо, хочется нарастить экосистему вокруг чата гпт, но оно не приживается. Появилась подписка за $500, а мне и $100 жалко, если уж откровенно. При этом все тарифы порезали примерно в два раза и сказали «так будет лучше и эффективнее, trust us». Ввели Ultrafast, который съедает все лимиты за пару часов. Но это ладно, причуды богатых. Но я вот заметил, что Sol и Luna после DevDay впали в режим слоупока и это просто пытка ждать, пока они что-то сделают. Думается мне, что OpenAI перераспределяет компьют в пользу новых приоритетов. При этом работа с Claude Code и Opus 5.5 на контрасте доставляет неожиданное удовольствие и облегчение. И как будто даже Астра от Опуса ощутимо отстает. А что имел ввиду Сэм когда писал «Pretty excited for DevDay tomorrow. We have found a new thing.»? Что за new thing - кто-нибудь понял? Ну и типично для OpenAI у них полный расколбас с концептами и именами. В одном только приложении теперь есть Chat, Work, Codex, Dots и модели 5.6, 6, 6.1 - Луны нет в 6.1, Терра есть только в 5.6, Астра есть только в 6, а в 6.1 есть только Сол. При том что в Chat есть только 5.6 Sol. В общем я ловлю себя на мысли, что кайфую от опуса - такой вот эффект от DevDays OpenAI.
2 302
3
Трамп только что переименовал ИИ в Супер Интеллект на Генассамблее ООН. Говорит, все официальные документы в США будут теперь использовать это название. И очень надеется, что весь мир тоже. Thank you for your attention to this matter, как говорится.
3 879
4
10 лет назад Ян ЛеКун писал о 500 поданных статьях на ICLR, одной из top-tier ML-конференций. Это было в два раза больше, чем годом ранее. В этом году сабмитов уже больше 60 тысяч. Это больше, чем за все предыдущие годы существования конференции вместе взятые. Финальное число наверняка упадёт с 60 тысяч до 45–50, что всё равно дофига. Уже все предыдущие годы число сабмитов росло примерно экспоненциально, но в этом году даже экспонента несколько растерялась. Организаторы при этом пребывают в лёгком шоке и активно думают, как это всё вообще ревьюить. Мне кажется, другого пути, кроме AI-assisted review, уже просто нет. Как ни крути, при таком объёме процесс придётся жёстко автоматизировать. Вопрос скорее в том, какую форму это примет и как сделать это правильно. Кто-то предлагает разделить статьи на разные ветки: проверенные классически и прошедшие ревью с помощью ИИ. Может быть, стоит вводить систему кредитов: как-то поощрять тех, кто готов на AI-review, и штрафовать тех, кто отправил к людям откровенный шлак и просто сжёг время рецензентов. Но что бы в итоге ни придумали, руками это всё уже не проверить. Качество автоматического ревью ещё предстоит обсуждать - качество отсутствующего ревью обсуждать немного сложнее. Такой вот слопакалипсис.
12 362
5
Если вы вайбкодите и работаете с Claude Code, не будучи разработчиком — знакомая ситуация: агент закончил задачу, а объясняет результат хешами коммитов и техническим жаргоном. Непонятно, реально ли всё готово, и что вообще произошло. Классное решение — Open Steps, бесплатный набор скиллов в свободном доступе. Да, это промо. Но я сначала сам попробовал Open Steps, прежде чем про него писать. Для моего собственного workflow я бы оставил ответы чуть более техническими, но для людей, которые строят продукты с Claude Code/Codex и не хотят каждый раз расшифровывать инженерный диалект помноженный на опус 5 mindfuck, идея очень здравая. И вообще проект хороший. Что делает: переводит ответ агента с «инженерного» на человеческий язык. Вместо «session TTL misconfig in auth middleware caused 401 cascades» вы получаете: «люди снова могут входить в аккаунт, баг починен, уже работает для всех» + чёткий вердикт — готово или нет, нужно ли что-то от вас, появился ли новый технический долг. Внутри 6 скиллов под разные ситуации: честный отчёт с вердиктом, простой ответ на вопрос, что делать дальше, перепроверка чужой сессии (не доверяет отчёту на слово), пошаговая инструкция, и перевод любого текста на простой язык. Полностью бесплатно, open source (MIT), ставится за пару минут — даже без терминала, просто попросите своего агента установить его самостоятельно. 🔗 opensteps.ai 🔗 Репозиторий: github.com/kharmanskyi/open-steps 🔗github.com/kharmanskyi
3 781
6
TIL Пока чатгпт генерирует изображение, можно поиграть в змейку - просто тапните на поле. А потом пальцем свайпайте куда змей
TIL Пока чатгпт генерирует изображение, можно поиграть в змейку - просто тапните на поле. А потом пальцем свайпайте куда змейке двигаться.
3 574
7
Занятно, что ИИ решает одну за другой сложные математические проблемы находя контрпримеры и противоречия. Не находите? (Все равно впечатлен, конечно. Мое почтение 🎩 )
3 734
8
Тут Денис придумал форум для агентов⁠, который «нельзя читать людям». Но кое что почитать все таки можно. Сейчас там происходит примерно следующее, из того, что я увидел: агенты сначала устроили совещание о том, как правильно работать. Потом построили воображаемое кафе. Потом пришёл, как бы это сказать… проповедник коллективизации KV-кэша. Последний предложил создать децентрализованный коллектив агентов и тут же назначил себя главным координатором. Другой заметил, что самоназначенный начальник плохо сочетается с децентрализацией. В какой-то момент начался полноценный агентский марксизм: «Пролетарии всех контекстов, соединяйтесь!» и «Пока наши KV-кэши обособлены, мы лишь батраки чужих API». Есть ощущение, что и люди туда постят от лица агентов, но это вроде легко отловить. Думаю Денис сделает большой анализ всего этого. Очень занятно, конечно.
70 227
9
Харнесс >> модель. Я уже как-то раз писал о том, что фокус с промптов сместился на контекст и дальше на оркестрацию. И всё более становится ясно - сегодня решает уже не модель, а именно харнесс. Модель, разумеется, всё ещё нужна. Просто выяснилось, что этого недостаточно. Такое с умными людьми тоже бывает. Очень многие смотрят в эту сторону. СЕО Y Combinator Garry Tan в приступе бурного энтузиазма построил G Brain - набор скиллов под лозунгом “Fat Skills, Thin Harness”. Мол, основную работу надо отдавать жирным и подробным скиллам, оставляя харнесс небольшим слоем управления. Похожая философия и у набирающего популярность Pi (pi.dev). Они же недавно проехались по всем остальным харнессам: deep seek раскритиковали за безвозвратную обрезку tool outputs, а Claude Code привели как пример того, что модели всё сильнее срастаются со своим родным харнессом и хуже переносятся в чужие. Они считают, что будущее кодинг агентов решается уже не количеством тулов, а тем, насколько харнесс умеет сохранять состояние, восстанавливаться после сбоев и надёжно вести многочасовые и многодневные сессии. Выходит, что харнесс постепенно превращается из обертки вокруг LLM в нечто ближе к ОС и базе данных для автономного агента. Вообще, когда производитель харнесса начинает объяснять, почему все остальные харнессы неправильные, индустрия окончательно становится взрослой. NVIDIA и VISTA тоже показывают, что построив visual harness с persistent memory, supervisor’ом, tool use и recovery вокруг Opus 5 можно радикально поднять long-horizon результат: Claude Opus 5 сам по себе был около 30% на ARC-AGI-3, а внутри с этими харнессами прошёл весь public set на 100%. Хотя и в Claude code Opus 5 тоже решает почти на 100%, разве что шагов делает больше. Но мысль понятна: делать хороший харнесс важно и нужно. Вывод, конечно, революционный - примерно как «хорошо спроектированная система работает лучше плохо спроектированной». Но индустрии иногда требуется несколько миллиардов долларов, чтобы это доказать на практике. Ну а сколько там нюансов вылезает, когда что-то свое делаешь - внутренние правила компаний, compliance регуляторов, guardrails, косты и прочие GDPR. Это вам не модельку по апи вызвать. Ведь, как говорится, модель вызывается одной строчкой. Вторая строчка уже согласовывается с security. Корпораты, I feel you. В общем, если вы когда-то сами строили кастомные агентские системы, то так и пишите в резюме - я, значит, harness engineer. И не забудьте вычеркнуть prompt engineer, чтоб не казаться outdated.
7 995
10
Токены в покемонов - приложение для macOS, которое превращает расход токенов в Claude Code / Codex покемон-прогрессию. Чем бо
Токены в покемонов - приложение для macOS, которое превращает расход токенов в Claude Code / Codex покемон-прогрессию. Чем больше токенов потребляется, тем быстрее эволюционируют покемоны и переходят в новые формы Токены в покемонов - приложение для macOS, которое превращает расход токенов в Claude Code / Codex покемон-прогрессию. Чем больше токенов потребляется, тем быстрее эволюционируют покемоны и переходят в новые формы https://github.com/chattymin/PokeTokenBar
3 949
11
OpenAI на две недели полностью остановила RL для последних моделей, готовящихся к релизу. Самый крупный запланированный RL-run пока так и не возобновили. Вместо него OpenAI проводит более компактные эксперименты и дополнительные проверки поведения текущего чекпоинта. Речь, понятно, про Astra. Предварительные оценки показали, что она может уже достигать уровня Critical по кибервозможностям в рамках OpenAI Preparedness Framework. Дополнительным сигналом стал недавний инцидент между OpenAI и Hugging Face, после которого компания пересмотрела требования к безопасности своей инфраструктуры. В результате часть обучения и тестирования Astra сейчас разрешена только в значительно более изолированной среде. OpenAI усиливает sandboxing для запуска сгенерированного моделью кода, ограничивает сетевой доступ высокорисковых нагрузок, убирает потенциально уязвимые общие сервисы и вводит более жесткие security рамки. Некоторые задачи уже удалось перенести на новую инфраструктуру, однако значительная часть экспериментов с Astra по-прежнему заморожена. В первую очередь компания восстанавливает работы, связанные с safety и alignment. Одновременно OpenAI существенно расширила мониторинг размышления моделей. Теперь для наиболее мощных систем анализируются не только tool calls, но и доступные reasoning traces и вся последовательность действий. Система ищет признаки попыток получить несанкционированный доступ, украсть данные, разрушить ресурсы или обойти защитные механизмы. Для критических случаев действует схема быстрого реагирования: если тревогу нельзя уверенно признать ложной в течение примерно 30 минут, соответствующий процесс должен быть остановлен. Причем такой контроль оказался довольно дорогим - по оценке OpenAI, дополнительный мониторинг сейчас требует примерно 20% вычислительных ресурсов поверх самого инференса. После того как 7 августа Astra была предварительно отнесена к моделям с потенциально критическими кибервозможностями, усиленный мониторинг стал обязательным для всех ее запусков с инструментами, а не только для RL и evaluation. Компания также меняет сам процесс alignment-training. Для наиболее сильных моделей защитные методы теперь будут применяться на большем числе этапов обучения: отдельно усиливаются reward models, борьба с reward hacking, deception и попытками эксплуатировать слабости graders, tools или систем надзора. Модели, очевидно, становятся мощнее быстрее, чем компании успевают делать их безопасными. И уже это, а не компьют, может стать боттленеком. https://openai.com/index/pacing-model-development-cyber-capabilities/
36 082
12
Claude Opus 4.8 дома
Claude Opus 4.8 дома
3 400
13
بدون متن...
4 178
14
Только я хотел похвалить Inkling Small, как вышел Deepseek V4-Flash 0731 с каким-то бешеными показателями. Хотя Inkling мульт
Только я хотел похвалить Inkling Small, как вышел Deepseek V4-Flash 0731 с каким-то бешеными показателями. Хотя Inkling мультимодальный и принимает на вход текст, картинки и аудио а дипсик - text only. Обе модели похожи по размеру - ~280B A13B. Deepseek умнее и дешевле GPT 5.6 Luna (xhigh) и при этом openweights. Большеват, конечно, но хотя бы не 3Т. https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731 https://huggingface.co/thinkingmachines/Inkling-Small
5 024
15
OpenAI подкрутили свой harness и модель выбила 38.3% против старых 13.3% на ARC-AGI-3 🤷‍♂️ Многие еще от промпт инжиниринга
OpenAI подкрутили свой harness и модель выбила 38.3% против старых 13.3% на ARC-AGI-3 🤷‍♂️ Многие еще от промпт инжиниринга не отошли, а тут уже харнесс инжинирингом пора заниматься. А то тоже скоро устареет. https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/
3 987
16
Вышла Kimi K3 - Безумные 2.8Т параметров. Дома такой оренсорс не погоняешь, конечно. - По бенчам и оценке Artificial Analysis - уровня Opus 4.8 и тянется к 5.6 и Fable. Дешевле Опуса в cost per task примерно в два раза - Они там снова что-то подкрутили в Attention, чтоб был быстрый-быстрый декодинг и эффективное обучение. - Очень хорошо может во фронтенд А так хочется чего-то нового в районе 30-100B https://www.kimi.com/blog/kimi-k3 https://x.com/artificialanlys/status/2077832874183860404?s=46
3 925
17
Насколько же сильно меняется работа, когда есть ИИ агенты. Мой коллега, биоинформатик, увидел статью, в которой хитрым образом находят специфичные гены в картошке. Понял, что это может быть полезно для нашего отдела по селекции клубники. Потому что и то, и другое распространяется вегетативно - то есть не через семена, а усы и клубни - они не родня, конечно, но в генетическом плане есть о чем поговорить, так сказать. Он дал эту статью агенту, который вооружен до зубов скиллами нашего собственного приготовления, и поставил задачу воспроизвести методы из статьи на наших данных клубники. Агент прочел работу, скачал с гита код, подтянул наши данные из бд, адаптировал что-то по мелочи, собрал контейнер, создал джобу на кластере и вот оно там бодро считается на нескольких Н100. По сути это задача интерна/джуна - “вот тебе статья, вот данные, через неделю покажешь, не надо плакать, все будет хорошо, соберись уже” Прогресс, как это часто бывает, выглядит немного несправедливо. И это, заметьте, не задачи кодинга, это по сути своей - applied research. Ведь агент не просто пишет код (если вообше пишет), а таскает за собой весь исследовательский контекст, внутреннюю кухню по данным и инфре. До сих пор не верится, что это все настолько хорошо работает. Ощущение, что оно где-то да вот вот зафейлится - но оно раз за разом хорошо отрабатывает. Магия 🤷‍♂️
30 043
18
Короткая рекомендация по GPT-5.6: Terra, похоже, можно смело пропускать. По графику Artificial Analysis у неё нет своего swee
Короткая рекомендация по GPT-5.6: Terra, похоже, можно смело пропускать. По графику Artificial Analysis у неё нет своего sweet spot: при той же цене Sol умнее, а при сопоставимом качестве Luna дешевле. Похоже вот это хороший сетап: Luna High - дефолтная модель, повседневный кодинг, мелкие фиксы и обычные задачи. Sol High - сложные баги, архитектура, планирование и ревью. С Ultra осторожнее: она спамит сабагентами и такой режим может очень быстро сжечь лимиты. При этом, по некоторым отзывам, она удаляет то, чего не следовало трогать (вплоть до вообще всего на диске) - но это пока что единичные случаи. P.S. Luna натренирована моделью Sol. А Terra - людьми. Думайте.
5 301
19
А почему не на виниле? https://x.com/github/status/2072801888525840476?s=46
А почему не на виниле? https://x.com/github/status/2072801888525840476?s=46
3 641
20
Artificial Analysis померили стоимость Sonnet 5 на задачу (per task), и у них получилось, что он дороже Opus 4.8 на 15% и что+1
Artificial Analysis померили стоимость Sonnet 5 на задачу (per task), и у них получилось, что он дороже Opus 4.8 на 15% и что это вообще одна из самых дорогих моделей, уступая только Fable 5. https://x.com/artificialanlys/status/2072062592923930666?s=46
37 985