uz
Feedback
partially unsupervised

partially unsupervised

Kanalga Telegram’da o‘tish

@arsenyinfo пишет про software engineering и machine learning

Ko'proq ko'rsatish
Rossiya60 308Toif belgilanmagan

📈 Telegram kanali partially unsupervised analitikasi

partially unsupervised (@partially_unsupervised) Rus til segmentidagi kanali faol ishtirokchi. Hozirda hamjamiyat 10 468 obunachidan iborat bo'lib, Boshqa toifasida -o'rinni va Rossiya mintaqasida 60 308-o'rinni egallagan.

📊 Auditoriya ko‘rsatkichlari va dinamika

невідомо sanasidan buyon loyiha tez o‘sib, 10 468 obunachiga ega bo‘ldi.

28 Sentabr, 2026 dagi oxirgi ma’lumotlarga ko‘ra kanal barqaror faollikka ega. Oxirgi 30 kunda obunachilar soni 224 ga, so‘nggi 24 soatda esa 21 ga o‘zgardi va umumiy qamrov yuqori darajada qolmoqda.

  • Tasdiqlash holati: Tasdiqlanmagan
  • Jalb etish (ER): Auditoriya o‘rtacha 70.48% darajada jalb etiladi. Nashrdan keyingi dastlabki 24 soatda kontent odatda umumiy obunachilar sonining 27.86% ini tashkil etuvchi reaksiyalarni to‘playdi.
  • Post qamrovi: Har bir post o‘rtacha 7 377 marta ko‘riladi; birinchi sutkada odatda 2 916 ta ko‘rish yig‘iladi.
  • Reaksiyalar va o‘zaro ta’sir: Auditoriya faol: har bir postga o‘rtacha 76 ta reaksiya keladi.

📝 Tavsif va kontent siyosati

Muallif resursni shaxsiy fikrni ifoda etish maydoni sifatida ta’riflaydi:
“@arsenyinfo пишет про software engineering и machine learning”

Yuqori yangilanish chastotasi (oxirgi ma’lumot 29 Sentabr, 2026 da olingan) sababli kanal doimo dolzarb va katta qamrovli bo‘lib qoladi. Analitika auditoriya kontent bilan faol hamkorlik qilishini, uni Boshqa toifasidagi muhim ta’sir nuqtasiga aylantirishini ko‘rsatadi.

10 468
Obunachilar
+2124 soatlar
+1037 kun
+22430 kun

Ma'lumot yuklanmoqda...

Taglar buluti
Ma'lumot yo'q
Muammo bormi? Iltimos, sahifani yangilang yoki bizning qo'llab-quvvatlash boshqaruvchimizga murojaat qiling>.
Kirish va chiqish esdaliklari
---
---
---
---
---
---
Obunachilarni jalb qilish
Sen '26
Sentabr '26
+268
3 kanalda
Avgust '26
+417
2 kanalda
Get PRO
Iyul '26
+277
5 kanalda
Get PRO
Iyun '26
+95
3 kanalda
Get PRO
May '26
+61
1 kanalda
Get PRO
Aprel '26
+71
4 kanalda
Get PRO
Mart '26
+110
4 kanalda
Get PRO
Fevral '26
+94
3 kanalda
Get PRO
Yanvar '26
+76
2 kanalda
Get PRO
Dekabr '25
+222
2 kanalda
Get PRO
Noyabr '25
+59
3 kanalda
Get PRO
Oktabr '25
+84
3 kanalda
Get PRO
Sentabr '25
+208
9 kanalda
Get PRO
Avgust '25
+167
3 kanalda
Get PRO
Iyul '25
+457
9 kanalda
Get PRO
Iyun '25
+224
6 kanalda
Get PRO
May '25
+350
5 kanalda
Get PRO
Aprel '25
+456
10 kanalda
Get PRO
Mart '25
+140
4 kanalda
Get PRO
Fevral '25
+179
4 kanalda
Get PRO
Yanvar '25
+266
10 kanalda
Get PRO
Dekabr '24
+59
4 kanalda
Get PRO
Noyabr '24
+62
0 kanalda
Get PRO
Oktabr '24
+102
1 kanalda
Get PRO
Sentabr '24
+160
4 kanalda
Get PRO
Avgust '24
+134
0 kanalda
Get PRO
Iyul '24
+730
2 kanalda
Get PRO
Iyun '24
+76
1 kanalda
Get PRO
May '24
+145
3 kanalda
Get PRO
Aprel '24
+88
1 kanalda
Get PRO
Mart '24
+140
3 kanalda
Get PRO
Fevral '24
+266
3 kanalda
Get PRO
Yanvar '24
+297
0 kanalda
Get PRO
Dekabr '23
+106
1 kanalda
Get PRO
Noyabr '23
+90
1 kanalda
Get PRO
Oktabr '23
+93
0 kanalda
Get PRO
Sentabr '23
+145
0 kanalda
Get PRO
Avgust '23
+197
0 kanalda
Get PRO
Iyul '23
+264
0 kanalda
Get PRO
Iyun '23
+165
0 kanalda
Get PRO
May '23
+1 601
0 kanalda
Get PRO
Aprel '23
+246
0 kanalda
Get PRO
Mart '23
+217
0 kanalda
Get PRO
Fevral '23
+75
0 kanalda
Get PRO
Yanvar '23
+73
0 kanalda
Get PRO
Dekabr '22
+130
0 kanalda
Get PRO
Noyabr '22
+47
0 kanalda
Get PRO
Oktabr '22
+37
0 kanalda
Get PRO
Sentabr '22
+60
0 kanalda
Get PRO
Avgust '22
+182
0 kanalda
Get PRO
Iyul '22
+72
0 kanalda
Get PRO
Iyun '22
+147
0 kanalda
Get PRO
May '22
+326
0 kanalda
Get PRO
Aprel '22
+386
0 kanalda
Get PRO
Mart '22
+91
0 kanalda
Get PRO
Fevral '22
+861
0 kanalda
Get PRO
Yanvar '22
+68
0 kanalda
Get PRO
Dekabr '21
+171
0 kanalda
Get PRO
Noyabr '21
+77
0 kanalda
Get PRO
Oktabr '21
+71
0 kanalda
Get PRO
Sentabr '21
+112
0 kanalda
Get PRO
Avgust '21
+292
0 kanalda
Get PRO
Iyul '21
+38
0 kanalda
Get PRO
Iyun '21
+75
0 kanalda
Get PRO
May '21
+11
0 kanalda
Get PRO
Aprel '21
+40
0 kanalda
Get PRO
Mart '21
+25
0 kanalda
Get PRO
Fevral '21
+11
0 kanalda
Get PRO
Yanvar '21
+21
0 kanalda
Get PRO
Dekabr '20
+773
0 kanalda
Sana
Obunachilarni jalb qilish
Esdaliklar
Kanallar
29 Sentabr+2
28 Sentabr+21
27 Sentabr+3
26 Sentabr+4
25 Sentabr+7
24 Sentabr+13
23 Sentabr+20
22 Sentabr+43
21 Sentabr+72
20 Sentabr0
19 Sentabr+2
18 Sentabr+2
17 Sentabr+6
16 Sentabr+3
15 Sentabr+4
14 Sentabr+5
13 Sentabr+3
12 Sentabr+3
11 Sentabr+9
10 Sentabr+2
09 Sentabr+8
08 Sentabr+5
07 Sentabr+9
06 Sentabr+1
05 Sentabr+5
04 Sentabr+1
03 Sentabr+8
02 Sentabr+5
01 Sentabr+2
Kanal postlari
Девять лет назад я участвовал в необычных соревнованиях на Kaggle: нужно было делать adversarial атаки на нейросеть и защищаться от них. Участники сабмитили свои решения и пытались атаковать/защищаться. Я кое-как заимплементил FGSM и Карлини-Вагнера для атаки и навелосипедил что-то типа test-time augmentation для защиты. Сабмит с защитой почему-то не отработал, атаки показали себя едва лучше медианного участника, в общем, даже бронзовой медальки мне не досталось. Это было моё самое близкое знакомство с AI/ML Security, пока фаундеры на нынешней работе не загнали меня в угол и не заставили ковырять агентскую безопасность. Спустя три месяца мы релизим OpenAPPA - Agentic Permissions Policy Algebra. APPA - это переосмысление классического information flow control под агентские нужды. Главная проблема текущей агентской безопасности в том, что тулколл оценивают в вакууме. Авто-моды и LLM-ревьюеры просят вторую модель угадать, выглядит ли действие безопасным. Чтобы эту модель саму не накачали промпт-инъекцией, из её контекста обычно вырезают предыдущие выводы тулов. В итоге ревьюер видит curl ... и понятия не имеет, что в пейлоаде: публичный README, креды от прод-базы или секреты клиента, которые агент прочитал два хода назад. Как это решает APPA: 1. Контроль происхождения данных (provenance), а не команд в вакууме. В отличие от чёрно-белых списков, тут не нужен ворох ифов и регулярок. В отличие от auto-mode в кодинг-агентах, APPA смотрит не на то, «выглядит ли команда безобидно», а откуда пришли данные и куда текут. Сами полиси при этом остаются компактными: не надо расписывать комбинаторный взрыв сочетаний — достаточно разметить источники и приемники (sources and sinks), остальное движок инферит по траектории сам. 2. Remedy-планы вместо дедлоков. Плохой секьюрити-софт либо дырявый, либо превращает агента в бесполезный кирпич при первой же ошибке. APPA возвращает не просто отказ, а инструкцию, как его можно обойти в рамках полиси (например, почистить PII через санитайзер, заспавнить сабагента со structured output или спросить человека ровно на один вызов). В итоге utility остаётся на уровне ~90% от бейзлайна (серьёзные конкуренты падают ниже 50%), а оверхед по токенам незначительный - всего +4.2% на Tau-Bench. 3. Под громким словом «алгебра» скрывается нехитрый fold. Буквально одна чистая функция над логом событий (в статье мы пафосно говорим про finite meet-semilattice where permissions only monotonically narrow, но в коде это дружище fold). Просто, но с доказуемыми инвариантами по построению. Зато снаружи к нему можно цеплять любые костыли под грязную реальность: от корпоративного каталога пользователей до локального ML-классификатора, который динамически размечает неструктурированные тулколлы вроде произвольного баша. Благодаря этому любые наработки - от любимой пачки ифов до автомода или jev-классификатора - отлично ложатся как дополнение. Можно поиграться локально (ставится в Claude Code одной командой), можно примерить для взрослого энтерпрайза (нативная поддержка в платформе archestra.ai), можно как угодно использовать у себя - исходники на гитхабе под MIT. P.S. Этот пост можно лайкнуть или даже репостнуть в линкедине, заранее большое спасибо!

2
Мои любимые HFT рекламодатели из Wunder Fund попросили рассказать про их новое соревнование: Alfa Connectome. В этот раз дата
Мои любимые HFT рекламодатели из Wunder Fund попросили рассказать про их новое соревнование: Alfa Connectome. В этот раз датасет гораздо больше, чем в прошлых двух соревнованиях; настоящая трейдинговая датка для двух связанных инструментов: ордербуки, сделки и кое-что еще. Задача - предсказывать индикаторы будущей цены для одного из инструментов. Соревнование идет до 15 ноября, призовый фонд - $13,600, ну и, как всегда, призеров и близких к ним позовут на интервью. К слову про интервью: лично знаю одного уважаемого читателя канала, который даже без прикладного опыта взялся решать одно из предыдущих соревнований, умеренно преуспел и на волне успеха пошел искать работу. Ирония: сам Wunder Fund ему в итоге отказал, но трамплина хватило, чтобы стать MLE у их отдаленных конкурентов. Так что вход в индустрию через соревнования работает и в 2026. >> Участвовать
4 688
3
Jev, про который говорят на каждом углу - это может и не революция технически, но чертовски сильная штука с точки зрения продукта. Да, под капотом там явно что-то более приличное, чем голый BERT в zero-shot, классические MNLI-пайплайны или открытые альтернативы вроде SemIf (бывший OpenJev), Laya на ModernBERT или Bespoke-Nimble. Но главное не в этом: чуваки идеально высекли подзадачу и завернули ее в человеческий API. И случился занятный психологический эффект: сам факт релиза заставил людей - включая меня - проводить ревизию своих пайплайнов с мыслью: «А что я у себя прямо сейчас могу пересадить на такую быструю и дешевую штуку?». Иронично, что если сесть и трезво посчитать, современные flash-модели не сильно отличаются от Jev: по деньгам это копейки и там, и там, разница в latency невелика, качество одного порядка. Упаковка тащит. Я успел немного погонять Jev на живой задаче: размечать тул-коллы в траекториях кодинг агентов на тему безопасности. Собрал сотню вызовов, четыре подзадачи на каждый, натравил Jev, Sonnet 5 и открытые модельки, с панелью LLM-as-a-judge для оценки: 1. Привет из классического ML: majority константа все еще сильный бейзлайн. В реальных сессиях 4 из 5 вызовов тулов - это унылая рутина вроде cargo test или git status. Базовый мажоритарный класс забирает почти 80%. Не каждый LM классификатор так осилил! 2. Как всегда, не все ошибки одинаково полезны вредны. У Sonnet 5 роскошные 90%+ общей точности (~80% у Jev), но на редких реально опасных вызовах Recall 4 из 9 (у Jev 7 из 9). 3. Из коробки открытые альтернативы не очень. В zero shot режиме мелкие открытые декодеры сколлапсировали в ноль. Делаем банальный циклический сдвиг вариантов ответа (A/B/C -> B/C/A): Qwen 0.6B в 100% случаев выбирает A, MiniCPM в 100% случаев жмет последний вариант. С few shot получше, но encoder-based модели я не смог довести до уровня той же константы. 4. Калибровка удивительно хороша. Если фильтровать предсказания Jev с конфиденсом >= 0.7, он не ошибся ни разу. У самодельных реранкеров и дешевых моделек софтмакс получился размазан тонким слоем (разница между топ-1 и топ-2 часто в районе 0.05). 5. Jev - это все еще LM. Не надо слишком надеяться на детерминизм и отсутствие positional bias. На моем датасете шумело на ~2-3% между прогонами и позициями. В общем, отличный пинок вспомнить, что не на каждую кнопку нужно доставать Astra и Fable. Кстати, на все развлечения в API Jev я потратил бешеные $0.37. See also: мнение Ильи про Jev.
6 309
4
Минутка рекламы. Если вы ненавидите двигать квадратики в джире так же люто, как и я, но ещё не накостыляли кастомного агента делать это за вас — посмотрите на Motion. Первый порыв любого инженера - «ща я за вечер соберу агента, пусть сам раскидывает мой календарь». Но языковые модели все еще отвратительно считают время, косячат с таймзонами, и на тривиальную арифметику дат сжигаются миллионы токенов. В Motion шедулинг отдали нормальному детерминированному алгоритму. Вы задаёте таскам эстимейты, дедлайны и приоритеты, а движок сам пакует их в свободные окна между встречами. Прилетел внезапный созвон => расписание само перестроилось на лету. Утверждается, что AI прикрутили только туда, где он уместен: экстракция задач из почты или Slack, конкретных action items и постановка их в очередь вместо десятков страниц мертвого транскрипта. Меньше ритуального микроменеджмента, больше шансов реально сесть за работу. Можно потыкать триал бесплатно (и перестать врать себе, что сделаете сами лучше)
6 930
5
Не люблю комментировать релизы, но Astra (и, внезапно, gemini 3.8) вернули забытое чувство: впервые с весны свежая фронтир-модель ощущается как полезный помощник, а не как душный упырь, которого вынужден терпеть только от безысходности.
8 674
6
Мой соавтор по первой книжке не удержался и недавно заспойлерил вторую. А если шило в мешке не утаить, то надо идти в обратную сторону, и начать собирать предзаказы. Оставляйте свои почты, но главное - пожелания, какие темы мы должны покрыть для дорогих подписчиков.
10 788
7
Когда я учился в школе, на каком-то этапе мои учителя математики и информатики объявили, что у меня полное отсутствие таланта к соответствующим дисциплинам, и хороших оценок по ним мне не видать. Так я отделался от судьбы отличника-медалиста, подзабил на учебу и примерно в десятом классе начал подрабатывать протоблогером - писать про канплюктеры в тогда еще бумажные газеты. Заметные деньги по тем временам, да еще и безлимитный интернет в офисе одной такой газеты. Гештальт вернуться в родную гимназию с риторическим вопросом «ну и кто после этого бестолковый?» я, впрочем, так и не закрыл. Как следствие, с поступлением в универ были вопросы. Писать про компьютеры мне нравилось и даже получалось (опять же, по меркам семнадцатилетнего сопляка), но в условиях посредственного знания математики и высоких конкурсов в нормальные универы между "писать" и "компьютеры" пришлось выбирать первое. Так я оказался на факультете журналистики БГУ - туда не нужно было сдавать математику, зато нужно было написать эссе и продемонстрировать публикации. Типичный абитуриент приносил несколько заметок из региональных "новостей хойников", я приволок толстенную папку на две сотни эпизодов графомании и был зачислен изучать "информацию и коммуникации". Потребность подрабатывать никуда не девалась, и вскоре помимо самостоятельной писанины я стал редактором пары малоизвестных сайтов, где мне нужно было доводить до ума писанину таких же вчерашних школьников. Работа редактора в мелком медиа - читать много слопа, переписывать его, оставлять комментарии, иногда ругаться и стараться не потерять лес за деревьями. Спустя двадцать лет я с ужасом понял, что история сделала круг. Я всё так же сижу на бесконечном потоке слопа - теперь с заморских серверов, а не из соседней аудитории. Всё так же пишу комменты в духе «переделай, тут логическая дыра» и ворчу, что проще самому переписать. Внештатный автор игнорировал чеклисты, а AI-агент игнорирует системный промпт. Один жрал фастфуд с пивом, другой жрет токены. Именно студентом первого курса я наработал те самые навыки для современного агентского программирования.
9 663
8
Четыре недели плотно работал над нечетко поставленной задачей на грани агентов и information flow, причем это само это словосочетание для меня было в новинку. Артефакт покажу позже, когда ревьювер номер два напихает в панамку, а пока буду ныть. Даже будучи адептом AI-assisted программирования со времен беты копайлота и пользователем клодкода с первого паблик релиза, я дошел до желания забиндить YOU FUCKING MORON на хоткей, потому что терпеть этот слоп никаких сил не осталось. Казалось, что остался какое-то небольшое множество топиков, в которых мое человеческое мнение и профессиональная экспертиза еще чего-то стоят; и совершенно точно новая для меня тема не может в него входить. Ага, щас: все новейшие модели вовсю жонглируют умными словами про semilattice morphisms, но регулярно пропускают совершенно тупые противоречия, заметные и школьнику, если он не начал бухать в пятом классе. И чтение этого слопа утомляет просто невероятно. В старом добром мире часто можно было читать сложную книгу или статью, страдать от собственной тупости на каждом абзаце, но неумолимо прогрессировать (помню, как использовал Multiple View Geometry in Computer Vision в качестве снотворного на долгих перелетах). Сейчас же каждое непонятное предложение оставляет вопрос "я чего-то не понимаю или агенты опять написали херни?". Совершенно не понимаю, это моя проблема в моменте (плохо шарю домен => рвусь от слопа) или просто GPT 5.6 / Fable / Opus 5 оверфитнули на average TS enjoyer, выпихнув меня ближе к границе OOD. Решений, кроме симптоматического "почаще трогать траву", тоже пока не вижу.
8 752
9
Точно знаю, что у меня много читателей в Лондоне 🇬🇧 и Варшаве 🇵🇱 - вот AI тусовки для вас: AI Agents in Production — Rooftop Drinks (Лондон, 4 августа) Меня там не будет, потому что я быдло чумазое невыездной в ожидании ПМЖ. Зато там будут мои коллеги, разговоры про харнессы и бесплатное бухло. The AI Black Swan (Варшава, 26 июля). За пафосным названием обещаются разговоры про агентов и особенно память для них, ну и просто хороший повод потрогать траву (ради этого и еду!). Этот евент платный, промокод BLACK_SWAN_ARCHESTRA дает скидку 10%
7 419
10
Давеча мне предложили немного денег за рекламу курса по AI-driven разработке 💸. Вахтер внутри меня победил безрассудного жадину, так что я взял слайды у рекламодателей и отдал агентам на ревью. Агенты быстро пришли к консенсусу и оценили контент на 7-8 из 10. Похвалили за честность (без хайпа и обещания золотых гор) и практичность, пожурили за неоригинальность. Уникального контента внутри действительно немного, но зато собран по делу. На мой личный вкус полезнее читать ключевой контент (статьи на архиве, блоги AI компаний, репозитории вроде 12-factor-agents) самому. Но каждому свое, кому-то больше нравится слушать видео с пересказом, пусть расцветает тысяча цветов. В общем, если вы сколько-то опытный разработчик, у которого горит стул от вайбкодинга и хочется структурированных рекомендаций, как этот бардак привести в относительный порядок - посмотрите. Курс начинается 21 июля, промокод arseny даст скидку 20%.
9 403
11
Давние читатели канала помнят, что когда-то в древние времена мы с Валерой написали книжку про ML design. Это было так давно,
Давние читатели канала помнят, что когда-то в древние времена мы с Валерой написали книжку про ML design. Это было так давно, что люди тогда умели не только читать по диагонали, но еще иногда писать, а книги были значимым артефактом для упаковки знаний. С тех пор утекло немало воды, работу делают агенты, и книгам они предпочитают скиллы. И вот мы с клодом наконец добрались перепаковать одно в другое: ML system design в форме скилла с набором рубрик для ревью. Устанавливается одной командой через skills.sh, умеет ревьювить дизайн-доки и ML проекты лучше агента из коробки и чесать нам эго ненавязчиво ссылаться на авторов как могучих авторитетов.
34 110
12
☭ https://sovietrxiv.org ☭ Самое время идти к VC с питчем: "Ивахненко и Вапник - два моих деда, нашел их записные книжки на даче, дайте миллиард"
18 295
13
Самая недохайпованная AI лаба тоже верит в будущее за оркестрацией доступных модей. Frontier-level performance without single-vendor dependency. > Our Fugu models surpass publicly accessible frontier models and are shoulder-to-shoulder with Fable 5 and Mythos Preview in various rigorous engineering, scientific, and reasoning benchmarks while delivering frontier capability without the risk of export controls. Как обычно, европейцам без впна можно только почитать репорт.
8 430
14
История с закрытием доступа к Fable - повод тянуться за шампанским в офисах провайдеров открытых моделей. Каждый executive, который участвовал во внедрении AI в своей организации (т.е. просто каждый executive), резко задумался: "А что и кому они внезапно отключат в следующий раз?". Все страхи про вендорлок материализовались мгновенно, даже если конкретно в этой компании Fable и не начали использовать, да и не планировали. И поэтому все мультивендорные альтернативы резко заиграли новыми красками. Во-первых, бигтехи, перепродающие много моделей под своей крышей (AWS Bedrock, Databricks Unity AI Gateway, Cursor в случае кодинг агентов). Но это полумера, все еще сильная зависимость от топовых лаб. Потому есть и во-вторых: выбрать что-то с open weights, как раз ключевые игроки в этой нише недавно выкатили свежие релизы (Minimax 3, Kimi 2.7, GLM 5.2). Сменить провайдера в таком сетапе совершенно не проблема. Где-то тут еще витают страхи, что токены в обозримом будущем подорожают, чтобы отбивать венчурные сотни миллиардов, кодинг агенты по подписке снизят лимиты / перестанут быть доступны для корпораций. В общем, беспокойное время для менеджеров, хорошее время делать vendor-agnostic платформы. Openrouter идеально подгадал по времени и выкатил fusion ендпоинт, из которого неспециалист достанет только один тейк - "микс из моделей попроще работает не хуже топовой модели". Воспитанные кагглом люди помнят, что ансамбли слабо скоррелированных моделей - универсальный молоток. Дьявол все еще в деталях, универсального способа блендить LLM пока не видно, хотя для частных случаев что-то придумать можно. — Именно для этих экспериментов я в свое время и сделал nitpicker - чтобы вайбчекать варианты бленда моделей, пытаясь получить близкое к tier-1 качество, используя tier-2 модели (впрочем, никто не мешает жечь и токены опуса/gpt). Для тех, кому лень ставить незнакомый софт, сделал бесплатную веб-версию. Ограничения: одно ревью на всех в момент времени, работает только с публичными PR на гитхабе, те самые tier-2 модели, аптайм не гарантирован (хостится у меня под теликом).
9 548
15
Личный карьерный апдейт: третью неделю работаю в archestra.ai, моя задача - тащить современный агентский слой в широком смысле слова. Иными словами, вернулся к позиции "писать в меру экспериментальный опенсорс за деньги". Снова работать в команде из семи человек после недолгого захода в бигтех - кайф. Archestra - security-first инфра платформа для агентов. Запустить openclaw-like агента локально несложно, особенно в YOLO режиме; раскатить на большую организацию - совсем не тривиально. Для больших ребят есть enterprise лицензия, forward deployed engineers и все такое; для энтузиастов и компаний поменьше есть опенсорсная репа, которую можно развернуть в любом кластере. Как я люблю шутить, моя главная роль в любом стартапе - это привлекать удачу, например, вот этот $10M series A, к которому я, конечно, отношения не имею. Зато теперь мне официально не придется ограничивать себя в токенмаксинге.
7 472
16
Многие из вас видели заголовок Rewrite Bun in Rust has been merged или, возможно, читали пересказы в популярных каналах (1, 2). Это сделанный агентом PR на 1 млн строк. Такие масштабы от меня далеки, но с похожими штуками я недавно ковырялся. Далеки - это в данном случае два порядка: получалось добиться успешной трансляции Typescript => Rust на 10к строк. Мои условия были в чем-то сложнее, чем в истории с Bun: тестовое покрытие значительно хуже, и волшебного Mythos у меня тоже не было, только Opus 4.6, GPT 5.4 и готовность сжигать миллионы токенов в дебатах между ними (как у nitpicker). Этот эксперимент TS=>Rust не заработал с первой попытки, но ломался исключительно на границах - например, не идеально совпадали env var для докерфайла. Тот же харнесс пробовали применить и для более сложной/масштабной задачи, и там one shot работал еще хуже, но в основном тоже из-за сложности в интеграции и нехватки специфического контекста. Там пришлось двигаться итеративно, и каждая такая итерация подсвечивала новые пробелы в контексте, несовершенство тестов и бенчмарков. В случае Bun отдельный вектор критики в том, что в Rust ветке примерно 10к вхождений unsafe в 700 файлах - "какой же это раст???". Не вижу в этом серьезной проблемы. Наверняка в этой миграции частью дизайна было "переносим все как есть строка в строку, а потом уже оптимизируем. Какое-то количество unsafe кода в рантайме практически неизбежно, и это окей - идиоматичный стиль не запрещает unsafe, а только рекомендует использовать его компактно, обернув в безопасный интерфейсы. Принцип make it work, make it right, make it fast никто не отменял, и снизить количество этих unsafe кусков тем же харнессом с моего дивана не представляется проблемой. Rust was accidentally designed for AI-assisted development 10 years before anyone knew that mattered. И сложно представить, что может изменить эту траекторию.
6 312
17
Наблюдая одним глазом за внедрением кодинг агентов на разных уровнях в разных компаниях, я не могу ответить на один вопрос: зачем топ-менеджеры поддерживают (а иногда и форсят) политику, что менеджеры теперь всерьез должны коммитить код. Не тимлиды, а настоящие менеджеры менеджеров, часто директора и выше. Не только прототипы на коленке, но и прямо в основные репозитории. На реддите воют, что такие директорские пуллреквесты в лучшем случае бесполезны. Типичный директор и так не страдает от безделия, у него есть возможность мультипликативно усилить свою команду. И даже самые умные из них обычно знают кишки проектов хуже рядовых разработчиков. Агенты - великие уравнители; и директор, и L4 гребец будут промптить примерно одинаково, только инженер, будучи в контексте проекта, с большей вероятностью отловит слоп до попадания в прод. Я понимаю, что вайбкодить - особенно в первое время - может быть тупо интересно. Но где тут рациональное зерно, зачем делать из дорогих менеджеров посредственных IC? Пожалуйста, расскажите в комментариях, чего я не понимаю - не готов поверить, что на волне хайпа экзеки просто слетают с катушек.
8 063
18
Мне недавно написал Макс (ресерчер в tessl.io и автор канала @max_dot_sh) и спросил, планирую ли я что-то добавлять в nitpicker. Так я узнал про третью компанию, в которой инженеры всерьез используют мою поделку. Удачное совпадение: как раз на прошлой неделе добрался катнуть несколько изменений. Во-первых, включил режим debate по умолчанию и подкрутил промпты, чтобы максимизировать adversarial аспект. Ожидаемо все стало еще медленнее. Во-вторых, попробовав гонять nitpicker на больших проектах целиком вместо мелких пулл реквестов, я уткнулся в ограничения контекста: агент легко мог выжрать 200к+ токенов и упасть. Так что я добавил поддержку субагентов и сжатие контекста после отсечки. По совпадению, субагентов я добавил к релизу Kimi 2.6, которая специально обучена на активное их использование. Правда, еще Kimi регулярно заикалась, пытаясь вызывать одинаковые тулы по кругу, пришлось обмазывать костылями про loop detection. В итоге машинка может сжечь под миллион токенов и 20 минут на ревью пулл реквеста на 500 строк, что вроде бы долго и дорого. С другой стороны, я проверил на нескольких настоящих живых проектах, и везде нашел какие-то пусть и не критичные, но достойные внимания баги или уязвимости. Люксовые конфиги типа opus 4.7 + gpt 5.5 работают лучше, но и на доступных китайских open weights моделях типа Kimi + GLM результат не полный слоп. Это все еще вайбчек, а не бенчмарк - надеюсь как-нибудь найти время и померять системно.
7 116
19
Когда-то я писал про вакансию DL инженера у моих старых корешей из GRAI.fm🎵. Прошло 10 месяцев, и ребята пришли ко мне снова. Они подняли жирный seed раунд, и теперь им нужен еще один могучий ресерч инженер, чтобы обмазываться статьями про аудио и доводить их до продукта. На самом деле инженерный вакансий больше - например, нужен и человек про датку и MLOps. Их СТО утверждает, что лучшие люди в их команду пришли именно из моего канала, так что не подведите и в этот раз, дорогие подписчики.
8 010
20
Семь лет назад я занимался AR примеркой обуви. Однажды к нам пришел один из VC партнеров и спросил: "а почему у вас в приложении нет allbirds? В Долине все только их и носят". Процедура добавления новой модели предполагала покупку физической пары, потом их сканировали, делали фотограмметрию, а результат доводили до ума руками. Так на полке со скопившейся обувью осталась пара allbirds ровно моего размера, и при увольнении мне ее подарили. С тех пор я стоптал пар пять этих прекрасных кроссовок разных цветов, они подходили мне идеально. И вот эпоха ушла: allbirds официально переключаются с обуви на GPU инфраструктуру. Раньше мы нагружали видеокарты, чтобы рендерить их кроссовки, теперь они сами будут продавать GPU-часы.
11 276