fa
Feedback
AI для Разработки — Claude | Cursor | Copilot

AI для Разработки — Claude | Cursor | Copilot

رفتن به کانال در Telegram

100+ AI-источников → лучшие инструменты для разработчиков. Cursor, Copilot, Claude API — обзоры, туториалы, новинки. Вопросы: @aiskladadmin

نمایش بیشتر
935
مشترکین
+124 ساعت
+37 روز
-1030 روز
آرشیو پست ها
Ждали Gemini 3.5 Pro — прислали спин-офф. И он внезапно годный Знакомое чувство: ждёшь новый сезон, а тебе спин-офф про второстепенного персонажа. Вот и 21 июля: вместо флагмана Pro (обещанного ещё в мае на I/O и переехавшего вправо уже третий раз) Google выкатила три модельки тира Flash. Ни одной Pro. Но главный герой — Gemini 3.6 Flash — оказался толковым. Не потому что поумнел (индекс интеллекта тот же — 50 баллов, ни на йоту больше), а потому что стал жаднее в хорошем смысле: тратит на 17% меньше выходных токенов на тех же задачах. А на автономной правке кода — вообще до 65% экономии (97к токенов вместо 276к). Для тебя в чате разница почти незаметна. А вот для агента, который внутри одной задачи открывает файл, гуглит, снова открывает файл, зовёт инструмент, думает — каждый лишний шаг это токены, а токены это деньги. Вот тут и начинается магия. Ценник: 3.6 Flash — $1,50 / $7,50 за 1M, а совсем бюджетная Flash-Lite — $0,30 / $2,50. А Pro? Тестируют с партнёрами. А Gemini 4 — «самый амбициозный претрейн» в истории компании. Короче, ждём дальше. Разбор целиком. 🔥 — экономия — это любовь 🤡 — а Pro где, Google? @ai_for_dev

Ваш AI-агент не понимает код — он просто уверенно угадывает Знакомо? Агент добавил функцию, тест зелёный, PR красивый. А через час падает прод, потому что где-то живёт вторая реализация provider'а, которую он не заметил 🙈 Mo Bitar (тот самый, из Standard Notes) два года пилил с AI и подытожил: локально — блеск, глобально — каша. Один агент правит HTTP-обёртку, но не видит backend-роут. Другой чинит сервис, забыв про фоновый consumer. Каждый кусок вроде правильный, а вместе всё разваливается. Причина простая: агент видит проект через окно контекста, а не целиком. Он может открыть не тот файл или достроить цель, которой вообще нет. Поэтому появился CodeSlicer — он трассирует настоящие связи между слоями проекта, чтобы правка одной функции не сносила соседний сценарий. Разбор на Хабре. 🔥 — болит, забираю 🤡 — да у меня и так всё падает @ai_for_dev

Китайские модели тихой сапой подбираются к топам Все следят за гонкой Opus vs GPT vs Gemini, а тем временем китайские модели
+2
Китайские модели тихой сапой подбираются к топам Все следят за гонкой Opus vs GPT vs Gemini, а тем временем китайские модели по бенчмаркам уже дышат в спину — и стоят при этом в разы дешевле. Когда твой бюджет на API не бесконечный, а задачи типовые — это уже не «ну ок, Китай что-то делает», а реальная альтернатива для продакшена. Осталось только дождаться, когда все перестанут делать вид, что не замечают. 😏 🤩 — китайцы тихо побеждают 😐 — без конкретных цифр не верю @ai_for_dev

AI-гиганты строят свои империи — и хотят, чтобы ты жил в одной из них Помните войну iOS vs Android? Теперь то же самое, только в AI. OpenAI, Anthropic, Google и Microsoft больше не соревнуются, у кого модель умнее — они строят целые платформы и хотят, чтобы вы писали код именно в их экосистеме. Что в стеке 2026 года: — Модели (ну это понятно) — Среда исполнения — песочницы, агенты, длинные сессии — Контекст — подключение к вашим данным — Оркестрация — координация агентов — Интерфейсы — IDE и чаты — Безопасность и аудит Антропик двинулся в управляемых агентов, OpenAI строит «операционку для AI-сотрудников», Google тащит Vertex AI + Workspace, а Microsoft — ну, у них и так Office стоит у всех. Что это значит для нас: выбирая API сегодня, ты по сути выбираешь, в чьём огороде будешь жить. Хочешь свободу — пиши кросс-платформенно. Хочешь глубину — готовься к привязке. Подробнее на Хабре 😎 — мультиплатформенный и горжусь 🤷 — уже по уши в одной экосистеме @ai_for_dev

Банк внедряет RAG и мультиагентов — и честно рассказывает, как ПСБ написали на Хабре, как у них дела с AI. Студенты на внутреннем обучении спросили: «А зачем нам это, если в банке ничего нет?» — и руководство решило, что пора показать. Что нашлось под капотом: — RAG для чат-ботов, которые знают историю клиента — Мультиагентные системы для автоматизации рутины — Генерация документации и анализ антифрода через LLM Отдельно подкупает честность: банк прямо говорит, что к LLM относится осторожно и не бежит за хайпом. В энтерпрайзе это скорее плюс, чем минус 😁 Деталей архитектуры маловато — больше обзор «что делаем и зачем». Но для понимания, как крупный российский бизнес подходит к AI — полезно. 👍 — нормальный подход 😐 — где код-то @ai_for_dev

GPU дорожают, API падают, лимиты везде — добро пожаловать в 2026 Короче, агентный AI жрёт вычислительные мощности так, что вс
GPU дорожают, API падают, лимиты везде — добро пожаловать в 2026 Короче, агентный AI жрёт вычислительные мощности так, что вся индустрия не справляется. Anthropic за 90 дней — доступность 98,95%. Для сравнения, нормальный SLA облачных провайдеров — 99,99%. Основатель Retool публично сказал, что ушёл с Claude на OpenAI, потому что сервис постоянно лежал. OpenAI вообще закрывает Sora 26 апреля — освободившиеся мощности перекинут на кодинг-инструменты. Токенов через API стало потребляться 15 млрд в минуту вместо 6 млрд полгода назад. А теперь самое весёлое для кошелька: аренда Nvidia Blackwell подскочила с $2,75 до $4,08/час. GitHub урезал Copilot, Windsurf ввёл квоты, OpenAI пересадила Codex на поштучную оплату. Bank of America говорит, что дефицит до 2029 года. Свободные мощности и энергия до конца 2026 уже разобраны. 🔗 Полный разбор от WSJ 💔 — мой бюджет на API 🔥 — ну хоть кодинг-тулы в приоритете @ai_for_dev

Ваш WAF уже не торт: как AI сломал сигнатурную защиту Чувак из NGENIX написал на Хабре отрезвляющую штуку. Он смотрит в логи каждый день, и вот что видит: Атаки перестали быть тупыми. Раньше массовая атака = дешёвый мусор с кривыми заголовками. Сейчас ML-модель атакующего изучает ваш фронтенд и API, а потом генерирует тысячи запросов, каждый из которых выглядит как нормальный пользователь. User-Agent, TLS-отпечаток, геолокация, тайминги — всё согласовано. Самое неприятное — скорость. Весь цикл от разведки до эксплуатации сжался до десятков минут. Пока ваша команда пишет правило для WAF, атакующий уже сменил тактику. Сигнатуры умирают не потому что они плохие. А потому что атаки перестали повторяться. Снаружи — хаос. Внутри — единая цель. Если вы разработчик и думаете «это проблема безопасников» — нет, это проблема вашего API. 😐 — ну и времена 🔥 — пошёл аудитить свой API @ai_for_dev

On-device ASR на STM32N6 + NPU: акустическая модель при 215 мВт Реализация распознавания произвольной речи на MCU без облака. Платформа — STM32N6 с интегрированным NPU и ядром Cortex-M55. Архитектура классическая трёхблочная: — Акустическая модель (на NPU) — входной аудиосигнал → мел-спектрограмма (на M55) → фонемный поток — Декодер — фонемы → слова через словарь + грамматические правила — Рескоринг — языковая модель для выбора оптимальной гипотезы Энергопотребление при активном инференсе: — NPU + Cortex-M55: 160 мВт — Внешняя Flash + PSRAM: 45 мВт — GPIO: ~10 мВт — Итого: ~215 мВт без оптимизации Текущее ограничение: декодер реализован как lookup-таблица фонем→слово, то есть словарь фиксированный. Полноценный фонемный декодер с LM в разработке — он снимет это ограничение и заметно поднимет точность. Ноу-хау в разделении на три блока — экономия RAM, акустическая модель не держит в памяти весь словарь. Детали и бенчмарки ⚡ — edge AI наступает 😐 — без декодера рано судить @ai_for_dev

Lip-sync через lookup-таблицу MFCC-векторов вместо real-time inference Подход к анимации говорящих лиц, который обходит главную проблему Wav2Lip/SadTalker/FasterLivePortrait — ~10x замедление относительно реального времени + артефакты генерации. Архитектура: Этап подготовки (offline, с GPU): — Видео речи нарезается на перекрывающиеся сегменты: 10 кадров, шаг 2 кадра (~0.4 сек) — Для каждого сегмента вычисляется 16-мерный feature-вектор: MFCC-коэффициенты + энергия + спектральный центроид — Результат — lookup-таблица acoustic_vector → video_segment Этап рендера (runtime, CPU): — Входное аудио разбивается на окна — Для каждого окна ищется ближайший сегмент по расстоянию в пространстве признаков — Сегменты склеиваются через оптический поток (плавные переходы) Для синтетических персонажей FasterLivePortrait используется только в offline-пайплайне — генерирует reference-видео для построения библиотеки. По сути, это замена generative inference на nearest-neighbor search в предрасчитанном пространстве. Zero артефактов — показывается реальное видео. Полный разбор ⚡ — элегантный трейдофф 🤔 — а как с разнообразием фонем? @ai_for_dev

KV-Cache в LLM: механика инференса через 9 вопросов Детальный разбор на Хабре — от базовой арифметики KV-Cache до production-метрик. Инференс разделён на две фазы: Prefill — полный forward pass промпта. Все токены параллельно, вычисляется полная матрица attention. Compute-bound: GPU загружен арифметикой матричных умножений. Decode — авторегрессия. Один новый Q-вектор × все накопленные K-векторы. Memory-bound: узкое место — пропускная способность HBM при чтении KV-Cache. Численно: промпт 4096 токенов, генерация 100 токенов.
Без кэша: 100 × 4096 + (100×101)/2 ≈ 414,650 проекций
С KV-Cache: 100 проекций (O(1) на шаг)
На модели 70B параметров разница между 414K и 100 проекций — это разница между «неприлично дорого» и «приемлемо». Это объясняет три ключевые метрики: TTFT зависит от длины prefill, throughput упирается в скорость чтения KV из HBM при decode, а стоимость — в объём памяти под кэш. Первая часть серии — на Хабре. Вторая обещает распределённый KV-Cache за рамками одного GPU. 🔥 — наконец нормальное объяснение 🤷 — для меня это уже база @ai_for_dev

Дядя Боб больше не читает код 😎 Тот самый автор «Чистого кода», который годами учил нас вылизывать каждую строчку, теперь пр
Дядя Боб больше не читает код 😎 Тот самый автор «Чистого кода», который годами учил нас вылизывать каждую строчку, теперь признаётся: код от ИИ-агентов он вообще не читает. Прогнал через автотесты — зелёно? Едем дальше. А что если ИИ наврал и нагаллюцинировал? Дядя Боб спокоен: люди, мол, тоже ошибаются, чем ИИ хуже. Звучит как освобождение — пока не вспомнишь, что теперь вся надежда на твои тесты. А они у тебя вообще есть? 🔥 — красиво отпустил 🤡 — а тесты-то фейковые @ai_for_dev

Промпт не лечит. Лечит среда вокруг агента Чувак год пилил штуку без названия: не обвязку над одной моделью, а среду, где ИИ-агент тащит проект от требований до рабочего кода и по дороге не сносит то, что трогать было нельзя. Звал по-простому — фабрика разработки. Кто уже гоняет coding-агентов в бою, тот в курсе прикола: агент бодро проходит все проверки и с той же уверенностью сносит запретное. CI зелёный, diff красивый, в чате победный отчёт. А необратимое уже улетело — публикация без approve, удаление данных, отправка не тому. Система честно думает, что всё ок, потому что проверки спрашивали не про то. Мораль: никакой промпт это не чинит. Чинит среда: цикл, роли, гейты, что делать после ошибки и кто откатывает необратимое. За год из одной фабрики выросло почти десять параллельных конвейеров с двухэтажным harness. Три привычки, чтобы всё это не развалилось: ratchet (фейл — сразу в постоянный фикс), sensor-first (инвариант сначала детектором), измеримость (правило должно менять поведение, а не пылиться в конфиге). Полная история — на Хабре. 🔥 — гейты наше всё 🤡 — а у меня CI зелёный @ai_for_dev

«Я не читаю код своих агентов» — Дядя Боб Человек, который написал «Чистый код» и учил нас вычитывать каждую строчку, теперь
«Я не читаю код своих агентов» — Дядя Боб Человек, который написал «Чистый код» и учил нас вычитывать каждую строчку, теперь говорит: код от ИИ-агентов он вообще не читает. Да-да, тот самый Роберт Мартин (пруф). Логика такая: читать код агентов — значит терять всю их продуктивность. Поэтому вместо чтения он загоняет агентов в адские рамки — юнит-тесты, Gherkin, QA-процедуры, мутационное тестирование, покрытие и куча метрик. Прошёл через всё это — код годный. «А как доверять ИИ, который врёт и галлюцинирует?» — спросили его. «Ну люди тоже врут», — ответил Боб. Железная логика, не поспоришь. Забавный поворот: чистота кода всё ещё важна, но теперь ради самих агентов — запутанный код их тормозит, они в нём путаются и не могут найти решение. Так что лимиты на размер функций и сложность — уже не для людей, а для роботов. 😁 — красиво вывернулся 🤔 — а тесты кто читает? Источник: habr.com @ai_for_dev

Свой приватный ИИ-сервер за пару команд Релизнулся ODS — штука, которая превращает твой комп (Windows, Mac, Linux) в локальны
Свой приватный ИИ-сервер за пару команд Релизнулся ODS — штука, которая превращает твой комп (Windows, Mac, Linux) в локальный ИИ-сервер. Сам смотрит на железо, подбирает под него модель, качает и запускает. Никакой ручной возни с Ollama, Open WebUI, n8n и ComfyUI — всё уже склеено. Что внутри: • чат в стиле ChatGPT прямо в браузере • панель управления моделями, сервисами и GPU • голосовые помощники, агенты, рабочие процессы • RAG и поиск по своим документам и коду • генерация картинок локально Самый смак — всё локально и приватно. Работаешь с кодом и важными данными, и они никуда не утекают. Без облака, без подписки, Apache 2.0. Запускаем имбу — тут, на GitHub. 🔥 — self-hosted и точка 👀 — сначала гляну на свою видюху @ai_for_dev

Почему ваш RAG-бенчмарк врёт — и что с этим делать Собрать RAG за вечер? Легко. Понять, работает ли он нормально? Вот тут начинается боль. Проблема простая: большинство бенчмарков основаны на статичных данных. LLM могла видеть эти данные при обучении, и вы по сути тестируете память модели, а не качество retrieval. Классическая утечка данных, только все делают вид, что всё ок. Ребята из Сбера и MWS AI предложили DRAGOn — методологию динамического бенчмарка, представленную на EACL 2026: — Корпус документов регулярно обновляется свежими данными — QA-пары генерируются автоматически (прощай, ручная разметка) — LLM физически не могла видеть тестовые данные — они появились после обучения Есть публичный лидерборд, можно сравнить свою систему с другими. Если вы строите RAG в продакшене и оцениваете его на фиксированном датасете — стоит задуматься, что именно вы измеряете. Разбор статьи 🔥 — пойду гонять свой RAG 😐 — eval — это больно @ai_for_dev

ChatGPT vs Claude: кто построит дашборд и не уронит браузер Человек прогнал 5 режимов топовых моделей через полный цикл BI-да
+6
ChatGPT vs Claude: кто построит дашборд и не уронит браузер Человек прогнал 5 режимов топовых моделей через полный цикл BI-дашборда — от интервью с заказчиком до готового HTML. Спойлер: AGI всё ещё не случилось. Что выяснилось: Требования — ChatGPT Thinking сгенерировал 124 вопроса для заказчика. Представьте лицо клиента. Claude задал 10-13 по делу и ещё предложил заполнить интерактивную форму. Кайф. Макеты — ChatGPT нарисовал текстом, причём отдельный экран на каждый вопрос (видимо, токены сами себя не потратят). Claude выдал HTML-прототипы, и Sonnet оказался аккуратнее Opus — тот ушёл в «дорого-богато» со шрифтами с засечками. Готовый дашборд — тут сюрприз: ChatGPT сделал лучше. Claude решил, что все хотят секси-чёрный фон с неоновыми цветами. А Opus вообще сгенерировал анимацию, которая бесконечно растягивала страницу и вешала браузер. Вывод: для прототипов — Claude, для финального фронтенда — пока ChatGPT, но оба требуют ручной доработки. 🤡 — 124 вопроса заказчику, красота 😎 — а я бы и сам за час накидал @ai_for_dev

Каппа почти ноль, а LLM-судья при чём? Чел строил оценку ответов из двух контуров. Первый скучный: нормализуй и сравни с эталоном. Второй — LLM как судья, читает смысл целиком. Каппа Коэна между ними — почти ноль. Классика: сразу хочется менять модель, крутить промпт, докидывать примеры. Пара дней в трубу, пока не откроешь таблицу расхождений. А там всё просто: детерминированный код сверял только каноническую форму, LLM рассуждала о смысле. Оба правы — просто отвечали на разные вопросы. Низкая каппа не значит «судья тупой», она значит только «контуры разошлись». Кто прав — метрика не в курсе, инструкцию разметчиков она не читает 🙂 И да, отдать всё LLM — плохая идея. Для 3/4 == 0.75 == 6/8 хватает Fraction и 30 строк стандартной библиотеки. LLM тут вообще лишняя. Весь код и разбор: habr.com 🔥 — знакомая грабля 👀 — пойду перечитаю свои тесты @ai_for_dev

LLM на плате за цену шавухи Какой-то умелец запихнул языковую модель прямо в ESP32-S3 — ардуиноподобную плату за восемь баксов. Всё крутится офлайн, на самом чипе, ничего не улетает на сервер. Внутрь утрамбовали модельку на 28.9M параметров, занимает ~15 МБ, выдаёт примерно 10 токенов в секунду. Секрет в том, что большая таблица эмбеддингов живёт в медленной flash-памяти, а не в RAM — на каждый токен читаются только нужные строчки. Идею подсмотрели у Google (Per-Layer Embeddings из Gemma). Яснопонятно, что это не карманный ChatGPT. Обучена на TinyStories, поэтому умеет в основном сочинять простенькие рассказы. Вопросы, код и захват человечества пока не завезли. Но сам факт годный: связный текст теперь генерится даже на железке за цену обеда. Исходники и вся инфа — на GitHub. 🔥 — пойду паять 👀 — надо глянуть 🔥 — пойду паять 👀 — надо глянуть @ai_for_dev

Своя RAG на Go, PostgreSQL и Ollama — без облаков и LangChain Все туториалы по RAG выглядят одинаково: OpenAI API, LangChain, облачная векторная база — и вроде готово. Только это работает как чёрный ящик: ты не видишь, как текст режется на чанки, как сравниваются векторы и как лепится финальный промпт. А ещё корпоративные документы в зарубежное облако не отправишь. Автор пошёл другим путём и собрал всё локально на Go + PostgreSQL (pgvector) + Ollama. Почему такой стек: ▪️ Go — один лёгкий бинарник, никакого тяжёлого рантайма как у Python, и мощная конкурентность из коробки для параллельной обработки документов. ▪️ PostgreSQL + pgvector — векторы живут прямо в базе, отдельную векторную БД поднимать не надо. ▪️ Ollama — модели крутятся локально, интернет не нужен. По ходу разбираешься, что вообще такое эмбеддинги и чанки, а не просто дёргаешь чужие абстракции. Красота. Весь код и детали: habr.com 🔥 — self-hosted gang 👀 — надо на выходных заценить @ai_for_dev

Зачем корпоративным LLM нужен firewall Большие языковые модели за год прошли путь от экспериментов до части рабочих процессов: ИТ-команды поднимают локальные модели, разработчики подключают AI-агентов к IDE, внутренние продукты используют LLM в своей логике. Вопрос уже не в том, нужны ли они бизнесу, а в том, как дать доступ, сохранив контроль, аудит и безопасность. Отсюда рождается новый класс решений — LLM Gateway и AI Firewall: управляемый слой между пользователями и моделями. Четыре ключевые боли: — Данные: в запросы попадают ФИО, паспорта, ИНН, договоры — и уходят в облако вопреки 152-ФЗ. — Поведение модели: токсичный контент, запрещённые инструкции, ответы не по назначению. — Prompt injection: злоумышленник прячет инструкцию во внешнем PDF или письме, и агент её выполняет. — Нет единой точки управления: непонятно, кто, в какую модель и сколько токенов отправил. Пример подхода — StarGuard AI работает как reverse proxy для LLM: централизует доступ, маскирует чувствительные данные и сохраняет доказательную базу по событиям. Подробнее на Хабре. 😐 — знакомая боль 🤔 — надо внедрять @ai_for_dev