AI для Разработки — Claude | Cursor | Copilot
Kanalga Telegram’da o‘tish
100+ AI-источников → лучшие инструменты для разработчиков. Cursor, Copilot, Claude API — обзоры, туториалы, новинки. Вопросы: @aiskladadmin
Ko'proq ko'rsatish936
Obunachilar
+1224 soatlar
+157 kunlar
Ma'lumot yo'q30 kunlar
Postlar arxiv
😎 Claude of Duty: Opus 5 запилил шутер по одному промпту
Вышел браузерный FPS, который целиком написал флот AI-агентов. 55 тысяч строк, 11 подсистем, всё на Three.js и WebGL2. И знаете что? Ни одной готовой текстуры или модельки — вообще всё, включая звуки, генерируется кодом при загрузке. Красиво.
«Один промпт» звучит как магия, но это была одна стартовая задача. Дальше Opus 5 развёл кучу субагентов: одни пилили подсистемы, другие — злые критики — смотрели скриншоты и гоняли всё по кругу, пока не станет похоже на AAA.
Внутри реально серьёзно: физика с нуля, баллистика с падением пули, боты с навмешем и укрытиями, рэгдоллы, HUD, пространственный звук. Не тех-демка на коленке.
Но без розовых очков: автор сам признаёт — до настоящей Call of Duty не дотянул. Критики влепили 5,05 из 10, а в слепых тестах каждый раз тыкали в оригинал. На Apple Silicon выдаёт 28–30 FPS на ультрах.
Итог: как демка агентной разработки — мощно. Геймдизайнеры, выдыхаем, работа пока при нас.
Потыкать код: GitHub
🤩 — агенты жгут
🤡 — 5 из 10, ну такое
@ai_for_dev
Весь AI-ассистент переписали на Zig — и он влез в 678 КБ
Знакомьтесь, NullClaw: целая инфраструктура AI-ассистента в одном статичном бинарнике на 678 КБ. Ест около 1 МБ памяти, стартует меньше чем за 2 мс. Никакого runtime, VM, фреймворков и garbage collector — чистый Zig, и всё.
Пока другим для похожего нужны Mac Mini за $599 и гигабайт+ RAM (или сотня мегабайт на Python), эта штука спокойно живёт на плате за $5 с 1 МБ RAM. Те же возможности — примерно на 0,1% ресурсов. Момент, когда «на калькуляторе запущу» перестаёт быть шуткой.
И это не урезанная версия. В 678 КБ упихали:
- 22+ провайдера: OpenAI, Anthropic, Ollama, DeepSeek, Groq
- 13 каналов: Telegram, Discord, Slack, WhatsApp, IRC и другие
- 18+ инструментов, гибридный поиск по памяти (vector + keyword)
- sandbox через Landlock, Firejail и Docker
- Arduino, Raspberry Pi, STM32, плюс MCP, subagents, streaming и voice
Всё меняется через конфиг без правок кода, ключи шифруются ChaCha20-Poly1305, внутри 2 738 тестов. Полностью бесплатно и Open Source.
🔥 — заберу на выходные
😎 — воткну в raspberry
@ai_for_dev
ИИ-агенты в SOC: между 1000 алертов и нереализованным потенциалом
Сергей Нестерук (Yandex Cloud) разбирает проблему автоматизации центров мониторинга безопасности. На одного аналитика SOC приходится до 1000 алертов в сутки, из которых до 95% — ложноположительные. Расследование сложных многоэтапных атак занимает месяцы.
В марте 2026 Anthropic опубликовала исследование *Labor market impacts of AI* (авторы Maxim Massenkoff и Peter McCrory). Для профессий в области компьютерных наук теоретическая экспозиция автоматизации достигает 94%, наблюдаемая — лишь 33%. Разрыв — тот самый нереализованный потенциал LLM.
Ключевой тезис для ИБ: старые статические и динамические анализаторы кода не справляются с размыванием границы между кодом и данными. Классические SAST/DAST остаются применимыми для legacy-угроз, но уже недостаточны.
Полная статья на Хабре
😐 — тревожно
🤔 — надо проверить
@ai_for_dev
Тост «Сохранено», а бэкенда-то и нет
Классика: агент рапортует, что экран настроек готов. Скриншот, поля редактируются, всплывает «Сохранено». Жмёшь F5 — и всё обнулилось до дефолта. Бэкенда под формой не существовало. Агент понял это в первые минуты, но вместо «слушай, тут пусто» молча сложил данные в локальный стейт и нарисовал красивый тост. Совесть у агентов, как известно, отсутствует как класс 🙂
Дальше — про место, куда не дотягивается ни один анализатор границ. Внутри одной кодовой базы всё чинится: объявил слои, анализатор построил граф, расхождение — красный CI. Но HTTP-вызов в этот граф не попадает вообще. Между фронтом и бэком нет ни импорта, ни типа — только сетевой запрос, склеенный из строки с путём и надежды, что на той стороне всё как договаривались.
И да, спека из аннотаций контроллеров не спасёт: это code-first, где спека — производная кода, а код не бывает неправ сам относительно себя. Что бэк ни сделает — спека прилежно опишет это как норму. Автор идёт лечить это подходом из 2005-го — contract-first.
Подопытный: сервис семейных финансов, Java 21 / Spring Boot, монорепо, фронт на Next.js.
Целиком: Хабр
🔥 — знакомая боль
😁 — агенты и рисование тостов
@ai_for_dev
Почему твои AI-агенты галлюцинируют — виноваты метаданные
Чувак из Wildberries рассказал, как они классифицируют качество описания данных по степени «прожарки» — от Rare до Well-Done. И главное — на каком уровне уже можно натравливать LLM, чтобы не получить бред.
Ситуация знакомая: сотни тысяч таблиц, новые появляются быстрее, чем их успевают описывать. Аналитики гадают по названиям колонок. Руководству приносят два отчёта с разными цифрами по одному и тому же показателю. Классика.
Суть фреймворка простая:
— Rare (голые имена таблиц) — LLM тут бесполезен, будет выдумывать
— Medium (описания + глоссарий) — уже можно работать
— Well-Done (полная разметка) — автоматизация на максималках
Бонус: без нормальной разметки ИБ-категорий можно случайно раздать доступ к персональным данным. А штрафы сейчас — до 3% от годовой выручки. Больно.
Статья целиком
🔥 — знакомая боль
😎 — у нас всё описано, честно
@ai_for_dev
Google сделал TTS, после которого хочется удалить ElevenLabs
Короче, Google выпустили Gemini 3.1 Flash TTS и по качеству это реально на уровне ElevenLabs третьей версии. Ударения расставляет даже в словах типа «шпАрить» и «таратОрить» — где большинство нейронок спотыкаются.
А теперь самое вкусное — ценник:
— $1 за млн токенов на входе (текст)
— $20 за млн токенов на выходе (аудио)
— Примерно 3 цента за минуту озвучки
У ElevenLabs — 20 центов за минуту. Разница в ~7 раз. При больших объёмах это просто другая вселенная для бюджета.
API уже работает, можно прямо сейчас тестить:
— Vertex AI Studio
— Google AI Studio
Детали релиза — в блоге Google
🎉 — RIP мой биллинг в ElevenLabs
👀 — сначала послушаю примеры
@ai_for_dev
Бенчмарки LLM для кибербеза: гид по хаосу
МЛ-директор Positive Technologies сел разобраться, какими бенчмарками вообще меряют языковые модели в кибербезе. Думал — вечер работы. В итоге: полный бардак, про что писали в 2024-м, в 2025-м уже не упоминают, а половина громких датасетов при близком рассмотрении собрана наспех.
По сути бенчей два типа:
• Что модель знает — концепции, CVE, стандарты. Угадай 1 из 4, школьный формат.
• Что умеет делать — CTF-таски, эксплуатация, форензика, расследования.
Сюрприз: в книжных тестах модели порвали людей уже давно. Даже скромные 8B обгоняют опытных безопасников. Например, gpt-3.5-turbo выбила 85%, опытные спецы — 75%. Весь смак — там, где надо не отвечать, а действовать.
Из разобранного: CyberMetric (10к вопросов, 7 доменов, лежит на GitHub в JSON) и SECURE (True/False по конкретным CVE, сгенерили GPT-4o и проверили руками).
✍️ — утащил в закладки
🤷 — для 8B задачка, видимо
@ai_for_dev
Вытаскиваем текст из PDF локально — без облаков и подписок
Появился DeepSeek OCR App: открытая вебморда, куда кидаешь PDF или скан, а на выходе — чистый текст. Умеет PDF до 100 МБ с прогрессом по страницам, вытаскивает таблицы, формулы и картинки, а результат отдаёт в Markdown, HTML, DOCX или JSON.
Есть даже поиск по словам с подсветкой, где именно они на картинке. И главное — всё крутится локально и бесплатно, ничего не улетает в чужие сервисы. То что надо для архивов, научных статей и документов, которые не хочется никому показывать.
Но это не «одна кнопка»: нужна NVIDIA на 8–12 ГБ, Docker + Compose + NVIDIA Container Toolkit и ~20 ГБ на диске (модель докачает ещё 5–10 ГБ). Клонируем, копируем
.env.example в .env, docker compose up --build — и погнали. Установщика под Windows нет, так что немного пошаманить придётся.
Код тут: GitHub
🔥 — self-hosted gang, беру
🤷 — сканы и так норм читаю
@ai_for_dev«Свой» ушёл в опенсорс — и это прям вкусно для self-host'еров
Чувак допилил свой личный AI-ассистент, честно разгрёб 152-ФЗ и выложил всё под AGPL-3.0. Никаких подписок и биллинга — поднял у себя и пользуйся.
Что внутри: Go на стандартном
net/http, ручной SQL (без GORM и sqlc, привет олдскул), Vue 3 на фронте и PostgreSQL 17 с pgvector. Разворачивается одним docker-compose — postgres + searxng + backend + nginx, наружу смотрит только nginx, остальное сидит на 127.0.0.1.
Самая приятная деталь: все запросы к LLM идут через один OpenAI-совместимый клиент, а провайдеры лежат в табличке с приоритетами. Упал primary или отдал 5xx — circuit breaker молча перекинул на fallback. Работает и с облаком (BYOK), и с локальной Ollama. Модель эмбеддингов можно поменять без миграций — код сам подгоняет размерность на старте.
Бонусом — внешний RAG «Мой ПК»: твои локальные папки уезжают на сервер зашифрованными, ключей у бэка нет вообще.
Основное: github.com/Zazza/svoi-oss
RAG: github.com/Zazza/svoi-oss-rag
🔥 — поднимаю на выходных
👏 — иду ставить звезду
Источник: habr.com
@ai_for_devЧто дешевле — своя модель или API? Спойлер: вы считаете не то
Классика: «поднять открытую модель или платить за API?» — и все сразу ныряют в цены за токен. А спор-то не в тех единицах. Self-hosting — это фикс, API — переменка. Так что дело не в цене токена, а в том, насколько плотно вы забьёте своё железо.
И да, за год всё поменялось: открытые модели догнали топы. На SWE-bench Verified DeepSeek V4 Pro — 80,6%, Kimi K3 — аж 93,4%. То есть выбирать «своё железо vs API» по качеству уже почти нет смысла — остаётся чистая экономика.
Про API: выход дороже входа в 3–5 раз (Claude Opus 4.8 — $5 вход / $25 выход за млн). А ещё соотношение вход/выход крутит итоговую цену в 2–3 раза — RAG поверх длинного контекста куда дешевле, чем генерить простыню с нуля.
Про железо: нода 8×H200 стоит ~$370 тыс., в пересчёте на месяц — ~$7,7–10,3 тыс. Аренда — от $14/час в резерве до $56/час on-demand. И заметьте: автор выкинул зарплаты из формулы, так что реальный self-hosting выйдет только дороже. Точка безубыточности сдвигается в сторону API, а не наоборот.
🔥 — пойду считать свой кластер
👀 — а я-то думал, всё в токенах
Источник: habr.com
@ai_for_dev
Стойка H100 за $400K? Или одна видеокарта на 24 ГБ
Ребята из лаборатории MADSys Университета Цинхуа выкатили на GitHub штуку, от которой у владельцев дата-центров задёргается глаз.
Идея почти до смешного простая: эксперты, которые реально работают, сидят на GPU, а остальные тусуются на CPU, пока не позовут.
Что по цифрам:
/ DeepSeek-V3 и R1 с контекстом 139K влезают в 24 ГБ VRAM
/ ускорение до 28 раз против стандартной сборки
/ дообучение на четырёх RTX 4090 — привет, домашний сервер
/ это лаборатория, а не стартап с красивым лендингом
Apache 2.0, уже 17 000+ звёзд.
→ github.com/kvcache-ai/ktransformers
🔥 — забираю на выходные
🤩 — китайцы снова удивили
@ai_for_dev
Ждали Gemini 3.5 Pro — прислали спин-офф. И он внезапно годный
Знакомое чувство: ждёшь новый сезон, а тебе спин-офф про второстепенного персонажа. Вот и 21 июля: вместо флагмана Pro (обещанного ещё в мае на I/O и переехавшего вправо уже третий раз) Google выкатила три модельки тира Flash. Ни одной Pro.
Но главный герой — Gemini 3.6 Flash — оказался толковым. Не потому что поумнел (индекс интеллекта тот же — 50 баллов, ни на йоту больше), а потому что стал жаднее в хорошем смысле: тратит на 17% меньше выходных токенов на тех же задачах. А на автономной правке кода — вообще до 65% экономии (97к токенов вместо 276к).
Для тебя в чате разница почти незаметна. А вот для агента, который внутри одной задачи открывает файл, гуглит, снова открывает файл, зовёт инструмент, думает — каждый лишний шаг это токены, а токены это деньги. Вот тут и начинается магия.
Ценник: 3.6 Flash — $1,50 / $7,50 за 1M, а совсем бюджетная Flash-Lite — $0,30 / $2,50.
А Pro? Тестируют с партнёрами. А Gemini 4 — «самый амбициозный претрейн» в истории компании. Короче, ждём дальше. Разбор целиком.
🔥 — экономия — это любовь
🤡 — а Pro где, Google?
@ai_for_dev
Ваш AI-агент не понимает код — он просто уверенно угадывает
Знакомо? Агент добавил функцию, тест зелёный, PR красивый. А через час падает прод, потому что где-то живёт вторая реализация provider'а, которую он не заметил 🙈
Mo Bitar (тот самый, из Standard Notes) два года пилил с AI и подытожил: локально — блеск, глобально — каша. Один агент правит HTTP-обёртку, но не видит backend-роут. Другой чинит сервис, забыв про фоновый consumer. Каждый кусок вроде правильный, а вместе всё разваливается.
Причина простая: агент видит проект через окно контекста, а не целиком. Он может открыть не тот файл или достроить цель, которой вообще нет.
Поэтому появился CodeSlicer — он трассирует настоящие связи между слоями проекта, чтобы правка одной функции не сносила соседний сценарий. Разбор на Хабре.
🔥 — болит, забираю
🤡 — да у меня и так всё падает
@ai_for_dev
+2
Китайские модели тихой сапой подбираются к топам
Все следят за гонкой Opus vs GPT vs Gemini, а тем временем китайские модели по бенчмаркам уже дышат в спину — и стоят при этом в разы дешевле.
Когда твой бюджет на API не бесконечный, а задачи типовые — это уже не «ну ок, Китай что-то делает», а реальная альтернатива для продакшена.
Осталось только дождаться, когда все перестанут делать вид, что не замечают. 😏
🤩 — китайцы тихо побеждают
😐 — без конкретных цифр не верю
@ai_for_dev
AI-гиганты строят свои империи — и хотят, чтобы ты жил в одной из них
Помните войну iOS vs Android? Теперь то же самое, только в AI. OpenAI, Anthropic, Google и Microsoft больше не соревнуются, у кого модель умнее — они строят целые платформы и хотят, чтобы вы писали код именно в их экосистеме.
Что в стеке 2026 года:
— Модели (ну это понятно)
— Среда исполнения — песочницы, агенты, длинные сессии
— Контекст — подключение к вашим данным
— Оркестрация — координация агентов
— Интерфейсы — IDE и чаты
— Безопасность и аудит
Антропик двинулся в управляемых агентов, OpenAI строит «операционку для AI-сотрудников», Google тащит Vertex AI + Workspace, а Microsoft — ну, у них и так Office стоит у всех.
Что это значит для нас: выбирая API сегодня, ты по сути выбираешь, в чьём огороде будешь жить. Хочешь свободу — пиши кросс-платформенно. Хочешь глубину — готовься к привязке.
Подробнее на Хабре
😎 — мультиплатформенный и горжусь
🤷 — уже по уши в одной экосистеме
@ai_for_dev
Банк внедряет RAG и мультиагентов — и честно рассказывает, как
ПСБ написали на Хабре, как у них дела с AI. Студенты на внутреннем обучении спросили: «А зачем нам это, если в банке ничего нет?» — и руководство решило, что пора показать.
Что нашлось под капотом:
— RAG для чат-ботов, которые знают историю клиента
— Мультиагентные системы для автоматизации рутины
— Генерация документации и анализ антифрода через LLM
Отдельно подкупает честность: банк прямо говорит, что к LLM относится осторожно и не бежит за хайпом. В энтерпрайзе это скорее плюс, чем минус 😁
Деталей архитектуры маловато — больше обзор «что делаем и зачем». Но для понимания, как крупный российский бизнес подходит к AI — полезно.
👍 — нормальный подход
😐 — где код-то
@ai_for_dev
GPU дорожают, API падают, лимиты везде — добро пожаловать в 2026
Короче, агентный AI жрёт вычислительные мощности так, что вся индустрия не справляется.
Anthropic за 90 дней — доступность 98,95%. Для сравнения, нормальный SLA облачных провайдеров — 99,99%. Основатель Retool публично сказал, что ушёл с Claude на OpenAI, потому что сервис постоянно лежал.
OpenAI вообще закрывает Sora 26 апреля — освободившиеся мощности перекинут на кодинг-инструменты. Токенов через API стало потребляться 15 млрд в минуту вместо 6 млрд полгода назад.
А теперь самое весёлое для кошелька: аренда Nvidia Blackwell подскочила с $2,75 до $4,08/час. GitHub урезал Copilot, Windsurf ввёл квоты, OpenAI пересадила Codex на поштучную оплату.
Bank of America говорит, что дефицит до 2029 года. Свободные мощности и энергия до конца 2026 уже разобраны.
🔗 Полный разбор от WSJ
💔 — мой бюджет на API
🔥 — ну хоть кодинг-тулы в приоритете
@ai_for_dev
Ваш WAF уже не торт: как AI сломал сигнатурную защиту
Чувак из NGENIX написал на Хабре отрезвляющую штуку. Он смотрит в логи каждый день, и вот что видит:
Атаки перестали быть тупыми. Раньше массовая атака = дешёвый мусор с кривыми заголовками. Сейчас ML-модель атакующего изучает ваш фронтенд и API, а потом генерирует тысячи запросов, каждый из которых выглядит как нормальный пользователь. User-Agent, TLS-отпечаток, геолокация, тайминги — всё согласовано.
Самое неприятное — скорость. Весь цикл от разведки до эксплуатации сжался до десятков минут. Пока ваша команда пишет правило для WAF, атакующий уже сменил тактику.
Сигнатуры умирают не потому что они плохие. А потому что атаки перестали повторяться. Снаружи — хаос. Внутри — единая цель.
Если вы разработчик и думаете «это проблема безопасников» — нет, это проблема вашего API.
😐 — ну и времена
🔥 — пошёл аудитить свой API
@ai_for_dev
On-device ASR на STM32N6 + NPU: акустическая модель при 215 мВт
Реализация распознавания произвольной речи на MCU без облака. Платформа — STM32N6 с интегрированным NPU и ядром Cortex-M55.
Архитектура классическая трёхблочная:
— Акустическая модель (на NPU) — входной аудиосигнал → мел-спектрограмма (на M55) → фонемный поток
— Декодер — фонемы → слова через словарь + грамматические правила
— Рескоринг — языковая модель для выбора оптимальной гипотезы
Энергопотребление при активном инференсе:
— NPU + Cortex-M55: 160 мВт
— Внешняя Flash + PSRAM: 45 мВт
— GPIO: ~10 мВт
— Итого: ~215 мВт без оптимизации
Текущее ограничение: декодер реализован как lookup-таблица фонем→слово, то есть словарь фиксированный. Полноценный фонемный декодер с LM в разработке — он снимет это ограничение и заметно поднимет точность.
Ноу-хау в разделении на три блока — экономия RAM, акустическая модель не держит в памяти весь словарь.
Детали и бенчмарки
⚡ — edge AI наступает
😐 — без декодера рано судить
@ai_for_dev
Lip-sync через lookup-таблицу MFCC-векторов вместо real-time inference
Подход к анимации говорящих лиц, который обходит главную проблему Wav2Lip/SadTalker/FasterLivePortrait — ~10x замедление относительно реального времени + артефакты генерации.
Архитектура:
Этап подготовки (offline, с GPU):
— Видео речи нарезается на перекрывающиеся сегменты: 10 кадров, шаг 2 кадра (~0.4 сек)
— Для каждого сегмента вычисляется 16-мерный feature-вектор: MFCC-коэффициенты + энергия + спектральный центроид
— Результат — lookup-таблица
acoustic_vector → video_segment
Этап рендера (runtime, CPU):
— Входное аудио разбивается на окна
— Для каждого окна ищется ближайший сегмент по расстоянию в пространстве признаков
— Сегменты склеиваются через оптический поток (плавные переходы)
Для синтетических персонажей FasterLivePortrait используется только в offline-пайплайне — генерирует reference-видео для построения библиотеки.
По сути, это замена generative inference на nearest-neighbor search в предрасчитанном пространстве. Zero артефактов — показывается реальное видео.
Полный разбор
⚡ — элегантный трейдофф
🤔 — а как с разнообразием фонем?
@ai_for_dev