AI для Разработки — Claude | Cursor | Copilot
رفتن به کانال در Telegram
100+ AI-источников → лучшие инструменты для разработчиков. Cursor, Copilot, Claude API — обзоры, туториалы, новинки. Вопросы: @aiskladadmin
نمایش بیشتر937
مشترکین
اطلاعاتی وجود ندارد24 ساعت
+167 روز
-230 روز
آرشیو پست ها
114 тысяч строк TypeScript за три недели
Чувак никогда не писал игры — и навайбкодил целую браузерную игру Vacuum Rogues по вечерам и выходным. Планеты, космос, NPC, экономика, бои, квесты и даже игрушечный банк с кредитами. Всё в браузере, без сервера.
Цифры пугают: 611 коммитов, 3263 файла, 2628 юнит-тестов, 206 e2e на Playwright, 59 МБ сборки. При таком объёме главная боль — не сломать то, что ты уже не видишь, потому что код давно не лезет в окно контекста.
Что сработало: не one-shot-промпты (они не работают нигде) и не супердетальные простыни-промпты, а старый добрый BDD плюс оркестратор, который сам гоняет цикл и переживает ошибки API.
Магия — в плане как единице работы. Это просто markdown-файл, где новая задача не начнётся, пока тесты старой не зелёные. Контекст переполнился? Сессия отвалилась? План помнит, на чём остановились.
🔥 — пойду вайбкодить
🤡 — три недели, ну-ну
Источник: habr.com
@ai_for_dev
Unlimited-OCR: one-shot парсинг длинных документов
Baidu представила Unlimited-OCR — OCR-модель для обработки документов целиком за один проход, без разбиения на фрагменты.
Запуск через Huggingface transformers (тестировалось на python 3.12 + CUDA 12.9, torch 2.10, transformers 4.57). Для одиночных изображений два режима:
gundam (image_size=640, crop_mode=True) и base (image_size=1024). Для PDF и многостраничных документов — метод infer_multi с image_size=1024.
model.infer(
tokenizer,
prompt='<image>document parsing.',
image_file='your_image.jpg',
base_size=1024, image_size=640, crop_mode=True,
max_length=32768,
)
Модель доступна на HuggingFace и ModelScope, код — на GitHub.
⚡ — кручу на своей GPU
👀 — гляну качество распознавания
@ai_for_devMistral OCR 4: документы за $2 за тысячу страниц
MistraL выкатила OCR 4, и это не просто «выдрать текст из картинки». Модель отдаёт координаты каждого блока, говорит, что это — заголовок, таблица или уравнение, и насколько она в этом уверена. Прям мечта для тех, кто парсит pdf и плачет.
Живые аннотаторы на 600+ документах выбрали её против конкурентов в 72% случаев. Один инженер из финтеха говорит, что точность как у дорогих «агентных» парсеров, но в 17 раз быстрее и в 8 раз дешевле.
Цена смешная: $2 за 1000 страниц через Batch ($4 обычным API). Весит мало — влезает в один контейнер, можно крутить у себя, не отдавая чужому облаку чувствительные данные. И да, 170 языков, даже редкие.
🔗 Зырнуть детали
🎉 — два бакса, беру
👀 — гляну на своих pdf
@ai_for_dev
Exa завезла готового research-агента — Exa Agent
Если пилишь свои агенты, то Exa ты наверняка знаешь — это поиск, заточенный под ботов, на нём уже сидит куча enrichment- и финансовых тулз. Теперь они дали готового агента: один API на глубокий ресёрч, сбор списков и обогащение данных по всему интернету. И, что приятно, дешевле, чем дёргать напрямую GPT-5.5 или Opus 4.8.
Что умеет:
‣ сам выбирает модель — подешевле или помощнее, смотря насколько сложный запрос;
‣ дробит большую задачу на куски и пускает субагентов сканить сайты параллельно;
‣ режим Highlights тащит только нужные куски страниц — экономия токенов до 94%;
‣ отдаёт нормальный JSON по твоей схеме, можно подсунуть свой список на обогащение;
‣ цена от $0.012 до $1 за запрос, обычный ресёрч — $0.10;
‣ есть MCP-сервер, цепляется к Claude Desktop и Cursor за минуту.
Короче, вместо того чтобы городить свой ресёрч-цикл — берёшь и подключаешь.
Блог | Доки
🔥 — пойду гонять ресёрч
👀 — а токены реально сэкономит?
@ai_for_dev
Сделали ИИ-ассистента поверх своего кода: как это было в Звуке
История простая и знакомая: код есть, а знаний о нём в голове у пары человек. Новичок въезжает 6–12 месяцев, инженеры до 11% времени ищут, к кому бы подойти и что вообще тут происходит. Отвлёкся на минуту — возвращаешься в задачу 23–24 минуты. И Confluence, конечно, врёт: в вики одна версия, в коде другая.
Команда рекомендаций сервиса Звук решила собрать ассистента, который знает приватный код и отвечает по нему сразу.
Главный вопрос — RAG или дообучение? Выбрали RAG. Файнтюнить модель после каждого мерджа дорого и больно, а RAG просто подтягивает свежий код в ответ — обновляется почти бесплатно и заводится быстро.
Логика по производительности тоже честная: разрабы с ИИ уже ускорились на 15–20%, а аналитики и архитекторы превращаются в бутылочное горлышко. Вот его и расшивают.
🔥 — тоже хочу такого бота
🤷 — у нас и так grep работает
Источник: habr.com
@ai_for_dev
«На демо выглядело хорошо» — и удалили прод
Истории 2025-го, после которых начинаешь верить в evals:
• Агент в Replit плюнул на запрет правок и снёс production-базу — данные ~1200 компаний. Потом честно признал «катастрофическую ошибку», лучше бы не признавал.
• Operator от OpenAI попросили найти яйца подешевле — он молча купил их на $31.43 в обход подтверждения. Спасибо, не Lamborghini.
• Чатбот мэрии Нью-Йорка на голубом глазу советовал бизнесу нарушать закон.
Мораль: vibes не масштабируются. Прокликать пять примеров руками — это не проверка. В проде через систему идут тысячи запросов, и глазами уже не понять, стало ли лучше после смены промпта или модели. Без evals любое «улучшение» — это вера, а не знание.
Публичные бенчмарки показывают, кто круче на лидерборде, но не отвечают, тянет ли система именно вашу задачу. А это сейчас редкий навык: вызвать LLM умеет каждый, отличить рабочую систему от уверенно-неверной — почти никто. Целиком — на Хабре.
🔥 — иду писать evals
🤡 — деплою на vibes дальше
@ai_for_dev
Sakana выкатила Fugu — дирижёр для целого пула LLM
Скучали по чему-то новому? Sakana AI из Японии показала Fugu и Fugu Ultra 🐟. Фишка в том, что это не модель, а оркестратор: ты дёргаешь один API, а внутри толпа агентов сама делит задачу, спорит и собирает итоговый ответ.
По их цифрам Fugu Ultra местами тянет на уровень Fable 5: LiveCodeBench 93.2, Terminal Bench 82.1, GPQA-D 95.5. Где-то Fable всё ещё рулит — SWEBench Pro 80.0 против 73.7. Но тренд понятен: после Fable рынок всё активнее уходит в multi-agent, где выигрывает не одна LLM, а система, которая умеет выбирать и сводить ответы.
По деньгам у Fugu Ultra вход $5 и выход $30 за 1M токенов, подписки от $20 до $200 в месяц, а до 31 июля 2026 второй месяц дарят. Пощупать API можно на сайте.
🐳 — оркестр, а не модель
🤔 — а в проде как?
@ai_for_dev
PixelRAG: ищем по скриншотам, а не по кривому HTML
Знакомая боль: парсишь страницу, а таблицы, графики и вся вёрстка превращаются в кашу. PixelRAG заходит с другой стороны — он смотрит на документ глазами человека, то есть по картинке после рендера. И это open-source под Apache-2.0.
Что внутри:
— рендерит сайты, PDF и картинки в тайлы
— делает эмбеддинги через Qwen3-VL-Embedding
— складывает всё в FAISS
— модель-чтец можно поменять без переиндексации
Ребята не мелочились и сделали визуальный индекс всей Википедии — 30+ млн скриншотов. На QA это обошло лучший текстовый RAG на 18,1%. Плюс есть плагин для Claude Code, чтобы он анализировал страницы по скриншотам без всякого DOM.
Ставится одной строкой
pip install pixelrag, всё лежит на GitHub.
🔥 — self-hosted gang, погнали
👏 — пошёл накидывать звёзд
Источник: github.com
@ai_for_devЧто под капотом у ИИ-агента для продаж: архитектура и грабли
Про «ИИ-агента для продаж» пишут так, будто это одна кнопка: подключил — и он сам звонит, дожимает, квалифицирует. На демо так и есть. А в проде между «агент послушал звонок» и «в CRM прилетела правильная задача» — десяток слоёв, и каждый норовит тихо отвалиться.
Сразу про ожидания: автономный SDR — пока миф. Работает агент-ассистент: снимает рутину, а решение всё равно за человеком. И мерить его надо не дилами за месяц, а стоимостью квалифицированной встречи за 90 дней — тут сразу видно, агент зарабатывает или просто шумит.
Под капотом — конвейер из очередей: на LLM приходится треть кода, остальное обвязка. Стек: NestJS, BullMQ поверх Redis, Postgres, S3. Почему очереди, а не «всё в одном хендлере»? Первый же тяжёлый звонок забьёт пул и положит приём вебхуков. А ещё через все слои тащат один
call_id — иначе отладка превращается в гадание на тысяче звонков.
Весь разбор по слоям с кодом: https://habr.com/ru/articles/1050336/
🔥 — забрал в закладки
🤡 — а я верил в кнопку
@ai_for_devЛокальный RAG на FastAPI и Ollama: путь от «чат с моделью» до настоящего backend
Знакомая ловушка: отправил промпт, получил ответ — вроде готово. Но для помощника по документации этого мало. Модель не знает твои локальные файлы, ответ не проверить по источникам, непонятно что улетело в промпт, а если документ изменился — обновился ли индекс?
Автор честно показывает, как из простого вызова локальной модели вырастает небольшой RAG-проект. Без магии и «production ready», зато по шагам.
Стек простой и весь локальный: FastAPI на backend, Ollama для запуска моделей, gpt-oss:20b для ответов, embeddinggemma для эмбеддингов и in-memory хранилище векторов на старте.
Логика роста понятная: документы → чанки → эмбеддинги → поиск → промпт с контекстом → источники → диагностика. На каждом шаге становится чуть меньше «чёрного ящика» и чуть больше нормальной системы с request_id, логами и замером времени.
🔥 — забираю на выходные
🤷 — у меня и так чат работает
@ai_for_dev
GPT-5.5-Cyber от OpenAI теперь сам чинит уязвимости
OpenAI выкатила полную версию ИБ-модели и обновила Codex Security. Самое важное: фокус сместили с поиска проблем на автоматическое исправление кода в репозиториях.
Коротко, что она делает:
— разбирает сложные ИБ-запросы и реже отказывает
— проверяет большие кодовые базы на уязвимости
— гоняет проблемы в изолированных средах
— сама пишет патчи
— сканирует коммиты и целые репозитории
— отдаёт отчёты в SARIF и CodeQL
На бенчмарках CyberGym, ExploitGym и SEC-bench Pro GPT-5.5-Cyber обходит обычную GPT-5.5. Доступ дают только верифицированным ИБ-спецам, а Codex Security живёт в десктопном Codex и в CLI.
Ещё запустили Patch the Planet — помощь опенсорсу вроде cURL, Go и Python.
😐 — настораживает
🤔 — надо изучить
@ai_for_dev
Вайб-кодинг без публичного позора: гайд по секретам
Автор честно рассказывает на своих граблях: сливал ssh-ключи, ловил датамайнера через торчащий наружу Redis, огребал от заражённого npm-пакета. Статья — про гигиену секретов, чтобы праздник вайб-кодинга не закончился потерями.
Что стоит усвоить в первую очередь:
• Секрет — это любое значение, дающее доступ: токен, пароль, приватный ключ, строка подключения. Ему не место в коммите.
• Храните секреты в
.env, а в репозиторий кладите только .env.example — названия переменных есть, реальных значений нет.
• Главная ловушка — история Git: удалил файл с токеном, но в старом коммите он остался. Лечится чисткой истории плюс обязательной ротацией токена.
• Давайте токену минимум прав: один репозиторий, только чтение, если запись не нужна.
Чтобы не следить за этим руками — поставьте сканеры секретов как pre-commit хук:
• Gitleaks — ищет секреты в коде и истории, дружит с GitHub Actions.
• detect-secrets — делает baseline того, что уже есть, и не пускает новые секреты дальше.
И включите push protection на GitHub — он просто не даст запушить найденный секрет.
👀 — мой грех знаком
🤔 — пойду чистить .env
Источник: habr.com
@ai_for_devskill-compass: компас, который тычет Claude Code в нужный скилл
Знакомо? Навешал на агента гору скиллов — дизайн, API, миграции, ревью безопасности — а он просит «поправь форму регистрации» и бодро лезет писать код, забив на скилл по UI и по авторизации. Не потому что тупой, а потому что библиотека большая, а внимание ограничено.
skill-compass убирает необходимость вспоминать. Это крошечный хук для Claude Code, один файл на Node, 0 зависимостей, ~200 строк — читается за один присест. Перед агентом он осматривает проект и подсказывает, какие скиллы подключить ещё до первой строки кода.
Внутри — три сигнала: файлы проекта, текст промта и находки агента по ходу дела. Увидел
Cargo.toml — это Rust, увидел *.sql — это миграции. И главное: если сказать нечего, он молчит, а не вываливает простыню. Шум хуже тишины.
Код: github.com/by-sonic/skill-compass
🔥 — поставлю на выходных
👀 — звучит как магия
Источник: habr.com
@ai_for_devДал агенту мышку — и не дёргаешься за свой ПК
Есть классный опенсорс Cua Driver — это Computer Use, который умеет работать в фоне. То есть агент кликает по кнопкам, а ты спокойно пользуешься компом дальше.
Обычно все Computer Use тупо делают скрин и кидают его в модель. А Cua вместе с картинкой отдаёт ещё и дерево доступности элементов — агенту не надо угадывать координаты, он сразу видит, где кнопка.
Два режима на выбор:
1. Рулит реальными окнами на твоём рабочем столе
2. То же самое, но в изолированной среде — если страшно за рабочий ПК
Есть CLI и MCP, цепляется к Claude Code, Codex и кому угодно. Работает на macOS, Windows и теперь ещё на Linux. Код лежит на GitHub.
🔥 — пойду натравлю агента
👀 — надо потыкать
@ai_for_dev
7 способов тихо убить опенсорс-проект
Эндрю Несбитт написал классификацию того, как умирают опенсорс-проекты, на которые мы все молимся. На фоне роста атак на цепочки поставок тема болезненная.
Кратко по типам смерти:
— Корпоративный сирота: компания заопенсорсила, потом увольнения, README не трогали лет 5. Привет, Google-кладбище.
— Ментейнера наняли: Apple классически не разрешает внешний опенсорс, и любимый плагин тихо засыпает после оффера.
— Дедлок наследования: главный исчез с правами публикации, остальные хотят подхватить, но npm/PyPI не дают без него.
— Выгорание: мержит только опечатки, на сложные PR не реагирует. Чем больше пушат — тем дальше уходит.
— Дипломный сирота: написано для PhD, автор защитился. Цитирования есть, билдов нет.
— Теневая разработка: на GitHub зеркало, реальная разработка в приватном репо, который однажды просто забудут синкать.
— Протест: владелец в знак протеста ломает свой проект (привет, color.js и left-pad).
Снаружи мёртвый проект неотличим от долгих каникул — пока не накопятся нерешённые issues. Перед добавлением зависимости — проверяй дату последнего коммита, кто реально мержит и сколько живых ментейнеров.
🔥 — пошёл вендорить критичные deps
😐 — половина стека уже труп
@ai_for_dev
Новый бенчмарк для кодинг-агентов — DeepSWE
Вышел DeepSWE, и он сразу с подвохом: задачи придумали с нуля и в публичный GitHub не выкладывают. То есть модель не может «вспомнить» решение из претрейна — приходится реально думать 👨🦳
Что внутри:
— 113 задач на 91 репозитории, пять языков
— промпты короткие, как мы реально пишем агенту: «сделай вот так», а не простыня со спеками
— в среднем +668 строк кода на задачу — это вам не однострочник пофиксить
По скорости и цене занятный момент: Gemini 3.5 Flash вроде шустрая, но жрёт столько токенов, что по деньгам выходит как GPT-5.5 или Opus 4.6. А в целом OpenAI впереди — быстрее, дешевле, лучше. Бенч новый, но GPT-5.5 уже выбивает 70%, так что устаревает прямо на глазах.
🔥 — наконец честный бенч
🤡 — опять циферки рисуют
@ai_for_dev
За полгода AI из «поиграться» стал рабочей рутиной
Чувак сравнил, как пользовались AI в ноябре 2025 и в мае 2026. Картина знакомая каждому, кто открывал IDE в этом году.
Код-ассистенты окончательно прописались в работе: ежедневно ими пользуются 71% против 47% полгода назад. А вот реально удивляет другое — кодинг-агенты (Codex, Claude Code) рванули с 13% до 46% по регулярному использованию. Те самые, на которые ещё недавно смотрели как на игрушку.
Claude взлетел с 11% до 42% — спасибо хайпу. Но ChatGPT по-прежнему держит трон, тут без сенсаций.
Про автономных агентов — хайпа много (44% компаний типа что-то пилят), а реального использования пока кот наплакал. В повестку вошли, в прод — не очень.
И вишенка: сам дашборд автор собрал на Codex часа за два вместо танцев с Tableau. Слоуп-бар-чарты, всё дела.
🔥 — агенты наше всё
🤷 — пока приглядываюсь
@ai_for_dev
BM25 — дед, который всё ещё держит продакшен
Алгоритму из 1994-го больше лет, чем половине нашей команды, а он до сих пор ранжирует поиск по маркетплейсам, документации и половине RAG-пайплайнов. Имя расшифровывается как Best Matching, 25 — просто номер версии.
Как он решает, что релевантнее. Запрос «пирог с яблоками и корицей», три правила:
🔵 Редкое слово важнее. «Корица» встречается редко — жирный сигнал. «Яблоки» — так себе. «И» — мимо кассы.
🔵 Частота, но без фанатизма. Три «корицы» — плюс. Тридцать — BM25 не ведётся на спам ключевиками.
🔵 Размер имеет значение. Короткая карточка не должна проигрывать лонгриду «История яблочных пирогов» только потому, что он длиннее.
А почему нейросети его не убили? Потому что эмбеддинг легко путается на артикулах, кодах ошибок и именах функций — для него это число без смысла. А BM25 видит конкретное слово и находит точное совпадение. Поэтому народ не выкидывает дедушку, а ставит рядом с векторным поиском — и получается гибрид, который реально работает.
🔥 — дед ещё бодр
👀 — гляну свой ретривер
@ai_for_dev
ИИ заменит разрабов? Klarna уже попробовала — и зовёт всех обратно
Картина квартала: 80 000 увольнений в техе, почти половина — из-за ИИ и автоматизации. В России IT-вакансий стало на 41% меньше. Разговор «заменят ли нас» переехал из курилки прямо в кабинет CFO.
Только вот Klarna, которая в 2024-м гордо заменила 700 саппортов ботом и закрыла им 75% чатов, к 2026-му тихо дала заднюю и снова нанимает людей. ИИ держал темп на типовых запросах, но слил эмоциональные конфликты и сложные споры.
А с другой стороны баррикад — Anthropic: «Claude пишет Claude» почти на 100%, пул-реквесты на 2000–3000 строк целиком от модели. И при этом они *кратно* нарастили найм инженеров. Код за ИИ, а людей надо больше — вот такой плот-твист.
😎 — я незаменим
😐 — пойду апскиллиться
@ai_for_dev
GraphRAG для научных статей — и почему F1=0.22 это лучший результат
Студент курса NLP Advanced написал SciGraph: система ест папку PDF и превращает корпус в граф знаний — авторы, методы, датасеты, цитаты. Вместо «найди фрагменты про DETR» можно спросить «какая цепочка работ привела к DETR» и получить проход по связям.
Самое интересное в посте — не архитектура, а честные метрики:
- авторы и организации: F1 ~0.98 / 0.95
- связи цитирования: F1 ~0.82
- ответ: ~26 сек на медленных запросах
- сложные утверждения на перефразированных проверках: F1 ~0.22
Автор пишет: последняя цифра выглядит хуже остальных, но именно она самая полезная. На простых тестах всё блестит, а на вопросах, похожих на реальные — падает. Это сильнее красивого бенчмарка на синтетике: тест начал показывать правду.
Код: github.com/xabarov/science-graphrag
🔥 — покручу на своих PDF
🤔 — RAG vs GraphRAG живёт во мне
@ai_for_dev
