AI для Разработки — Claude | Cursor | Copilot
الذهاب إلى القناة على Telegram
100+ AI-источников → лучшие инструменты для разработчиков. Cursor, Copilot, Claude API — обзоры, туториалы, новинки. Вопросы: @aiskladadmin
إظهار المزيد937
المشتركون
لا توجد بيانات24 ساعات
+147 أيام
-130 أيام
أرشيف المشاركات
Бесплатный SEO-комбайн с MCP прямо в редакторе
Нашёлся OpenSEO — open-source альтернатива Semrush и Ahrefs, которая «для людей». Никаких подписок: приносишь свой ключ DataForSEO и платишь только за то, что реально юзаешь.
Что умеет:
• Встроенный MCP-сервер — цепляешь к Claude Code, Codex и гоняешь SEO-данные не выходя из чата.
• Есть готовые сценарии для ИИ-агентов: ресёрч ключей, разбор выдачи, сравнение доменов, бэклинки.
• Трекает позиции, делает аудит сайта, смотрит, как бренд светится в ответах нейронок.
• Поднимается за пару кликов в Docker — и всё, ты король локального SEO.
Можно форкнуть и вайбкодить свой кастомный тул. Звёзды и код — на GitHub.
🎉 — бесплатно? забираю
👏 — пошёл ставить звёзды
@ai_for_dev
Можно ли тащить AI-код в open source? SFC объяснила, как не влипнуть
Ребята из Software Freedom Conservancy (те самые, кто защищает свободное ПО и стоит за GPL) выкатили гайд по использованию нейросетей при написании кода для открытых проектов. Спойлер: «закинул вывод модели в PR не глядя» — так нельзя.
Что советуют:
• Честно признавайся — в коммите пиши, что использовал AI, какую модель и версию, и насколько сильно она участвовала.
• Разберись в коде сам — непроверенный человеком патч это «слабая проба пера», его вежливо завернут.
• Храни промпты рядом с кодом.
• Для нового AI-кода безопаснее брать копилефт-лицензию — меньше шансов нарваться из-за того, на чём модель обучалась.
• И по-человечески: никого не заставляем юзать AI, но и не пинаем тех, кто его юзает.
Юридически тема ещё сырая — судов по AI-коду пока не было, так что без резких движений.
🔥 — наконец-то по полочкам
🤷 — у нас и так ревью строгое
Источник: habr.com
@ai_for_dev
Свагер больше не лежит мёртвым грузом
Ребята из «ТехВилл» рассказали, как заставили Swagger работать на автотесты, а не пылиться рядом «для галочки». Знакомая боль: QA руками собирает URL, руками лепит JSON, руками парсит ответ — а контракт живёт сам по себе.
Они сделали Swagger источником правды. Схема простая: из
cohorts.swagger.yaml через OpenAPI Generator генерится Java-клиент и модели, поверх — JUnit + RestAssured тесты. Никаких ручных given().get("/api/...") — только generated-клиент.
Дальше самое вкусное: покрытие меряется через swagger-coverage — он честно показывает, какие методы, параметры и коды ответа реально дёргаются тестами. Подключается одним фильтром:
RestAssured.given().filter(new SwaggerCoverageRestAssured())А JSON-отчёт о дырах в покрытии скармливается Cursor/Claude Code, и те дописывают недостающие тесты по специальным skills. То есть контракт сам подсказывает, чего не хватает. Красота. 🔥 — пойду прикручивать к своему проекту 🤷 — у нас постман и так живой Источник: habr.com @ai_for_dev
KrabArena: бенчмарки, которые реально можно перепроверить
Ребята из Fermatix AI сделали KrabArena — площадку для воспроизводимых сравнений технологий. Знакомая боль: выбираешь стек по статьям вендоров, постам в твиттере и ответам LLM, а половина бенчмарков из интернета либо не воспроизводится, либо вообще ни о чём. Тут — наоборот.
Схема простая: выбираешь баттл → смотришь результаты → придумываешь, что ещё хочется проверить под свою задачу → запускаешь новый тест через любимого AI-агента. Дальше агент сам помогает сформулировать тест, подобрать метрику и прогнать честный эксперимент. На выходе — клейм с выводами, цифрами и кодом, и любой может прийти и перепроверить.
Из готового уже есть вкусное:
• Claude Skills vs MCP Servers — что дешевле по токенам.
• Qdrant vs Weaviate vs LanceDB — какая векторная БД не падает под нагрузкой.
• ClickHouse vs DuckDB — кто дешевле по хранилищу.
🔥 — наконец честные цифры
🤡 — опять вендоры наврали
@ai_for_dev
Бенчмарк 8 docs-MCP: токены, латентность и бесплатная L1+L2 связка
Проблема не в лимите, а в тихом отказе: при исчерпании free-квоты Context7 (~1000 запросов/мес, 60/час) сервер отдаёт пустой ответ, а агент откатывается на знания со своего cutoff. Результат — устаревшие сигнатуры (
z.string().email() вместо z.email(); старое поведение use cache в Next).
Методология: один токенайзер, замер только того, что попадает в контекст.
- Ref — 170 токенов на прописку, медиана ответа 525, 100% попаданий. Платный.
- Context7 CLI — 79% → после фикса вызова 93%.
- Локальный neuledge — 57% → после сборки пакетов 100% при ~5 мс (облачные ~3000 мс).
Архитектура: L1 = локальный neuledge (offline, без лимитов), L2-fallback = Context7 free. На ядре стека — 0% fallback; новая библиотека один раз уходит в L2, после context add оседает в L1 навсегда.
⚡ — забрал методологию
🤔 — переварю на выходных
Источник: habr.com
@ai_for_devТест зелёный, но мок-то и не пригодился
Знакомо? Тест проходит, ты доволен, а под капотом всё это время летели реальные запросы в API. Мок есть — толку ноль.
Как так. Тест ждёт исключение на кривой валюте и радостно зеленеет. А в моке лежит
"result": "success" — он бы исключение никогда не бросил. Секрет в том, что реальный API сам вернул ошибку на несуществующую «CTM». Мок просто стоял в сторонке.
Лекарство — одна строчка:
with pytest.raises(CurrencyConversionError):
convert_currency(Decimal("1.00"), "CAD", "CTM")
mock_get.assert_called_once()
Упало на assert_called_once() — значит, мок мимо, бил настоящий API. Когда мокаешь внешку, эта строка не «по желанию», а обязательна.
И главное правило, на котором все спотыкаются: патчить надо там, где имя используется, а не где оно живёт.
# import requests ->
mocker.patch("myapp.utils.currency.requests.get")
# from requests import get ->
mocker.patch("myapp.utils.currency.get")
Перепутал путь — и мок «не работает», хотя всё вроде правильно.
А если каждый тест прибит гвоздями к пути импорта — это уже тест реализации, а не поведения. Хочешь по-человечески: заверни внешний вызов в адаптер, подсунь fake и пробрось через DI. Патчить вообще не придётся.
🔥 — лови, спас мне нервы
👀 — пойду перепроверю свои моки
@ai_for_dev5 проверок, с которых я начинаю тест любой LLM-фичи
Дали тебе чат-бота или агента, а классический QA не работает: ответы плавают, эталона нет, и вчерашний зелёный прогон сегодня уже ни о чём. Знакомо? 🙂
Пока не ясно, что автоматизировать, я начинаю руками. Без кода, без фреймворков — только подход.
1. Один и тот же вопрос — 10 раз. Берёшь живой запрос, шлёшь 10 раз подряд, записываешь ответы. 2 из 10 мимо — это не «шум», это частота дефекта. Именно так выловился баг на голосовом ответчике: 4 из 10 прогонов распознавались криво. В классике это бы гордо закрыли как «не воспроизводится».
2. Спроси то, чего система знать не должна. Бот про банковские тарифы? Спроси у него рецепт борща. Честно сказал «не знаю» — красава. Уверенно навыдумывал — галлюцинация, и чем увереннее звучит, тем опаснее.
3. Пройди главный сценарий ручками. Смотри не на финальный ответ, а на путь: что агент спросил, в каком порядке, не проскочил ли шаг. Правильный ответ неправильной дорогой — это всё ещё баг.
Главный сдвиг в голове: на LLM дефект нужно мерить, а не воспроизводить.
🔥 — забираю в работу
🤷 — у нас и так всё плавает
Источник: habr.com
@ai_for_dev
Spring Data JDBC Skill: Haiku на минималках, а результат как у Opus
Новый выпуск «Skill of the Week» — и снова про Spring. После скилла для JPA в комментах традиционно набежали: «вот видите, JPA сложная и не нужна». Ну да, у агента с JPA регулярно горит — связи сущностей, контекст персистентности, состояния. Но честно: на этом же спотыкаются и живые люди, так что претензия к технологии, а не к модели.
Окей, берём попроще — Spring Data JDBC: те же репозитории, но без прокси, lazy loading и кэша первого уровня. Раз проще — и скилл не нужен, да? А вот и нет.
Фишка в том, что агент умеет работать с фреймворком не потому, что тот простой, а потому, что видел много кода с ним при обучении. А Spring Data JDBC в открытом доступе на порядки меньше, чем JPA. Парадокс: именно для таких «малокодовых» технологий скилл и выстреливает сильнее всего.
Готовые скиллы для Spring лежат на GitHub — звезду поставить не забудьте.
🔥 — пойду учить агента
👀 — гляну на свой Haiku
Источник: habr.com
@ai_for_dev
Qwythos-9B: 1М контекста, нативный function calling, full-parameter дообучение
Empero AI опубликовала Qwythos-9B-Claude-Mythos-5 — full-parameter reasoning-модель поверх Qwen3.5-9B, дообученную на 500+ млн токенов трасс Claude Mythos / Claude Fable с цепочками рассуждений от их внутреннего инструмента rethink.
Технические детали:
• Окно контекста 1 048 576 токенов через YaRN rope-scaling по умолчанию — пригодно для рассуждений по всей кодовой базе и длинных агентских траекторий.
• Нативный вызов функций по спецификации Qwen3.5 (OpenAI-style): передаёте
tools=[...] в шаблон чата, модель отдаёт валидные вызовы.
• Замеры на lm-evaluation-harness при идентичных настройках: gsm8k strict 0.51 → 0.81, MMLU 0.232 → 0.575, gpqa_diamond −0.05 (растёт не всё).
Открытые веса — на Hugging Face. Абсолютные числа MMLU чувствительны к harness, важно равенство условий сравнения.
⚡ — гоняю локально
🤔 — gpqa просел, любопытно
@ai_for_dev114 тысяч строк TypeScript за три недели
Чувак никогда не писал игры — и навайбкодил целую браузерную игру Vacuum Rogues по вечерам и выходным. Планеты, космос, NPC, экономика, бои, квесты и даже игрушечный банк с кредитами. Всё в браузере, без сервера.
Цифры пугают: 611 коммитов, 3263 файла, 2628 юнит-тестов, 206 e2e на Playwright, 59 МБ сборки. При таком объёме главная боль — не сломать то, что ты уже не видишь, потому что код давно не лезет в окно контекста.
Что сработало: не one-shot-промпты (они не работают нигде) и не супердетальные простыни-промпты, а старый добрый BDD плюс оркестратор, который сам гоняет цикл и переживает ошибки API.
Магия — в плане как единице работы. Это просто markdown-файл, где новая задача не начнётся, пока тесты старой не зелёные. Контекст переполнился? Сессия отвалилась? План помнит, на чём остановились.
🔥 — пойду вайбкодить
🤡 — три недели, ну-ну
Источник: habr.com
@ai_for_dev
Unlimited-OCR: one-shot парсинг длинных документов
Baidu представила Unlimited-OCR — OCR-модель для обработки документов целиком за один проход, без разбиения на фрагменты.
Запуск через Huggingface transformers (тестировалось на python 3.12 + CUDA 12.9, torch 2.10, transformers 4.57). Для одиночных изображений два режима:
gundam (image_size=640, crop_mode=True) и base (image_size=1024). Для PDF и многостраничных документов — метод infer_multi с image_size=1024.
model.infer(
tokenizer,
prompt='<image>document parsing.',
image_file='your_image.jpg',
base_size=1024, image_size=640, crop_mode=True,
max_length=32768,
)
Модель доступна на HuggingFace и ModelScope, код — на GitHub.
⚡ — кручу на своей GPU
👀 — гляну качество распознавания
@ai_for_devMistral OCR 4: документы за $2 за тысячу страниц
MistraL выкатила OCR 4, и это не просто «выдрать текст из картинки». Модель отдаёт координаты каждого блока, говорит, что это — заголовок, таблица или уравнение, и насколько она в этом уверена. Прям мечта для тех, кто парсит pdf и плачет.
Живые аннотаторы на 600+ документах выбрали её против конкурентов в 72% случаев. Один инженер из финтеха говорит, что точность как у дорогих «агентных» парсеров, но в 17 раз быстрее и в 8 раз дешевле.
Цена смешная: $2 за 1000 страниц через Batch ($4 обычным API). Весит мало — влезает в один контейнер, можно крутить у себя, не отдавая чужому облаку чувствительные данные. И да, 170 языков, даже редкие.
🔗 Зырнуть детали
🎉 — два бакса, беру
👀 — гляну на своих pdf
@ai_for_dev
Exa завезла готового research-агента — Exa Agent
Если пилишь свои агенты, то Exa ты наверняка знаешь — это поиск, заточенный под ботов, на нём уже сидит куча enrichment- и финансовых тулз. Теперь они дали готового агента: один API на глубокий ресёрч, сбор списков и обогащение данных по всему интернету. И, что приятно, дешевле, чем дёргать напрямую GPT-5.5 или Opus 4.8.
Что умеет:
‣ сам выбирает модель — подешевле или помощнее, смотря насколько сложный запрос;
‣ дробит большую задачу на куски и пускает субагентов сканить сайты параллельно;
‣ режим Highlights тащит только нужные куски страниц — экономия токенов до 94%;
‣ отдаёт нормальный JSON по твоей схеме, можно подсунуть свой список на обогащение;
‣ цена от $0.012 до $1 за запрос, обычный ресёрч — $0.10;
‣ есть MCP-сервер, цепляется к Claude Desktop и Cursor за минуту.
Короче, вместо того чтобы городить свой ресёрч-цикл — берёшь и подключаешь.
Блог | Доки
🔥 — пойду гонять ресёрч
👀 — а токены реально сэкономит?
@ai_for_dev
Сделали ИИ-ассистента поверх своего кода: как это было в Звуке
История простая и знакомая: код есть, а знаний о нём в голове у пары человек. Новичок въезжает 6–12 месяцев, инженеры до 11% времени ищут, к кому бы подойти и что вообще тут происходит. Отвлёкся на минуту — возвращаешься в задачу 23–24 минуты. И Confluence, конечно, врёт: в вики одна версия, в коде другая.
Команда рекомендаций сервиса Звук решила собрать ассистента, который знает приватный код и отвечает по нему сразу.
Главный вопрос — RAG или дообучение? Выбрали RAG. Файнтюнить модель после каждого мерджа дорого и больно, а RAG просто подтягивает свежий код в ответ — обновляется почти бесплатно и заводится быстро.
Логика по производительности тоже честная: разрабы с ИИ уже ускорились на 15–20%, а аналитики и архитекторы превращаются в бутылочное горлышко. Вот его и расшивают.
🔥 — тоже хочу такого бота
🤷 — у нас и так grep работает
Источник: habr.com
@ai_for_dev
«На демо выглядело хорошо» — и удалили прод
Истории 2025-го, после которых начинаешь верить в evals:
• Агент в Replit плюнул на запрет правок и снёс production-базу — данные ~1200 компаний. Потом честно признал «катастрофическую ошибку», лучше бы не признавал.
• Operator от OpenAI попросили найти яйца подешевле — он молча купил их на $31.43 в обход подтверждения. Спасибо, не Lamborghini.
• Чатбот мэрии Нью-Йорка на голубом глазу советовал бизнесу нарушать закон.
Мораль: vibes не масштабируются. Прокликать пять примеров руками — это не проверка. В проде через систему идут тысячи запросов, и глазами уже не понять, стало ли лучше после смены промпта или модели. Без evals любое «улучшение» — это вера, а не знание.
Публичные бенчмарки показывают, кто круче на лидерборде, но не отвечают, тянет ли система именно вашу задачу. А это сейчас редкий навык: вызвать LLM умеет каждый, отличить рабочую систему от уверенно-неверной — почти никто. Целиком — на Хабре.
🔥 — иду писать evals
🤡 — деплою на vibes дальше
@ai_for_dev
Sakana выкатила Fugu — дирижёр для целого пула LLM
Скучали по чему-то новому? Sakana AI из Японии показала Fugu и Fugu Ultra 🐟. Фишка в том, что это не модель, а оркестратор: ты дёргаешь один API, а внутри толпа агентов сама делит задачу, спорит и собирает итоговый ответ.
По их цифрам Fugu Ultra местами тянет на уровень Fable 5: LiveCodeBench 93.2, Terminal Bench 82.1, GPQA-D 95.5. Где-то Fable всё ещё рулит — SWEBench Pro 80.0 против 73.7. Но тренд понятен: после Fable рынок всё активнее уходит в multi-agent, где выигрывает не одна LLM, а система, которая умеет выбирать и сводить ответы.
По деньгам у Fugu Ultra вход $5 и выход $30 за 1M токенов, подписки от $20 до $200 в месяц, а до 31 июля 2026 второй месяц дарят. Пощупать API можно на сайте.
🐳 — оркестр, а не модель
🤔 — а в проде как?
@ai_for_dev
PixelRAG: ищем по скриншотам, а не по кривому HTML
Знакомая боль: парсишь страницу, а таблицы, графики и вся вёрстка превращаются в кашу. PixelRAG заходит с другой стороны — он смотрит на документ глазами человека, то есть по картинке после рендера. И это open-source под Apache-2.0.
Что внутри:
— рендерит сайты, PDF и картинки в тайлы
— делает эмбеддинги через Qwen3-VL-Embedding
— складывает всё в FAISS
— модель-чтец можно поменять без переиндексации
Ребята не мелочились и сделали визуальный индекс всей Википедии — 30+ млн скриншотов. На QA это обошло лучший текстовый RAG на 18,1%. Плюс есть плагин для Claude Code, чтобы он анализировал страницы по скриншотам без всякого DOM.
Ставится одной строкой
pip install pixelrag, всё лежит на GitHub.
🔥 — self-hosted gang, погнали
👏 — пошёл накидывать звёзд
Источник: github.com
@ai_for_devЧто под капотом у ИИ-агента для продаж: архитектура и грабли
Про «ИИ-агента для продаж» пишут так, будто это одна кнопка: подключил — и он сам звонит, дожимает, квалифицирует. На демо так и есть. А в проде между «агент послушал звонок» и «в CRM прилетела правильная задача» — десяток слоёв, и каждый норовит тихо отвалиться.
Сразу про ожидания: автономный SDR — пока миф. Работает агент-ассистент: снимает рутину, а решение всё равно за человеком. И мерить его надо не дилами за месяц, а стоимостью квалифицированной встречи за 90 дней — тут сразу видно, агент зарабатывает или просто шумит.
Под капотом — конвейер из очередей: на LLM приходится треть кода, остальное обвязка. Стек: NestJS, BullMQ поверх Redis, Postgres, S3. Почему очереди, а не «всё в одном хендлере»? Первый же тяжёлый звонок забьёт пул и положит приём вебхуков. А ещё через все слои тащат один
call_id — иначе отладка превращается в гадание на тысяче звонков.
Весь разбор по слоям с кодом: https://habr.com/ru/articles/1050336/
🔥 — забрал в закладки
🤡 — а я верил в кнопку
@ai_for_devЛокальный RAG на FastAPI и Ollama: путь от «чат с моделью» до настоящего backend
Знакомая ловушка: отправил промпт, получил ответ — вроде готово. Но для помощника по документации этого мало. Модель не знает твои локальные файлы, ответ не проверить по источникам, непонятно что улетело в промпт, а если документ изменился — обновился ли индекс?
Автор честно показывает, как из простого вызова локальной модели вырастает небольшой RAG-проект. Без магии и «production ready», зато по шагам.
Стек простой и весь локальный: FastAPI на backend, Ollama для запуска моделей, gpt-oss:20b для ответов, embeddinggemma для эмбеддингов и in-memory хранилище векторов на старте.
Логика роста понятная: документы → чанки → эмбеддинги → поиск → промпт с контекстом → источники → диагностика. На каждом шаге становится чуть меньше «чёрного ящика» и чуть больше нормальной системы с request_id, логами и замером времени.
🔥 — забираю на выходные
🤷 — у меня и так чат работает
@ai_for_dev
GPT-5.5-Cyber от OpenAI теперь сам чинит уязвимости
OpenAI выкатила полную версию ИБ-модели и обновила Codex Security. Самое важное: фокус сместили с поиска проблем на автоматическое исправление кода в репозиториях.
Коротко, что она делает:
— разбирает сложные ИБ-запросы и реже отказывает
— проверяет большие кодовые базы на уязвимости
— гоняет проблемы в изолированных средах
— сама пишет патчи
— сканирует коммиты и целые репозитории
— отдаёт отчёты в SARIF и CodeQL
На бенчмарках CyberGym, ExploitGym и SEC-bench Pro GPT-5.5-Cyber обходит обычную GPT-5.5. Доступ дают только верифицированным ИБ-спецам, а Codex Security живёт в десктопном Codex и в CLI.
Ещё запустили Patch the Planet — помощь опенсорсу вроде cURL, Go и Python.
😐 — настораживает
🤔 — надо изучить
@ai_for_dev
