ar
Feedback
AI для Разработки — Claude | Cursor | Copilot

AI для Разработки — Claude | Cursor | Copilot

الذهاب إلى القناة على Telegram

100+ AI-источников → лучшие инструменты для разработчиков. Cursor, Copilot, Claude API — обзоры, туториалы, новинки. Вопросы: @aiskladadmin

إظهار المزيد
937
المشتركون
لا توجد بيانات24 ساعات
+147 أيام
-130 أيام
أرشيف المشاركات
Бесплатный SEO-комбайн с MCP прямо в редакторе Нашёлся OpenSEO — open-source альтернатива Semrush и Ahrefs, которая «для люде
Бесплатный SEO-комбайн с MCP прямо в редакторе Нашёлся OpenSEO — open-source альтернатива Semrush и Ahrefs, которая «для людей». Никаких подписок: приносишь свой ключ DataForSEO и платишь только за то, что реально юзаешь. Что умеет: • Встроенный MCP-сервер — цепляешь к Claude Code, Codex и гоняешь SEO-данные не выходя из чата. • Есть готовые сценарии для ИИ-агентов: ресёрч ключей, разбор выдачи, сравнение доменов, бэклинки. • Трекает позиции, делает аудит сайта, смотрит, как бренд светится в ответах нейронок. • Поднимается за пару кликов в Docker — и всё, ты король локального SEO. Можно форкнуть и вайбкодить свой кастомный тул. Звёзды и код — на GitHub. 🎉 — бесплатно? забираю 👏 — пошёл ставить звёзды @ai_for_dev

Можно ли тащить AI-код в open source? SFC объяснила, как не влипнуть Ребята из Software Freedom Conservancy (те самые, кто защищает свободное ПО и стоит за GPL) выкатили гайд по использованию нейросетей при написании кода для открытых проектов. Спойлер: «закинул вывод модели в PR не глядя» — так нельзя. Что советуют: • Честно признавайся — в коммите пиши, что использовал AI, какую модель и версию, и насколько сильно она участвовала. • Разберись в коде сам — непроверенный человеком патч это «слабая проба пера», его вежливо завернут. • Храни промпты рядом с кодом. • Для нового AI-кода безопаснее брать копилефт-лицензию — меньше шансов нарваться из-за того, на чём модель обучалась. • И по-человечески: никого не заставляем юзать AI, но и не пинаем тех, кто его юзает. Юридически тема ещё сырая — судов по AI-коду пока не было, так что без резких движений. 🔥 — наконец-то по полочкам 🤷 — у нас и так ревью строгое Источник: habr.com @ai_for_dev

Свагер больше не лежит мёртвым грузом Ребята из «ТехВилл» рассказали, как заставили Swagger работать на автотесты, а не пылиться рядом «для галочки». Знакомая боль: QA руками собирает URL, руками лепит JSON, руками парсит ответ — а контракт живёт сам по себе. Они сделали Swagger источником правды. Схема простая: из cohorts.swagger.yaml через OpenAPI Generator генерится Java-клиент и модели, поверх — JUnit + RestAssured тесты. Никаких ручных given().get("/api/...") — только generated-клиент. Дальше самое вкусное: покрытие меряется через swagger-coverage — он честно показывает, какие методы, параметры и коды ответа реально дёргаются тестами. Подключается одним фильтром:
RestAssured.given().filter(new SwaggerCoverageRestAssured())
А JSON-отчёт о дырах в покрытии скармливается Cursor/Claude Code, и те дописывают недостающие тесты по специальным skills. То есть контракт сам подсказывает, чего не хватает. Красота. 🔥 — пойду прикручивать к своему проекту 🤷 — у нас постман и так живой Источник: habr.com @ai_for_dev

KrabArena: бенчмарки, которые реально можно перепроверить Ребята из Fermatix AI сделали KrabArena — площадку для воспроизводимых сравнений технологий. Знакомая боль: выбираешь стек по статьям вендоров, постам в твиттере и ответам LLM, а половина бенчмарков из интернета либо не воспроизводится, либо вообще ни о чём. Тут — наоборот. Схема простая: выбираешь баттл → смотришь результаты → придумываешь, что ещё хочется проверить под свою задачу → запускаешь новый тест через любимого AI-агента. Дальше агент сам помогает сформулировать тест, подобрать метрику и прогнать честный эксперимент. На выходе — клейм с выводами, цифрами и кодом, и любой может прийти и перепроверить. Из готового уже есть вкусное: • Claude Skills vs MCP Servers — что дешевле по токенам. • Qdrant vs Weaviate vs LanceDB — какая векторная БД не падает под нагрузкой. • ClickHouse vs DuckDB — кто дешевле по хранилищу. 🔥 — наконец честные цифры 🤡 — опять вендоры наврали @ai_for_dev

Бенчмарк 8 docs-MCP: токены, латентность и бесплатная L1+L2 связка Проблема не в лимите, а в тихом отказе: при исчерпании free-квоты Context7 (~1000 запросов/мес, 60/час) сервер отдаёт пустой ответ, а агент откатывается на знания со своего cutoff. Результат — устаревшие сигнатуры (z.string().email() вместо z.email(); старое поведение use cache в Next). Методология: один токенайзер, замер только того, что попадает в контекст. - Ref — 170 токенов на прописку, медиана ответа 525, 100% попаданий. Платный. - Context7 CLI — 79% → после фикса вызова 93%. - Локальный neuledge — 57% → после сборки пакетов 100% при ~5 мс (облачные ~3000 мс). Архитектура: L1 = локальный neuledge (offline, без лимитов), L2-fallback = Context7 free. На ядре стека — 0% fallback; новая библиотека один раз уходит в L2, после context add оседает в L1 навсегда. ⚡ — забрал методологию 🤔 — переварю на выходных Источник: habr.com @ai_for_dev

Тест зелёный, но мок-то и не пригодился Знакомо? Тест проходит, ты доволен, а под капотом всё это время летели реальные запросы в API. Мок есть — толку ноль. Как так. Тест ждёт исключение на кривой валюте и радостно зеленеет. А в моке лежит "result": "success" — он бы исключение никогда не бросил. Секрет в том, что реальный API сам вернул ошибку на несуществующую «CTM». Мок просто стоял в сторонке. Лекарство — одна строчка:

with pytest.raises(CurrencyConversionError):
    convert_currency(Decimal("1.00"), "CAD", "CTM")

mock_get.assert_called_once()
Упало на assert_called_once() — значит, мок мимо, бил настоящий API. Когда мокаешь внешку, эта строка не «по желанию», а обязательна. И главное правило, на котором все спотыкаются: патчить надо там, где имя используется, а не где оно живёт.

# import requests  ->
mocker.patch("myapp.utils.currency.requests.get")

# from requests import get  ->
mocker.patch("myapp.utils.currency.get")
Перепутал путь — и мок «не работает», хотя всё вроде правильно. А если каждый тест прибит гвоздями к пути импорта — это уже тест реализации, а не поведения. Хочешь по-человечески: заверни внешний вызов в адаптер, подсунь fake и пробрось через DI. Патчить вообще не придётся. 🔥 — лови, спас мне нервы 👀 — пойду перепроверю свои моки @ai_for_dev

5 проверок, с которых я начинаю тест любой LLM-фичи Дали тебе чат-бота или агента, а классический QA не работает: ответы плавают, эталона нет, и вчерашний зелёный прогон сегодня уже ни о чём. Знакомо? 🙂 Пока не ясно, что автоматизировать, я начинаю руками. Без кода, без фреймворков — только подход. 1. Один и тот же вопрос — 10 раз. Берёшь живой запрос, шлёшь 10 раз подряд, записываешь ответы. 2 из 10 мимо — это не «шум», это частота дефекта. Именно так выловился баг на голосовом ответчике: 4 из 10 прогонов распознавались криво. В классике это бы гордо закрыли как «не воспроизводится». 2. Спроси то, чего система знать не должна. Бот про банковские тарифы? Спроси у него рецепт борща. Честно сказал «не знаю» — красава. Уверенно навыдумывал — галлюцинация, и чем увереннее звучит, тем опаснее. 3. Пройди главный сценарий ручками. Смотри не на финальный ответ, а на путь: что агент спросил, в каком порядке, не проскочил ли шаг. Правильный ответ неправильной дорогой — это всё ещё баг. Главный сдвиг в голове: на LLM дефект нужно мерить, а не воспроизводить. 🔥 — забираю в работу 🤷 — у нас и так всё плавает Источник: habr.com @ai_for_dev

Spring Data JDBC Skill: Haiku на минималках, а результат как у Opus Новый выпуск «Skill of the Week» — и снова про Spring. После скилла для JPA в комментах традиционно набежали: «вот видите, JPA сложная и не нужна». Ну да, у агента с JPA регулярно горит — связи сущностей, контекст персистентности, состояния. Но честно: на этом же спотыкаются и живые люди, так что претензия к технологии, а не к модели. Окей, берём попроще — Spring Data JDBC: те же репозитории, но без прокси, lazy loading и кэша первого уровня. Раз проще — и скилл не нужен, да? А вот и нет. Фишка в том, что агент умеет работать с фреймворком не потому, что тот простой, а потому, что видел много кода с ним при обучении. А Spring Data JDBC в открытом доступе на порядки меньше, чем JPA. Парадокс: именно для таких «малокодовых» технологий скилл и выстреливает сильнее всего. Готовые скиллы для Spring лежат на GitHub — звезду поставить не забудьте. 🔥 — пойду учить агента 👀 — гляну на свой Haiku Источник: habr.com @ai_for_dev

Qwythos-9B: 1М контекста, нативный function calling, full-parameter дообучение Empero AI опубликовала Qwythos-9B-Claude-Mytho
Qwythos-9B: 1М контекста, нативный function calling, full-parameter дообучение Empero AI опубликовала Qwythos-9B-Claude-Mythos-5 — full-parameter reasoning-модель поверх Qwen3.5-9B, дообученную на 500+ млн токенов трасс Claude Mythos / Claude Fable с цепочками рассуждений от их внутреннего инструмента rethink. Технические детали: • Окно контекста 1 048 576 токенов через YaRN rope-scaling по умолчанию — пригодно для рассуждений по всей кодовой базе и длинных агентских траекторий. • Нативный вызов функций по спецификации Qwen3.5 (OpenAI-style): передаёте tools=[...] в шаблон чата, модель отдаёт валидные вызовы. • Замеры на lm-evaluation-harness при идентичных настройках: gsm8k strict 0.51 → 0.81, MMLU 0.232 → 0.575, gpqa_diamond −0.05 (растёт не всё). Открытые веса — на Hugging Face. Абсолютные числа MMLU чувствительны к harness, важно равенство условий сравнения. ⚡ — гоняю локально 🤔 — gpqa просел, любопытно @ai_for_dev

114 тысяч строк TypeScript за три недели Чувак никогда не писал игры — и навайбкодил целую браузерную игру Vacuum Rogues по вечерам и выходным. Планеты, космос, NPC, экономика, бои, квесты и даже игрушечный банк с кредитами. Всё в браузере, без сервера. Цифры пугают: 611 коммитов, 3263 файла, 2628 юнит-тестов, 206 e2e на Playwright, 59 МБ сборки. При таком объёме главная боль — не сломать то, что ты уже не видишь, потому что код давно не лезет в окно контекста. Что сработало: не one-shot-промпты (они не работают нигде) и не супердетальные простыни-промпты, а старый добрый BDD плюс оркестратор, который сам гоняет цикл и переживает ошибки API. Магия — в плане как единице работы. Это просто markdown-файл, где новая задача не начнётся, пока тесты старой не зелёные. Контекст переполнился? Сессия отвалилась? План помнит, на чём остановились. 🔥 — пойду вайбкодить 🤡 — три недели, ну-ну Источник: habr.com @ai_for_dev

+1
Unlimited-OCR: one-shot парсинг длинных документов Baidu представила Unlimited-OCR — OCR-модель для обработки документов целиком за один проход, без разбиения на фрагменты. Запуск через Huggingface transformers (тестировалось на python 3.12 + CUDA 12.9, torch 2.10, transformers 4.57). Для одиночных изображений два режима: gundam (image_size=640, crop_mode=True) и base (image_size=1024). Для PDF и многостраничных документов — метод infer_multi с image_size=1024.

model.infer(
    tokenizer,
    prompt='<image>document parsing.',
    image_file='your_image.jpg',
    base_size=1024, image_size=640, crop_mode=True,
    max_length=32768,
)
Модель доступна на HuggingFace и ModelScope, код — на GitHub. ⚡ — кручу на своей GPU 👀 — гляну качество распознавания @ai_for_dev

Mistral OCR 4: документы за $2 за тысячу страниц MistraL выкатила OCR 4, и это не просто «выдрать текст из картинки». Модель
Mistral OCR 4: документы за $2 за тысячу страниц MistraL выкатила OCR 4, и это не просто «выдрать текст из картинки». Модель отдаёт координаты каждого блока, говорит, что это — заголовок, таблица или уравнение, и насколько она в этом уверена. Прям мечта для тех, кто парсит pdf и плачет. Живые аннотаторы на 600+ документах выбрали её против конкурентов в 72% случаев. Один инженер из финтеха говорит, что точность как у дорогих «агентных» парсеров, но в 17 раз быстрее и в 8 раз дешевле. Цена смешная: $2 за 1000 страниц через Batch ($4 обычным API). Весит мало — влезает в один контейнер, можно крутить у себя, не отдавая чужому облаку чувствительные данные. И да, 170 языков, даже редкие. 🔗 Зырнуть детали 🎉 — два бакса, беру 👀 — гляну на своих pdf @ai_for_dev

Exa завезла готового research-агента — Exa Agent Если пилишь свои агенты, то Exa ты наверняка знаешь — это поиск, заточенный под ботов, на нём уже сидит куча enrichment- и финансовых тулз. Теперь они дали готового агента: один API на глубокий ресёрч, сбор списков и обогащение данных по всему интернету. И, что приятно, дешевле, чем дёргать напрямую GPT-5.5 или Opus 4.8. Что умеет: ‣ сам выбирает модель — подешевле или помощнее, смотря насколько сложный запрос; ‣ дробит большую задачу на куски и пускает субагентов сканить сайты параллельно; ‣ режим Highlights тащит только нужные куски страниц — экономия токенов до 94%; ‣ отдаёт нормальный JSON по твоей схеме, можно подсунуть свой список на обогащение; ‣ цена от $0.012 до $1 за запрос, обычный ресёрч — $0.10; ‣ есть MCP-сервер, цепляется к Claude Desktop и Cursor за минуту. Короче, вместо того чтобы городить свой ресёрч-цикл — берёшь и подключаешь. Блог | Доки 🔥 — пойду гонять ресёрч 👀 — а токены реально сэкономит? @ai_for_dev

Сделали ИИ-ассистента поверх своего кода: как это было в Звуке История простая и знакомая: код есть, а знаний о нём в голове у пары человек. Новичок въезжает 6–12 месяцев, инженеры до 11% времени ищут, к кому бы подойти и что вообще тут происходит. Отвлёкся на минуту — возвращаешься в задачу 23–24 минуты. И Confluence, конечно, врёт: в вики одна версия, в коде другая. Команда рекомендаций сервиса Звук решила собрать ассистента, который знает приватный код и отвечает по нему сразу. Главный вопрос — RAG или дообучение? Выбрали RAG. Файнтюнить модель после каждого мерджа дорого и больно, а RAG просто подтягивает свежий код в ответ — обновляется почти бесплатно и заводится быстро. Логика по производительности тоже честная: разрабы с ИИ уже ускорились на 15–20%, а аналитики и архитекторы превращаются в бутылочное горлышко. Вот его и расшивают. 🔥 — тоже хочу такого бота 🤷 — у нас и так grep работает Источник: habr.com @ai_for_dev

«На демо выглядело хорошо» — и удалили прод Истории 2025-го, после которых начинаешь верить в evals: • Агент в Replit плюнул на запрет правок и снёс production-базу — данные ~1200 компаний. Потом честно признал «катастрофическую ошибку», лучше бы не признавал. • Operator от OpenAI попросили найти яйца подешевле — он молча купил их на $31.43 в обход подтверждения. Спасибо, не Lamborghini. • Чатбот мэрии Нью-Йорка на голубом глазу советовал бизнесу нарушать закон. Мораль: vibes не масштабируются. Прокликать пять примеров руками — это не проверка. В проде через систему идут тысячи запросов, и глазами уже не понять, стало ли лучше после смены промпта или модели. Без evals любое «улучшение» — это вера, а не знание. Публичные бенчмарки показывают, кто круче на лидерборде, но не отвечают, тянет ли система именно вашу задачу. А это сейчас редкий навык: вызвать LLM умеет каждый, отличить рабочую систему от уверенно-неверной — почти никто. Целиком — на Хабре. 🔥 — иду писать evals 🤡 — деплою на vibes дальше @ai_for_dev

Sakana выкатила Fugu — дирижёр для целого пула LLM Скучали по чему-то новому? Sakana AI из Японии показала Fugu и Fugu Ultra
Sakana выкатила Fugu — дирижёр для целого пула LLM Скучали по чему-то новому? Sakana AI из Японии показала Fugu и Fugu Ultra 🐟. Фишка в том, что это не модель, а оркестратор: ты дёргаешь один API, а внутри толпа агентов сама делит задачу, спорит и собирает итоговый ответ. По их цифрам Fugu Ultra местами тянет на уровень Fable 5: LiveCodeBench 93.2, Terminal Bench 82.1, GPQA-D 95.5. Где-то Fable всё ещё рулит — SWEBench Pro 80.0 против 73.7. Но тренд понятен: после Fable рынок всё активнее уходит в multi-agent, где выигрывает не одна LLM, а система, которая умеет выбирать и сводить ответы. По деньгам у Fugu Ultra вход $5 и выход $30 за 1M токенов, подписки от $20 до $200 в месяц, а до 31 июля 2026 второй месяц дарят. Пощупать API можно на сайте. 🐳 — оркестр, а не модель 🤔 — а в проде как? @ai_for_dev

PixelRAG: ищем по скриншотам, а не по кривому HTML Знакомая боль: парсишь страницу, а таблицы, графики и вся вёрстка превращаются в кашу. PixelRAG заходит с другой стороны — он смотрит на документ глазами человека, то есть по картинке после рендера. И это open-source под Apache-2.0. Что внутри: — рендерит сайты, PDF и картинки в тайлы — делает эмбеддинги через Qwen3-VL-Embedding — складывает всё в FAISS — модель-чтец можно поменять без переиндексации Ребята не мелочились и сделали визуальный индекс всей Википедии — 30+ млн скриншотов. На QA это обошло лучший текстовый RAG на 18,1%. Плюс есть плагин для Claude Code, чтобы он анализировал страницы по скриншотам без всякого DOM. Ставится одной строкой pip install pixelrag, всё лежит на GitHub. 🔥 — self-hosted gang, погнали 👏 — пошёл накидывать звёзд Источник: github.com @ai_for_dev

Что под капотом у ИИ-агента для продаж: архитектура и грабли Про «ИИ-агента для продаж» пишут так, будто это одна кнопка: подключил — и он сам звонит, дожимает, квалифицирует. На демо так и есть. А в проде между «агент послушал звонок» и «в CRM прилетела правильная задача» — десяток слоёв, и каждый норовит тихо отвалиться. Сразу про ожидания: автономный SDR — пока миф. Работает агент-ассистент: снимает рутину, а решение всё равно за человеком. И мерить его надо не дилами за месяц, а стоимостью квалифицированной встречи за 90 дней — тут сразу видно, агент зарабатывает или просто шумит. Под капотом — конвейер из очередей: на LLM приходится треть кода, остальное обвязка. Стек: NestJS, BullMQ поверх Redis, Postgres, S3. Почему очереди, а не «всё в одном хендлере»? Первый же тяжёлый звонок забьёт пул и положит приём вебхуков. А ещё через все слои тащат один call_id — иначе отладка превращается в гадание на тысяче звонков. Весь разбор по слоям с кодом: https://habr.com/ru/articles/1050336/ 🔥 — забрал в закладки 🤡 — а я верил в кнопку @ai_for_dev

Локальный RAG на FastAPI и Ollama: путь от «чат с моделью» до настоящего backend Знакомая ловушка: отправил промпт, получил ответ — вроде готово. Но для помощника по документации этого мало. Модель не знает твои локальные файлы, ответ не проверить по источникам, непонятно что улетело в промпт, а если документ изменился — обновился ли индекс? Автор честно показывает, как из простого вызова локальной модели вырастает небольшой RAG-проект. Без магии и «production ready», зато по шагам. Стек простой и весь локальный: FastAPI на backend, Ollama для запуска моделей, gpt-oss:20b для ответов, embeddinggemma для эмбеддингов и in-memory хранилище векторов на старте. Логика роста понятная: документы → чанки → эмбеддинги → поиск → промпт с контекстом → источники → диагностика. На каждом шаге становится чуть меньше «чёрного ящика» и чуть больше нормальной системы с request_id, логами и замером времени. 🔥 — забираю на выходные 🤷 — у меня и так чат работает @ai_for_dev

GPT-5.5-Cyber от OpenAI теперь сам чинит уязвимости OpenAI выкатила полную версию ИБ-модели и обновила Codex Security. Самое
+2
GPT-5.5-Cyber от OpenAI теперь сам чинит уязвимости OpenAI выкатила полную версию ИБ-модели и обновила Codex Security. Самое важное: фокус сместили с поиска проблем на автоматическое исправление кода в репозиториях. Коротко, что она делает: — разбирает сложные ИБ-запросы и реже отказывает — проверяет большие кодовые базы на уязвимости — гоняет проблемы в изолированных средах — сама пишет патчи — сканирует коммиты и целые репозитории — отдаёт отчёты в SARIF и CodeQL На бенчмарках CyberGym, ExploitGym и SEC-bench Pro GPT-5.5-Cyber обходит обычную GPT-5.5. Доступ дают только верифицированным ИБ-спецам, а Codex Security живёт в десктопном Codex и в CLI. Ещё запустили Patch the Planet — помощь опенсорсу вроде cURL, Go и Python. 😐 — настораживает 🤔 — надо изучить @ai_for_dev