uz
Feedback
AI для Разработки — Claude | Cursor | Copilot

AI для Разработки — Claude | Cursor | Copilot

Kanalga Telegram’da o‘tish

100+ AI-источников → лучшие инструменты для разработчиков. Cursor, Copilot, Claude API — обзоры, туториалы, новинки. Вопросы: @aiskladadmin

Ko'proq ko'rsatish
936
Obunachilar
+1224 soatlar
+157 kunlar
Ma'lumot yo'q30 kunlar
Postlar arxiv
MCP-сервер: первые грабли собирают не инженеры, а обычные юзеры Ребята из Туту сделали MCP-сервер, чтобы ИИ-агент искал поездки по реальной базе билетов, а не галлюцинировал «секунду, подбираю…». И тут же собрали занятные шишки. Самая неожиданная: у MCP-сервера должен быть лендинг. Первые отзывы прислали не разработчики, а живые люди — тыкали в адрес сервера в браузере и ловили белый экран:

{"detail": "Method Not Allowed"}
Логично же: видишь ссылку — жмёшь. А там техническая ошибка, и всё «сломалось». Фикс простой — научить сервер отличать агента от браузера по методу и заголовку Accept. POST — отдаём JSON-RPC агенту. GET с text/html — показываем человеку нормальную страницу: что это, как подключить, зачем. По умолчанию безопаснее отвечать как агенту, а лендинг отдавать, только если точно распознали браузер. Боты-превьюшки в мессенджерах тоже получат страничку — и это ок. В целом MCP — открытый протокол: агент сам узнаёт про инструменты сервиса и дёргает их, вместо парсинга сайта. McKinsey вообще пророчит агентам продажи на 3–5 трлн долларов к 2030-му. Остальные наблюдения: habr.com 🔥 — забрал в закладки 😁 — «Method Not Allowed» — родное @ai_for_dev

Код от ИИ красиво работает — и красиво дырявый Исследователи из Университета Дакоты взяли простые Python-скрипты от ChatGPT,
+1
Код от ИИ красиво работает — и красиво дырявый Исследователи из Университета Дакоты взяли простые Python-скрипты от ChatGPT, Copilot и Gemini для обычных офисных задач и прогнали через проверку. Результат жёсткий: 100% содержали критические уязвимости. История знакомая до боли: разработчик или обычный сотрудник просит утилиту, получает первый рабочий вариант — и сразу в прод. А дальше начинается веселье: — парсеры глотают любые ссылки → привет, SSRF и доступ к внутренним серверам; — почтовые скрипты дырявы для инъекций → корпоративный SMTP становится шлюзом для фишинга; — сортировщики файлов ведутся на подмену путей и симлинки → отдают локальные документы. Самое ироничное: аудит этого кода поручили Claude Code. Нейросети уже проверяют поделки друг друга на закладки. 😐 — знакомая картина 🤔 — надо перепроверить утилиты @ai_for_dev

GPT-6: анонс на этой неделе (по слухам) Инсайдеры сообщают о поездке Сэма Альтмана в Вашингтон с презентацией новой модели дл
GPT-6: анонс на этой неделе (по слухам) Инсайдеры сообщают о поездке Сэма Альтмана в Вашингтон с презентацией новой модели для Белого дома. Заявленные направления: решение долгоиграющих математических задач и снижение стоимости сложной бизнес-работы. Для тех, кто строит на OpenAI API, это потенциально новый уровень рассуждений и, возможно, другой ценник за токены. По неподтверждённым данным, речь о модели, ранее фигурировавшей в истории с Hugging Face. Подтверждённых первоисточников нет — оценивать стоит после публикации бенчмарков и документации. 🤔 — жду цифры 😎 — потестим на выходных @ai_for_dev

Microsoft сделала ИИ, который сам себя взламывает — и сам чинит Microsoft показала Project Perception: три команды ИИ-агентов
Microsoft сделала ИИ, который сам себя взламывает — и сам чинит Microsoft показала Project Perception: три команды ИИ-агентов гоняют по кругу без людей. Одни ломают, другие разбираются, что из найденного реально опасно, третьи закрывают дыры. И так круглосуточно. Модель MAI-Cyber-1-Flash живёт внутри системы управления уязвимостями MDASH и уже выбила 96% на бенчмарке CyberGym — на 12 пунктов больше, чем Mythos от Anthropic. Бонусом всё это почти вдвое дешевле: дорогие «думающие» модели берут на себя сложное, а рутину раздают быстрым узким моделям. Публичный тест стартует 3 августа. В июле Белый дом запустил инициативу Gold Eagle по ИИ-защите от кибератак, и Microsoft явно хочет стать её основной платформой. Но осадочек есть: 96% — это на синтетике, а не на настоящих атаках. Пока агенты сами не закроют реальную брешь в проде без человека, цифра остаётся лабораторной. Читать целиком 👀 — интересно, что покажут 🤔 — а на живых атаках? @ai_for_dev

Anthropic выпустила бесплатный курс по Claude Code Anthropic запустила бесплатный онлайн-курс Claude Code in Action, посвящённый её инструменту для программирования. Курс входит в образовательную программу Anthropic Academy и размещён на платформе Skilljar; отдельный аккаунт для прохождения не требуется. Курс рассчитан не на новичков, а на разработчиков, которые уже используют Claude Code и хотят перейти к более длинным, командным сценариям. Основная идея — научиться запускать агента на часы работы и затем с уверенностью проверять результат. Программа разбита на четыре блока: управление длинными сессиями (планирование, откат неудачных шагов); настройка (файл инструкций CLAUDE.md, «навыки», режимы доступа и правила через хуки); автоматизация (запуск по расписанию, «безголовый» режим, встраивание в проверку кода и pull-запросы на GitHub); верификация автономных прогонов и упаковка конфигурации в плагин для всей команды. По итогам — тест и сертификат. Отдельно на неделе: беспилотные такси Waymo с 2024 года накопили около 9,3 тыс. долларов штрафов за парковку — примерно 400 долларов в месяц на весь парк, большую часть Waymo уже оплатила. 🎉 — бесплатно, забираю 🤔 — курс или маркетинг Источник: kod.ru @ai_for_dev

Microsoft выкатил модель, которая сама ищет уязвимости Новая MAI-Cyber-1-Flash прочёсывает кодовые базы, находит дыры и помогает готовить исправления. Работает она не в одиночку, а внутри MDASH — системы из 100+ AI-агентов. Самое интересное — экономика. Компактная модель тянет до 90% задач, а на сложные 10% зовут тяжёлую GPT-5.4. В сумме система выдаёт 96% на бенчмарке CyberGym и выходит вдвое дешевле старой связки из трёх моделей. А ещё Microsoft запускает Perception — команды агентов, которые круглосуточно следят за корпоративной инфраструктурой, ставят патчи и закрывают новые угрозы. Читать: microsoft.ai 😐 — тревожно 🤔 — надо изучить @ai_for_dev

Antares от Cisco: маленькие модели, которые ищут дыры в коде Cisco представила семейство малых языковых моделей Antares — они
Antares от Cisco: маленькие модели, которые ищут дыры в коде Cisco представила семейство малых языковых моделей Antares — они находят известные уязвимости в исходном коде и стоят при этом копейки. В линейке три модели: Antares-350M, Antares-1B и Antares-3B. Две младшие уже лежат на Hugging Face. Главная фишка — их можно гонять локально, так что свой закрытый код никуда отправлять не нужно. Цифры бодрые: 350M обошла Gemini 2.5 flash, 1B — Gemini 3 Pro и GLM-5.2, а ещё не вышедшая 3B набрала столько же, сколько GPT-5.5. И это при всего трёх миллиардах параметров — у больших GPT их сотни миллиардов. Внутри — итеративный поиск, имитирующий работу исследователя: модель берёт описание уязвимости, ищет похожие шаблоны, читает файлы и сужает круг до подозрительных. Пригодится для CWE-разбора, приоритизации инцидентов, усиления статического анализа и сортировки в CI/CD. 😐 — звучит настораживающе 🤔 — надо проверить на своём репо Источник: habr.com @ai_for_dev

Детерминированный пайплайн: свободный текст → граф действий Задача: превратить реплику игрока на естественном языке в исполняемый порядок операций, где зависимости («выхватить меч» → «прыгнуть») не нарушаются. Решение — не один большой промпт, а декомпозиция. Слои архитектуры: 1. Классификатор — маршрутизирует вход: игровое действие → движок, спам → игнор, вопрос по правилам → лёгкая LLM, «ещё раз» → подстановка предыдущего сообщения. 2. Атомизация — реплика дробится на атомарные действия. 3. Граф зависимостей — фиксирует порядок и параллелизм атомов. 4. Параллельный пайплайн специалистов — отдельные модели считают атаку, проверяют ловушки, назначают проверку атлетики; арбитр склеивает разрозненные ответы в непротиворечивый результат. Профит: контролируемость, меньше галлюцинаций и предсказуемая стоимость токенов вместо ставки на «умную» модель. Архитектурный разбор 😎 — атомизация по-взрослому 🤔 — арбитр не узкое место? @ai_for_dev

Fable 5.1 может выйти уже в августе По утечке Anthropic уже допилила новую модель внутри и готова выкатить её следом за GPT-6
Fable 5.1 может выйти уже в августе По утечке Anthropic уже допилила новую модель внутри и готова выкатить её следом за GPT-6. Самое вкусное: цену обещают оставить как у Fable 5. То есть новый уровень качества по старому прайсу — если не наврали, конечно. А то ведь знакомо: вертишь эти цены так и эдак, а на паре серьёзных запросов кошелёк уже плачет. Официального анонса пока нет, так что ждём и надеемся. 🔥 — по старому прайсу, беру 🤔 — верю после релиза @ai_for_dev

Stolen Compute: инвентаризация открытых inference-эндпоинтов Проект сканирует публичное адресное пространство, находит ИИ-сер
Stolen Compute: инвентаризация открытых inference-эндпоинтов Проект сканирует публичное адресное пространство, находит ИИ-серверы без аутентификации и агрегирует их в поисковый каталог. Пользователю остаётся выбрать модель и слать запросы напрямую — вся нагрузка ложится на владельца незащищённого узла. Заявленные цифры: около 2 тысяч моделей и порядка 20 тысяч активных нод. В выдаче встречаются тяжёлые веса — Kimi 1T, DeepSeek V3 и другие. Вывод простой: любой self-hosted inference (vLLM, Ollama, TGI и т.п.), выставленный наружу без обратного прокси с авторизацией и без файрвола, попадает в такие каталоги за считанные часы. Проверьте адрес привязки (0.0.0.0 против 127.0.0.1) и наличие токена. Каталог: stolencompute.com. 🤔 — конфиги под замок 😐 — нод нараспашку @ai_for_dev

Visa открыла VVAH — агентный харнесс для поиска уязвимостей Visa выложила на GitHub свой инструмент VVAH (Visa Vulnerability
Visa открыла VVAH — агентный харнесс для поиска уязвимостей Visa выложила на GitHub свой инструмент VVAH (Visa Vulnerability Agentic Harness) — открытый харнесс для автономного поиска, устранения и проверки уязвимостей с помощью AI-моделей. Построен на наработках Project Glasswing от Anthropic. Это пайплайн из 4 фаз и 11 стадий — от загрузки кода до проверенного исправления: - Фаза 1 — разведка и моделирование угроз, карта поверхности атаки; - Фаза 2 — глубокий анализ и адверсариальная верификация эксплуатируемости; - Фаза 3 — синтез и отчёты (Markdown + SARIF 2.1.0); - Фаза 4 — предложение фиксов и их проверка перед принятием. Качество находок держат три решения: моделирование угроз до анализа, детерминированное голосование нескольких агентов против ложных срабатываний и структурированные артефакты триажа. Ключевая метрика — Mean Time to Adapt: время от обнаружения до проверенного фикса в продакшене. Мульти-модельный по дизайну: Claude, OpenAI-совместимые или их комбинация через vendor-neutral слой. Важно: сканируйте только тот код, на который у вас есть права, а находки требуют ревью человеком. Репозиторий 😐 — тревожно 🤔 — надо проверить @ai_for_dev

LLM не думает — она угадывает по паттернам Когда разработчик получает задачу, он её разбирает: декомпозиция, зависимости, дизайн, потом код. LLM делает ровно наоборот — сразу генерирует, перебирая паттерны из обучающего корпуса, пока не найдёт что-то похожее. Без проектирования, без понимания. И это не баг — это фундаментальный принцип трансформеров. Отсюда же все странности: почему миллион токенов контекста — не панацея, а подорожник, почему thinking-модели не думают, и почему RAG — это не магия, а костыль поверх очень ограниченного инструмента. Короткая историческая справка: до трансформеров были RNN/LSTM — обрабатывали текст слово за словом, обучались медленно, дальние связи теряли (градиент тухнет). В 2017 Google выкатил Attention Is All You Need — и индустрия почти полностью съехала на трансформеры. Статья хорошая для тех, кто устал слышать "AI всё может" от менеджеров. Пора перестать очеловечивать инструмент и считать его магией — он просто очень хорошо предсказывает следующий токен. 🔥 — наконец-то по делу 😎 — расскажу менеджеру @ai_for_dev

Пять терминалов — это уже норма Помните времена, когда хватало одного окна и одного агента? Теперь у вас пять терминалов, семь веток, и вы понимаете: код давно не проблема — проблема в том, что на всех не хватает внимания. Из этого хаоса вырос целый рынок «диспетчерских»: программ, которые разводят агентов по отдельным рабочим копиям, следят за их статусом и не дают устроить пожар в проекте. Забавно, что инфраструктура появилась раньше спроса: tmux (2007) держал процессы живыми, Docker дал контейнеры, git worktree (2015) развёл ветки по папкам, а gVisor и Firecracker добавили изоляцию. Агентам осталось только всё это собрать вместе. За пару лет мы прошли путь от Aider до Claude Code, Claude Squad и Vibe Kanban. И, кажется, гонка оркестраторов только начинается. Подробнее — на Хабре. 🔥 — пять окон это норма 🙈 — семь веток и паника @ai_for_dev

30к рублей, 17 часов на GPU — и твой локальный GPT-5.4 Ребята взяли Qwen3.5-27B, докрутили её через QLoRA на задачах российских учителей и получили 3.21 из 4 — ровно как у GPT-5.4 (3.2). Только работает на Mac Mini M4 Pro и не сливает данные в облако (152-ФЗ велел). Самый сочный момент — они параллельно обучали 32B на Qwen3. Потратили в 3 раза больше GPU-времени, training loss был красивее (0.47 vs 0.51), а на реальных задачах она слила -0.52 пункта. Мораль: новая архитектура бьёт больший размер. Qwen3.5 лучше дружит с русским и структурой, чем его же старший брат предыдущего поколения. Данные собрали по методике CRAFT — берёшь открытые датасеты (MMLU-RU, MERA, gsm8k-ru) как затравку, а сильная модель генерит из них 30 000 пар запрос-ответ. Всё в пределах бюджета на обед в Москве. Подробности на Habr 🔥 — QLoRA gang 🤔 — а Qwen3.5 реально такая бодрая? @ai_for_dev

189к звёзд — и не за вайбкодинг Тот самый репозиторий, который стоит закинуть в закладки, если гоняешь ИИ-агентов в разработке. Без магии «сделай всё за меня» — это набор маленьких, проверенных скиллов, которые учат ассистента нормально планировать, отлаживать код, ревьюить и продумывать архитектуру. Автор прямо говорит: это про реальную инженерию, а не vibe coding. Скиллы композируемые, легко пилятся под себя и дружат с любой моделью — Claude Code, Codex, что угодно. Поставить — минутное дело:

npx skills@latest add mattpocock/skills
Забрать на GitHub 🔥 — тащу к себе в репозиторий 👀 — гляну, что там у Matt @ai_for_dev

Тренды нейросетей за неделю: скиллы, вайбкодинг и полезные инструменты Подборка заметных проектов недели для разработчиков. 💻 Аналитик Макс Вайнбах собрал копию веб-версии macOS 27 роем агентов Kimi K3пиксельно точная симуляция прямо в браузере. Ушло 3 часа и 60% месячного лимита Kimi. ⚔ Навык No AI Slop убирает из сгенерированных текстов более 20 типичных для нейросетей оборотов. Подключается к Codex, Claude Code и любому чат-боту. 🍩 Таблица со 150+ бесплатными API ИИ-моделей: Google AI Studio, OpenRouter, Groq, NVIDIA, Mistral, GitHub Models — с точными лимитами. Ещё в выпуске: скилл сборки 3D-лендинга из описания бренда, скилл apple-design для интерфейсов по гайдлайнам Apple и бесплатная программа для монтажа видео через Claude Code и Codex — с обрезкой, переходами, субтитрами и цветокоррекцией. 👍 — полезная подборка 🤔 — надо разобрать Источник: habr.com @ai_for_dev

502 снаружи, 302 внутри: как отучить LLM-агента врать Чувак сделал внутреннего read-only агента для разбора инцидентов. Пишешь ему в чат «почему сервис отдаёт 502?» — а он сам лезет в Kubernetes, VictoriaMetrics, Elasticsearch, GitLab и Grafana, собирает факты и честно выдаёт, что проверил, а что нет. В прод при этом ничего не трогает. Самое вкусное — без всякого LangChain. Всё на Go: свой рантайм хранит контекст, проверяет права, гоняет план и собирает доказательства. Модели на открытых весах только думают и объясняют, руками в production не лезут. И вот классика жанра. Снаружи прокси показывает 502, а в логах приложения тот же request_id — редирект 302. Бот сначала выдал «на уровне приложения всё ок, ищите на edge». Формально правда, толку ноль. А причина была тупо в том, что заголовки не влезли в буфер прокси: один Location весил 1191 байт, и прокси просто выкинул ответ. Мораль: инструментов у агента было даже слишком много. Не хватало умения связать логи между собой и не прыгать на знакомый симптом. Статья — про то, что начинается ПОСЛЕ первого успешного tool call. 🔥 — до боли знакомо 😎 — почитаю на выходных Источник: habr.com @ai_for_dev

Агент, собери мне игру: 17 скиллов для Three.js Чувак выложил коллекцию из 17 скиллов, чтобы агент клепал браузерные экшен-RPG почти сам 😳 Внутри — весь цикл: камера, уровни, враги, инвентарь, VFX, звук, плюс оптимизация и тесты. По сути готовые папки-плейбуки: короткий SKILL.md, который агент читает и делает по нему. Дружит с Codex, Claude Code и Cursor. Самое сочное — игра на видео и правда собрана этими скиллами, поиграть можно прямо сейчас, а всё добро лежит на GitHub. 🔥 — пойду вайбкодить RPG 🤡 — агент, а баги кто чинит @ai_for_dev

Deep Agents: собрал всё в кучу — но какой ценой? Агентов сейчас строят кто во что горазд: берут готовые фреймворки, кликают конструктор на веб-портале или пишут своё — дешевле и в своём контуре. Классика для последнего — LangChain / LangGraph: обёртки, графы, пайплайны под типовые куски агента. Обычно всё крутится вокруг цикла ReAct: модель порассуждала, дёрнула инструмент, посмотрела результат, снова подумала — и так до ответа. На короткой задаче норм. А на длинной агент начинает тащить на себе всё: историю, результаты инструментов, планы, файлы. И вопрос уже не «как написать промпт», а «как разгрести весь этот бардак». Вот этим и занимается контекст-инжиниринг. Deep Agents — это когда LangChain уже собрал тебе рабочую среду вокруг обычного агента. Не новая модель, а готовый «тяжёлый рюкзак»: в API — create_deep_agent поверх create_agent. В статье на Хабре разбирают, из чего он собран и когда его реально стоит брать, а когда лучше налегке. 🔥 — забираю в закладки 🤷 — мне и ReAct хватает @ai_for_dev

Как я собрал «правильный» RAG и сделал только хуже Знакомая картина? Берём вектора, эмбеддер, сверху реранкер, добавляем BM25 для гибридного поиска — и на схеме всё летает. Двадцать строк кода, стрелочки, продакшн готов. Автор реально дошёл до конца на своих данных. Итог: почти каждый «канонический» апгрейд уронил метрику. BM25 — вниз. Реранкер — вниз, причём дважды в разных конфигах. А выстрелило то, что программистам обычно скучно: пара дней возни с данными и нормальные замеры. Мораль простая: RAG работает, но магия не в коде, который пишется за день, а в eval-харнессе и чистке корпуса. «Так все делают» — это не про ваши данные. Хочешь узнать, что реально помогает — меряй у себя. Вся история с пруфами: Habr 🔥 — узнал свою боль 😐 — опять мерять руками @ai_for_dev