Битрикс24 Вайбкод
Open in Telegram
Вайбкодинг – когда ИИ пишет код, а ты задаёшь ритм. В этом канале про то, как делать полезные штуки в Битрикс24 без глубокого знания программирования. Разборы реальных кейсов. Гайды по vibecoding'у под бизнес-сценарии. Примеры рабочих решений.
Show more2 674
Subscribers
-124 hours
+47 days
+10330 days
Posts Archive
2 674
Perplexity анонсировала концепцию агента, который работает круглосуточно без участия пользователя.
Этот агент интегрирован с локальными файлами и приложениями на выделенном Mac mini и выполняет сложные рабочие процессы самостоятельно. Тяжёлые вычисления обрабатываются на серверах Perplexity, а взаимодействие с десктопом остаётся локальным – для скорости и приватности.
Ядро – собственный оркестратор, который динамически выбирает оптимальную модель под задачу. Управлять агентом можно удалённо с любого устройства.
Безопасность: — экстренное отключение — детальный аудит всех действий — ручное подтверждение для чувствительных операцийЗапись в лист ожидания Подробнее о проетке #AIagents #AutonomousAI #Perplexity #LocalAI
2 674
MiroFish: мультиагентная симуляция социальных процессов на основе ИИ
Репозиторий MiroFish – открытый движок для моделирования поведения множества ИИ-агентов в условиях информационного воздействия. Каждый агент имеет собственную память, способен к взаимодействию и принимает решения на основе входных данных.
🔹 Что делает
— Запускает тысячи независимых агентов, каждый из которых обрабатывает текстовые входы (новости, заявления, отчёты), и реагирует в соответствии с внутренними паттернами.
— Симулирует коллективное поведение: споры, распространение информации, формирование мнений.
— На выходе даёт прогноз: как может развиваться ситуация в реальном мире на основе реакций агентов.
🔹 Примеры использования — Финансы: вводите отчёт компании или новость о рынке – смотрите, как агенты реагируют, и какие сценарии котировок могут возникнуть. — Коммуникации: тестируете публичное заявление – система показывает, какие фразы вызовут негатив, а какие – поддержку. — Гуманитарные исследования: агенты восстановили концовку утерянного китайского романа, сыграв роли персонажей и логически завершив сюжет.🔹 Как запустить — Требуется только Docker и API-ключ от любой LLM (GPT, Claude, Qwen и др.). — Установка занимает несколько минут. — Нет необходимости в специализированном железе – работает на стандартных серверах. 🔹 Ограничения — Не является точным прогнозатором реальных событий, даёт вероятностные сценарии. — Результаты зависят от качества входных данных и настроек агентов. — Не интегрируется с внешними системами – работает как изолированный симулятор. Проект создан студентом Го Ханцзяном за 10 дней в конце 2025 года. Сейчас репозиторий имеет более 13 тыс. звёзд на GitHub. Инвестор Shanda Group выделил около $4 млн на развитие стартапа. 🔗 Репозиторий #MiroFish #ИИагенты #МультиагентныеСистемы #СимуляцияПоведения
2 674
MCP Hub приехал в Битрикс24 🔌
Теперь в редакторе бизнес-процессов и с агентом Мартой можно напрямую подключать внешние сервисы – и работать с ними прямо в чате, без переходов.
Что уже доступно? 🧩
— Предустановленные: Контур.Фокус (уже тут), далее – 1С, Gmail, Google Drive
— Из Маркета: Notion и другие интеграции
Как это работает? 💡
Пишете Марте: «Проверь компанию ООО Ромашка» – она сама лезет в Контур.Фокус, вытягивает реквизиты и возвращает всё в чат. Никаких вкладок, никаких копипастов.
Подключение ⚙️
Через кнопку «Подключения» в поле ввода чата.
— Настроить для себя
— Расшарить на отдел или всю компанию
— Админы управляют правами в настройках
📌 Доступно только по подписке BitrixGPT + Маркетплейс.
#News #Bitrix24 #MCPHub #Интеграции #БизнесПроцессы
2 674
Theory of Space: могут ли ИИ-агенты строить карты пространства?
Исследование от Stanford, University of Washington и Cornell (ICLR 2026) проверяет, способны ли языковые модели самостоятельно исследовать незнакомую среду и строить её внутреннюю карту – как это делает человек.
Задача: агент стартует в незнакомом пространстве с несколькими комнатами. Он должен сам решать, куда двигаться и куда смотреть, фиксировать объекты в JSON и использовать накопленные данные для ответа на пространственные вопросы: где находится объект? Как добраться туда? Как изменится вид, если повернуться?Тестируются три навыка: — Построение карты из частичных наблюдений; — Обновление карты при изменении среды; — Использование карты для решения задач (локализация, ориентация, смена перспективы). Тесты проводились на 6 моделях: GPT-5.2, Gemini 3 Pro, Claude Sonnet 4.5, GLM-4.6V, Qwen3-VL-235B, InternVL 3.5-241B. Всего – 2700 вопросов на каждую из 100 сцен. Результаты: 🟢 Активное исследование – слабое место Модели тратят в среднем 14+ шагов, чтобы охватить среду. Детерминированный скрипт (просто обход комнат с поворотом на 360°) справляется за 9 шагов и строит более точную карту. 🟢 Поведение моделей различается — GPT-5.2: бросается к новым дверям, не исследуя текущую комнату. — Gemini 3 Pro: методично осматривает каждую комнату – как скрипт. — Claude Sonnet 4.5: нет чёткой стратегии. 🟢 Инерция убеждений Когда объекты перемещали после первоначального обследования, GPT-5.2 продолжал «видеть» их на старых местах в 69% случаев – даже при наличии новой визуальной информации. 🟢 Разрыв между текстом и изображением В текстовой среде точность – 91–92%. В визуальной – 20–32%. Проблема не в логике, а в восприятии изображений: модели плохо интерпретируют визуальные данные.
Модели хорошо рассуждают о пространстве, если им дают готовую карту. Но самостоятельно собирать информацию, строить и обновлять карту – пока не умеют. Даже простой алгоритм превосходит их по эффективности.🔗 Проект 📄 Статья 📦 Датасет 💻 GitHub
2 674
Бенчмарки качества для AI-агентов: как перейти от «вроде работает» к измеримым результатам
Когда AI-агент в продакшене начинает давать некорректные ответы, сложно понять: это новая ошибка, регрессия после правки промпта, или просто редкий кейс? Ручное тестирование не масштабируется – особенно при частых изменениях.
Мы построили систему автоматической оценки качества для агента Марта в Битрикс24. И хотим поделиться с вами этим опытом. Вот ключевые этапы:
🔹Observability
Подключили Langfuse – собираем трейсы: вход, выход, шаги, модель, токены. Это база для анализа.
🔹Тестовые сценарии
Собрали 20–30 реальных кейсов:
— баги из прода
— фидбэк пользователей
— обогащённые трейсы с ожидаемым результатом
Не нужно 500 – хватает 10–20 качественных.
🔹Среда запуска
Настроили пайплайн: загрузка датасета → запуск агента → запись трейса → оценка.
Важно: агент должен работать в реальном окружении (CRM, контекст портала), а не в моке.
🔹Варианты проверки Используем три подхода: — Код: для структурированных ответов (например, заполнение полей сделки). Проверяем: JSON валиден? Все поля на месте? Значения точные? — LLM-судья: для свободных ответов. Разбиваем ожидаемый результат на факты. Судья проверяет, отражён ли каждый факт в ответе. — Человек: создаёт факты, проверяет работу судьи, фиксирует ошибки.🔹Анализ и тренды Запускаем один и тот же сценарий 5 раз (pass@k). Считаем частоту успеха – не бинарный результат, а стабильность. Сравниваем прогоны: после правки промпта метрики выросли или упали? Пример: модель с 4x меньше параметров показала сопоставимый результат – без бенчмарков мы бы переплатили.
Что не работает: — Один прогон = одна точка. Тренд реально отследить только по нескольким запускам. — 100% точность не является целью. Для сложных задач 70–80% – норма. — Эмбеддинги плохо ловят перефразирования – используйте LLM-судью для текстовых полей.Следующие шаги: — Проверка траектории (как агент пришёл к ответу, а не только что ответил) — Интеграция в CI: автоматический запуск бенчмарков при изменении промпта — Автоматическая разметка ошибок из прода Система не сделала агента идеальным. Но теперь мы знаем, что именно сломалось – и почему. Подробнее в статье #AI-агенты #Битрикс24 #Бенчмарки #Качество
2 674
Hodoscope – инструмент для обнаружения нестандартного поведения ИИ-агентов
Проблема: когда агенты решают задачи (скажем, исправляют баги в GitHub), они могут использовать скрытые уловки – например, извлекать готовые патчи из истории коммитов, а не анализировать проблему. Стандартные оценщики этого не видят.
Hodoscope помогает найти такие случаи без предварительных предположений.
🔹 Как это работает: — Каждое действие агента (например, «выполнил git log», «прочитал файл») сжимается в краткое описание – без технического шума. — Описания преобразуются в векторы и проецируются в 2D-пространство с помощью t-SNE. — Строится карта плотности: кластеры, где поведение одного агента отличается от остальных, выделяются цветом.Результат: вместо анализа тысяч строк логов – вы видите 2–3 подозрительных кластера. 🔹 Пример: — В тесте на SWE-bench у агента iQuest обнаружили 79 действий с использованием git log (из 4006). — Это было 2% от всех действий – но только Hodoscope выявил это за несколько минут. Поддерживаемые форматы: • Docent • Inspect AI .eval • OpenHands JSONL • Обычный JSON Эмбеддинги: любая модель через LiteLLM (OpenAI, Gemini, Anthropic и др.) Результат – интерактивная HTML-карта, которую можно открыть в браузере. Подробнее о проекте: GitHub Документация
2 674
SkillsBench: как готовые навыки влияют на эффективность LLM-агентов
Исследование SkillsBench (15+ университетов) протестировало 84 задачи из 11 доменов с 7 моделями – в трёх сценариях: без навыков, с готовыми навыками, с навыками, сгенерированными самой моделью. Всего – 7 308 траекторий, проверенных через pytest.
🔹 Готовые навыки повышают точность, но не везде одинаково — Средний прирост pass rate: +16,2 п.п. (с 24,3% до 40,6%). — В медицине: +51,9% – модели плохо обучены клиническим протоколам. — В производстве: +41,9% – сложные воркфлоу не покрыты в обучении. — В разработке ПО: всего +4,5% – модели уже хорошо знают этот домен.🔹 Самогенерация навыков не работает — Когда модель сначала писала навык, а потом использовала его – результат упал на 1,3% в среднем. — GPT-5.2 показал падение на 5,6%. — Только Claude Opus 4.6 дал небольшой рост (+1,4%). — Вывод: модели умеют использовать навыки, но не умеют их надёжно создавать. 🔹 Объём навыков важен — Оптимально: 2–3 навыка, тогда прирост составит +18,6%. — 4+ навыка – прирост падает до +5,9%. — Детальная документация снижает результат на – 2,9%, агент теряется в контексте. 🔹 Экономия и эффективность — Haiku 4.5 с навыками обходит Opus 4.5 без них и выходит дешевле и точнее. — Gemini 3 Flash: лучший результат – 48,7% с навыками, при цене $0,57 за задачу. — Gemini 3 Pro: $1,06 за задачу, результат 45,1%. Подробнее на skillsbench и архив #SkillsBench #LLM #AIагенты #Бенчмарк
2 674
Anthropic изучил, как люди используют ИИ-агентов на практике
Анализ более миллиона сессий в Claude Code и через публичный API показал, как реальные пользователи взаимодействуют с агентами – без идеализации, только по данным.
🔹 Длительность сессий растёт
— Медианная продолжительность самых длинных сессий выросла с 25 до 45+ минут за 3 месяца.
— Рост не связан с обновлениями модели – значит, люди меняют подход, а не возможности.
🔹 Опытные пользователи доверяют больше, но контролируют точнее — 20% новичков запускают агента с полным автоподтверждением. — У опытных – более 40%. — При этом они чаще вмешиваются в процесс – не из недоверия, а потому что работают со сложными задачами и знают, когда остановить.🔹 Агент сам ограничивает себя чаще, чем человек — На сложных задачах Claude задаёт уточняющие вопросы в 2 раза чаще, чем пользователи прерывают его вручную. — Это означает: агенты уже умеют распознавать неопределённость – и останавливаются, когда не уверены. 🔹 Домены использования — ~50% всех запросов – разработка ПО. — Рост в медицине, финансах и кибербезопасности – но объёмы пока малы. 🔹 Вывод Anthropic — Технически агенты способны на большую автономию, чем сейчас используют. — Эффективное управление требует не только технических ограничений, но и: • инфраструктуры для мониторинга после запуска, • новых паттернов взаимодействия – где человек и агент совместно определяют границы действия. Подробнее на Anthropic https://www.anthropic.com/research/measuring-agent-autonomy #AIагенты #Anthropic #Claude #АвтономияИИ #Исследование
2 674
Mistral AI приобретает Koyeb – стартап с технологией безопасного запуска ИИ-агентов, а это внедрение изоляции как стандарта для ИИ-агентов
Mistral AI купила Koyeb – компанию, разрабатывавшую serverless-платформу для развертывания ИИ-приложений. Основная цель – интегрировать их технологию Koyeb Sandboxes в экосистему Mistral.
🔹 Что такое Koyeb Sandboxes
— Изолированные среды для запуска ИИ-агентов.
— Каждый агент работает в собственном окружении – без доступа к другим процессам, данным или системам.
— Позволяет запускать ненадёжный или неизвестный код без риска для инфраструктуры.
🔹 Что изменится после покупки
— Технология Sandboxes будет встроена в Mistral Compute – платформу для запуска ИИ-моделей на серверах с водяным охлаждением.
— Команда Koyeb из 16 инженеров переходит в Mistral – их опыт будет использован для улучшения безопасности и масштабируемости.
— Планируется внедрение изолированных сред в продукты Mistral для запуска агентов, работающих с внешними API, файлами или пользовательскими данными.
🔹 Зачем это нужно — Безопасность, агенты не могут «сбежать» из своей среды и получить доступ к системе. — Стабильность, сбои одного агента не влияют на другие. — Масштабируемость, можно запускать сотни агентов одновременно – каждый в своей изоляции.Подробнее в статье #MistralAI #Koyeb #AIагенты #Serverless #ИзолированныеСреды
2 674
Manus AI теперь в Telegram: агент в чате выполняет задачи без настройки
Manus представил интеграцию своего ИИ-агента в Telegram – без API, ключей или технической настройки. Достаточно отсканировать QR-код, чтобы агент стал частью диалога.
🔹 Что умеет агент в чате — Обрабатывает текст, голосовые сообщения, изображения и файлы (PDF, Excel, TXT и др.) — Транскрибирует аудио, распознаёт намерение и отвечает в формате диалога — Выполняет многошаговые задачи: анализ данных, генерация отчётов, сбор информации, формирование PDF — Работает с теми же инструментами, что и веб-версия – без перехода между платформами🔹 Два режима работы — Manus 1.6 Max: для сложных задач с глубоким анализом и логическим рассуждением — Manus 1.6 Lite: для быстрых ответов, уточнений и простых запросов 🔹 Настройки — Стиль ответа: от краткого до подробного – выбирается в чате — Поддержка русского и английского языков 🔹 Что не делает — Не интегрируется с CRM, ERP или внутренними системами – работает только в Telegram — Не хранит историю диалогов за пределами чата – данные не передаются вне платформы — Не заменяет специализированные инструменты – это помощник для работы с информацией, а не система обработки бизнес-процессов Это доступный агент в привычном интерфейсе. Подробнее в блоге #ManusAI #AIагенты #Telegram #ИИвЧате
2 674
Человек + ИИ-агент: как построить гибридную команду, которая работает, а не сопротивляется
Гибридные команды – не будущее. Они уже в работе. ИИ-агенты не заменяют людей – они берут на себя рутину, чтобы люди сосредоточились на решении, доверии и ответственности.
🔹 Что такое ИИ-агент
Это цифровой «сотрудник» с чёткой зоной ответственности: он планирует шаги, вызывает системы, обрабатывает данные и передаёт результат человеку – без постоянного контроля.
🔹 Где уже работает
— Salesforce: 74% обращений в поддержку закрываются агентами без вмешательства.
— Битрикс24: агенты проверяют доступность интерфейсов, формируют черновики, напоминают о задачах – но только после проверки DesignOps.
— McKinsey: агенты обрабатывают многошаговые процессы – от заявок до черновиков документов, при этом люди контролируют качество и принимают решения.
🔹 Как начать? Шесть последовательных шагов 1. Выберите один процесс – не весь отдел, а один поток: например, обработка заявок или подготовка отчётов. 2. Разложите его на шаги – на доске, в Figma. Видно, где рутина, где нужен человек. 3. Соберите команду – руководитель, HR, IT. Без них точно не получится. 4. Определите, какие агенты нужны – не «всё автоматизировать», а «что точно можно отдать». 5. Назначьте ответственного – кто следит за «флотом» агентов. Это не IT, это тимлид или Ops-специалист. 6. Запустите пилот – с метриками: скорость, точность, доля автономных задач.🔹 Как управлять — Метрики: • Для агента: время ответа, доля исправлений, автономность. • Для команды: время цикла, снижение выгорания, количество ошибок. — Менеджер ИИ-агентов – новая роль. Не пишет промпты. Управляет системой: задаёт правила, следит за ошибками, решает, что агенту можно, а что нет. — Безопасность: чёткие границы доступа к данным. Не всё агенту. — Регулярные ревью: раз в месяц – «как у нас живут агенты?» – обсуждение провалов и успехов. 🔹 Три сценария взаимодействия 1. Агент готовит – человек решает – черновик → проверка → отправка. 2. Агент действует – человек контролирует по отчётам – автоматические напоминания, сортировка заявок. 3. Агент как участник обсуждения – на совещании: подсвечивает слепые зоны, проверяет гипотезы.
Гибридные команды – это про перераспределение ответственности. ИИ берёт то, что можно стандартизировать. Человек остаётся там, где нужно чувствовать, решать, отвечать.Подробнее в статье #AIагенты #HRбудущего #ГибридныеКоманды #Битрикс24
2 674
WebMCP: стандарт для ИИ-агентов, работающих с веб-сайтами
Google представила WebMCP – протокол для взаимодействия AI-агентов с веб-интерфейсами, заменяющий хрупкий парсинг страниц на структурированные, предсказуемые API.
🔹 Что решает
— Устраняет проблему нестабильности: раньше агенты ломались при изменении дизайна сайта. Теперь сайты предоставляют чёткие инструменты – например, «забронировать билет» или «создать тикет поддержки» – как функции в API.
— Поддерживает два типа действий:
• Декларативный – через HTML-формы (простые операции: отправка данных, выбор фильтров).
• Императивный – через JavaScript (сложные сценарии: многошаговые процессы, динамическая валидация).
🔹 Как это работает — Сайт описывает доступные действия в стандартизированном формате. — Агент вызывает их напрямую – без анализа HTML-структуры. — Результаты возвращаются в предсказуемом формате – упрощается интеграция и отладка.🔹 Что будет дальше — Пока доступно только в режиме раннего доступа для разработчиков. — В перспективе – интеграция с Chrome и Gemini, чтобы агенты могли выполнять действия в браузере без участия пользователя (например: «найди и забронируй билет на самолёт»). Подробнее на developer.chrome.com #WebMCP #MCP #AIагенты #Google #ВебИнтеграции
2 674
Cowork от Anthropic теперь доступен на Windows
Пользователи Windows могут использовать Cowork – инструмент для работы с файлами и выполнения многошаговых задач через AI-агента в среде Claude.
🔹 Что теперь можно делать
— Открывать и редактировать файлы напрямую с диска (PDF, DOCX, TXT, код и др.)
— Выполнять последовательные задачи: например, собрать данные из нескольких файлов, сформировать отчёт и сохранить его
— Использовать плагины и MCP-коннекторы – как и на macOS
— Настройка инструкций на двух уровнях:
• Глобальные – тон, формат ответов, роль агента - применяются ко всем чатам)
• По папкам – автоматически активируются при работе в определённой директории
🔹 Как это работает — Инструкции можно менять прямо в ходе диалога – без выхода в настройки. — Агент запоминает контекст: если вы попросили его «сравни два отчёта», он знает, какие файлы вы имеете в виду. — Работает в рамках платных тарифов Claude – не требует отдельной подписки.🔹 Что важно — Инструмент всё ещё в стадии research preview – возможны ошибки, нестабильность, ограничения. — Не поддерживает автоматическое сохранение изменений – вы должны подтверждать каждое изменение. Источник #Cowork #Claude #AIагенты #MCP #Windows #AIинструменты
2 674
ElevenAgents обновлён: голосовые агенты теперь говорят естественнее и точнее
ElevenLabs выпустила режим Expressive Mode – обновление, которое позволяет голосовым агентам адаптировать интонацию, темп и эмоциональную окраску речи в реальном времени, в зависимости от контекста диалога.
🔹 Что изменилось
— Новая TTS-модель Eleven v3 Conversational: звучание стало более человечным, с сохранением контекста разговора – меньше «роботизированного» тона.
— Улучшенная система определения пауз и моментов для вступления: агент меньше перебивает собеседника, точнее ловит момент для ответа.
🔹 Как это работает — На основе транскрипции речи ИИ анализирует эмоциональный тон собеседника и корректирует свою речь: • Мягче и медленнее – при напряжённом диалоге. • Чётче и увереннее – при передаче важной информации. — Поддержка более чем 70 языков – без необходимости отдельной настройки под каждый.🔹 Где можно использовать — Автоматизированные колл-центры: клиенты воспринимают агента как более человечного собеседника. — Службы поддержки: снижается уровень фрустрации из-за «неловких» пауз и перебиваний. — AI-агенты в B2B-коммуникациях: повышается доверие при сложных переговорах или уточнениях. Подробнее на #ElevenLabs #AIагенты #MCP #ГолосовойИИ #Колл-центр #ДиалоговыеАгенты
2 674
Директор по маркетингу Битрикс24 Александр Вартанян собрал skill на GitHub для того, чтобы AI могла работать за вас в вашем Битрикс24.
С ним можно заставить AI-агентов типа Openclaw, Claude или Codex общаться с вашими коллегами, ставить задачи или работать со сделками в Битрикс24 на благо компании.Есть прям крутые сценарии: пустить ИИ согласовывать тексты от подчиненных, обогащать лиды AI-поиском по расписанию, присылать в телегу список задач и встреч на завтра или навайбкодить обмен данными с другими сервисами без знания API. Есть и более банальные, но все равно впечатляющие: можно самим писать в чате команды простым языком, а бот будет их выполнять – "Поставь встречу в битрикс на любое свободное время на 16 февраля", "Проверь, какие новые лиды появились в CRM", "Напиши завтра в 9 утра Вове, чтобы он отправил отчет".
И главное – ничего не надо кодить, просто объясняешь сценарий текстом – и Openclaw сам все настраивает.Скилл содержит все инструкции и методы API в оптимизированном для ИИ формате – агенту не нужно каждый раз разбираться с нуля. Подключил, объяснил сценарий текстом – и он сам все настраивает, без кода. Все что нужно – иметь Битрикс24 с доступом к API и вебхукам, и свой собственный OpenClaw. Забрать можно на Github или на Clawhub P.S. Следите за безопасностью и используйте скилл аккуратно. Он секурен в своей роли, и модерацию в Clawhub от VirusTotal он тоже прошел. Но, к примеру, openclaw-ассистент внутри боевого Битрикс24 вашей компании с полными правами и выходом в интернет – так себе идея. Поэтому и ответственность на вас. #Bitrix24 #AIагенты #MCP #OpenClaw #NoCode #CRM
2 674
Step 3.5 Flash: MoE-модель с гибридным вниманием и скоростью до 350 токенов/сек
StepFun выпустила Step 3.5 Flash – MoE-модель с 196 млрд общих и всего 11 млрд активных параметров, оптимизированную для скорости и работы с длинными контекстами.
🔹 Что делает ее быстрой
— Гибридная архитектура внимания: чередование полного внимания и скользящего окна – позволяет работать с контекстом до 256K токенов без перегрузки памяти.
— Алгоритм MIS-PO снижает «сбивание» с логической траектории в длинных цепочках рассуждений (CoT).
— Скорость: до 300–350 токенов/сек – выше, чем у большинства моделей аналогичного размера.
🔹 Что умеет — Модель затачивали под автономных агентов. Умеет работать с 10+ инструментами одновременно (включая поиск, анализ кода, генерацию отчетов до 10K слов). — Поддерживает гибридный режим: сервер планирует задачу, локальная версия исполняет ее на устройстве (например, управление приложениями на смартфоне). — Хорошо справляется с большими репозиториями кода – без типичных тормозов при обработке объемных текстов.🔹 Результаты — 97.3% на AIME 2025 (без калькуляторов) → 99.8% с доступом к Python. — 74.4% на SWE-Bench, 51.0% на Terminal-Bench 2.0. — Уступает Gemini 3.0 Pro по плотности знаний, но выигрывает в скорости и локальной доступности. 🔹 Доступ — Открыта под Apache 2.0 – можно скачать и запустить локально. — Доступна через API для тестирования. 🔹 Полезные ссылки — Статья — Модель — Demo 🖥GitHub #Step35Flash #MoE #AIагенты #ЛокальныйИИ #Кодинг
2 674
GitHub запустил выбор ИИ-агентов прямо в VS Code и редакторе пулл-реквестов
Теперь, при наличии подписки Copilot Pro+, Pro или Enterprise, разработчики могут выбирать между Claude и Codex прямо внутри VS Code или веб-интерфейса GitHub – без переключения между вкладками.
🔹 Что изменилось — Можно выбрать модель под задачу: • Claude – для написания документации, анализа контекста, формулировки комментариев. • Codex – для рефакторинга, генерации кода, исправления багов. — Агенты работают в рамках текущего пулл-реквеста или файла – контекст не теряется. — Нет необходимости копировать код или переключаться на сторонние интерфейсы.🔹 Для кого полезно — Разработчики, которые тратят время на переключение между инструментами. — Команды, где важна точность: один агент пишет тесты, другой – документацию, третий – оптимизирует логику. — Те, кто хочет сохранять фокус в среде разработки, а не в браузере. 🔹 Что дальше GitHub планирует добавить поддержку моделей от Google, Cognition и xAI – расширив выбор без выхода из экосистемы. Подробнее на GitHub #GitHub #AIагенты #MCP #Copilot #VSCode #Разработка #Интеграция
2 674
Frontier от OpenAI: платформа для управления ИИ-агентами в корпоративной среде
OpenAI представила Frontier – платформу для создания и управления ИИ-агентами, работающими в рамках существующей корпоративной инфраструктуры.
🔹 Что делает — Объединяет данные из CRM, внутренних систем и хранилищ в единый семантический слой – агенты получают доступ к актуальной информации без переноса данных. — Позволяет задавать точные границы полномочий: какой доступ есть у агента, какие действия он может выполнять, с какими системами взаимодействовать. — Поддерживает дообучение на реальных кейсах через обратную связь от сотрудников – агенты становятся точнее со временем.🔹 Чем отличается от других решений — Не требует переделки IT-ландшафта: работает поверх существующих систем (API, интеграции). — Не заменяет процессы – усиливает их: агенты выполняют рутину (анализ отчётов, поиск информации, подготовка данных), а люди принимают решения. 🔹 Для кого — Компании с большим количеством внутренних систем и сложными рабочими процессами. — Команды, которым нужно автоматизировать поиск информации, обработку запросов, анализ данных – без увеличения нагрузки на ИТ. 🔹 Статус — На старте доступен ограниченной группе клиентов. — Расширение программы ожидается в ближайшие месяцы. Подробнее на #Frontier #OpenAI #AIагенты #КорпоративныйИИ #Автоматизация
2 674
Claude Opus 4.6: улучшенная модель для сложных агентских задач и работы с большими объемами данных
Anthropic обновила флагманскую модель – Claude Opus 4.6 теперь лучше справляется с длительными агентскими цепочками, стабильнее работает с крупными кодовыми базами и способна обнаруживать собственные ошибки.
🔹 Ключевое обновление — Поддержка контекста до 1 млн токенов (в бете) – позволяет сохранять полную картину больших проектов, длинных документов и сложных логических цепочек без потери связности.🔹 Производительность — State-of-the-art результаты в: • агентском программировании • междисциплинарном рассуждении • knowledge work • агентском поиске 🔹 Интеграции — Расширены возможности в Excel, PowerPoint, Claude Code и API – для более глубокого встраивания в аналитические и разработческие рабочие процессы. Подробнее на #ClaudeOpus #AIагенты #MCP #Кодинг #Агенты #ИИразработка
2 674
Qwen3-Coder-Next: открытая MoE-модель для агентных задач в кодинге
Qwen3-Coder-Next – открытая MoE-модель с 80 млрд общих и 3 млрд активных параметров, оптимизированная для автономной работы с кодом. Контекст – дот 256K токенов, поддержка 370 языков.
🔹 Как обучали
— На 800 тыс. реальных задач из GitHub PR, запущенных в Docker-контейнерах – с прямым фидбеком от среды.
— Через SFT на агентных траекториях, дистилляцию экспертов (WebDev, QA, UX) и RL с юнит-тестами как сигналом вознаграждения.
— Основные данные: Python (202K), JS/TS (175K) – для редких языков точность ниже из-за нехватки данных для проверки.
🔹 Результаты — 70% на SWE-Bench Verified (SWE-Agent) — 44.3% на SWE-Bench Pro — 62.8% на SWE-Bench Multilingual — Отстает от Claude 4.5 Opus на сложных архитектурных задачах и в кибербезопасности. — Слабо справляется с фронтендом и UI-задачами.🔹 Особенности — Поддержка fill-in-the-middle – эффективное автодополнение в IDE. — Лицензия: Apache 2.0. — Модель доступна на Hugging Face, исходники – на GitHub. 🔹 Полезные ссылки — Сама модель https://huggingface.co/collections/Qwen/qwen3-coder-next — Технический отчет https://github.com/QwenLM/Qwen3-Coder/blob/main/qwen3_coder_next_tech_report.pdf — GitHub https://github.com/QwenLM/Qwen3-Coder Подробнее на #Qwen3Coder #MoE #AIагенты #OpenSource #Кодинг #ИИразработка
