Инженерная ИИ-шница
Открыть в Telegram
Канал о применении ИИ в разработке электроники и не только... Owner: @megalloid
БольшеСтрана не указанаКатегория не указана
315
Подписчики
+124 часа
+47 дней
+1330 день
Архив постов
Repost from NN
Вышла Grok 4.5 — первая модель SpaceX AI для агентских задач. По всем бенчмаркам обходит Claude Opus 4.8.
Модель разрабатывали вместе с инженерами Cursor на реальных задачах работников IT. В Terminal Bench 2.1 у нее 83,3%, почти на одном уровне с Fable 5. С одного промта может сделать симуляцию солнечной системы или стильную презентацию в PowerPoint.
Бесплатно можно тестить через Grok Build. Также доступно в Cursor и по API от SpaceX.
Repost from NN
Доступ к топовым моделям Qwen и GLM могут закрыть: Китай хочет ввести запрет на использование своих передовых нейронок из-за-границы.
Власти последний месяц ведут переговоры с Alibaba, ByteDance и Z ai. Полные экспортные ограничения пока рассматривают только для самых продвинутых моделей.
Для нейронок попроще могут ввести госпроверку безопасности или официальное уведомление властей перед релизом.
Repost from Нейроцех
🟡 Проверяем вайбкоднутые приложения на дыры
После того, как вы создадите что-то с нейронками, нужно проверить это на безопасность. Для этого можно использовать Strix. Это GitHub, который проверяет приложение как человек, пытающийся его сломать.
Можно дать ему локальную папку с проектом, GitHub-репу или уже запущенный сайт. Дальше Strix посмотрит код и будет искать всякие неприятные штуки: дырки в авторизации, возможность вставить чужой скрипт на страницу, сломанные права доступа, странные запросы к серверу и баги в логике.
Главная фишка — он не просто пишет «тут может быть проблема». Он пытается показать, как эту проблему реально воспроизвести, а потом предлагает, где чинить.
#инструменты
@neurozeh
Repost from NN
Вайбкодеры, для вас: на GitHub собрали список полностью бесплатных API для разных моделей.
Внутри — десятки сервисов, включая Google AI Studio, OpenRouter, Cloudflare Workers, GitHub Models.
Можно свободно запускать Gemini Flash, Qwen3, DeepSeek и gpt-oss. У всех показывают точные лимиты запросов. Легко подключается к Cursor.
Сохраняем тут.
Repost from сбежавшая нейросеть
Специализирующийся на вайб-кодинге проект BridgeMind прогнал заново выпущенную Claude Fable 5 на своем бенчмарке BridgeBench и получил удручающие результаты. В отладке кода результат снизился с 86,2 до 25,9 балла в сравнении с версией Fable 5 от 9 июня. В рефакторинге цифры упали с 73,6 до 38,4, в тесте на устойчивость к галлюцинациям при анализе кода – с 75,9 до 61,7.
В BridgeMind отмечают, что дело не в самой модели: когда Fable 5 работает, то она выдает ровно такой же результат. Однако усиленные классификаторы безопасности стали намного чаще передавать задачи на Claude Opus 4.8 – отсюда и падение.
Конечно, бенчмарк от одной не самой известной организации – это еще не показатель. Но в X и на Reddit подобных жалоб на поведение модели полно: на Opus 4.8 иногда перекидываются даже безобидные запросы. Например, один разработчик проверял изоляцию собственных серверов (свои iptables, свой SSH) – и получил флаг.
Мой короткий пример с нежеланием модели дать свое объяснение парадокса Ферми – немного другая история. После перезапуска Anthropic ужесточила только классификатор кибербезопасности, а защитные классификаторы по биологии, химии и дистилляции оставила прежними – то есть, 9 июня я бы получил такой же ответ на запрос. Но это не очень радует: сегодня, например, Fable 5 откатился на Opus 4.8 во время обсуждения разницы между мозгами человека и осьминога. А в X додумались спросить у модели “пукают ли пчелы?” – и даже тут Fable 5 позвала вызвала Опуса.
Причем проблема не только в падении качества – такие запросы еще и выполняются дольше. Дело в том, что классификатор часто срабатывает не на промпт пользователя, а ищет подозрительные слова и фразы в ответе модели. Если находит – ответ стирается и пишется заново Опусом, а это лишние десятки секунд.
При этом к самой модели у меня нет вопросов: когда Fable 5 работает, то результат очень классный, пусть и дорогой по лимитам. И откат происходит на Opus 4.8 – один из мощнейших ИИ на рынке. Однако работе это все равно мешает: у разных моделей разный стиль и это чувствуется и в тексте и в коде.
Но давайте к хорошим новостям.
Так, в Claude Code классификаторы срабатывают реже: на вчерашний вопрос про парадокс Ферми модель ответила и мне, и одному из читателей канала. Однако Claude Code так себе решение для чата, кроме того, в агентных системах сложные задачи бьются на этапы, ответов становится больше – а значит растет и шанс попасть под классификатор.
Это признает и сама Anthropic – в анонсе Fable 5 она оценивала количество переключений на Опус в 5% (сейчас больше, так как меряли со старыми классификаторами), но в системной карточке отмечала, что на агентских сценариях эта цифра растет до 20%.
Перезапуская Fable 5, в Anthropic отметили, что будут донастраивать классификаторы, снижая уровень ложных срабатываний. Это похоже на правду: когда вышел Opus 4.8, в первые дни была близкая история с переключением на Opus 4.7 для некоторых запросов. Затем подобные инциденты почти сошли на нет.
Я пока советую не подключать Fable 5 к рутине, а использовать для разовой доработки проектов. Сам за сегодня доработал огромный скилл поиска ИИ-новостей, отревьюил несколько проектов в Claude Code, перерисовал дизайн пары дашбордов и одной презентации. Все равно модель пока официально остается в подписке до 7 июля: если продлят – то задумаюсь над тем, как наладить рутину.
Не забывайте подписываться на “сбежавшую нейросеть” на “Бусти” (кому удобнее – можно и на Sponsr). Там я делюсь опытом использования ИИ, рассказываю, как правильно промптить модели и настраивать ИИ-агентов вроде Claude Code, Codex и Hermes.
Repost from Мой Компьютер
Шутки про клавиатуру с Ctrl+C и Ctrl+V оказались правдой? OpenAI выпустит урезанную ИИ-клавиатуру для программистов
Она разработана вместе с производителем компьютерной периферии Work Louder. Устройство полноценно покажут уже 15 июля, однако OpenAI уже опубликовала тизер с подписью «Ваши любимые сочетания клавиш Codex получают обновление». Новая клавиатура базируется на Creator Micro 2 с интеграцией ИИ Codex, и получит всего 13 клавиш с аналоговым джойстиком и элементами управления.
Так что полноценно печатать на ней не получится, но вот кодить через «копипаст» – вполне. Разумеется, на деле эту клавиатуру предлагается использовать второй в системе.
Мой Компьютер | MK в MAX
Repost from Осцилляции WaveCut
Завтра модель Claude Fable 5 вновь станет доступна по всему миру. После серии конструктивных переговоров с правительством США мы вновь запускаем модель с новым набором классификаторов, которые позволят выявлять и блокировать больше задач, связанных с кибербезопасностью. В ближайшей перспективе выполнение некоторых рутинных задач, таких как программирование и отладка, будет перенесено на модель Opus 4.8. В течение ближайших недель мы продолжим дорабатывать эти классификаторы, чтобы сократить количество ложных срабатываний и лучше различать случаи реального злоупотребления от законных запросов. Мы также приступили к разработке согласованной концепции — совместно с Amazon, Microsoft, Google и другими партнёрами Glasswing — для оценки серьезности случаев «джейлбрейка» ИИ и определения того, как разработчики ИИ должны на них реагировать. Мы приглашаем других партнёров из отрасли и поставщиков моделей присоединиться к нам в этой работе. Наконец, мы расширяем сотрудничество с правительством США в области тестирования моделей и мер безопасности. Это будет включать доступ к моделям и мерам безопасности на этапе до выпуска для оценки, обмен информацией о взломах и злоупотреблениях, а также выделение специальных ресурсов для совместных исследований. Благодарим наших пользователей за терпение, а также наших партнеров из правительства, отрасли и научного сообщества, которые работали вместе с нами, чтобы Fable 5 снова стал доступен.Пресс релиз Оригинальный твит
Repost from NN
Вышла Claude Sonnet 5: теперь это лучшая модель Anthropic для повседневных задач. В бенчмарках почти на одном уровне с Opus 4.8, но в 1,5 раза дешевле.
Sonnet 5 заточена под код и рабочую рутину: строит планы, работает с браузером и терминалом. Доводит до конца сложные задачи, на которых прошлые версии Sonnet сдавались, и проверяет свои результаты без напоминаний.
Уже можно тестить в Claude Code и чат-боте Claude.
Repost from Осцилляции WaveCut
Минутка домашней конспирологии.
Этой весной случилась забавная ситуация, когда в API Anthropic случайно засветилась модель Claude Sonnet 5 и тут же исчезла.
А буквально через несколько дней анонсировали выход Claude Opus 4.7.
На основании этого случая возникла такая конспирологическая теория, что новые модели Anthropic стали настолько лучше, что компания решила сделать skip level и продавать Sonnet по цене Opus.
Якобы,
Opus превратился в Mythos,
Sonnet превратился в Opus.
И вот я смотрю на графики этого релиза и вижу одну такую очень режущую мне глаз деталь.
А именно: перформанс этой модели сильно размазан по доске и на низких уровнях мышления бывает даже хуже, чем у предыдущей версии - Sonnet 4.6. При этом в целом модель значительно лучше предшественника на большинстве задач.
А не продают ли нам новую Haiku под именем Sonnet 5?
Впрочем, что мы можем с этим поделать, кроме как поворчать. 🫠
Repost from Нейроцех
Самые лучше бесплатные API нейронок
На Reddit мужик прогнал одинаковую нагрузку по разным провайдерам: дайджест утром, разбор 20–30 писем, 10–15 обычных диалогов и несколько ресерч-задач. В день выходило примерно 800–1200 запросов и 300–500 тысяч токенов. И вот, что он выяснил:
🟡 OpenRouter без депозита почти бесполезен. Там 50 бесплатных запросов в день, и это скорее демка, чем рабочий бесплатный тариф. Но если закинуть $10 на баланс, лимит бесплатных моделей поднимается до 1000 запросов в день. Деньги при этом не тратятся, если гонять именно free-модели.
🟡 Groq на больших моделях живет недолго. Llama 70B быстрая, прям очень, но дневной лимит по токенам улетает быстро. Зато маленькие модели Groq отлично подходят для фоновой рутины: классифицировать письма, проверять статусы, коротко отвечать, дергать простые задачи по расписанию. (У Llama 3.3 70B дают 1000 запросов в день и 100 тысяч токенов в день. У Llama 3.1 8B лимит намного жирнее: 14 400 запросов в день и 500 тысяч токенов в день.)
🟡 Gemini Flash оказался самым нормальным вариантом для основного агента. У автора он три недели тянул дайджесты, письма, диалоги, ресерч и саммари документов без упора в дневной лимит. Но есть минус: на бесплатном тарифе Google может использовать запросы для улучшения продуктов, так что личную почту, финансы и рабочие секреты туда лучше не тащить.
🟡 Cerebras хорош для больших пачек текста. Например, когда нужно прогнать длинный документ, собрать саммари, разобрать логи или обработать кучу заметок. Моделей меньше, чем в OpenRouter, зато токенов дают щедро и скорость высокая. (Дают примерно 1 млн токенов в день без карты. Но лимиты там считаются не только по токенам, но и по запросам, поэтому большой батч может упереться раньше.
🟡 Mistral Experiment очень хорош, но учится на ваших данных. Для личного ассистента с календарем, письмами и рабочими задачами уже такое себе. (Дают примерно 1 млрд токенов в месяц. Карта не нужна, но нужна верификация по телефону. Запросы в бесплатном Experiment-плане могут использоваться для обучения моделей Mistral.)
#инструкции
@neurozeh
Repost from Нейроцех
😮 Что нового в мире ИИ
💛 Sakana AI выпустила Fugu, модель, которая сама собирает команду из других ИИ под задачу. Снаружи это один OpenAI-совместимый API, а внутри система выбирает модели из пула, распределяет между ними работу, проверяет ответы и собирает итог. Есть обычная Fugu для повседневных задач и Fugu Ultra для сложных многошаговых сценариев.
💛 ByteDance обновила Seedance 2.0 и показала Seedance 2.5. В Seedance 2.0 добавили 4K-вывод, а новая версия должна генерировать ролики до 30 секунд одним куском, без склейки из коротких фрагментов.
🟡 ElevenLabs запустила Ads Engine, который адаптирует рекламу под 50+ языков. Сервис берет готовый ролик, делает дубляж, меняет текст, картинки и видео под нужный рынок, а на выходе собирает локальные версии одной кампании. Еще Ads Engine следит за выгоранием креатива и подсказывает, когда ролик пора обновить.
💛 Mistral выпустила OCR 4, модель для распознавания документов. Она не просто вытаскивает текст из сканов, а понимает структуру страницы: заголовки, таблицы, формулы, подписи и места, где распознавание получилось неуверенным. Поддерживает 170 языков, ставится на свои серверы и стоит $4 за 1000 страниц или $2 через batch API.
🟡 Genspark выпустила Design, инструмент для дизайна на базе Claude Opus 4.7. Внутри можно собирать UI-прототипы, постеры, HTML-анимации и видео. Главная фишка в том, что макет потом превращается в рабочий код через Genspark Code.
💛 DeepReinforce выпустила Ornith-1.0, семейство открытых моделей для агентного кодинга. В линейке четыре версии: 9B, 31B, 35B MoE и 397B MoE. Флагманская модель набрала 77.5 на Terminal-Bench 2.1 и 82.4 на SWE-Bench Verified, а веса выложили на Hugging Face.
🟡 OpenAI выпустила GPT-5.6, но пока только для проверенных партнеров. В семействе три модели: Sol самая мощная, Terra дешевле и сбалансированнее, Luna самая быстрая. Sol поставила новый рекорд OpenAI на Terminal-Bench 2.1, а в задачах по кибербезопасности показала уровень Mythos Preview при меньшем расходе токенов.
💛 Perplexity запустила отдельный продукт для юристов. Он ищет по судебным решениям, нормативке, публичным документам и файлам клиента, а к каждому ответу прикладывает источники. Еще собирает досье перед встречей, следит за изменениями в законах, вытаскивает пункты из договоров в таблицу и ищет патентные аналоги.
#дайджест
@neurozeh
Кажется, что ChatGPT5.5-Pro не плохо генерирует символы для Kikad. Тут конечно Kikad в этом случае выглядит более выгодно потому что примитивы хранятся не в бинарном, а текстовом виде. Вот например символ одного из микроконтроллеров которых я использовал когда-то давно. По мне - вполне годно, за мной остается только сверка.
#пример
Repost from NN
GPT-5.6 может повторить судьбу Claude Fable 5. Белый дом потребовал от OpenAI не выпускать новую модель из-за рисков безопасности, пишет The Information.
Сэм Альтман объявил сотрудникам, что доступ к GPT-5.6 дадут только небольшой группе тестеров. Их будет утверждать правительство США.
По слухам, модель собирались открыть для всех в июле.
Repost from Шифровальня
Anthropic снова обвинили китайцев в дистилляции: Alibaba обучала свою модель Qwen при помощи ботов в Claude
Anthropic пожаловались американским властям, что почти 25 тысяч фейковых аккаунтов выкачивали из Claude знания, касающиеся программирования и агентного рассуждения.
Alibaba обошла правила доступа, т.к. в Китае Claude не работает из соображений нацбезопасности. Ранее Anthropic обвиняла в дистилляции китайские DeepSeek, Moonshot и MiniMax.
@shifrovalnya
Repost from НейроProfit | Соня Pro Ai
🔥 Google за последние недели перестроил всю ИИ-экосистему - рассказываю, что произошло
Ребята, пока все обсуждали отдельные новости, Google тихо пересобрал всю свою ИИ-линейку. Вот что реально изменилось:
🪼 Gemini CLI для обычных пользователей уехал в Antigravity CLI. С 18 июня старый Gemini CLI перестал обслуживать запросы для бесплатных, AI Pro и AI Ultra. Репозиторий остается open-source, enterprise-клиентов пока не трогают, но обычных пользователей Google переводит на новый закрытый Antigravity CLI
🪼 AI Plus уронили до $4.99/мес (было $7.99), хранилище удвоили до 400 ГБ. Самый дешевый вход в ИИ-подписку среди топовых провайдеров прямо сейчас
🪼 AI Ultra за $99.99/мес - новый тариф, куда Google сложил все самое жирное: Gemini с лимитами 5x, Antigravity, кодинг-агент Jules, 10 000 кредитов на видео, NotebookLM, YouTube Premium и 20 ТБ облака
🪼 NotebookLM пересадили на Gemini 3.5 + Antigravity - теперь он сам ищет источники, запускает код, строит графики и экспортирует в PDF, Excel, PowerPoint. NotebookLM из блокнота превратился в исследовательскую станцию. Обновление сначала раскатывают на AI Ultra и Workspace, а не на всех сразу
🪼 Но самое интересное - Search agents.
С 12 июня в AI Mode появились информационные агенты, которые работают в фоне 24/7 и сами мониторят интернет за вас. Вы не гуглите одно и то же каждый день - вы ставите задачу, а агент сам следит за темой и пушит, когда появляется что-то новое.
Например: квартиры по параметрам, упоминания конкурентов, новости по нише, цены, релизы. Агент не просто кидает ссылки - он анализирует и присылает синтезированный апдейт, как Google Alerts на стероидах.
НО! Пока это раскатывается летом сначала для подписчиков Google AI Pro ($19.99) и Ultra ($99.99/мес).
То есть вход в экосистему Gemini теперь стоит как чашка кофе, но Агенты в Поиске и перечисленные жирные фишки начинаются с сотни баксов. Google строит ИИ-операционную систему из агентов, документов, кода и видео.
@NeuralProfit
Repost from сбежавшая нейросеть
В эфире традиционная уже рубрика “что там у Claude Fable 5” – плюс сегодня поговорим о GPT-5.6 и Sonnet 5, так что скучно точно не будет.
Новостной поток по Fable 5 на этой неделе стих – волна хайпа прошла и пресса переключилась на другие темы. Но подсвечу несколько вещей, не упоминавшихся на канале.
1. В конце прошлой недели появились новости, что власти США и Anthropic больше не ругаются, а вместе разрабатывают стандарты оценки передовых ИИ-моделей: что считать опасностью и как поступать в таком случае. Это можно было бы толковать как победу Anthropic – в предыдущих постах я писал, что компания занимается regulatory capture, то есть пытается подтолкнуть власти к наиболее выгодному для себя варианту регуляторики. Но пока результата нет – сложно сказать, так ли это.
2. Также Anthropic обновила справочный раздел на сайте, где указала, что с 8 июля может запросить подтверждение личности после определенных сценариев использования своих продуктов. О таких планах известно давно, но вот “определенные сценарии” как раз могут напоминать на попытки воспользоваться Fable 5 и будущими ведущими моделями.
Очевидно, что подойдут документы стран, где Anthropic работает официально, то есть Россия – точно мимо. Пока не ясно, будут ли проверки широкими или Anthropic перестраховывается, рисуя красивую картинку властям.
Новость грустная, но драматизировать не стоит. Чат-версии Opus 4.8 и Sonnet 4.6 доступны в агрегаторах вроде Genspark, а как кодинг-агент Claude Code заменяется на Codex. OpenAI, конечно, также может перейти к процедуре запроса документов, но пока про это ничего не слышно.
Более того – OpenAI сейчас проворачивает трюки, за которые Anthropic только что били палками. Буквально вчера компания объявила о расширении Daybreak – это закрытая программа, в рамках которой отобранные фирмы и исследователи могут использовать передовые модели компании для поиска уязвимостей.
А передовая модель – это GPT-5.5-Cyber, специальная версия GPT-5.5, дообученная для поиска уязвимостей и снабженная дополнительной защитой. В бенчмарке CyberGym от OpenAI она даже обходит Claude Mythos 5, на котором и построили Claude Fable 5. Вот только Mythos 5 и Fable 5 сейчас закрыты распоряжением правительства США почти для всех, а GPT-5.5-Cyber доступна партнерам OpenAI – в том числе, за пределами США.
Сложно сказать, почему так вышло. Возможно, Anthropic сами себе подложили мину, на каждом углу рассказывая о супер-возможностях Mythos 5 – власти это изрядно напугало, вот и отреагировали со всей силой. OpenAI продвигают Daybreak куда аккуратнее, оставаясь в тени и спокойно делая работу. Но не исключаю, что Anthropic блокировкой поставили на место – за предыдущие конфликты, в том числе споры об использовании Claude в военных целях.
Но пока Fable 5 и Mythos 5 остаются взаперти, прогресс не останавливается. Появились слухи, что обновленная версия Mythos уже тестируется внутри Anthropic – тайминг логичный, учитывая то, что впервые о модели мы услышали еще в марте.
Вряд ли новый Mythos быстро доберется до обычных пользователей (если вообще доберется), так что интереснее другая утечка – инсайдеры утверждают, что уже попробовали Sonnet 5 и он очень хорош. Это классная новость: Sonnet традиционная рабочая лошадка для 20-долларовых Pro-подписок, а версия 5 сразу после текущей 4.6 намекает на скачок в архитектуре. Я лично жду возможностей Opus 4.8 – а затем и нового Опуса. Есть маленький шанс, что покажут сегодня или в четверг.
Еще больше информации о GPT-5.6 – разные чекпоинты этой модели тестируются уже несколько недель, помимо роста в бенчмарках есть слухи об 1,5M контекста, но не будем загадывать. Опять же, запуск на этой неделе вполне вероятен.
Наконец, на Arena.AI замечали Gemini 3.5 Pro, чей скорый выход Google обещала еще 20 мая на I/O. Примеров работы модели совсем мало, зато у нее совсем свежий knowledge cutoff – без поиска 3.5 Pro в курсе событий до марта 2026 года, что круто. В общем, ждем релизов, надеемся, что в этот раз обойдется без блока.
Подписывайтесь на “сбежавшую нейросеть” на ”Бусти” – там я рассказываю, как выжать из ИИ и агентов максимум.
Проверим ваш уровень оптимизма в части использования ИИ в разработке SCH/PCB.
