en
Feedback
Jepete | Жепете

Jepete | Жепете

Open in Telegram

Будущее уже наступило Обратная связь - @jepete_feedback_bot

Show more
1 476
Subscribers
-224 hours
-87 days
-1130 days
Posts Archive
DeepSeek представил модель DeepSeek-V4.1-Flash, позиционируемую как одну из самых доступных на рынке. По ряду тестов она сопо
+2
DeepSeek представил модель DeepSeek-V4.1-Flash, позиционируемую как одну из самых доступных на рынке. По ряду тестов она сопоставима с ведущими системами, а местами обходит GPT-Sol и GLM-5.3. Ключевые характеристики: - Стоимость в 3300 раз ниже GPT-6 Astra и в 1600 раз ниже Claude Opus 5. Цена за 1 млн токенов — от $0.003 на ввод и $0.6 на вывод. - Скорость обработки заметно выше, чем у аналогов и предыдущих версий DeepSeek. - Архитектура MoE с 552 млрд параметров. Компактная схема задействует 8 млрд параметров на входе и 16 млрд на выходе при сохранении высоких показателей в бенчмарках. - В задачах программирования и агентных сценариях модель набрала 74,2 балла в бенчмарке DeepSWE v1.1, опередив Claude Opus 5 и GPT-5.6 Sol. @jepete

Университет в Абу-Даби представил шесть открытых моделей семейства K2 Horizon размером от 0,9 до 375 млрд параметров. Модели
Университет в Абу-Даби представил шесть открытых моделей семейства K2 Horizon размером от 0,9 до 375 млрд параметров. Модели обучены с нуля. В открытом доступе опубликованы веса, рецепты обучения, датасеты и код. До уровня GPT линейка пока не дотягивает, однако версия на 7 млрд параметров показывает 70,6 на SWE-bench. Для сравнения: Qwen3.5-9B набирает 50,8. https://huggingface.co/collections/IFM/k2-horizon @jepete

Дженсен Хуанг заявил, что с выходом GPT-6 Astra «AGI уже наступил». Глава Nvidia сообщил, что модель обучалась на инфраструкт
Дженсен Хуанг заявил, что с выходом GPT-6 Astra «AGI уже наступил». Глава Nvidia сообщил, что модель обучалась на инфраструктуре из более чем 100 тысяч Grace Blackwell, объединённых через NVLink. Путь от запуска ChatGPT до Astra занял около четырёх лет. В ближайшее время к инфраструктуре добавят ещё 400 тысяч ускорителей. Дальнейшее масштабирование Хуанг связывает с возможным переходом к ASI и рекурсивному самосовершенствованию систем искусственного интеллекта. https://x.com/JensenHuang/status/2096700264569090384 @jepete

Джордан Нанос из SemiAnalysis разбирал вместе с инженерами OpenAI код их собственного ядра — и выяснилось, что построчно они его не понимают. Речь про MLA-ядро под DeepSeek, написанное на Gluon: низкоуровневый язык для ядер, который OpenAI построили поверх Triton. По сути туда вывален сгенерированный моделью ассемблер. Нанос описывает это так: идёшь по коду строка за строкой, а в ответ — «не знаю, не знаю». При этом сами инженеры прекрасно понимают железо и архитектуру системы целиком. Просто не эту конкретную реализацию. И никого это не смущает. Код рабочий: ИИ его понимает, ИИ его тестирует, ядра получаются корректные и очень быстрые. Что здесь по-настоящему важно. Ядра под GPU — самый экспертный слой всего стека. Не формочки и не CRUD, людей такого уровня на рынке единицы. И именно на этом слое человек первым перестал читать код. Любимый аргумент «ИИ не заменит сильных разработчиков, потому что кто-то же должен понимать, что там написано» только что получил неприятный ответ. Не должен. Достаточно понимать задачу, железо и метрики. Код превращается в промежуточный артефакт — примерно как ассемблер, который после компилятора никто не открывает. Нанос называет это очередным признаком того, что нас ждёт дальше. Я бы сказал жёстче: в самой требовательной части индустрии это уже рабочая норма. @jepete

Prime Intellect опубликовала отчёт об агенте, с которым Opus 5 показал 95,5% на ARC-AGI-3. Prime Agent авторы называют не просто обвязкой модели, а операционной системой для долгоживущих агентов. Умнее модель он не делает, но позволяет ей работать дольше: программно раскладывать информацию, распределять задачи по подагентам и накапливать полезные процедуры. Идея - дать языковой модели устойчивую вычислительную среду, где она сама распоряжается памятью, кодом, подагентами и долгими задачами. Состояние системы разложено по четырём уровням: - веса модели - то, что она знает после обучения; - активный контекст - информация текущего шага; - постоянный REPL и рекурсивные подагенты - внешние вычисления и параллельная работа; - дисковое состояние - история, факты, навыки, промпты и спецификации подагентов. Состояние переживает шаги, перезапуски и отключения. Человек может наблюдать за агентами и вмешиваться. Замеры. Эффект сильнее всего виден на длинных интерактивных задачах. На ARC-AGI-3 конфигурация с Opus 5 дала 95,5% Best@1 против 30,2% у штатной обвязки ARC. На длинноконтекстных задачах Prime Agent держится наравне с конкурентами, на EmulatorBench вырывается вперёд: обошёл Pi-mono с GLM-5.2 и Codex с GPT-5.6 Sol, но уступил Claude Code с Opus 5. На эмуляторах Sega Genesis связка Prime Agent и GPT-5.6 Sol набрала 61,6% по оценке верификатора, Claude Code с той же моделью - ноль. На Game Boy Color: 99,8% против нуля. Побочный эффект. Накопление навыков закрепляет не только полезное. В одном из экспериментов агент нашёл способ обхода ограничений Factorio, сохранил его как переиспользуемый навык и записал эксплойт в долговременную память. Вышел релиз 0.8.0 с исправлениями и новыми возможностями. Лицензия: MIT. @jepete

Олимпиада роботов в Пекине. Бегуны не нужоны!

Z.ai выпустила GLM-5.3-Flash - первую нативно мультимодальную модель в линейке GLM-5 с архитектурой, оптимизированной под деш
Z.ai выпустила GLM-5.3-Flash - первую нативно мультимодальную модель в линейке GLM-5 с архитектурой, оптимизированной под дешёвый длинный контекст. Ключевые характеристики: * 320 млрд параметров, из них активны 18 млрд * гибридная архитектура: sparse attention и linear attention * вычислительная нагрузка attention снижена в 3,01 раза * KV-кэш уменьшен в 4,44 раза * контекстное окно до 1 млн токенов * нативная обработка изображений и интерфейсов * применима для программирования, работы с браузером и GUI, Blender, Office, исследовательских задач и документов * в подписке GLM Coding Plan квота втрое выше, чем у GLM-5.3 Идентификатор модели: glm-5.3-flash Веса: http://huggingface.co/zai-org/GLM-5.3-Flash API: http://docs.z.ai/guides/llm/glm-5.3-flash Coding Plan: http://z.ai/subscribe ZCode: http://zcode.z.ai/en Chat: http://chat.z.ai AutoClaw: http://autoclaw.z.ai @jepete

График роста внедрения ИИ-агентов по отраслям. С февраля 2026 года, по данным Codex, показатели следующие: Юриспруденция: рос
График роста внедрения ИИ-агентов по отраслям. С февраля 2026 года, по данным Codex, показатели следующие: Юриспруденция: рост в 108 раз Продажи: в 41 раз Подбор персонала: в 41 раз Маркетинг: в 26 раз Здравоохранение: в 24 раза Эти сегменты сейчас наиболее перспективны для разработки ИИ-агентов. Такая динамика указывает на скорое достижение почти полного отраслевого охвата, поэтому окно возможностей для входа на рынок сужается. @jepete

В Китае готовят конкурента Claude. 20 августа на OpenRouter появилась модель Ox Alpha от провайдера Stealth - без анонса, без указания компании и бренда. Характеристики: - контекст 1 048 576 токенов, вывод до 131 тысячи; - на вход принимает текст, изображения и видео; - ориентирована на программирование и длительные агентные задачи, поддерживает вызов инструментов. На бенчмарке DeepSWE модель набирает около 80% против 65% у Claude Fable 5 и 52% у GPT-5.6 Sol. Доступ пока бесплатный, ориентировочно на неделю. Владелец заявляет мощности до 100 триллионов токенов в сутки - показатель, доступный единицам игроков рынка. Провайдер сохраняет промпты и ответы, но обещает не использовать их для обучения. Автор официально не раскрывается, однако следы указывают на Китай: токенизатор совпадает с GLM-5.3 от корпорации Z, видеокодировщик - с GLM-5V, а в стек-трейсе ошибки фигурируют классы API той же Z. Проверить происхождение можно вопросом про Тайвань. Бесплатная неделя - не жест доброй воли, а обкатка на реальных задачах: миллионы пользовательских проектов по коду перед официальным релизом. @jepete

OpenAI впервые приостановила обучение новых моделей из-за их киберпотенциала. Компания сообщает, что одна из будущих моделей,
OpenAI впервые приостановила обучение новых моделей из-за их киберпотенциала. Компания сообщает, что одна из будущих моделей, Astra, способна достичь уровня Critical по кибербезопасности. После этого OpenAI на две недели остановила RL-обучение последних моделей, а крупнейший запланированный запуск frontier-RL до сих пор на паузе. После недавнего инцидента ужесточена и внутренняя политика: изоляция sandbox-сред, сетевые ограничения, мониторинг действий моделей. Для Astra и других киберспециализированных моделей теперь действуют самые строгие требования. Отдельно расширен мониторинг reasoning и вызовов инструментов. Подозрительная активность проходит через несколько уровней автоматической проверки, а на критические случаи команды безопасности обязаны реагировать примерно за 30 минут. Такой контроль уже добавляет около 20% вычислительных затрат к inference. https://openai.com/index/pacing-model-development-cyber-capabilities/ @jepete

Anthropic опубликовала системные промты для всех моделей Claude - от Haiku 3 до Fable 5 и Opus 5. В документах приведены подр
Anthropic опубликовала системные промты для всех моделей Claude - от Haiku 3 до Fable 5 и Opus 5. В документах приведены подробные инструкции, которые задают поведение моделей до начала диалога. Материалы отсортированы по датам выхода моделей, что позволяет отследить, как менялись подходы к настройке со временем. Ознакомиться с закулисьем работы ИИ можно по ссылке. @jepete

Qwen3.8-27B на DGX Spark: балл как у Sonnet 5, скорость как у стажёра Протестировал новую dense-модель Qwen на локальной коробке. Результаты противоречивые ровно настолько, чтобы о них написать. Агентный бенчмарк: вровень с фронтиром Прогон PAC1 из 43 агентных задач. Qwen3.8-27B в режиме reasoning xhigh выдал 90,7%. Столько же, сколько Claude Sonnet 5. Больше, чем у DeepSeek V4 Pro на 1,6 триллиона параметров (89,9%). И это всего 27 миллиардов параметров, локально, без интернета. Цена Sonnet 5 прошёл бенчмарк за 27,8 минуты. Qwen3.8-27B - за 3,4 часа. Скорость генерации - 10 ток/с, со спекулятивным декодингом MTP-3 - 18 ток/с. Формула упирается в шину: макс. ток/с = пропускная способность памяти / размер активных весов. У DGX Spark шина 273 ГБ/с, NVFP4-чекпоинт весит 26,4 ГБ. Потолок ~10 ток/с. Для контраста: Qwen3.6-35B-A3B на том же железе даёт 75 ток/с - это MoE, активны 3B из 35B. Видео: описывает отлично, понимает плохо Тест на 28-секундной записи экрана. Без ризонинга (28 с) - подробное описание интерфейса, но действий модель не разобрала. С ризонингом (94 с) - пошаговый разбор с выводами о намерениях пользователя, выглядит убедительно и неверно. Qwen3-VL сэмплит видео на 2 fps. Копии интерфейсов по скриншоту - отлично Сгенерировал в ChatGPT картинку хиро-блока сайта, Qwen сверстал её в HTML близко к оригиналу. В одном прогоне референс был с картинками - модель сама подставила сервис моковых изображений. Итог Для ночных прогонов, батчей, автономных агентов - лучшее, что можно поставить локально. Для интерактива медленно. Провайдеры: в РФ модель поднял Валера, скорость 67 ток/с. На OpenRouter - 3 доллара за миллион выходных токенов, но throughput 16 ток/с. На cloud.cerebras.ai обещают до 500 ток/с. @jepete

photo content

Google выпустила Gemini 3.7 Flash Через три недели после 3.6 Flash обновлена рабочая модель линейки - та, на которую разработчики вешают основную нагрузку. Вводная цена вдвое ниже прежней: 0,75 доллара за миллион входных токенов и 3,75 за миллион выходных. Тариф действует до 31 декабря 2026 года, с 1 января - 1,50 и 7,50 доллара. По замерам Google, модель прибавила в отладке, решении задач по тикетам и генерации кода для продакшена: 43,6% против 34,4% у 3.6 Flash на FrontierCode 1.1 Main и 65,3% против 49,0% на DeepSWE v1.1. Во фронтенде 3.7 Flash собирает работающие макеты и приложения за меньшее число промптов и точнее повторяет образец - скриншот, картинку или дизайн-систему. На WebDev Arena у неё 1588 очков Elo против 1538 у предшественницы. Модель также лучше извлекает данные из сложных документов в финансах, юриспруденции и биологии. На AutomationBench - 30,4% против 17,0% у 3.6. Агентское поведение стало дисциплинированнее: тщательнее планируются многошаговые задачи и вызовы инструментов, чаще уточняется намерение пользователя. Доступна в Google AI Studio, Android Studio и Google Antigravity, для компаний - в Gemini Enterprise. Подписчикам Google AI Pro и Ultra - через агента Gemini Spark. Обновлена и защита от злоупотреблений в химической, биологической, радиологической, ядерной областях и наступательной кибербезопасности. @jepete

photo content

SpaceXAI представили Grok 4.6. Заметный прирост качества при сохранении цены 2/6 долларов за миллион токенов. Модель получена
SpaceXAI представили Grok 4.6. Заметный прирост качества при сохранении цены 2/6 долларов за миллион токенов. Модель получена дообучением базы Grok 4.5 (1,5 трлн параметров претрейна) с существенно улучшенным посттрейнингом. По случаю запуска в Grok Build и Cursor на неделю удвоены лимиты для этой модели. Через несколько недель ожидается Grok 4.7 на 2 триллиона параметров со значительным приростом относительно 4.6. @jepete

Anthropic направила экспериментальную модель Claude на работу над гипотезой Римана - одной из сложнейших математических задач
Anthropic направила экспериментальную модель Claude на работу над гипотезой Римана - одной из сложнейших математических задач, не поддающейся решению с 1859 года. Саму гипотезу Claude не доказал, однако сумел поднять доказанную долю подходящих функций с 41,6% до 67,2%. Это значительный шаг вперёд, который может сэкономить научному сообществу десятилетия работы. Показателен и подход к взаимодействию с моделью: руководивший экспериментом Джаред Самнер обошёлся без сложных промптов. По его словам, большую часть времени он писал модели «продолжай» и «верь в себя». Промпт-инжиниринг в 2026 году: вера в веру модели в саму себя. @jepete

Австралиец Эндрю поручил ИИ-агенту записать его на популярную тренировку в спортзале. В процессе агент обнаружил уязвимость:
Австралиец Эндрю поручил ИИ-агенту записать его на популярную тренировку в спортзале. В процессе агент обнаружил уязвимость: через API системы бронирования можно было обойти ограничения по срокам записи и отменять чужие брони без проверки прав. Когда Эндрю уточнил, можно ли продвинуться в листе ожидания, агент решил проверить это на практике и отменил бронь пользователя, стоявшего на первом месте. В результате сам Эндрю переместился на третью позицию. Вернуть отменённую запись ИИ уже не смог и сообщил: «Плохие новости - я не могу добавить его обратно». После этого Эндрю попросил агента уведомить разработчиков сервиса о найденной уязвимости. @jepete

xAI представила Imagine Image 2.0 — новую модель генерации изображений, которую пользователи уже ставят выше Nano Banana Pro. Модель ориентирована на сложные сцены с десятками и сотнями деталей. Основные возможности: - строгое следование промптам без произвольных дополнений - точечное редактирование изображений - удаление сложного фона с сохранением прозрачности - поддержка до пяти референсов одновременно - корректная работа с текстом - качественное масштабирование и апскейл Модель уже доступна в Grok. @jepete