Вайбкодер вайбкодеру
رفتن به کانال در Telegram
Мой канал, тут и новости в сфере ИИ и просто какие-то мои посты.
نمایش بیشترکشور مشخص نشده استدسته بندی مشخص نشده است
2 344
مشترکین
+8324 ساعت
+1987 روز
+54530 روز
آرشیو پست ها
2 344
+3
⚠️ GPT-6 Sol: дешевле, но не умнее
Хоть и цены в 2 раза ниже чем у 5.6, по бенчмаркам модель не выросла, а местами даже просела.
Ключевые цифры: • DeepSWE: 68,8% у GPT-6 Sol против 72,7% у 5.6 Sol • Internal Research Debugging: 64,2% против 68,3% • Computer use (OSWorld) — тоже чуть ниже или примерно на том же уровне • Кибербезопасность — без заметного прогресса То есть модель стала заметно дешевле и выгоднее по цене за задачу, но «потолок» интеллекта на сложных агентных и исследовательских задачах не подняли. Официальные данные OpenAI это подтверждают. Просто в маркетинге акцент сделали на цене, фактичности и сравнении с конкурентами, а не на прямом сравнении с предыдущим Sol.
2 344
👉 Кажется, все идет в лучшую сторону.
⚡️ У меня работал 1 чат на GPT 6 Sol Max и еще я работал в режиме «Работа» (Max) на протяжении +-10 минут. И я потратил 1% лимита.
🛡 Раньше же в таком результате на 5.6 Sol я бы потратил около 3%.Мне кажется есть Сэм Альтман а есть его злая версия, и они борятся за включение Х2 Usage.
2 344
⚡️ В 1 канале я увидел промпт для создания видео через JS код, и вот прикол что Opus 5.5 создал видео за 5 часов, а GPT 6 Sol (Max) за 13 минут.
👉 В референс был дан ролик Opus 5.5
(саму базу видео за 3 минуты, но я попросил улучшить и сделать качественнее), все без fast режима
👉 Залил оба видео в комментарии!
2 344
⚡️ Лимиты сбросили, но, нас помиловали и дали докушать текущие.
🥶 Лимит можно сбросить в настройках Codex, у меня лично такой сброс будет жив до 23 октября.
2 344
⚡️ ChatGPT выпустила GPT 6 Sol….
Потом обновлю пост и добавлю бенчмарки, кто-то пробовал? Лимиты вернули?
2 344
➡️Anthropic выпустила Claude Opus 5.5.
• По большинству задач работает на уровне Fable 5.1 • При этом примерно на 40% дешевле Opus 5 в реальных нагрузках • Генерация ответов стала быстрее более чем на 30%Модель уже доступна на сайте, по API и в Claude Code.
2 344
👀 Тибо (руководитель Codex в OpenAI) обещал ресет на вторник.
Правда какой вторник он не упомянул.
2 344
🇨🇳 Китай снова в игре: Xiaomi ночью выпустила MiMo-V2.6 Pro и Flash и результаты очень сильные.
Xiaomi потратила всего 130 часов, 75 млрд токенов и $2,6 млн на RL, чтобы вывести MiMo-V2.6 Pro на первое место среди открытых моделей. И у них получилось! 🫣AA Intelligence Index — 46,32 (выше Kimi K3 и Qwen3.8 Max) При этом цена за 1 млн токенов осталась такой же, как у V2.5.
• MiMo-V2.6 Pro — $0.435 / $0.87 • MiMo-V2.6 Flash — $0.14 / $0.28, примерно треть цены Pro • DeepSeek V4 Pro — около $0.66–1.32 / $1.98–3.96, Pro дешевле примерно в 2–5 раз • GLM-5.3 — около $1.40 / $4.40, Pro дешевле примерно в 3–5 раз • Qwen3.8 Max — около $2 / $6, Pro дешевле примерно в 5–7 раз • Gemini 3.5 Flash — около $1.50 / $9, Pro дешевле примерно в 3–10 раз • Gemini 3.1 Pro — около $2 / $12, Pro дешевле примерно в 5–14 раз • GPT-5.6 Sol — около $4–5 / $20, Pro дешевле примерно в 10–23 раза • Claude Opus 5 — около $5 / $25, Pro дешевле примерно в 12–29 раз • Claude Fable 5 — около $10 / $50, Pro дешевле примерно в 23–58 разОдна задача обходится примерно в $0.13.
↪️ Весь процесс обучения транслировался в реальном времени, а расходы и сбои публиковались онлайн 🥳. Вместе с моделью открыты веса, код RL и среды.Это вам не Muse Spark)))
2 344
Codex начал сейфгуардить за легальные код-задачи: написать простое MCP для 1 сайта 🥶
Классно, спасибо! Если я потеряю свой х20 из-за этого я убью руководителя опенаи
