uz
Feedback
Python вопросы с собеседований

Python вопросы с собеседований

Kanalga Telegram’da o‘tish

Вопросы с собеседований по Python @workakkk - админ @machinelearning_interview - вопросы с собесдований по Ml @pro_python_code - Python @data_analysis_ml - анализ данных на Python @itchannels_telegram - 🔥 главное в ит РКН: clck.ru/3FmrFd

Ko'proq ko'rsatish

📈 Telegram kanali Python вопросы с собеседований analitikasi

Python вопросы с собеседований (@python_job_interview) Rus til segmentidagi kanali faol ishtirokchi. Hozirda hamjamiyat 24 877 obunachidan iborat bo'lib, Texnologiyalar & Aralashmalar toifasida 5 210-o'rinni va Rossiya mintaqasida 26 126-o'rinni egallagan.

📊 Auditoriya ko‘rsatkichlari va dinamika

невідомо sanasidan buyon loyiha tez o‘sib, 24 877 obunachiga ega bo‘ldi.

15 Sentabr, 2026 dagi oxirgi ma’lumotlarga ko‘ra kanal barqaror faollikka ega. Oxirgi 30 kunda obunachilar soni 108 ga, so‘nggi 24 soatda esa 6 ga o‘zgardi va umumiy qamrov yuqori darajada qolmoqda.

  • Tasdiqlash holati: Tasdiqlanmagan
  • Jalb etish (ER): Auditoriya o‘rtacha 7.77% darajada jalb etiladi. Nashrdan keyingi dastlabki 24 soatda kontent odatda umumiy obunachilar sonining 3.34% ini tashkil etuvchi reaksiyalarni to‘playdi.
  • Post qamrovi: Har bir post o‘rtacha 1 934 marta ko‘riladi; birinchi sutkada odatda 830 ta ko‘rish yig‘iladi.
  • Reaksiyalar va o‘zaro ta’sir: Auditoriya faol: har bir postga o‘rtacha 9 ta reaksiya keladi.
  • Tematik yo‘nalishlar: Kontent github, api, собеседование, git, docker kabi asosiy mavzularga jamlangan.

📝 Tavsif va kontent siyosati

Muallif resursni shaxsiy fikrni ifoda etish maydoni sifatida ta’riflaydi:
Вопросы с собеседований по Python @workakkk - админ @machinelearning_interview - вопросы с собесдований по Ml @pro_python_code - Python @data_analysis_ml - анализ данных на Python @itchannels_telegram - 🔥 главное в ит РКН: clck.ru/3FmrFd

Yuqori yangilanish chastotasi (oxirgi ma’lumot 16 Sentabr, 2026 da olingan) sababli kanal doimo dolzarb va katta qamrovli bo‘lib qoladi. Analitika auditoriya kontent bilan faol hamkorlik qilishini, uni Texnologiyalar & Aralashmalar toifasidagi muhim ta’sir nuqtasiga aylantirishini ko‘rsatadi.

24 877
Obunachilar
+624 soatlar
+177 kun
+10830 kun
Obunachilarni jalb qilish
Sentabr '26
Sentabr '26
+155
18 kanalda
Avgust '26
+117
33 kanalda
Get PRO
Iyul '26
+178
43 kanalda
Get PRO
Iyun '26
+111
0 kanalda
Get PRO
May '26
+94
1 kanalda
Get PRO
Aprel '26
+108
0 kanalda
Get PRO
Mart '26
+153
0 kanalda
Get PRO
Fevral '26
+361
0 kanalda
Get PRO
Yanvar '26
+473
1 kanalda
Get PRO
Dekabr '25
+167
2 kanalda
Get PRO
Noyabr '25
+300
45 kanalda
Get PRO
Oktabr '25
+149
16 kanalda
Get PRO
Sentabr '25
+669
37 kanalda
Get PRO
Avgust '25
+441
4 kanalda
Get PRO
Iyul '25
+500
50 kanalda
Get PRO
Iyun '25
+311
36 kanalda
Get PRO
May '25
+100
2 kanalda
Get PRO
Aprel '25
+309
26 kanalda
Get PRO
Mart '25
+217
1 kanalda
Get PRO
Fevral '25
+354
42 kanalda
Get PRO
Yanvar '25
+438
48 kanalda
Get PRO
Dekabr '24
+871
44 kanalda
Get PRO
Noyabr '24
+1 419
55 kanalda
Get PRO
Oktabr '24
+2 144
61 kanalda
Get PRO
Sentabr '24
+1 009
198 kanalda
Get PRO
Avgust '24
+855
40 kanalda
Get PRO
Iyul '24
+836
49 kanalda
Get PRO
Iyun '24
+1 071
57 kanalda
Get PRO
May '24
+766
39 kanalda
Get PRO
Aprel '24
+821
44 kanalda
Get PRO
Mart '24
+733
21 kanalda
Get PRO
Fevral '24
+1 270
3 kanalda
Get PRO
Yanvar '24
+1 326
47 kanalda
Get PRO
Dekabr '23
+843
41 kanalda
Get PRO
Noyabr '23
+304
2 kanalda
Get PRO
Oktabr '23
+912
0 kanalda
Get PRO
Sentabr '23
+773
0 kanalda
Get PRO
Avgust '23
+995
0 kanalda
Get PRO
Iyul '23
+458
0 kanalda
Get PRO
Iyun '23
+943
0 kanalda
Get PRO
May '23
+1 161
0 kanalda
Get PRO
Aprel '23
+98
0 kanalda
Get PRO
Mart '23
+150
0 kanalda
Get PRO
Fevral '23
+695
0 kanalda
Get PRO
Yanvar '23
+799
0 kanalda
Get PRO
Dekabr '22
+2 227
0 kanalda
Get PRO
Noyabr '22
+1 876
0 kanalda
Get PRO
Oktabr '22
+1 231
0 kanalda
Get PRO
Sentabr '22
+3 143
0 kanalda
Get PRO
Avgust '22
+4 522
0 kanalda
Sana
Obunachilarni jalb qilish
Esdaliklar
Kanallar
16 Sentabr+1
15 Sentabr+13
14 Sentabr+15
13 Sentabr+17
12 Sentabr+6
11 Sentabr+3
10 Sentabr+4
09 Sentabr+4
08 Sentabr+10
07 Sentabr+8
06 Sentabr+3
05 Sentabr+3
04 Sentabr+6
03 Sentabr+9
02 Sentabr+8
Kanal postlari
🐍 Python: как найти изменённое поле во вложенном словаре Сравнение before == after покажет, равны ли объекты. DeepDiff покажет, где именно они отличаются, включая старое и новое значения.

from deepdiff import DeepDiff

before = {"user": {"name": "Egor", "level": 3}}
after = {"user": {"name": "Egor", "level": 4}}

print(DeepDiff(before, after))
Результат:

{
    "values_changed": {
        "root['user']['level']": {
            "old_value": 3,
            "new_value": 4
        }
    }
}
Библиотека находит изменения значений и типов, добавленные и удалённые элементы. Работает со вложенными словарями, списками и другими объектами. Полезно для сравнения ответов API, конфигураций и результатов обработки данных. Можно исключать отдельные поля через exclude_paths и игнорировать порядок элементов через ignore_order=True. Установка: pip install deepdiff Документация - https://zepworks.com/deepdiff/current/

2
🔥 Один из лучших обучающих курсов на StepiK по SQL SQL можно знать годами и всё равно теряться, когда запрос внезапно начина
🔥 Один из лучших обучающих курсов на StepiK по SQL SQL можно знать годами и всё равно теряться, когда запрос внезапно начинает тормозить в проде. Этот курс про уровень, где ты не просто пишешь SELECT, а понимаешь, что происходит внутри MySQL, почему запрос работает медленно и как ускорить его без новых проблем. Здесь разбираются EXPLAIN, индексы, CTE, оконные функции, транзакции, аналитические паттерны, legacy SQL и работа с AI-ассистентами. Каждый урок - с практикой и реальными SQL-задачами на MySQL 8 с автопроверкой. После курса ты сможешь увереннее разбирать чужой код, находить узкие места и предлагать решения, которые действительно работают. Для подписчиков скидка - 49% в течение 2 суток: https://stepik.org/a/298827/
663
3
🐍 Python: type(x) == str или isinstance(x, str)? На первый взгляд разницы почти нет. Но она есть. ❌ type(x) == str проверяет
🐍 Python: type(x) == str или isinstance(x, str)? На первый взгляд разницы почти нет. Но она есть. ❌ type(x) == str проверяет только точное совпадение типа. ✅ isinstance(x, str) учитывает ещё и наследников str. Пример: class MyString(str): pass x = MyString("hello") print(type(x) == str) # False print(isinstance(x, str)) # True Поэтому в большинстве случаев лучше использовать: isinstance(x, str) Так код получается гибче и лучше работает с наследованием. #Python #Programming #BestPractices
990
4
🔥 Хочешь расти в IT быстрее остальных? Перестань учиться в одиночку Можно годами смотреть курсы, читать документацию и всё р
🔥 Хочешь расти в IT быстрее остальных? Перестань учиться в одиночку Можно годами смотреть курсы, читать документацию и всё равно топтаться на месте. А можно попасть в правильное окружение, где каждый день обсуждают новые инструменты, вакансии, реальные кейсы, ошибки и то, что уже завтра станет стандартом. Я собрал папки и каналы по разным направлениям IT, чтобы ты быстрее находил нужных людей, идеи и полезный контент - без бесконечного поиска. AI: t.me/ai_machinelearning_big_data Python: t.me/pythonl Linux: t.me/linuxacademiya Хакинг: t.me/linuxkalii DevOps: t.me/DevOPSitsec Docker: https://t.me/+90Z5TAyfuNU5YmRi Golang: t.me/Golang_google Rust: t.me/rust_code C++: t.me/cpluspluc C#: t.me/csharp_ci Java: t.me/javatg JavaScript: t.me/javascriptv React: t.me/react_tg Frontend: t.me/front PHP: t.me/phpshka Android: t.me/android_its Мобильная разработка: t.me/mobdevelop Базы данных: t.me/sqlhub Data Science: t.me/data_analysis_ml Big Data: t.me/bigdatai Математика: t.me/data_math Физика: t.me/fizmat Kubernetes: t.me/kubernetc GameDev: https://t.me/gamedev Haskell: t.me/haskell_tg Собеседования и карьера: DS собеседования: t.me/machinelearning_interview Python собеседования: t.me/python_job_interview Папка с вакансиями: t.me/addlist/_zyy_jQ_QUsyM2Vi Папка Go разработчика: t.me/addlist/MUtJEeJSxeY2YTFi Папка Python разработчика: t.me/addlist/eEPya-HF6mkxMGIy Папка ML: https://t.me/addlist/2Ls-snqEeytkMDgy Папка Frontend: https://t.me/addlist/mzMMG3RPZhY2M2Iy Полезное сверху: ИТ-мемы: t.me/memes_prog Английский для программистов: t.me/english_forprogrammers ИИ и технологии: t.me/vistehno 954 ГБ open-source курсов: https://t.me/+rKBQEMccAA01MTcy ИТ-книги бесплатно: https://t.me/addlist/BkskQciUW_FhNjEy Max Ai: https://max.ru/ai_machinelearning_big_data Max python: https://max.ru/pythonl ТЕХНО: https://max.ru/vistehno Max Go: https://max.ru/Golang_google Max Linux: https://max.ru/linuxkalii Devops: https://max.ru/DevOPSitsec C#: https://max.ru/csharp_ci C++: https://max.ru/cpluspluc SQL: https://max.ru/sqlhub Java: https://max.ru/javatg Подпишись и сохрани, здесь регулярно появляются новые подборки, инструменты и материалы, которые реально помогают расти быстрее.
828
5
🐍 Как правильно использовать Lock в Python multiprocessing Если несколько процессов одновременно пишут в общий ресурс — файл
🐍 Как правильно использовать Lock в Python multiprocessing Если несколько процессов одновременно пишут в общий ресурс — файл, stdout, shared memory — вывод или данные могут перемешиваться. Для этого есть multiprocessing.Lock: from multiprocessing import Process, Lock def printer(item, lock): with lock: print(item) if __name__ == "__main__": lock = Lock() for item in ["tango", "foxtrot", 10]: Process(target=printer, args=(item, lock)).start() Lock гарантирует, что критическую секцию в конкретный момент выполняет только один процесс. Вместо ручных: lock.acquire() → try/finally → lock.release() обычно удобнее использовать: with lock: Особенно полезно при работе с файлами, логами и общими структурами данных между процессами.
1 230
6
🌦 Linecast — погода, карты, радар, приливы, Солнце и Луна прямо в терминале Open-source CLI превращает публичные данные в ше
🌦 Linecast — погода, карты, радар, приливы, Солнце и Луна прямо в терминале Open-source CLI превращает публичные данные в шесть интерактивных приложений: - linecast weather — погода, почасовой прогноз, AQI и предупреждения - linecast sunshine — восход, закат и длина дня - linecast moon — фазы Луны, восход/заход и календарь - linecast tides — график приливов и отливов - linecast radar — анимированный радар и спутниковые данные - linecast maps — карты, рельеф, поиск мест и маршруты Работает на macOS, Linux и Windows. Написан на Python, почти без зависимостей, не требует аккаунта или API-ключей и подстраивает цвета под тему терминала. Можно даже запустить без установки: uvx linecast weather GitHub: https://github.com/ashuttl/linecast
1 351
7
Matn yo'q...
1 497
8
🐍 Python считает эти даты равными. Хотя между ними целый час В ночь перевода часов время 02:30 наступает дважды: from dateti
🐍 Python считает эти даты равными. Хотя между ними целый час В ночь перевода часов время 02:30 наступает дважды: from datetime import datetime, UTC from zoneinfo import ZoneInfo tz = ZoneInfo("Europe/Berlin") a = datetime(2026, 10, 25, 2, 30, tzinfo=tz, fold=0) b = datetime(2026, 10, 25, 2, 30, tzinfo=tz, fold=1) print(a) # 2026-10-25 02:30:00+02:00 print(b) # 2026-10-25 02:30:00+01:00 Это разные моменты: a = 00:30 UTC b = 01:30 UTC Но Python выдаёт: a == b # True b - a # 0:00:00 len({a, b}) # 1 Причина: если у двух datetime один объект tzinfo, при сравнении Python игнорирует смещение и fold. Из-за этого дедупликация может принять два платежа, заказа или события за одно. Для сравнения реальных моментов переводите время в UTC: a_utc = a.astimezone(UTC) b_utc = b.astimezone(UTC) a_utc == b_utc # False (b_utc - a_utc).total_seconds() # 3600.0 Используйте astimezone(UTC). Метод replace(tzinfo=UTC) только заменяет метку и не пересчитывает время. https://docs.python.org/3/library/datetime.html https://peps.python.org/pep-0495/
1 571
9
CPython официально добавил поддержку RISC-V 🚀 RISC-V теперь официально поддерживается CPython как платформа Tier 3. Это важн
CPython официально добавил поддержку RISC-V 🚀 RISC-V теперь официально поддерживается CPython как платформа Tier 3. Это важный шаг для открытой архитектуры процессоров: в отличие от x86 и ARM, RISC-V основана на открытом ISA и может свободно использоваться производителями железа. До этого Python уже запускался на RISC-V, но теперь архитектура официально внесена в PEP 11. Для неё появились постоянные buildbot-тесты на реальном RISC-V-железе, предоставленном RISE Project. Следующие цели: - добавить RISC-V непосредственно в CI CPython; - быстрее находить архитектурные баги до merge; - со временем поднять поддержку до Tier 2; - добавить оптимизации CPython специально под возможности RISC-V. - Для Python это ещё один шаг к полноценной поддержке RISC-V не только на уровне интерпретатора, но и всей экосистемы пакетов и инструментов. https://blog.python.org/2026/08/riscv-now-officially-supported/
1 641
10
Matn yo'q...
3 804
11
⚡️ DeepSeek открыла веса DeepSeek-V4-Flash-Vision-Exp Спустя 10 дней после релиза, модель на 305 млрд параметров опубликована
⚡️ DeepSeek открыла веса DeepSeek-V4-Flash-Vision-Exp Спустя 10 дней после релиза, модель на 305 млрд параметров опубликована под лицензий MIT. Чекпоинт экспериментальный, её собрали на архитектуре V4-Flash, добавили визуальные модули и дообучили на понимание изображений, что бы получился агент, который умеет разбирать скриншоты, читать графики и работать с инструментами. 🟡Мультимодальные задачи На ApexBench модель берет 36,5 балла против 26,2 у предыдущей V4-Flash-0731. Тут сравнение не совсем честное - старая модель не поддерживает изображения во входных данных. На Agents' Last Exam новинка дает 27,3 против 25,7 у Opus 4.8, на ZeroBench - 35,0 против 34,0. На ApexBench и Chartography от того же Opus пока отстает - 36,5 против 39,4 и 64,3 против 65,0. 🟡Текстовые задачи Toolathlon-Verified - 75,9 против 70,3 у предшественницы, NL2Repo - 57,7 против 54,2. Просела только Cybergym, 75,3 против 76,7. На DeepSWE модель обходит и Opus 4.8 - 59,3 против 58,0. На Terminal Bench 2.1 уступает - 83,9 против 85,0. В репозитории лежат токенизатор, минимальный инференс на PyTorch с визуальным энкодером, DFlash-вниманием, MoE, Hyper-Connections и прямым проходом DSpark. Картинки можно подавать и блоками в стиле OpenAI, и компактной записью через теги. Запускается через vLLM, SGLang, Transformers и Docker. Cообщество уже сделало квантованные версии для локального запуска. @ai_machinelearning_big_data #news #ai #ml
1 712
12
🔍Тестовое собеседование на Middle Python с разработчиком из Авито завтра вечером Уже завтра вечером в 19:00 по мск приходи о
🔍Тестовое собеседование на Middle Python с разработчиком из Авито завтра вечером Уже завтра вечером в 19:00 по мск приходи онлайн на открытое собеседование, чтобы посмотреть на настоящее интервью на Middle Python-разработчика. Как это будет: 📂 Даня, старший разработчик в Авито, будет задавать реальные вопросы и задачи разработчику-добровольцу 📂 Даня будет комментировать каждый ответ респондента, чтобы дать понять чего от вас ожидает собеседующий на интервью 📂 В конце можно будет задать любой вопрос Дане Это бесплатно. Эфир проходит в рамках менторской программы от ШОРТКАТ для Python-разработчиков, которые хотят повысить свой грейд, ЗП и прокачать скиллы. Переходи в нашего бота, чтобы получить ссылку на эфир → @shortcut_py_bot Реклама. О рекламодателе.
1 694
13
🔥 Бесплатный ElevenLabs, который можно запускать локально: VoiceStudio - локальная open-source студия для работы с голосом б
🔥 Бесплатный ElevenLabs, который можно запускать локально: VoiceStudio - локальная open-source студия для работы с голосом без подписок и лимитов В одном приложении собрали: - клонирование голоса по короткому образцу - создание голоса по описанию - возраст, акцент, стиль, подача - автоматический дубляж видео с переводом и разделением спикеров - импорт EPUB/PDF и сборку многоголосых аудиокниг .m4b - диктовку с очисткой текста локальной LLM - удаление фонового звука через Demucs - разделение говорящих через Pyannote/WhisperX - MCP-сервер и локальный API Внутри - 16 TTS-движков, 11 ASR-систем и каталог на 646 языков**. Основные данные и проекты по умолчанию остаются на вашем компьютере. Работает на Windows, Linux и Apple Silicon Mac. Проект пока в активной beta. https://github.com/debpalash/VoiceStudio
1 621
14
🚀 Tencent показали Hy4-preview - новую open-source модель на 770B параметров Архитектура MoE: - 770B параметров всего - 49B
🚀 Tencent показали Hy4-preview - новую open-source модель на 770B параметров Архитектура MoE: - 770B параметров всего - 49B активны на токен - контекст до 1 млн токенов - упор на coding, agentic-задачи и продуктивность Использует Gated DeepSeek Sparse Attention + IndexCache, чтобы удешевить длинный контекст и переиспользовать sparse-индексы между слоями. Tencent позиционирует Hy4 как frontier-level open model с доступной стоимостью запуска. Apache 2.0 🟡 Блог: https://hy.tencent.ai/research/hy4-preview 🟡Hugging Face: https://huggingface.co/tencent/Hy4-preview 🟡GitHub: https://github.com/Tencent-Hunyuan/Hy4-preview @ai_machinelearning_big_data #Tencent
1 774
15
Что выведет код ?
Что выведет код ?
2 093
16
📚 Бесплатная книга по causal inference + ML Applied Causal Inference Powered by Machine Learning and AI - большая открытая к
📚 Бесплатная книга по causal inference + ML Applied Causal Inference Powered by Machine Learning and AI - большая открытая книга про причинно-следственный анализ с современным уклоном в машинное обучение и AI. Внутри: * causal graphs и DAG * потенциальные исходы * A/B и observational data * propensity score * matching и weighting * heterogeneous treatment effects * Double/Debiased Machine Learning * causal forests * uplift и policy learning * связь causal inference с современными ML-моделями Подойдёт тем, кто хочет выйти за пределы обычной корреляции и разбираться, что действительно влияет на результат. 496 страниц, PDF доступен бесплатно: http://arxiv.org/abs/2403.02467
2 265
17
Python: как не дать нескольким процессам одновременно полезть в один ресурс В multiprocessing процессы работают параллельно и
Python: как не дать нескольким процессам одновременно полезть в один ресурс В multiprocessing процессы работают параллельно и иногда пытаются одновременно изменить один и тот же ресурс. Для таких случаев есть Lock: from multiprocessing import Process, Lock def printer(item, lock): with lock: print(item) Дальше один и тот же lock передаётся всем процессам: if __name__ == "__main__": lock = Lock() for item in ["tango", "foxtrot", 10]: Process( target=printer, args=(item, lock) ).start() Пока один процесс находится внутри with lock:, остальные ждут. Это особенно полезно при работе с файлами, логами, общими структурами и другими ресурсами, где одновременная запись может привести к race condition. И лучше использовать with lock:, а не вручную acquire() / release() — так блокировка гарантированно снимется даже при исключении.
1 891
18
Блокчейн за минуту: почему один изменённый блок ломает всю цепь Каждый блок хранит данные, время и хэш предыдущего блока, поэ
Блокчейн за минуту: почему один изменённый блок ломает всю цепь Каждый блок хранит данные, время и хэш предыдущего блока, поэтому цепь держится сама на себе. Меняешь один байт в первом блоке, его хэш становится другим, и все последующие блоки мгновенно превращаются в недействительные. Показываю механику на тридцати строках Python: класс Block, SHA-256 и три транзакции, где видно, как ломается связь. #blockchain #jojo
1 531
19
🔥 Хочешь быстрее расти в IT? Хватит учиться в одиночку Окружение решает больше, чем кажется. Собрал папки и каналы, где можн
🔥 Хочешь быстрее расти в IT? Хватит учиться в одиночку Окружение решает больше, чем кажется. Собрал папки и каналы, где можно быстрее влиться в нужное направление, следить за трендами и не вариться в своём пузыре. AI: t.me/ai_machinelearning_big_data Python: t.me/pythonl Linux: t.me/linuxacademiya Хакинг: t.me/linuxkalii DevOps: t.me/DevOPSitsec Docker: https://t.me/+90Z5TAyfuNU5YmRi Golang: t.me/Golang_google Rust: t.me/rust_code C++: t.me/cpluspluc C#: t.me/csharp_ci Java: t.me/javatg JavaScript: t.me/javascriptv React: t.me/react_tg Frontend: t.me/front PHP: t.me/phpshka Android: t.me/android_its Мобильная разработка: t.me/mobdevelop Базы данных: t.me/sqlhub Data Science: t.me/data_analysis_ml Big Data: t.me/bigdatai Математика: t.me/data_math Физика: https://t.me/+S4hinvO3QI43ZjNi Kubernetes: t.me/kubernetc GameDev: https://t.me/gamedev Haskell: t.me/haskell_tg Собеседования и карьера: DS собеседования: t.me/machinelearning_interview Python собеседования: t.me/python_job_interview Папка с вакансиями: t.me/addlist/_zyy_jQ_QUsyM2Vi Папка Go разработчика: t.me/addlist/MUtJEeJSxeY2YTFi Папка Python разработчика: t.me/addlist/eEPya-HF6mkxMGIy Папка ML: https://t.me/addlist/2Ls-snqEeytkMDgy Папка Frontend: https://t.me/addlist/mzMMG3RPZhY2M2Iy Полезное сверху: ИТ-мемы: t.me/memes_prog Английский для программистов: t.me/english_forprogrammers ИИ и технологии: t.me/vistehno 954 ГБ open-source курсов: https://t.me/+rKBQEMccAA01MTcy ИТ-книги бесплатно: https://t.me/addlist/BkskQciUW_FhNjEy Max Ai: https://max.ru/ai_machinelearning_big_data Max python: https://max.ru/pythonl ТЕХНО: https://max.ru/vistehno Max Go: https://max.ru/Golang_google Max Linux: https://max.ru/linuxkalii Devops: https://max.ru/DevOPSitsec C#: https://max.ru/csharp_ci C++: https://max.ru/cpluspluc SQL: https://max.ru/sqlhub Java: https://max.ru/javatg Подписывайся на нужные направления и собирай себе ленту, которая реально двигает вперёд.
1 423
20
📌Scale AI измерила, насколько хорошо модели переписывают других агентов HarnessOpt-Bench - бенчмарк, который проверяет, умее+1
📌Scale AI измерила, насколько хорошо модели переписывают других агентов HarnessOpt-Bench - бенчмарк, который проверяет, умеет ли модель улучшать харнесс чужого ИИ-агента. 🟡Механика Модель-оптимизатор получает исходную обвязку целевого агента, размеченную обратную связь по результатам прогонов и фиксированный бюджет. Она переписывает код, а в конце собирает финальную версию, которую оценивают на отложенном наборе задач - его оптимизатор во время работы не видит. Тесты выполняются в доверенной среде исполнения на базе VeRO - она следит за бюджетом, прячет отложенные данные, считает потраченные токены и сохраняет каждую версию для аудита. Так сделали для того, чтобы защита от накрутки была свойством песочницы, а не инструкцией, которую модель может обойти. 🟡Результаты Прогнали пять топовых моделей на четырех наборах - OfficeQA, BrowseComp-Plus, Terminal-Bench и GAIA, - всего 111 запусков. Модели четко разошлись по уровням, причем выбор самой модели влияет на результат примерно в 1,8 раза сильнее, чем то, в каком кодинг-агенте она работает. Впереди Opus-5, она выбрала около двух третей доступного запаса улучшений на OfficeQA и половину на BrowseComp-Plus, а всего выиграла три задачи из четырех. Родная среда для модели (Сodex для GPT, Сlaude Сode для Claude, Kimi Cli для Kimi) устойчивого преимущества не дает. Отдельно Scale AI посмотрела динамику по поколениям. У пяти релизов GPT прирост рос монотонно, с +0,03 до +0,49, у пяти релизов Claude Opus - с +0,37 до +0,59. Важно понимать, что настоящим самоулучшением это назвать пока нельзя, так как одна модель переписывает среду другого агента, исходный тестовый харнесс которого специально был сделан с большим запасом для оптимизации. @ai_machinelearning_big_data #news #ai #ml
1