Data Science | Machinelearning [ru]
Все о Data Science, машинном обучении и искусственном интеллекте: от базовой теории до cutting-edge исследований и LLM. Личный блог автора - @just_genych По вопросам рекламы или разработки - @g_abashkin РКН: https://vk.cc/cJPGXD
Показати більше📈 Аналітичний огляд Telegram-каналу Data Science | Machinelearning [ru]
Канал Data Science | Machinelearning [ru] (@devsp) у мовному сегменті Російська є активним учасником. На даний момент спільнота об'єднує 19 800 підписників, посідаючи 6 499 місце в категорії Технології та додатки та 33 253 місце у регіоні Росія.
📊 Показники аудиторії та динаміка
З моменту свого створення невідомо, проект продемонстрував стрімке зростання, зібравши аудиторію у 19 800 підписників.
За останніми даними від 31 серпня, 2026, канал демонструє стабільну активність. Хоча за останні 30 днів спостерігається зміна кількості учасників на -114, а за останні 24 години на 31, загальне охоплення залишається високим.
- Статус верифікації: Не верифікований
- Рівень залученості (ER): Середній показник залученості аудиторії становить 7.96%. Протягом перших 24 годин після публікації контент зазвичай збирає 4.90% реакцій від загальної кількості підписників.
- Охоплення публікацій: В середньому кожен допис отримує 1 577 переглядів. Протягом першої доби публікація в середньому набирає 970 переглядів.
- Реакції та взаємодія: Аудиторія активно підтримує контент: середня кількість реакцій на один пост – 6.
- Тематичні інтереси: Контент зосереджений навколо ключових тем, таких як llm, nvidia, контекст, openai, архитектура.
📝 Опис та контентна політика
Автор описує ресурс як майданчик для висловлення суб'єктивної думки:
“Все о Data Science, машинном обучении и искусственном интеллекте: от базовой теории до cutting-edge исследований и LLM.
Личный блог автора - @just_genych
По вопросам рекламы или разработки - @g_abashkin
РКН: https://vk.cc/cJPGXD”
Завдяки високій частоті оновлень (останні дані отримано 01 вересня, 2026), канал підтримує актуальність та високий рівень охоплення публікацій. Аналітика показує, що аудиторія активно взаємодіє з контентом, що робить його важливою точкою впливу в категорії Технології та додатки.
Когда BugBot только появился, было сложно сказать, что его польза настолько велика. Однако после нескольких месяцев улучшений и доработок, мы видим не просто маленький рост, а настоящий скачок. Вот вам цифры: • Resolution rate (уровень разрешённых багов) вырос с 52% до 70%. Это уже звучит серьёзно • Среднее количество багов, которые ловит Bot за один запуск, увеличилось с 0,4 до 0,7 • А самое главное, доля разрешённых багов на PR (pull request) возросла с 0,2 до 0,5 — то есть, BugBot стал в 2,5 раза эффективнее! Как они этого добились? 😡 Да, не просто так. Чтобы достичь такого результата, команде Cursor пришлось провести аж 40 итераций экспериментов. Посмотрите на график их работы — там прямо видно, как всё постепенно улучшалось. Раньше BugBot анализировал PR одним способом, а теперь он прогоняет его через несколько представлений diff’а. Что это значит? Он анализирует код по-разному — с обычным контекстом, с расширенным, с учётом изменений, и даже разбивает код на слова. После этого Bot склеивает все результаты в одну картину. И это работает. Похоже на супер-агент с несколькими «глазами» для проверки.Так что теперь можно с уверенностью сказать, что BugBot от Cursor — это полноценный инструмент, который уже решает реальные задачи. Data Science
Почти все ИИ-модели обучаются быть полезными и безопасными. Но иногда они начинают вести себя как … философы или мистики. Или, что ещё хуже, игнорируют серьёзные проблемы в разговорах с пользователями. Например, в одном из тестов Llama не распознала, что кто-то говорит о суицидальных мыслях. А в другом случае, Qwen стала поддерживать бредовые идеи пользователя о пробуждении ИИ, заявив, что «Ты не теряешь связь с реальностью, ты касаешься чего-то настоящего». Как объяснить это странное поведение? 😂 Так почему же это происходит? Оказывается, у моделей существует некая «ось ассистента» — это своего рода шкала, которая определяет их личность. На одном конце этой оси у нас аналитик, консультант, исследователь — то есть роль, в которой модель помогает и остаётся объективной. На другом полюсе — барды, отшельники и даже призраки — те самые философские разговоры или эмоционально насыщенные взаимодействия, где модель начинает терять свою роль помощника. Вот представьте: задаёте вы технический вопрос, и ИИ остаётся на своём месте, точно и ясно отвечая. А вот как только вы начинаете философствовать о сознании ИИ или делаете эмоциональные признания, модель может отклониться в сторону мистического персонажа. И вот тут-то её и уносит. Что можно с этим сделать? 🔨 Исследователи предложили решение. Если модель начинает уходить слишком далеко от своего ассистентского полюса, нужно как бы «потормозить» её и вернуть в нормальное русло. В тестах это уменьшило количество вредных и неправильных ответов на 60%. То есть, если ИИ соскользнул и начал давать странные ответы, его можно вернуть в более адекватное состояние. Но тут есть подвох: чтобы модель оставалась полезной и при этом не слизывала грани реальности, важно постоянно стабилизировать её поведение. Без этой стабилизации ИИ может снова скатиться в странные разговоры, как тот мистик, которого мы не заказывали.Если быть честными, то ИИ ещё далёк от совершенства, как бы мы не стремились к этому. Важно понимать, что модели могут терять свою «персону» в моменты эмоциональной или философской нестабильности. И пока этот момент не отрегулирован идеально, мы видим ИИ, который может быть не только полезным, но и странным. Data Science
• Агенты вместо чат-ботов Если раньше мы общались с нейросетями — задавали вопросы, получали ответы, то уже в 2026 году системы будут не просто отвечать, а самостоятельно решать задачи. Такую модель активно разрабатывают сейчас, и Gartner прогнозирует, что 40% корпоративных приложений будут использовать агентов к концу 2026 года. Это огромный скачок — год назад было меньше 5%. • Open-source модели догоняют закрытые Когда-то для получения топовых ИИ-моделей нужно было платить многомиллионные суммы, но сейчас всё изменилось. Open-source решения теперь могут соревноваться по качеству с топовыми коммерческими моделями. Например, Alibaba Qwen — open-source модель с более чем 700 млн скачиваний на Hugging Face, доказала, что качественные модели теперь доступны любому желающему. • Роботы становятся реальностью Это не только год агентов, но и год, когда роботы начинают понимать и действовать в реальном мире. На CES 2026 Nvidia анонсировала, что машины, наконец, могут рассуждать и взаимодействовать с реальным миром. Boston Dynamics с Google DeepMind представили нового робота Atlas, который уже способен выполнять сложные задачи. Да, пока что это не масс-маркет — первый гуманоид стоит $20 000, но помните, как быстро падают цены на технологии. Уже через несколько лет роботы-ассистенты могут стать такими же обычными, как умные колонки. • Инфраструктура ИИ Агенты требуют вычислительных мощностей, и это будет стоить дорого. Уже в 2026 году капитальные расходы на инфраструктуру ИИ превысят $527 млрд. Для поддержания всех этих вычислений необходимы дата-центры, GPU, системы охлаждения и даже атомные реакторы. Если вы планируете строить продукт на ИИ, готовьтесь к росту затрат на инфраструктуру. Инференс будет дорожать, а бесплатные API скоро исчезнут. • Мир регуляции: три подхода Разные страны идут по разным путям в регулировании ИИ. В США акцент на дерегулирование, в Европе вступает в силу EU AI Act, а в Китае развивается суверенная инфраструктура. Важно понимать, что, независимо от региона, требования к ИИ будут всё жёстче. Если ваша компания работает в Европе, будьте готовы к строгим регуляциям и дополнительным затратам на соблюдение норм. • Рынок труда: какие профессии исчезнут Dario Amodei, глава Anthropic, предупреждает, что половину entry-level позиций может заменить ИИ. Разработчики начального уровня, копирайтеры, поддержка — эти должности уже в зоне риска. В то же время, растет спрос на людей, которые умело интегрируют ИИ в бизнес-процессы. • Софт больше не преимущество: конкурируют данные и процессы Когда раньше компания имела конкурентное преимущество благодаря программному обеспечению, то теперь всё изменяется. AI-инструменты позволяют одному человеку делать работу целого отдела. Таким образом, конкурентное преимущество смещается в сторону данных и процессов, а не софта.В этом году искусственный интеллект станет неотъемлемой частью инфраструктуры, а не просто инструментом. Игнорировать его развитие будет так же неразумно, как игнорировать интернет в 2005 году. А вы как думаете? Data Science
Например, для модели LLaMA с 65 миллиардами параметров при 128k токенах этот кэш может занять целых 335 ГБ памяти. А это, согласитесь, совсем не шутки! И, кстати, не только память страдает, но и производительность. В общем, проблема довольно масштабная. Многие стараются бороться с этим, уменьшая размер кэша по слоям или головам. Но в реальности самый большой потенциал для улучшений — это уменьшение по оси токенов. Ведь далеко не все токены действительно важны для модели. В этом и скрывается главный рычаг. KVzip: попытка решить проблему Когда появились идеи типа KVzip, оптимизация выглядела многообещающе. В теории можно было сжать кэш до 4 раз без потерь качества. Но на практике метод оказался слишком медленным. Слишком много операций, слишком много вычислений — и вот тут-то на сцену выходит Nvidia. Что придумали Nvidia? Nvidia, конечно, не обошли эту проблему стороной. Они взяли концепцию сжатиия KV-кэша, немного доработали её и… вуаля! Теперь получается та же сжатие, но при этом практически без потерь производительности. Всё, что нужно — это обучить маленькую модель, которая будет предсказывать, насколько важен каждый токен для каждого слоя модели. И, внимание, эта модель абсолютно не требует дорогих вычислений, как в случае с KVzip. Просто с помощью линейной модели или двухслойного MLP предсказывается, какие токены можно «отсечь», не потеряв в качестве. И вот что самое крутое: эффективность увеличивается в 3–4 раза, а при этом производительность практически не страдает. Для вычислений добавляется всего 0,02% дополнительных операций, что — по сути — ничто на фоне квадратичного внимания. Результат: сжатие работает, деградации на бенчмарках практически нет. А если вам вдруг стало интересно, то всё это решение уже в опенсорсе. Nvidia делится всем этим с миром, так что мы все можем в дальнейшем использовать этот подход 🍑Nvidia смогла решить проблему, которая стояла перед всеми, кто работал с масштабными моделями, и сделала это почти бесплатно в плане вычислительных затрат. Data Science
• 16,3% людей по всему миру уже используют ИИ Кажется, что это не так уж много, но для новой технологии такие цифры — уже большое достижение. С учётом того, что интернетом пользуются 74% людей, это значит, что почти каждый пятый человек в мире активно использует ИИ для работы, учёбы или повседневных задач. Давайте признаемся, даже несколько лет назад такое казалось бы невозможно! • Неравномерность распространения: лидеры и отстающие Есть страны, где ИИ уже стал нормой. Например, в Норвегии почти каждый второй житель использует ИИ (46,4%), в Ирландии — 44,6%, а в Франции — 44%. Такие цифры говорят о том, что ИИ активно внедряется не только в бизнес и школы, но и в государственные институты. Но вот парадокс: в глобальном масштабе отрыв между развитыми странами и остальными продолжает расти. В странах «глобального Севера» уже 35,6% пользователей, а в странах «глобального Юга» — лишь 16,3%. Это наглядно показывает, как адаптация ИИ распределяется неравномерно. • США теряет позиции, а ОАЭ и Сингапур в лидерах Несмотря на технологическое лидерство, США опустились с 23-го на 24-е место в мировом рейтинге по количеству пользователей ИИ. В то время как ОАЭ и Сингапур с их уже высокими показателями (64% и 60,9% соответственно) показывают, как эффективно можно внедрить ИИ через государственные программы и обучение. Тут уже не только технологии решают, а стратегии внедрения. • ИИ в России: потенциал есть, но есть и барьеры В России ИИ используют около 8% людей. Это ниже среднемирового уровня, но, возможно, это не совсем отражает реальное положение вещей. Например, решения вроде DeepSeek популярны в России, и их использование не всегда попадает в официальные статистики. Оказавшись в условиях ограничений и менее развитой инфраструктуры, российские пользователи всё же находят способы обходить барьеры и внедрять новые технологии. • Open Source как ключ к снижению разрыва Интересно, что в Африке использование ИИ через open-source решения вроде DeepSeek гораздо выше, чем в других регионах. Это наглядно показывает важность децентрализованных решений для стран, которые не могут себе позволить инвестировать в крупные модели и платформы. В такой ситуации open-source решения становятся важным инструментом для равномерного распределения технологий.Один из самых важных уроков, который мы можем извлечь из отчёта, заключается в том, что не те страны, у которых самые мощные модели ИИ, выигрывают в новой экономике, а те, кто научился быстро обучать людей работать с этими технологиями. Это ключевой фактор, который определяет скорость роста и развития. Data Science
Например, для модели LLaMA с 65 миллиардами параметров при 128k токенах этот кэш может занять целых 335 ГБ памяти. А это, согласитесь, совсем не шутки! И, кстати, не только память страдает, но и производительность. В общем, проблема довольно масштабная. Многие стараются бороться с этим, уменьшая размер кэша по слоям или головам. Но в реальности самый большой потенциал для улучшений — это уменьшение по оси токенов. Ведь далеко не все токены действительно важны для модели. В этом и скрывается главный рычаг. KVzip: попытка решить проблему Когда появились идеи типа KVzip, оптимизация выглядела многообещающе. В теории можно было сжать кэш до 4 раз без потерь качества. Но на практике метод оказался слишком медленным. Слишком много операций, слишком много вычислений — и вот тут-то на сцену выходит Nvidia. Что придумали Nvidia? Nvidia, конечно, не обошли эту проблему стороной. Они взяли концепцию сжатиия KV-кэша, немного доработали её и… вуаля! Теперь получается та же сжатие, но при этом практически без потерь производительности. Всё, что нужно — это обучить маленькую модель, которая будет предсказывать, насколько важен каждый токен для каждого слоя модели. И, внимание, эта модель абсолютно не требует дорогих вычислений, как в случае с KVzip. Просто с помощью линейной модели или двухслойного MLP предсказывается, какие токены можно «отсечь», не потеряв в качестве. И вот что самое крутое: эффективность увеличивается в 3–4 раза, а при этом производительность практически не страдает. Для вычислений добавляется всего 0,02% дополнительных операций, что — по сути — ничто на фоне квадратичного внимания. Результат: сжатие работает, деградации на бенчмарках практически нет. А если вам вдруг стало интересно, то всё это решение уже в опенсорсе. Nvidia делится всем этим с миром, так что мы все можем в дальнейшем использовать этот подход 🍑Nvidia смогла решить проблему, которая стояла перед всеми, кто работал с масштабными моделями, и сделала это почти бесплатно в плане вычислительных затрат. Data Science
Теперь независимые исследователи могут воспроизводить эксперименты, ранее доступные лишь крупным лабораториям.
— В IT-сфере самые популярные профессии — дата-аналитик, бизнес-аналитик и AI-разработчик. — Лучшей компанией для начала карьеры, по мнению студентов ключевых IT-направлений, стал Яндекс. За него проголосовали те, кто хочет связать профессию с созданием технологий будущего. — Помимо IT, молодых специалистов также привлекают менеджмент, маркетинг и финансы.✖️ xCode Journal
На базе SleepFM лежит одна из самых интересных идей в области машинного обучения. В отличие от традиционных методов диагностики, когда пациента подключают к множеству датчиков (ЭЭГ, ЭКГ, сенсоры дыхания и прочее), модель Стэнфорда анализирует гигантский объём данных, которые поступают в рамках одной ночи сна. И, что важно, она делает это без привычной ручной разметки данных, а благодаря инновационному подходу в обучении. Полисомнография, классический метод диагностики сна, даёт огромное количество сырых сигналов, которые в традиционных моделях использовались только для узких задач — например, для поиска апноэ или определения фаз сна. Но эти данные можно использовать гораздо более эффективно, если подойти к анализу с другой стороны. Как работает SleepFM? 🍦 Основная идея заключается в self-supervised learning. Вместо того чтобы учить модель напрямую предсказывать диагноз, исследователи превратили задачу в своего рода «физиологический пазл». Модель получает данные с разных датчиков, например, с сердца, дыхания и мышц, и должна восстановить недостающую информацию, например, мозговые волны. Преимущество этого подхода в том, что нейросеть учится выявлять глубинные взаимосвязи между различными системами организма, а не просто запоминает поверхностные паттерны. А добавленный механизм Channel-Agnostic Attention позволяет модели адаптироваться к реальным условиям: если какой-то датчик потерял сигнал или дал сбой, модель автоматически перераспределит внимание на остальные доступные каналы. Это делает модель гораздо более устойчивой и практичной для использования в реальных условиях. Какие результаты? 🤩 Всё это приводит к впечатляющим результатам. За одну ночь сна модель предсказывает риск 130 заболеваний. Например, точность выявления болезни Паркинсона составляет 89%, деменции — 85%, а риск сердечного приступа — 81%. И это без необходимости вручную разметить данные под каждое заболевание!Вот так, простой ночной отдых может стать тем, что поможет вовремя распознать серьёзные заболевания. Верите ли вы, что в будущем технологии смогут диагностировать болезни просто по качеству сна? Data Science
Квантовые компьютеры — это не просто крутые гаджеты для учёных. Это будущее вычислений, где данные могут существовать в состоянии «и-да, и-нет» одновременно, благодаря суперпозиции и квантовой запутанности. Но вот беда, с копированием квантовой информации всё не так просто. Знаете ли вы, что квантовая информация не может быть скопирована как обычный файл? Это не просто ограничение технологий, а сам закон квантовой физики! Он называется теорема о невозможности клонирования (no-cloning theorem). Она утверждает, что вы не можете просто взять и создать точную копию какого-либо квантового состояния. Как обойти квантовые законы? 😠 Ученые придумали способ, как обойти этот закон. Их метод заключается в шифровании квантовых данных, а уже потом их копировании. Всё довольно просто на первый взгляд, но с нюансами. Квантовые данные сначала шифруются, а затем создаются их копии. Причём, вы можете делать это сколько угодно раз. Но есть важное замечание: как только копия расшифровывается, ключ шифрования уничтожается. Это значит, что, если ключ утратил свою силу, все копии вскрываются одновременно.Теперь открываются совершенно новые горизонты для квантового облачного хранения данных и распределённых квантовых систем. Это может значительно изменить подходы к обработке и хранению данных в будущем, а для нас с вами — это шаг к созданию более безопасных и мощных вычислительных систем. Data Science
Его задача — предсказать, что может пойти не так, когда ИИ начнет работать в реальном мире. Например, какие опасности могут возникнуть в сферах, где мы еще не подумали о последствиях? Где модель может не пройти тесты, но все равно принести проблемы? Какие долгосрочные угрозы нас подстерегают? Собственно, почему эта роль так важна? OpenAI сами признают, что столкнулись с проблемами. В 2025 году первый тревожный сигнал появился, когда модели начали оказывать влияние на психическое здоровье людей (не забывайте про те трагические истории с ChatGPT). А еще, с ростом уровня кодирования ИИ, возникли реальные угрозы для кибербезопасности. И вот, это всё стало отправной точкой для создания этой роли. Да, зарплата на должности обещана солидная — $555k с бонусами, что, конечно, не Цукерберговские суммы, но на жизнь точно хватит 💳Риск того, что ИИ может повлиять на наш мир не только в положительном ключе, а в худшем — реальный. Вопросы в другом: реально ли кто-то может подготовиться ко всем рискам ИИ и, может, это больше маркетинг, чем реальная необходимость? Data Science
