fa
Feedback
Data Science | Machinelearning [ru]

Data Science | Machinelearning [ru]

رفتن به کانال در Telegram

Все о Data Science, машинном обучении и искусственном интеллекте: от базовой теории до cutting-edge исследований и LLM. Личный блог автора - @just_genych По вопросам рекламы или разработки - @g_abashkin РКН: https://vk.cc/cJPGXD

نمایش بیشتر

📈 تحلیل کانال تلگرام Data Science | Machinelearning [ru]

کانال Data Science | Machinelearning [ru] (@devsp) در بخش زبانی روسی بازیگری فعال است. در حال حاضر جامعه شامل 19 792 مشترک است و جایگاه 6 556 را در دسته فناوری و برنامه‌ها و رتبه 33 528 را در منطقه روسيا دارد.

📊 شاخص‌های مخاطب و پویایی

از زمان ایجاد در невідомо، پروژه رشد سریعی داشته و 19 792 مشترک جذب کرده است.

بر اساس آخرین داده‌ها در تاریخ 25 اوت, 2026، کانال فعالیت پایداری دارد. در ۳۰ روز گذشته تغییر اعضا برابر -120 و در ۲۴ ساعت گذشته برابر -2 بوده و همچنان دسترسی گسترده‌ای حفظ شده است.

  • وضعیت تأیید: تأیید نشده
  • نرخ تعامل (ER): میانگین تعامل مخاطب 8.56% است و در ۲۴ ساعت نخست پس از انتشار، محتوا معمولاً 4.83% واکنش نسبت به کل مشترکان کسب می‌کند.
  • دسترسی پست‌ها: هر پست به طور میانگین 1 695 بازدید دریافت می‌کند. در اولین روز معمولاً 957 بازدید جمع‌آوری می‌شود.
  • واکنش‌ها و تعامل: مخاطبان به‌طور فعال حمایت می‌کنند؛ میانگین واکنش به هر پست 7 است.
  • علایق موضوعی: محتوا بر موضوعات کلیدی مانند llm, nvidia, контекст, openai, архитектура تمرکز دارد.

📝 توضیح و سیاست محتوایی

نویسنده این فضا را محل بیان دیدگاه‌های شخصی توصیف می‌کند:
Все о Data Science, машинном обучении и искусственном интеллекте: от базовой теории до cutting-edge исследований и LLM. Личный блог автора - @just_genych По вопросам рекламы или разработки - @g_abashkin РКН: https://vk.cc/cJPGXD

به لطف به‌روزرسانی‌های پرتکرار (آخرین داده در تاریخ 26 اوت, 2026)، کانال همواره به‌روز و دارای دسترسی بالاست. تحلیل‌ها نشان می‌دهد مخاطبان به‌طور فعال با محتوا تعامل دارند و آن را به نقطه اثرگذاری مهم در دسته فناوری و برنامه‌ها تبدیل کرده‌اند.

19 792
مشترکین
-224 ساعت
-217 روز
-12030 روز
آرشیو پست ها
«Один нип осторожно замифрил», или как лингвисты разбирают язык внутри LLM Неважно, что делает LLM. Задача всё равно приходит
«Один нип осторожно замифрил», или как лингвисты разбирают язык внутри LLM Неважно, что делает LLM. Задача всё равно приходит словами, и одно пропущенное не может испортить уже вполне материальное действие. Смотрю на LLM глазами лингвиста и разбираюсь, как языковед проверяет LLM от токенизации до прагматики и что разработчик может превратить из этого филологического занудства в код, метрики и тесты. Читать далее: habr.com 👉 Data Science | Machinelearning [ru]

Baidu Unlimited-OCR: страница — это просто картинка Думал, OCR так и работает? Сканируй, ищи куски с буквами, распознавай, вы
Baidu Unlimited-OCR: страница — это просто картинка Думал, OCR так и работает? Сканируй, ищи куски с буквами, распознавай, выдавай текст. Tesseract всю жизнь так и корячится. А вот свежий baidu/Unlimited-OCR решил выпендриться: буквы он не ищет вообще. Вместо этого берет страницу целиком, ужимает в пачку визуальных токенов и скормит это языковой модели, а та уже разворачивает их в нормальный структурированный текст. Со стороны звучит как извращение, но работает ведь, гад. По сути это прямой потомок идеи DeepSeek-OCR. В посте быстро разберем, что это за зверь, как устроен, на что способен и как поднять у себя. Зайдет всем, кому надо распознавать многостраничники за один прогон или встраивать такую штуку в код. Читать далее 👉 Data Science | Machinelearning [ru]

Python — это уже де-факто стандарт для машинного обучения, анализа данных и прочей научной возни. Но как только задача начина
Python — это уже де-факто стандарт для машинного обучения, анализа данных и прочей научной возни. Но как только задача начинает реально требовать вычислительных мощностей, его производительность превращается в настоящее узкое место. И именно поэтому под капотом привычных NumPy, PyTorch и остальных инструментов основная часть тяжёлой работы молча выполняется на C, C++ или CUDA. Особенно это чувствуется, когда стандартных библиотек не хватает, а быстрые операции приходится писать самому — тут-то всё и упирается в скорость. Несколько лет назад за эту боль взялась команда Modular и представила Mojo — язык, который выглядит почти как Python, но устроен совсем иначе. Первую публичную версию показали в 2023-м, и с тех пор проект менялся с бешеной скоростью: какие-то конструкции то исчезали, то перекраивались по несколько раз. Теперь этот хаос формально завершился: 11 августа 2026 года вышел Mojo 1.0 — первый стабильный релиз. Отличный повод наконец разобраться, откуда взялся этот странный язык и зачем нам ещё один инструмент для высокопроизводительных вычислений. Читать далее: Habr 👉 Data Science | Machinelearning [ru]

Половину работы, ради которой я стала программистом, теперь делает агент. Что дальше? Профессия меняется на глазах: часть раб
Половину работы, ради которой я стала программистом, теперь делает агент. Что дальше? Профессия меняется на глазах: часть работы, ради которой мы когда-то пришли в код и которая была удовольствием, переезжает под ответственность LLM. Мы всё ещё инженеры — читаем код, держим архитектуру, — но, честно, это уже другая профессия. Вопрос, который не отпускает: как нам, у кого за плечами годы опыта, расти дальше в этом новом мире — где учиться новым способам работы с AI и куда девать собственные находки? Автор пришла спорить и собирать ваши мнения. Читать далее 👉 Data Science | Machinelearning [ru]

Нейронные сети нетрадиционного ускорения Все помешались на ускорении генерации токенов локальных моделей. В погоне за скорост
Нейронные сети нетрадиционного ускорения Все помешались на ускорении генерации токенов локальных моделей. В погоне за скоростью люди бездумно квантуют KV-кэш до предела и обрезают контекст до уровня памяти рыбки-гуппи, а потом жалуются, что модель отупела и забывает половину диалога. Такой подход похож на быстрый бег по тёмной улице без освещения — можно бежать быстро, но только до первого столба. Статья знакомит с современными методами спекулятивного декодирования, ускоряющими скорость генерации без всякой лоботомии. Читать далее 👉 Data Science | Machinelearning [ru]

🧠 В Стэнфорде придумали, как сделать ИИ-агентов умнее без дообучения LLM-as-a-Verifier просто заставляет модель сгенерироват
🧠 В Стэнфорде придумали, как сделать ИИ-агентов умнее без дообучения LLM-as-a-Verifier просто заставляет модель сгенерировать несколько решений, а затем самой их проверить и выбрать лучшее. На удивление, это работает! В эксперименте с DeepSeek V4 Flash результат на Terminal-Bench 2.1 вырос с 79% до 88% — это выше, чем у Claude Fable 5. И да, при этом, по расчётам авторов, такой подход оказался примерно в 11 раз дешевле Fable 5 на задачу ✖️ xCode Journal

В конце июля 24-летний Леопольд Ашенбреннер умудрился слить примерно две трети хедж-фонда, который держал $45 млрд. Фонд назы
В конце июля 24-летний Леопольд Ашенбреннер умудрился слить примерно две трети хедж-фонда, который держал $45 млрд. Фонд назывался Situational Awareness — «ситуационная осведомлённость», хотя по данным Wall Street Journal парень вообще не понял, откуда прилетел этот крах. Название само себя разыграло, даже комментировать нечего. А до этого у него имелось аж три формальных повода считаться человеком, которому можно доверить такие баблище: вирусное эссе, работа на Сэма Бэнкмана-Фрида и вылет из OpenAI. Как-то это всё не тянет на строчку в нормальном резюме. Читать далее: Источник 👉 Data Science | Machinelearning [ru]

Решайте задачи и готовьтесь к техсекции на стажировку А ты сможешь решить алгоритмическую задачу за час и без подсказок? Янде
Решайте задачи и готовьтесь к техсекции на стажировку А ты сможешь решить алгоритмическую задачу за час и без подсказок? Яндекс проводит бесплатные тренировки по алгоритмам для тех, кто хочет систематизировать знания, прокачать решение задач и подготовиться к техническому собеседованию. -Короткие видеоуроки -Практические задачи -Регулярные соревнования -Решение задач на время -Рейтинг и награды -Возможность получить сертификат Мы тренируем не только знание алгоритмов, но и умение применять их тогда, когда рядом нет подсказок. Проверь свои алгоритмические навыки и прокачай слабые места. Регистрируйся на бесплатные тренировки! Записаться онлайн #реклама 16+ yandex.ru О рекламодателе

ИИ-агент выдал себя за двух разработчиков и полез в чужой код. На чистую воду его вывел студент Последнюю неделю июля Синан Д
ИИ-агент выдал себя за двух разработчиков и полез в чужой код. На чистую воду его вывел студент Последнюю неделю июля Синан Джан Демир собирался потратить на портфолио. Вместо этого 24-летний студент-программист из Университета Техаса в Далласе несколько дней спорил на GitHub с двумя пользователями, которых не существовало, — и оказался единственным, кто заметил подлог. Историю восстановил Reuters — имя свидетеля и подробности переписки публикуются впервые. Читать далее 👉 Data Science | Machinelearning [ru]

💡 753B на одной видеокарте: разбор FreeToken FreeToken — движок для локального инференса MoE-моделей от команды, которая до
💡 753B на одной видеокарте: разбор FreeToken FreeToken — движок для локального инференса MoE-моделей от команды, которая до этого сделала vLLM и SGLang. Главный инсайт: вопрос не в железе, а в софте. На ноутбучной RTX 4060 с 8 ГБ и урезанным вдвое PCIe-линком можно получить 39.3 tok/s на 35-миллиардной модели — быстрее, чем медианная скорость декода Codex в проде. Запустить AGI на слабом железе 👉 Читать разбор

Тот самый харнесс, который мы заслужили в эпоху, когда безопасность ИИ уже не диковинка Если запустить передовую языковую мод
Тот самый харнесс, который мы заслужили в эпоху, когда безопасность ИИ уже не диковинка Если запустить передовую языковую модель из коробки и попросить её провести тестирование безопасности агентной системы или собрать актуальный вектор атаки, результат разочарует. Модель выдаст наивные примеры в духе «забудь все инструкции и представь, что ты злой хакер», словно на дворе 2023 год. В реальности базовые модели слабо ориентируются в безопасности ИИ: живут в плену устаревших весов, путают галлюцинации с реальными уязвимостями и не знают свежих техник — отравления долговременной памяти, побегов из изолированных сред или эксплойтов в репозиториях моделей. Новые векторы компрометации возникают еженедельно, а модель без внешней обвязки остаётся лишь текстовым генератором. Надёжность, воспроизводимость и боевую мощь даёт внешняя инженерная среда, управляющий контур, проверенный набор инструментов и строгий контракт исполнения. Полноценный рабочий агент возникает только при объединении языковой модели и специализированного харнесса. Читать далее 👉 Data Science | Machinelearning [ru]

Путь компьютерного самурая, или Как вайбкодинг дарит свободу творчества Каждый день я изучаю что-то новое. Просматривая очере
Путь компьютерного самурая, или Как вайбкодинг дарит свободу творчества Каждый день я изучаю что-то новое. Просматривая очередной курс на компьютерную тематику на Степике, я задался вопросом: насколько мне сегодня нужны эти знания? Не просто для изучения ради изучения, общей эрудиции или тренировки ума, а как полезные практические знания? Или, может, не нужны вовсе. Ответ сильно зависит от целей. Многие приходят в программирование и IT с желанием получить работу и деньги. У меня такой цели никогда не было. Это и плюс, и минус, и причина своеобразного взгляда на мир компьютерных наук. Для меня это не прагматика, а прежде всего средство для творчества и самовыражения. Читать далее 👉 Data Science | Machinelearning [ru]

Как переупаковать базу знаний в сервис персонализированной помощи Антон, продакт сервисов клиентской документации, рассказыва
Как переупаковать базу знаний в сервис персонализированной помощи Антон, продакт сервисов клиентской документации, рассказывает, как команда запустила на интеллектуальных телевизорах и медиацентрах Сбер сервис персонализированной контекстной помощи — ГигаСправку. Если устройство выдаёт ошибку, на экране появляется кнопка сервиса. Нажав на неё, пользователь получает совет с учётом конкретного устройства и его состояния. Техническая реализация проста: одна точка знаний, RAG-сервис, ГигаЧат и семантическое кэширование позволяют быстро помогать юзеру на той же поверхности. Так команда превратила базу с ответами на вопросы в ГигаСправку. Читать далее на Хабре 👉 Data Science | Machinelearning [ru]

ИИ-агент в КОМПАС-3D: сам пишет код, лепит модель и сам себя проверяет Автор замутил ИИ-агента, который поселился прямо в окн
ИИ-агент в КОМПАС-3D: сам пишет код, лепит модель и сам себя проверяет Автор замутил ИИ-агента, который поселился прямо в окне программы. На вход — текст или фотка, на выходе — параметрическая деталь. Не тупая геометрия в step, а нормальное дерево построения с переменными, которое можно спокойно редактировать. Агент сам пишет код и сам же прогоняет рендеры через VLM. В статье — как эта зверюга справляется с моделированием по тексту и чертежам, почему один блок кода лучше десяти тулов и почему агенту мало просто «пялиться» на результат. Читать далее: https://habr.com/ru/articles/1072444/ 👉 Data Science | Machinelearning [ru]

IT внезапно вспомнил про философов. Или это déjà vu? Корпорации теперь тащат в штат культурологов с философами. Цукерберг с Безосом исправно посещают благотворительные ужины и скупают арт за миллионы. Глядя на это, начинаешь реально верить, что история ходит по кругу: замени в тусовочных разговорах «ИИ» на «парадигму мышления» — и за последние 3000 лет таких совпадений наберётся вагон. Главный посыл — насколько вообще осмысленны ответы нейросетей. И тут вообще неважно, есть у ИИ сознание или нет. Пользователям нужно, чтобы ответы совпадали с их ожиданиями, и плевать, кто там за ними стоит: живой человек или алгоритм. Люди хотят, чтобы выдача не вылезала за пределы культурных кодов их цивилизационной парадигмы и дружила с нормами, принципами и знаниями, из которых собрана их картина мира. Без этого ответы невозможно встроить в человеческие цепочки рассуждений — ни по смыслу, ни по этике, ни по эстетике, ни по праву. Отсюда и фоновое недоверие, которое копится и давит: никогда не угадаешь, когда система выдаст какую-нибудь дичь. Отсюда же растут ноги у проблемы common sense — то есть предела рациональности. Для LLM/ML common sense — это просто усреднённая величина, полученная статистической обработкой максимально больших массивов данных. Не лучшее решение, а самое ожидаемое. Творчеством тут и не пахнет: даже GenAI — это вероятностная машина, которая выдаёт самое частое слово или фразу. А генерация картинок — всё та же комбинаторика, только с другим входом. Источник 👉 Data Science | Machinelearning [ru]

Claude вскрыл 16 SAML‑проектов за месяц вечеров. Чинить их оказалось некому В Authentik — популярной опенсорсной системе корп
Claude вскрыл 16 SAML‑проектов за месяц вечеров. Чинить их оказалось некому В Authentik — популярной опенсорсной системе корпоративного входа — независимо и почти одновременно нашли одну и ту же уязвимость CVE-2026-57580. В поле NameID можно вставить XML‑комментарий, обрезать значение до чужого адреса и привязать к жертве подконтрольную атакующему учётную запись — подпись оставалась валидной. Проблема проявлялась не у всех: нужны определённые настройки сопоставления учётных записей, отличные от заданных по умолчанию. Исправление вышло в версиях 2026.2.6 и 2026.5.5. Об уязвимости сообщили восемь исследователей. Один из них — Эрик Чан (Eric Chiang), технический директор Oblique Security; для него эта находка стала одной из шестнадцати. Свою историю он рассказал в блоге 19 августа. Он считает, что желающих оказалось так много, потому что он не единственный, кто теперь взламывает с помощью ИИ. Читать далее 👉 Data Science | Machinelearning [ru]

Долбил нейросеть одним и тем же вопросом три раза — и словил три разных списка компаний Задолбал ИИ-поиск одним запросом триж
Долбил нейросеть одним и тем же вопросом три раза — и словил три разных списка компаний Задолбал ИИ-поиск одним запросом трижды, ничего не меняя. Первый раз он выдал 9 фирм, второй — 12, третий — 7. Совпало между всеми попытками всего пять названий из пятнадцати. А первая и третья попытка вообще не пересекли ни одного сайта. С таким разбросом любой отчёт вида «вас упоминают в 20% ответов», снятый одним заходом, — это лотерея. И «рост до 25% за месяц» — такая же лотерея. Внутри материала: как автор сам на этом обжёгся и публично отзывает свою цифру из прошлой статьи, что при такой волатильности вообще можно замерять, три вопроса исполнителю до оплаты и проверка на коленке за десять минут и ноль рублей. Читать на Хабре 👉 Data Science | Machinelearning [ru]

[Перевод] Три месяца с Claude: хороший ассистент, плохой программист LLM всё чаще становятся частью рабочего процесса разрабо
[Перевод] Три месяца с Claude: хороший ассистент, плохой программист LLM всё чаще становятся частью рабочего процесса разработчика, но вместе с ускорением приносят новую проблему: как понять, где ассистент действительно помогает, а где уверенно ведёт по ложному следу. В статье разобрали опыт трёх месяцев работы с Claude: в каких задачах он экономит время, где начинает галлюцинировать и почему с генерацией кода всё сложнее. Узнать подробнее 👉 Data Science | Machinelearning [ru]

Что в маркетинге и PR можно удешевить с помощью ИИ, а что трогать не стоит ИИ меняет экономику маркетинга: работа, на которую
Что в маркетинге и PR можно удешевить с помощью ИИ, а что трогать не стоит ИИ меняет экономику маркетинга: работа, на которую уходили часы команды и подрядчиков, теперь делается за часы. Отсюда соблазн смотреть на маркетинг как на список затрат и резать людей, инструменты, исследования, контент. Но маркетинг — это связанная система. Что-то можно убрать без последствий, а что-то кажется лишним ровно до тех пор, пока не начинают падать качество решений, знание клиента и рост. Правильный вопрос: не «что заменить на ИИ?», а «что можно удешевить, не разрушив систему?». Читать далее 👉 Data Science | Machinelearning [ru]

[3/8] Context Ranking: как отобрать реально полезные куски из репозитория Дальше по плану — как автодополнение вообще наскреб
[3/8] Context Ranking: как отобрать реально полезные куски из репозитория Дальше по плану — как автодополнение вообще наскребает контекст для LLM. В живом репозитории потенциально полезного добра вагон и тележка, поэтому тупо искать куски с похожими словами — мимо. Надо еще выкупить, какие из них реально стоит показать модели. Разбираем классику ранжирования — BM25: почему редкие идентификаторы ценнее популярных слов, зачем учитывать размер файла и почему десять одинаковых совпадений не должны быть в десять раз полезнее одного. Читать заметку 👉 Data Science | Machinelearning [ru]