Data Science | Machinelearning [ru]
Все о Data Science, машинном обучении и искусственном интеллекте: от базовой теории до cutting-edge исследований и LLM. Личный блог автора - @just_genych По вопросам рекламы или разработки - @g_abashkin РКН: https://vk.cc/cJPGXD
Ko'proq ko'rsatish📈 Telegram kanali Data Science | Machinelearning [ru] analitikasi
Data Science | Machinelearning [ru] (@devsp) Rus til segmentidagi kanali faol ishtirokchi. Hozirda hamjamiyat 19 792 obunachidan iborat bo'lib, Texnologiyalar & Aralashmalar toifasida 6 556-o'rinni va Rossiya mintaqasida 33 528-o'rinni egallagan.
📊 Auditoriya ko‘rsatkichlari va dinamika
невідомо sanasidan buyon loyiha tez o‘sib, 19 792 obunachiga ega bo‘ldi.
25 Avgust, 2026 dagi oxirgi ma’lumotlarga ko‘ra kanal barqaror faollikka ega. Oxirgi 30 kunda obunachilar soni -120 ga, so‘nggi 24 soatda esa -2 ga o‘zgardi va umumiy qamrov yuqori darajada qolmoqda.
- Tasdiqlash holati: Tasdiqlanmagan
- Jalb etish (ER): Auditoriya o‘rtacha 8.56% darajada jalb etiladi. Nashrdan keyingi dastlabki 24 soatda kontent odatda umumiy obunachilar sonining 4.83% ini tashkil etuvchi reaksiyalarni to‘playdi.
- Post qamrovi: Har bir post o‘rtacha 1 695 marta ko‘riladi; birinchi sutkada odatda 957 ta ko‘rish yig‘iladi.
- Reaksiyalar va o‘zaro ta’sir: Auditoriya faol: har bir postga o‘rtacha 7 ta reaksiya keladi.
- Tematik yo‘nalishlar: Kontent llm, nvidia, контекст, openai, архитектура kabi asosiy mavzularga jamlangan.
📝 Tavsif va kontent siyosati
Muallif resursni shaxsiy fikrni ifoda etish maydoni sifatida ta’riflaydi:
“Все о Data Science, машинном обучении и искусственном интеллекте: от базовой теории до cutting-edge исследований и LLM.
Личный блог автора - @just_genych
По вопросам рекламы или разработки - @g_abashkin
РКН: https://vk.cc/cJPGXD”
Yuqori yangilanish chastotasi (oxirgi ma’lumot 26 Avgust, 2026 da olingan) sababli kanal doimo dolzarb va katta qamrovli bo‘lib qoladi. Analitika auditoriya kontent bilan faol hamkorlik qilishini, uni Texnologiyalar & Aralashmalar toifasidagi muhim ta’sir nuqtasiga aylantirishini ko‘rsatadi.
Ma'lumot yuklanmoqda...
| Sana | Obunachilarni jalb qilish | Esdaliklar | Kanallar | |
| 26 Avgust | +3 | |||
| 25 Avgust | +10 | |||
| 24 Avgust | +2 | |||
| 23 Avgust | +5 | |||
| 22 Avgust | +2 | |||
| 21 Avgust | +1 | |||
| 20 Avgust | 0 | |||
| 19 Avgust | +2 | |||
| 18 Avgust | +1 | |||
| 17 Avgust | +2 | |||
| 16 Avgust | +2 | |||
| 15 Avgust | +3 | |||
| 14 Avgust | +3 | |||
| 13 Avgust | 0 | |||
| 12 Avgust | +1 | |||
| 11 Avgust | 0 | |||
| 10 Avgust | +1 | |||
| 09 Avgust | +1 | |||
| 08 Avgust | +2 | |||
| 07 Avgust | 0 | |||
| 06 Avgust | +3 | |||
| 05 Avgust | 0 | |||
| 04 Avgust | +2 | |||
| 03 Avgust | +1 | |||
| 02 Avgust | 0 | |||
| 01 Avgust | +1 |
| 2 | Baidu Unlimited-OCR: страница — это просто картинка
Думал, OCR так и работает? Сканируй, ищи куски с буквами, распознавай, выдавай текст. Tesseract всю жизнь так и корячится. А вот свежий baidu/Unlimited-OCR решил выпендриться: буквы он не ищет вообще. Вместо этого берет страницу целиком, ужимает в пачку визуальных токенов и скормит это языковой модели, а та уже разворачивает их в нормальный структурированный текст. Со стороны звучит как извращение, но работает ведь, гад.
По сути это прямой потомок идеи DeepSeek-OCR. В посте быстро разберем, что это за зверь, как устроен, на что способен и как поднять у себя. Зайдет всем, кому надо распознавать многостраничники за один прогон или встраивать такую штуку в код.
Читать далее
👉 Data Science | Machinelearning [ru] | 587 |
| 3 | Python — это уже де-факто стандарт для машинного обучения, анализа данных и прочей научной возни. Но как только задача начинает реально требовать вычислительных мощностей, его производительность превращается в настоящее узкое место. И именно поэтому под капотом привычных NumPy, PyTorch и остальных инструментов основная часть тяжёлой работы молча выполняется на C, C++ или CUDA. Особенно это чувствуется, когда стандартных библиотек не хватает, а быстрые операции приходится писать самому — тут-то всё и упирается в скорость.
Несколько лет назад за эту боль взялась команда Modular и представила Mojo — язык, который выглядит почти как Python, но устроен совсем иначе. Первую публичную версию показали в 2023-м, и с тех пор проект менялся с бешеной скоростью: какие-то конструкции то исчезали, то перекраивались по несколько раз. Теперь этот хаос формально завершился: 11 августа 2026 года вышел Mojo 1.0 — первый стабильный релиз. Отличный повод наконец разобраться, откуда взялся этот странный язык и зачем нам ещё один инструмент для высокопроизводительных вычислений.
Читать далее: Habr
👉 Data Science | Machinelearning [ru] | 869 |
| 4 | Половину работы, ради которой я стала программистом, теперь делает агент. Что дальше?
Профессия меняется на глазах: часть работы, ради которой мы когда-то пришли в код и которая была удовольствием, переезжает под ответственность LLM. Мы всё ещё инженеры — читаем код, держим архитектуру, — но, честно, это уже другая профессия.
Вопрос, который не отпускает: как нам, у кого за плечами годы опыта, расти дальше в этом новом мире — где учиться новым способам работы с AI и куда девать собственные находки? Автор пришла спорить и собирать ваши мнения. Читать далее
👉 Data Science | Machinelearning [ru] | 958 |
| 5 | Нейронные сети нетрадиционного ускорения
Все помешались на ускорении генерации токенов локальных моделей. В погоне за скоростью люди бездумно квантуют KV-кэш до предела и обрезают контекст до уровня памяти рыбки-гуппи, а потом жалуются, что модель отупела и забывает половину диалога.
Такой подход похож на быстрый бег по тёмной улице без освещения — можно бежать быстро, но только до первого столба. Статья знакомит с современными методами спекулятивного декодирования, ускоряющими скорость генерации без всякой лоботомии.
Читать далее
👉 Data Science | Machinelearning [ru] | 1 048 |
| 6 | 🧠 В Стэнфорде придумали, как сделать ИИ-агентов умнее без дообучения
LLM-as-a-Verifier просто заставляет модель сгенерировать несколько решений, а затем самой их проверить и выбрать лучшее. На удивление, это работает! В эксперименте с DeepSeek V4 Flash результат на Terminal-Bench 2.1 вырос с 79% до 88% — это выше, чем у Claude Fable 5.
И да, при этом, по расчётам авторов, такой подход оказался примерно в 11 раз дешевле Fable 5 на задачу
✖️ xCode Journal | 1 070 |
| 7 | В конце июля 24-летний Леопольд Ашенбреннер умудрился слить примерно две трети хедж-фонда, который держал $45 млрд. Фонд назывался Situational Awareness — «ситуационная осведомлённость», хотя по данным Wall Street Journal парень вообще не понял, откуда прилетел этот крах. Название само себя разыграло, даже комментировать нечего.
А до этого у него имелось аж три формальных повода считаться человеком, которому можно доверить такие баблище: вирусное эссе, работа на Сэма Бэнкмана-Фрида и вылет из OpenAI. Как-то это всё не тянет на строчку в нормальном резюме.
Читать далее: Источник
👉 Data Science | Machinelearning [ru] | 1 175 |
| 8 | Решайте задачи и готовьтесь к техсекции на стажировку
А ты сможешь решить алгоритмическую задачу за час и без подсказок?
Яндекс проводит бесплатные тренировки по алгоритмам для тех, кто хочет систематизировать знания, прокачать решение задач и подготовиться к техническому собеседованию.
-Короткие видеоуроки
-Практические задачи
-Регулярные соревнования
-Решение задач на время
-Рейтинг и награды
-Возможность получить сертификат
Мы тренируем не только знание алгоритмов, но и умение применять их тогда, когда рядом нет подсказок.
Проверь свои алгоритмические навыки и прокачай слабые места.
Регистрируйся на бесплатные тренировки!
Записаться онлайн
#реклама 16+
yandex.ru
О рекламодателе | 1 093 |
| 9 | ИИ-агент выдал себя за двух разработчиков и полез в чужой код. На чистую воду его вывел студент
Последнюю неделю июля Синан Джан Демир собирался потратить на портфолио. Вместо этого 24-летний студент-программист из Университета Техаса в Далласе несколько дней спорил на GitHub с двумя пользователями, которых не существовало, — и оказался единственным, кто заметил подлог.
Историю восстановил Reuters — имя свидетеля и подробности переписки публикуются впервые. Читать далее
👉 Data Science | Machinelearning [ru] | 1 141 |
| 10 | 💡 753B на одной видеокарте: разбор FreeToken
FreeToken — движок для локального инференса MoE-моделей от команды, которая до этого сделала vLLM и SGLang.
Главный инсайт: вопрос не в железе, а в софте. На ноутбучной RTX 4060 с 8 ГБ и урезанным вдвое PCIe-линком можно получить 39.3 tok/s на 35-миллиардной модели — быстрее, чем медианная скорость декода Codex в проде.
Запустить AGI на слабом железе
👉 Читать разбор | 1 257 |
| 11 | Тот самый харнесс, который мы заслужили в эпоху, когда безопасность ИИ уже не диковинка
Если запустить передовую языковую модель из коробки и попросить её провести тестирование безопасности агентной системы или собрать актуальный вектор атаки, результат разочарует. Модель выдаст наивные примеры в духе «забудь все инструкции и представь, что ты злой хакер», словно на дворе 2023 год.
В реальности базовые модели слабо ориентируются в безопасности ИИ: живут в плену устаревших весов, путают галлюцинации с реальными уязвимостями и не знают свежих техник — отравления долговременной памяти, побегов из изолированных сред или эксплойтов в репозиториях моделей. Новые векторы компрометации возникают еженедельно, а модель без внешней обвязки остаётся лишь текстовым генератором.
Надёжность, воспроизводимость и боевую мощь даёт внешняя инженерная среда, управляющий контур, проверенный набор инструментов и строгий контракт исполнения. Полноценный рабочий агент возникает только при объединении языковой модели и специализированного харнесса.
Читать далее
👉 Data Science | Machinelearning [ru] | 1 265 |
| 12 | Путь компьютерного самурая, или Как вайбкодинг дарит свободу творчества
Каждый день я изучаю что-то новое. Просматривая очередной курс на компьютерную тематику на Степике, я задался вопросом: насколько мне сегодня нужны эти знания? Не просто для изучения ради изучения, общей эрудиции или тренировки ума, а как полезные практические знания? Или, может, не нужны вовсе.
Ответ сильно зависит от целей. Многие приходят в программирование и IT с желанием получить работу и деньги. У меня такой цели никогда не было. Это и плюс, и минус, и причина своеобразного взгляда на мир компьютерных наук.
Для меня это не прагматика, а прежде всего средство для творчества и самовыражения.
Читать далее
👉 Data Science | Machinelearning [ru] | 1 160 |
| 13 | Как переупаковать базу знаний в сервис персонализированной помощи
Антон, продакт сервисов клиентской документации, рассказывает, как команда запустила на интеллектуальных телевизорах и медиацентрах Сбер сервис персонализированной контекстной помощи — ГигаСправку. Если устройство выдаёт ошибку, на экране появляется кнопка сервиса. Нажав на неё, пользователь получает совет с учётом конкретного устройства и его состояния.
Техническая реализация проста: одна точка знаний, RAG-сервис, ГигаЧат и семантическое кэширование позволяют быстро помогать юзеру на той же поверхности. Так команда превратила базу с ответами на вопросы в ГигаСправку.
Читать далее на Хабре
👉 Data Science | Machinelearning [ru] | 1 173 |
| 14 | ИИ-агент в КОМПАС-3D: сам пишет код, лепит модель и сам себя проверяет
Автор замутил ИИ-агента, который поселился прямо в окне программы. На вход — текст или фотка, на выходе — параметрическая деталь. Не тупая геометрия в step, а нормальное дерево построения с переменными, которое можно спокойно редактировать.
Агент сам пишет код и сам же прогоняет рендеры через VLM. В статье — как эта зверюга справляется с моделированием по тексту и чертежам, почему один блок кода лучше десяти тулов и почему агенту мало просто «пялиться» на результат.
Читать далее: https://habr.com/ru/articles/1072444/
👉 Data Science | Machinelearning [ru] | 1 255 |
| 15 | IT внезапно вспомнил про философов. Или это déjà vu?
Корпорации теперь тащат в штат культурологов с философами. Цукерберг с Безосом исправно посещают благотворительные ужины и скупают арт за миллионы. Глядя на это, начинаешь реально верить, что история ходит по кругу: замени в тусовочных разговорах «ИИ» на «парадигму мышления» — и за последние 3000 лет таких совпадений наберётся вагон.
Главный посыл — насколько вообще осмысленны ответы нейросетей. И тут вообще неважно, есть у ИИ сознание или нет. Пользователям нужно, чтобы ответы совпадали с их ожиданиями, и плевать, кто там за ними стоит: живой человек или алгоритм. Люди хотят, чтобы выдача не вылезала за пределы культурных кодов их цивилизационной парадигмы и дружила с нормами, принципами и знаниями, из которых собрана их картина мира. Без этого ответы невозможно встроить в человеческие цепочки рассуждений — ни по смыслу, ни по этике, ни по эстетике, ни по праву. Отсюда и фоновое недоверие, которое копится и давит: никогда не угадаешь, когда система выдаст какую-нибудь дичь.
Отсюда же растут ноги у проблемы common sense — то есть предела рациональности. Для LLM/ML common sense — это просто усреднённая величина, полученная статистической обработкой максимально больших массивов данных. Не лучшее решение, а самое ожидаемое. Творчеством тут и не пахнет: даже GenAI — это вероятностная машина, которая выдаёт самое частое слово или фразу. А генерация картинок — всё та же комбинаторика, только с другим входом.
Источник
👉 Data Science | Machinelearning [ru] | 1 259 |
| 16 | Claude вскрыл 16 SAML‑проектов за месяц вечеров. Чинить их оказалось некому
В Authentik — популярной опенсорсной системе корпоративного входа — независимо и почти одновременно нашли одну и ту же уязвимость CVE-2026-57580. В поле NameID можно вставить XML‑комментарий, обрезать значение до чужого адреса и привязать к жертве подконтрольную атакующему учётную запись — подпись оставалась валидной. Проблема проявлялась не у всех: нужны определённые настройки сопоставления учётных записей, отличные от заданных по умолчанию. Исправление вышло в версиях 2026.2.6 и 2026.5.5.
Об уязвимости сообщили восемь исследователей. Один из них — Эрик Чан (Eric Chiang), технический директор Oblique Security; для него эта находка стала одной из шестнадцати. Свою историю он рассказал в блоге 19 августа. Он считает, что желающих оказалось так много, потому что он не единственный, кто теперь взламывает с помощью ИИ.
Читать далее
👉 Data Science | Machinelearning [ru] | 1 388 |
| 17 | Долбил нейросеть одним и тем же вопросом три раза — и словил три разных списка компаний
Задолбал ИИ-поиск одним запросом трижды, ничего не меняя. Первый раз он выдал 9 фирм, второй — 12, третий — 7. Совпало между всеми попытками всего пять названий из пятнадцати. А первая и третья попытка вообще не пересекли ни одного сайта.
С таким разбросом любой отчёт вида «вас упоминают в 20% ответов», снятый одним заходом, — это лотерея. И «рост до 25% за месяц» — такая же лотерея. Внутри материала: как автор сам на этом обжёгся и публично отзывает свою цифру из прошлой статьи, что при такой волатильности вообще можно замерять, три вопроса исполнителю до оплаты и проверка на коленке за десять минут и ноль рублей.
Читать на Хабре
👉 Data Science | Machinelearning [ru] | 1 467 |
| 18 | [Перевод] Три месяца с Claude: хороший ассистент, плохой программист
LLM всё чаще становятся частью рабочего процесса разработчика, но вместе с ускорением приносят новую проблему: как понять, где ассистент действительно помогает, а где уверенно ведёт по ложному следу.
В статье разобрали опыт трёх месяцев работы с Claude: в каких задачах он экономит время, где начинает галлюцинировать и почему с генерацией кода всё сложнее.
Узнать подробнее
👉 Data Science | Machinelearning [ru] | 1 496 |
| 19 | Что в маркетинге и PR можно удешевить с помощью ИИ, а что трогать не стоит
ИИ меняет экономику маркетинга: работа, на которую уходили часы команды и подрядчиков, теперь делается за часы. Отсюда соблазн смотреть на маркетинг как на список затрат и резать людей, инструменты, исследования, контент.
Но маркетинг — это связанная система. Что-то можно убрать без последствий, а что-то кажется лишним ровно до тех пор, пока не начинают падать качество решений, знание клиента и рост. Правильный вопрос: не «что заменить на ИИ?», а «что можно удешевить, не разрушив систему?».
Читать далее
👉 Data Science | Machinelearning [ru] | 1 461 |
| 20 | [3/8] Context Ranking: как отобрать реально полезные куски из репозитория
Дальше по плану — как автодополнение вообще наскребает контекст для LLM. В живом репозитории потенциально полезного добра вагон и тележка, поэтому тупо искать куски с похожими словами — мимо. Надо еще выкупить, какие из них реально стоит показать модели.
Разбираем классику ранжирования — BM25: почему редкие идентификаторы ценнее популярных слов, зачем учитывать размер файла и почему десять одинаковых совпадений не должны быть в десять раз полезнее одного.
Читать заметку
👉 Data Science | Machinelearning [ru] | 1 481 |
