DATApedia | Data science
前往频道在 Telegram
Тут вы найдете всё, что связано с Data Science, AI и Machine Learning, как для начинающих, так и для бывалых специалистов. Также, для вас, мы переводим зарубежные статьи. Сотрудничество: @Seyfme
显示更多3 309
订阅者
无数据24 小时
-57 天
-3230 天
帖子存档
Cryfish: Как научить большую языковую модель слышать и понимать звуки?
Сегодня мы расскажем вам о Cryfish — модели на основе LLM, которая не только читает, но и слышит. Мы разберём, как заставить LLM понимать речь, музыку, эмоции и бытовые шумы, и расскажем о сложностях, с которыми столкнулись при обучении.
Читать | DATApedia
От пет-проекта до продажи бизнеса: мой опыт внедрения ИИ агентов и автоматизации на n8n
Сегодня решил впервые поделиться своей историей, как я набивал шишки на коммерческих проектах по автоматизации, а потом решил запустить интенсив на Stepik по автоматизациям, который в итоге стал хитом. Набрал больше 700 студентов и получил среднюю оценку 5/5 за раскрытие «своей кухни».
Читать | DATApedia
Как подключить LLM в n8n без иностранной карты и протестировать сервис бесплатно
Подключить LLM к n8n вроде бы просто, но на практике большинство зарубежных сервисов ломают весь процесс. Чтобы получить ключ, приходится использовать карту иностранного банка и заходить с иностранного IP-адреса. Для российских разработчиков и вайбкодеров это превращается в отдельный квест.
Читать | DATApedia
Мы научили ИИ-агента думать как программист, и теперь мы не знаем, что у него на уме
Помните ту сцену в «Матрице», где в мозг Нео мгновенно загружают навыки джиу-джитсу?
Как только загрузка завершается, он начинает драться так, будто тренировался десять лет. Именно так я и представляла себе работу ИИ-агентов с инструментами. Дайте им доступ ко всему, и они просто будут знать, как всем этим пользоваться.
Но теперь, немного разобравшись в том, как всё это устроено, я поняла, что мои наивные представления были в корне неверны. Конечно, тогда я была ребёнком :)
Читать | DATApedia
Привет! Авито проводит второй ML reading club, в этот раз с Денисом Кайшевым, Senior Backend Engineer. Вместе со зрителями прочитаем и разберём статью Demystifying NCCL: An In-depth Analysis of GPU Communication Protocols and Algorithms.
Изучим архитектуру библиотеки NCCL и обсудим:
— как работают её внутренние механизмы, для которых почти нет документации;
— как описываются способы обмена при взаимодействии intra/inter node;
— как строятся алгоритмы коллективных операций.
Найдём узкие места библиотеки и выясним, как оптимизировать производительность распределённых вычислений.
📌 Встреча пройдёт 20 ноября в 18:00 в Контур.Толке.
⌚️ Ссылку на подключение пришлём в канал «Доска AI-объявлений» за час до начала эфира.
Что такое маршрутизатор LLM?
Маршрутизатор LLM — это система, которая автоматически направляет запросы пользователей к наиболее подходящей большой языковой модели (LLM) в зависимости от типа задачи, сложности и ожиданий по скорости и стоимости. Статья объясняет, зачем нужен такой подход: он позволяет оптимизировать производительность, снизить затраты и повысить надёжность ИИ-систем, особенно при мультимодельных архитектурах.
Статья | DATApedia | #DS_AI
ТОП-10 малоизвестных AI-сервисов, которые удивляют возможностями
2025 год щедро раздаёт нейросети всем желающим. Кажется, уже невозможно открыть браузер, чтобы на тебя не посмотрела очередной умник, обещающий сгенерировать гениальный текст, как у Толстого, но быстрее.
Одни модели сочиняют музыку, другие красят фотографии, третьи уверяют, что понимают людей лучше психологов. Но за громкими именами вроде ChatGPT, Midjourney и Runway скрывается подлесок маленьких, но интересных проектов.
Мы собрали десятку инструментов, на которые стоит обратить внимание.
Статья | DATApedia
Data Dojo | Москва | 27 ноября
Это мероприятие Яндекса для сообщества ML-специалистов с обсуждением трендов, прикладных кейсов и разбором реальных задач из соревнований.
Зачем участвовать:
💬 послушать выступления экспертов
💬 разобрать задачи вместе с сообществом
💬 узнать, как попасть на стажировку и начать карьеру ML’щика в Яндексе
💬 завести новые знакомства и зажечь на afterparty
👉 Заполняй форму до 16 ноября.
Data-самураи действуют поодиночке, но учатся вместе. Присоединяйся.
Cursor 2.0: многоагентная AI‑IDE и собственная модель Composer — что это меняет для разработчиков
Cursor 2.0 перестраивает процесс разработки: вместо ручного набора кода — постановка целей и параллельная оркестрация до восьми агентов, интегрированных с безопасными терминалами и ревью‑UI. Собственная модель Composer (MoE + RL) ускоряет генерацию и лучше ориентируется в больших кодовых базах, хотя качество топ‑моделей всё ещё выше; основной фокус — скорость, интерактивность и масштаб для крупных репозиториев.
Статья | DATApedia | #DS_AI
Как в Авито нашли способ считать сделки, которых не видно
В классифайдах сделки часто происходят вне платформы: например, продавец и покупатель встретились, чтобы осмотреть машину, и на месте совершили сделку.
Оценивать эти сделки и даже узнавать о них — нетривиальная задача. Но инженеры и аналитики из команды Авито всё равно научились замерять их ценность и формализовать понятие «договорённость» так, чтобы их могла распознавать ML-модель.
В статье — история о том:
— почему считать просто сделки может быть ошибкой,
— как «договорённость» стала новой единицей ценности,
— как превратили абстрактное понятие в рабочую бизнес-метрику.
Подробности — в материале на Хабре.
👉 «Как мы обучили ML-модель находить „договорённости“ без данных о сделках: кейс Авито»
ИИ в кино — это уже реальность. На примере Wink AI Challenge показываем, как ML-инженер может превратить фильм в набор данных и помочь продюсерам:
🔸 Анализировать сценарий с помощью NER и NLP.
🔸 Генерировать раскадровки на базе text-to-image и text-to-video.
🔸 Прогнозировать возрастной рейтинг фильма по описанию сцен и готовым кадрам.
Эти задачи предстоит решать на Wink AI Challenge — хакатоне на стыке кино и ИИ. Регистрация открыта до 4 ноября.
Если вас пугает слово «превизуализация», вы не знаете, чем отличаются форматы сценариев и как рассчитывается возрастной рейтинг, статья поможет разобраться. Внутри — реальные примеры из культовых фильмов и рекомендации по использованию моделей CLIP, Wan-AI, Qwen3-Omni и множества других.
В статье есть всё, чтобы быстро погрузиться в тему и подобрать рабочие инструменты: https://cnrlink.com/winkdswikiblogarticle
Тестирование движков массивно-параллельных вычислений: StarRocks, Trino, Spark. Spark – с DataFusion Comet и Impala
В статье проведено сравнение производительности и масштабируемости современных вычислительных движков для Lakehouse-платформы: StarRocks, Trino, Spark (также с DataFusion Comet), и Impala. Материал полезен для специалистов по большим данным и архитекторов платформ, выбирающих оптимальные технологии для аналитических задач.
Статья | DATApedia | #DS_AI
