DATApedia | Data science
Open in Telegram
Тут вы найдете всё, что связано с Data Science, AI и Machine Learning, как для начинающих, так и для бывалых специалистов. Также, для вас, мы переводим зарубежные статьи. Сотрудничество: @Seyfme
Show more3 309
Subscribers
No data24 hours
-57 days
-3230 days
Posts Archive
Большое сравнение архитектур LLM
В статье приведён подробный сравнительный анализ современных архитектур главных опенсорсных больших языковых моделей (LLM) 2024–2025 годов: DeepSeek, OLMo, Gemma, Mistral, Llama, Qwen, SmolLM, Kimi K2, GPT-OSS, Grok и других. Автор разбирает их ключевые архитектурные отличия — такие как способы организации внимания, использование смеси экспертов (Mixture-of-Experts), методы нормализации, подходы к экономии памяти и вычислений, а также особенности современных трендов, влияющих на производительность и эффективность LLM.
Статья | DATApedia | #DS_AI
ClickHouse vs StarRocks: сравнение выбора MPP‑баз данных для всех сценариев
В статье подробно сравниваются две MPP-OLAP СУБД — ClickHouse и StarRocks — на основе актуальных тестов производительности, сценариев использования, поддержки join, масштабируемости и обработки изменений данных. Автор приводит результаты практических тестов (SSB, TPC-H), объясняет архитектурные различия и рекомендации по выбору между системами для аналитических задач, делая акцент на сильных сторонах каждой СУБД.
Статья | DATApedia | #DS_AI
Разработка MCP-сервера на примере CRUD операций
В статье подробно рассматривается открытый протокол MCP (Model Context Protocol), который унифицирует взаимодействие между LLM-моделями и внешними сервисами через стандартизированный API. На реальном примере показан процесс создания MCP-сервера и реализация простых CRUD-операций для управления базой данных персонала с помощью LLM, включая архитектуру, настройку и интеграцию всех компонентов. MCP позволяет использовать инструменты, ресурсы и шаблоны промтов в едином формате, значительно упрощая разработку и поддержку сервисов.
Статья | DATApedia | #DS_AI
Когда руководу нужно сделать что-то срочное для директора, но уже 18:01
Куда идти в IT новичку в 2026: план для быстрого старта в AI от практика
Автор делится личным опытом, как построить карьеру в IT с нуля и почему в 2025–2026 году новичкам не стоит идти сразу в Data Science или Frontend из-за высокой конкуренции и сложностей старта. Вместо этого рекомендует автоматизацию и адаптацию LLM для реальных бизнес-задач, приводя пошаговый план входа в AI-сферу.
Статья | DATApedia | #DS_AI
+2
ML-квалификация — сегодня в 16:00
Яндекс открыл регистрацию на Yandex Cup — международный чемпионат с призовым фондом 12 млн рублей и финалом в Стамбуле.
В ML-треке можно участвовать с 14 лет. Это возможность выиграть от 100 тысяч рублей и попасть в Яндекс по упрощённой схеме.
Этапы:
— регистрация до 29 октября
— онлайн-квалификация с 15 октября по 5 ноября
— финал 5–7 декабря в Стамбуле
Пора регистрироваться.
Почему «больше токенов ≠ лучше» или Как научить LLM работать с длинным контекстом
Статья объясняет, что увеличение объема контекста для LLM не всегда приводит к лучшим ответам: при длинных входных данных часто возрастает шум и риск галлюцинаций. Авторы сравнивают различные стратегии (baseline, RAG, динамические промпты), показывая, что для работы с большими документами важно не просто «скармливать» всё подряд, а выбирать и структурировать релевантный контекст. Статья будет полезна всем, кто разрабатывает ИИ-продукты на основе языковых моделей, работающих с длинными текстами.
Статья | DATApedia | #DS_AI
Инженирия контекста для саморазвивающихся ИИ-агентов
В работе предлагается ACE — подход, где контекст рассматривается как живой плейбук и эволюционирует через роли Генератора, Рефлектора и Куратора, избегая коллапса кратких сводок. Показаны стабильные приросты качества в агентных и финансовых задачах при снижении стоимости за счёт дельта-обновлений и использования KV‑кеша.
Статья | DATApedia | #DS_AI
Как мы обеспечили +33% к точности на сложных SQL-запросах
Статья разбирает улучшение Text-to-SQL на локальных LLM без внешних API: комбинируют промпт-пайплайны и RL-дообучение (GRPO/GSPO) с guided decoding. На BIRD показан прирост +33% по EX в категории challenging для Qwen3‑0.6B, обсуждаются шаги для дальнейшего усиления метрик.
Статья | DATApedia | #DS_AI
Агент-исследователь: как научить LLM работать с поиском в интернете
В данной статье рассказывается обInfoAgent. Это «веб-детектив» на базе LLM, который чередует рассуждение с поиском и просмотром, строит длинные траектории, и через SFT+RL учится глубоко проверять факты вместо догадок. Собственная инфраструктура поиска (BM25, эмбеддинги, ререйанкеры) даёт контроль и стабильность, обеспечивая сильные результаты на сложных бенчмарках и кросс-языковую генерализацию.
Статья | DATApedia | #DS_AI
GLM-4.6: новый флагман от Zhipu AI в области агентных рабочих процессов и кодинга
Модель GLM-4.6 улучшает работу с длинным контекстом до 200K токенов, снижает расходы на токены и нативно поддерживает tool calling для агентных сценариев. По бенчмаркам она сильна в математике и реальном кодинге, предлагая практические выгоды для разработки, автоматизации и интеграции с поиском.
Статья | DATApedia | #DS_AI
VK Weekend Offer: получите офер за три шага!
4–5 октября VK проведёт Weekend Offer для бэкендеров и ML-инженеров с опытом от трёх лет. Ребята в VK много лет создают облачные решения, системы рекомендаций и поисковые движки — всё с миллионами пользователей в проде — и сейчас ищут новых коллег.
Бекэндеров – с опытом коммерческой разработки от трёх лет, знанием Java, Go, Python или C++.
ML-экспертов – также три года опыта, и знание Classic ML, RecSys, NLP/LLM, CV, Speech Участников ждут технические собеседования, знакомство с продуктами и, если всё сложится, офер уже в конце выходных.
Поэтому оставляйте заявку до 2 октября, чтобы попасть в команду!
Подробности — на сайте.
Реклама: ООО «ВК» ИНН 7743001840
Хотите вкатиться в ML или DS с нуля?
Совсем скоро стартует курс «Machine Learning. Basic» от OTUS! Это обучение — ваш шанс овладеть востребованными навыками и начать карьеру в области, которая меняет мир технологий. На курсе вы:
- Освоите Python для Data Science с нуля до профессионального уровня.
- Научитесь работать с ML-библиотеками: pandas, numpy, sklearn, и применять их для решения реальных задач.
- Освоите A/B-тестирование
- Научитесь решать реальные бизнес-задачи при помощи методов машинного обучения от задач классификации до ансамблей моделей
Осталось совсем немного времени, присоединяйтесь к курсу. Успейте по максимально выгодной цене месяца + примените дополнительный промокод ML_BASIC_5: https://clck.ru/3PRYdc
Реклама. ООО «Отус онлайн-образование», ОГРН 1177746618576
T-ECD — кросс-доменный датасет для исследований в области рекомендательных систем
Описание. Представлен крупнейший открытый синтетический датасет T-ECD, созданный на основе реальных данных Т-Банка для исследований рекомендательных систем. Датасет охватывает пять доменов (маркетплейс, ритейл, офферы, платежи, отзывы), содержит более 135 млрд взаимодействий и позволяет исследовать кросс-доменные сценарии персонализации.
Статья | DATApedia | #DS_AI
Федеративное обучение диффузионных моделей с обрезкой и иерархией — экономим ресурсы, побеждаем гетерогенность данных
Описание. В статье рассказывается о FedPhD — новом подходе к обучению диффузионных моделей в федеративной среде. Метод сочетает иерархическую архитектуру, структурированную обрезку моделей и умную агрегацию, что позволяет повысить качество генерации изображений, снизить трафик и вычислительные затраты, а также лучше справляться с неоднородными (non-IID) данными.
Статья | DATApedia | #DS_AI
Руководство по ChatGPT: правильно выбираем модель и режим рассуждений
В статье рассказывается о новых режимах и моделях ChatGPT, включая GPT-5 и его “роутер”, лимиты запросов, а также о том, как выбрать подходящий режим для разных задач. Автор делится советами по использованию Thinking, Instant и других моделей, а также объясняет, как получить максимальную отдачу от сервиса.
Статья ↗ | DATApedia ↗ | #DS_AI
Неформально про реком
Глитч нейросети — это база, а ивент AI VK & Pro в «оригинале» — повод собраться и узнать, как меняются рекомендательные системы.
27 августа VK проводит AI VK & Pro — закрытый митап про RecSys и ML. Где соберутся крутые ML-инженеры, исследователи и разработчики.
В программе доклады от ML-лидов VK. Поговорим про Discovery Platform, продовые трансформеры и мультимодальные модели.
Приходите задать вопросы, поделиться опытом и поглитчевать среди своих в неформальной обстановке. А после — афтепати: винил, сигары, вино и покер.
📍 Москва, только офлайн
📅 27 августа, сбор с 18:00
🎟 Вход по регистрации
