en
Feedback
DATApedia | Data science

DATApedia | Data science

Open in Telegram

Тут вы найдете всё, что связано с Data Science, AI и Machine Learning, как для начинающих, так и для бывалых специалистов. Также, для вас, мы переводим зарубежные статьи. Сотрудничество: @Seyfme

Show more
3 309
Subscribers
No data24 hours
-57 days
-3230 days
Posts Archive
Большое сравнение архитектур LLM В статье приведён подробный сравнительный анализ современных архитектур главных опенсорсных
Большое сравнение архитектур LLM В статье приведён подробный сравнительный анализ современных архитектур главных опенсорсных больших языковых моделей (LLM) 2024–2025 годов: DeepSeek, OLMo, Gemma, Mistral, Llama, Qwen, SmolLM, Kimi K2, GPT-OSS, Grok и других. Автор разбирает их ключевые архитектурные отличия — такие как способы организации внимания, использование смеси экспертов (Mixture-of-Experts), методы нормализации, подходы к экономии памяти и вычислений, а также особенности современных трендов, влияющих на производительность и эффективность LLM. Статья | DATApedia | #DS_AI

ClickHouse vs StarRocks: сравнение выбора MPP‑баз данных для всех сценариев В статье подробно сравниваются две MPP-OLAP СУБД
ClickHouse vs StarRocks: сравнение выбора MPP‑баз данных для всех сценариев В статье подробно сравниваются две MPP-OLAP СУБД — ClickHouse и StarRocks — на основе актуальных тестов производительности, сценариев использования, поддержки join, масштабируемости и обработки изменений данных. Автор приводит результаты практических тестов (SSB, TPC-H), объясняет архитектурные различия и рекомендации по выбору между системами для аналитических задач, делая акцент на сильных сторонах каждой СУБД. Статья | DATApedia | #DS_AI

Разработка MCP-сервера на примере CRUD операций В статье подробно рассматривается открытый протокол MCP (Model Context Protoc
Разработка MCP-сервера на примере CRUD операций В статье подробно рассматривается открытый протокол MCP (Model Context Protocol), который унифицирует взаимодействие между LLM-моделями и внешними сервисами через стандартизированный API. На реальном примере показан процесс создания MCP-сервера и реализация простых CRUD-операций для управления базой данных персонала с помощью LLM, включая архитектуру, настройку и интеграцию всех компонентов. MCP позволяет использовать инструменты, ресурсы и шаблоны промтов в едином формате, значительно упрощая разработку и поддержку сервисов. Статья | DATApedia | #DS_AI

Когда руководу нужно сделать что-то срочное для директора, но уже 18:01

Куда идти в IT новичку в 2026: план для быстрого старта в AI от практика Автор делится личным опытом, как построить карьеру в
Куда идти в IT новичку в 2026: план для быстрого старта в AI от практика Автор делится личным опытом, как построить карьеру в IT с нуля и почему в 2025–2026 году новичкам не стоит идти сразу в Data Science или Frontend из-за высокой конкуренции и сложностей старта. Вместо этого рекомендует автоматизацию и адаптацию LLM для реальных бизнес-задач, приводя пошаговый план входа в AI-сферу. Статья | DATApedia | #DS_AI

ML-квалификация — сегодня в 16:00 Яндекс открыл регистрацию на Yandex Cup — международный чемпионат с призовым фондом 12 млн
+2
ML-квалификация — сегодня в 16:00 Яндекс открыл регистрацию на Yandex Cup — международный чемпионат с призовым фондом 12 млн рублей и финалом в Стамбуле. В ML-треке можно участвовать с 14 лет. Это возможность выиграть от 100 тысяч рублей и попасть в Яндекс по упрощённой схеме. Этапы: — регистрация до 29 октября — онлайн-квалификация с 15 октября по 5 ноября — финал 5–7 декабря в Стамбуле Пора регистрироваться.

Почему «больше токенов ≠ лучше» или Как научить LLM работать с длинным контекстом Статья объясняет, что увеличение объема контекста для LLM не всегда приводит к лучшим ответам: при длинных входных данных часто возрастает шум и риск галлюцинаций. Авторы сравнивают различные стратегии (baseline, RAG, динамические промпты), показывая, что для работы с большими документами важно не просто «скармливать» всё подряд, а выбирать и структурировать релевантный контекст. Статья будет полезна всем, кто разрабатывает ИИ-продукты на основе языковых моделей, работающих с длинными текстами. Статья | DATApedia | #DS_AI

Инженирия контекста для саморазвивающихся ИИ-агентов В работе предлагается ACE — подход, где контекст рассматривается как жив
Инженирия контекста для саморазвивающихся ИИ-агентов В работе предлагается ACE — подход, где контекст рассматривается как живой плейбук и эволюционирует через роли Генератора, Рефлектора и Куратора, избегая коллапса кратких сводок. Показаны стабильные приросты качества в агентных и финансовых задачах при снижении стоимости за счёт дельта-обновлений и использования KV‑кеша. Статья | DATApedia | #DS_AI

Как мы обеспечили +33% к точности на сложных SQL-запросах Статья разбирает улучшение Text-to-SQL на локальных LLM без внешних
Как мы обеспечили +33% к точности на сложных SQL-запросах Статья разбирает улучшение Text-to-SQL на локальных LLM без внешних API: комбинируют промпт-пайплайны и RL-дообучение (GRPO/GSPO) с guided decoding. На BIRD показан прирост +33% по EX в категории challenging для Qwen3‑0.6B, обсуждаются шаги для дальнейшего усиления метрик. Статья | DATApedia | #DS_AI

photo content

Агент-исследователь: как научить LLM работать с поиском в интернете В данной статье рассказывается обInfoAgent. Это «веб-дете
Агент-исследователь: как научить LLM работать с поиском в интернете В данной статье рассказывается обInfoAgent. Это «веб-детектив» на базе LLM, который чередует рассуждение с поиском и просмотром, строит длинные траектории, и через SFT+RL учится глубоко проверять факты вместо догадок. Собственная инфраструктура поиска (BM25, эмбеддинги, ререйанкеры) даёт контроль и стабильность, обеспечивая сильные результаты на сложных бенчмарках и кросс-языковую генерализацию. Статья | DATApedia | #DS_AI

GLM-4.6: новый флагман от Zhipu AI в области агентных рабочих процессов и кодинга Модель GLM-4.6 улучшает работу с длинным ко
GLM-4.6: новый флагман от Zhipu AI в области агентных рабочих процессов и кодинга Модель GLM-4.6 улучшает работу с длинным контекстом до 200K токенов, снижает расходы на токены и нативно поддерживает tool calling для агентных сценариев. По бенчмаркам она сильна в математике и реальном кодинге, предлагая практические выгоды для разработки, автоматизации и интеграции с поиском. Статья | DATApedia | #DS_AI

VK Weekend Offer: получите офер за три шага! 4–5 октября VK проведёт Weekend Offer для бэкендеров и ML-инженеров с опытом от трёх лет. Ребята в VK много лет создают облачные решения, системы рекомендаций и поисковые движки — всё с миллионами пользователей в проде — и сейчас ищут новых коллег. Бекэндеров – с опытом коммерческой разработки от трёх лет, знанием Java, Go, Python или C++. ML-экспертов – также три года опыта, и знание Classic ML, RecSys, NLP/LLM, CV, Speech Участников ждут технические собеседования, знакомство с продуктами и, если всё сложится, офер уже в конце выходных. Поэтому оставляйте заявку до 2 октября, чтобы попасть в команду! Подробности — на сайте. Реклама: ООО «ВК» ИНН 7743001840

Хотите вкатиться в ML или DS с нуля? Совсем скоро стартует курс «Machine Learning. Basic» от OTUS! Это обучение — ваш шанс ов
Хотите вкатиться в ML или DS с нуля? Совсем скоро стартует курс «Machine Learning. Basic» от OTUS! Это обучение — ваш шанс овладеть востребованными навыками и начать карьеру в области, которая меняет мир технологий. На курсе вы: - Освоите Python для Data Science с нуля до профессионального уровня. - Научитесь работать с ML-библиотеками: pandas, numpy, sklearn, и применять их для решения реальных задач. - Освоите A/B-тестирование - Научитесь решать реальные бизнес-задачи при помощи методов машинного обучения от задач классификации до ансамблей моделей Осталось совсем немного времени, присоединяйтесь к курсу. Успейте по максимально выгодной цене месяца + примените дополнительный промокод ML_BASIC_5: https://clck.ru/3PRYdc Реклама. ООО «Отус онлайн-образование», ОГРН 1177746618576

T-ECD — кросс-доменный датасет для исследований в области рекомендательных систем Описание. Представлен крупнейший открытый с
T-ECD — кросс-доменный датасет для исследований в области рекомендательных систем Описание. Представлен крупнейший открытый синтетический датасет T-ECD, созданный на основе реальных данных Т-Банка для исследований рекомендательных систем. Датасет охватывает пять доменов (маркетплейс, ритейл, офферы, платежи, отзывы), содержит более 135 млрд взаимодействий и позволяет исследовать кросс-доменные сценарии персонализации. Статья | DATApedia | #DS_AI

«Брендометр» Airbnb: автоматизация оценки восприятия бренда в социальных сетях с помощью ИИ Эта статья посвящена тому, как в
«Брендометр» Airbnb: автоматизация оценки восприятия бренда в социальных сетях с помощью ИИ Эта статья посвящена тому, как в Airbnb, пользуясь технологиями глубокого обучения, вычисляют показатели восприятия бренда на основе данных, полученных из социальных сетей. Читать | DATApedia | #DS_AI

Федеративное обучение диффузионных моделей с обрезкой и иерархией — экономим ресурсы, побеждаем гетерогенность данных Описани
Федеративное обучение диффузионных моделей с обрезкой и иерархией — экономим ресурсы, побеждаем гетерогенность данных Описание. В статье рассказывается о FedPhD — новом подходе к обучению диффузионных моделей в федеративной среде. Метод сочетает иерархическую архитектуру, структурированную обрезку моделей и умную агрегацию, что позволяет повысить качество генерации изображений, снизить трафик и вычислительные затраты, а также лучше справляться с неоднородными (non-IID) данными. Статья | DATApedia | #DS_AI

Руководство по ChatGPT: правильно выбираем модель и режим рассуждений В статье рассказывается о новых режимах и моделях ChatG
Руководство по ChatGPT: правильно выбираем модель и режим рассуждений В статье рассказывается о новых режимах и моделях ChatGPT, включая GPT-5 и его “роутер”, лимиты запросов, а также о том, как выбрать подходящий режим для разных задач. Автор делится советами по использованию Thinking, Instant и других моделей, а также объясняет, как получить максимальную отдачу от сервиса. Статья ↗ | DATApedia ↗ | #DS_AI

photo content

Неформально про реком Глитч нейросети — это база, а ивент AI VK & Pro в «оригинале» — повод собраться и узнать, как меняются
Неформально про реком Глитч нейросети — это база, а ивент AI VK & Pro в «оригинале» — повод собраться и узнать, как меняются рекомендательные системы. 27 августа VK проводит AI VK & Pro — закрытый митап про RecSys и ML. Где соберутся крутые ML-инженеры, исследователи и разработчики. В программе доклады от ML-лидов VK. Поговорим про Discovery Platform, продовые трансформеры и мультимодальные модели. Приходите задать вопросы, поделиться опытом и поглитчевать среди своих в неформальной обстановке. А после — афтепати: винил, сигары, вино и покер. 📍 Москва, только офлайн 📅 27 августа, сбор с 18:00 🎟 Вход по регистрации