uk
Feedback
Data Scientist | ML & AI

Data Scientist | ML & AI

Відкрити в Telegram

Один из ведущих каналов по Data Science, Machine Learning и Big Data Сотрудничество: @bape_ads Прайс: @bape_media

Показати більше
3 056
Підписники
+424 години
+117 днів
+6730 днів
Архів дописів
📰 RAG без фреймворков: руками и по шагам В разборе показывают, как собрать RAG с нуля: чанки, эмбеддинги, векторный поиск, r
📰 RAG без фреймворков: руками и по шагам В разборе показывают, как собрать RAG с нуля: чанки, эмбеддинги, векторный поиск, reranking и финальная генерация. Всё на Python, без LangChain и LlamaIndex, с локальными моделями через Ollama. ⛓️ Читать статью tags: #статья ➡ Data Scientist | Чат

🔖 Быстрый градиентный бустинг для больших данных LightGBM умеет обучаться на CPU и GPU, поддерживает распределённый режим и
🔖 Быстрый градиентный бустинг для больших данных LightGBM умеет обучаться на CPU и GPU, поддерживает распределённый режим и рассчитан на большие объёмы данных при относительно небольшом расходе памяти. Хороший инструмент для классификации, регрессии и ranking-задач. ⛓ Ссылка на GitHub tags: #полезное ➡ Data Scientist | Чат

🗂 Пакет Безопасности — папка, которую админ собирал более 10 лет ⚡️ Слитые курсы по IT и ИБ ⚡️ Сервисы и тулзы для приватнос
🗂 Пакет Безопасности — папка, которую админ собирал более 10 лет ⚡️ Слитые курсы по IT и ИБ ⚡️ Сервисы и тулзы для приватности ⚡️ Инструкции и шпаргалки ⚡️ Редкие книги и утилиты ⚡️ Гайды написанные автором Большинство собирает такую базу годами. Здесь все отсортировали и разбили в одном канале ссылка действует 48 часов 📌 Подписывайся: @package_security

📰 Как устроены векторные базы данных под капотом В статье разбирают путь от обычных векторов до полноценного semantic search
📰 Как устроены векторные базы данных под капотом В статье разбирают путь от обычных векторов до полноценного semantic search: векторизацию, поиск ближайших соседей, индексацию, LSH и HNSW. Плюс автор собирает рекомендательную систему на Weaviate и сравнивает её с поиском «в лоб» по расстоянию между векторами. ⛓️ Читать статью tags: #статья ➡ Data Scientist | Чат

Выбор моделей наглядно 😁 ➡ Data Scientist | Чат

REKONFA: что интересного вас ждёт 15 октября 15 октября встречаемся на REKONFA — большой конференции Яндекс Рекламы. На сцене: — Глеб Доброрадных — о рекламном рынке и эффективности в сложных условиях — Алексей Штоколов — о новых продуктах и технологиях — Лиза Смирнова — о 360°-форматах и новых точках контакта — Александр Пушной — о человеке и ИИ — Александр Умаров — о персональном подходе, который помогает влюблять клиентов в бренд — Яна Чурикова — об актуальных задачах предпринимателей — Татьяна Мужицкая — о целях и энергии — Антон Беляев — об индивидуальности и проектах, которые любят зрители Вне сцены — зона продуктов Яндекс Рекламы, три игры, викторина, зоны Яндекс Ярда и eLama и нетворкинг. 15 октября, Москва, ВТБ Арена и онлайн. Участие бесплатное. Зарегистрироваться #реклама 16+ ya.rekonfa.ru О рекламодателе

🔖 Что изменилось в DeepEP V2.5 DeepSeek серьёзно обновила библиотеку коммуникаций для MoE: 🫡 ElasticBuffer разделили на отд
+1
🔖 Что изменилось в DeepEP V2.5 DeepSeek серьёзно обновила библиотеку коммуникаций для MoE:
🫡 ElasticBuffer разделили на отдельные буферы; 🫡 Добавили BufferAllocator для предварительного планирования VRAM; 🫡 Появились batch all-gather, reduce-scatter и all-reduce; 🫡 Добавили prefetch весов резервных экспертов через NVLink; 🫡 Engram теперь умеет работать в несколько уровней на GPU и CPU; 🫡 Доработали сценарии обучения; 🫡 Полностью удалили V1 API и NVSHMEM.
⛓ Ссылка на GitHub tags: #полезное ➡ Data Scientist | Чат

📰 GraphRAG против обычного RAG В разборе показывают, как графы знаний помогают сохранять связи между сущностями и лучше отве
📰 GraphRAG против обычного RAG В разборе показывают, как графы знаний помогают сохранять связи между сущностями и лучше отвечать на сложные многошаговые вопросы. Плюс есть сравнение GraphRAG и LightRAG и реальные тесты на трёх типах документации. ⛓️ Читать статью tags: #статья ➡ Data Scientist | Чат

🔖 База по CUDA от NVIDIA В CUDA Refresher объясняют, как GPU распределяет вычисления и как устроена CUDA-модель: ядра, сетки
🔖 База по CUDA от NVIDIA В CUDA Refresher объясняют, как GPU распределяет вычисления и как устроена CUDA-модель: ядра, сетки, блоки и потоки. Плюс есть разбор библиотек и готовых инструментов. tags: #полезное ➡ Data Scientist | Чат

Выспался, собрал чат-бота в течения дня → заработал 29 000₽ Это не развод, а обычный день работы, тех. спеца: Взял схему от заказчика → собрал бота по шаблону → отдал клиенту → получил деньги👌 Работы — 2–4 часа. Оплата — 20–50 000₽ за проект. ✅ Не надо рано вставать и ехать на "любимую работу" ✅ Никакого долгого обучения или знаний программирования ✅ Если умеешь пользоваться браузером, то легко справишься И спрос на это сейчас огромный, заказов куча. Бизнесу нужны ИИ, чат-боты и автоматизация уже сегодня. Это одна из самых быстрорастущих ниш 2026 года, просто заходи и бери заказы. Инструкции здесь, открой пока доступна: 👉 https://t.me/Alekseicoach_bot?start=testdrivetg209 Если ты хочешь реально хорошо зарабатывать, от 150к в месяц без начальников, нужно решать важные задачи бизнесов. Сейчас это задачи по сборке ботов на конструкторах (да, у тебя по-любому получится). Пробуй 👇 https://t.me/Alekseicoach_bot?start=testdrivetg209

📰 Как работает поиск в векторных базах В статье показывают весь путь: текст → embedding → расстояние между векторами → поиск
📰 Как работает поиск в векторных базах В статье показывают весь путь: текст → embedding → расстояние между векторами → поиск похожих документов. А дальше начинается самое интересное — NSW и HNSW, которые позволяют не сравнивать запрос вообще со всей базой, а быстро находить ближайшие векторы через граф. ⛓️ Читать статью tags: #статья ➡ Data Scientist | Чат

🔖 Архитектура GPU для тех, кто работает с LLM-инференсом В руководстве разбирают, как современные GPU реально исполняют код
🔖 Архитектура GPU для тех, кто работает с LLM-инференсом В руководстве разбирают, как современные GPU реально исполняют код и почему без этого сложно осмысленно оптимизировать ядра. Основной фокус — NVIDIA и CUDA: execution model, occupancy, shared memory, конфликты банков и другие вещи, которые напрямую влияют на производительность инференса. ⛓ Ссылка на руководство tags: #полезное ➡ Data Scientist | Чат

📰 Как дообучать LLM через Supervised Fine-Tuning В статье разбирают SFT — один из ключевых этапов выравнивания LLM, где моде
📰 Как дообучать LLM через Supervised Fine-Tuning В статье разбирают SFT — один из ключевых этапов выравнивания LLM, где модель дообучают на качественных примерах «правильных» ответов. Внутри — отличие SFT от pretraining и обычного fine-tuning, роль качества датасета, связь с RLHF и практический пример через Hugging Face TRL и SFTTrainer. ⛓️ Читать статью tags: #статья ➡ Data Scientist | Чат

🔖 Запускаем LLM локально на Mac MLX-LM позволяет запускать модели с Hugging Face одной командой, а затем дообучать их через
🔖 Запускаем LLM локально на Mac MLX-LM позволяет запускать модели с Hugging Face одной командой, а затем дообучать их через LoRA или полноценный fine-tuning. Есть поддержка квантованных моделей, длинного контекста, распределённых вычислений и кэша промптов. ⛓ Ссылка на GitHub tags: #полезное ➡ Data Scientist | Чат

📰 RAG под капотом: от retrieval до генерации Автор проходит весь путь: как документы режутся на чанки, превращаются в embedd
📰 RAG под капотом: от retrieval до генерации Автор проходит весь путь: как документы режутся на чанки, превращаются в embeddings, ищутся через retrieval, реранжируются и попадают в промпт LLM. Дальше уже начинается мясо: semantic chunking, HyDE, contextual retrieval, hybrid search и автоматизация RAG. ⛓️ Читать статью tags: #статья ➡ Data Scientist | Чат

Бесплатный ChatGPT для работы прямо в Telegram Личный ассистент для рабочих задач. Без зарубежных карт, бесконечных регистрац
Бесплатный ChatGPT для работы прямо в Telegram Личный ассистент для рабочих задач. Без зарубежных карт, бесконечных регистраций и десятка вкладок.
— Топовые модели без банов и ограничений — Анализ кода, текста и скриншотов — Написание функций, скриптов и парсеров — Бесплатный доступ сразу после старта
Получи своего личного помощника: @callgpt

🔖 Открытый Jev почти догнал оригинал Bespoke Labs выпустила Nimble — открытую модель на базе Qwen3.5-9B с опубликованными ве
🔖 Открытый Jev почти догнал оригинал Bespoke Labs выпустила Nimble — открытую модель на базе Qwen3.5-9B с опубликованными весами, данными и рецептом обучения. Самое интересное — её не дистиллировали из Jev: его использовали только как ориентир для оценки. Nimble обучали на синтетических контрастных примерах, где один изменённый факт должен менять итоговое решение. ⛓ GitHub | Модель tags: #полезное ➡ Data Scientist | Чат

Если ты ждёшь знака, что пора валить в IT за границу, то вот он. IT — одна из немногих сфер, где можно сменить страну и валюту зарплаты без годов ожидания. Средняя цифра на руки среди трудоустроенных — 5 500$, а лучшие кейсы доходят до 13 750$. А чтобы понять, как это делают другие — изучи @interview_hustlers За 3,5 года через систему прошло 250+ учеников, которые трудоустроились за рубежом: Кипр, Германия, Ирландия, Канада, ОАЭ. География — 25+ стран. На канале вы найдёте: — Реальные кейсы трудоустройства с цифрами офферов и деталями переезда — Истории тех, кто ушёл в IT без опыта и получил оффер за границей за несколько месяцев — Сборку Linkedin под зарубеж, мок-собесы, подготовку к техничке и помощь с торгами, чтобы выбить оффер побольше Огромный опыт, который ты можешь перенять абсолютно бесплатно. Переходи и изучай: @interview_hustlers

📰 Что можно запустить в три строки через Transformers В статье есть примеры по: 🫡 Анализу тональности; 🫡 Суммаризации; 🫡
📰 Что можно запустить в три строки через Transformers В статье есть примеры по:
🫡 Анализу тональности; 🫡 Суммаризации; 🫡 Question Answering; 🫡 Embeddings; 🫡 Переводу; 🫡 NER; 🫡 Классификации и генерации текста; 🫡 Другим задачам NLP и компьютерного зрения.
Всего — 20 рабочих примеров, большая часть которых запускается даже без GPU. ⛓️ Читать статью tags: #статья ➡ Data Scientist | Чат

🔖 Дообучаем open-source модели прямо в Google Colab С Unsloth можно дообучать 500+ открытых моделей прямо в бесплатном Google Colab. Загружаете модель и датасет, запускаете обучение, а затем экспортируете результат. Плюс PDF и CSV можно превращать в синтетические датасеты для дальнейшего fine-tuning. ⛓ Ссылка на GitHub tags: #полезное ➡ Data Scientist | Чат