Data Scientist | ML & AI
Ir al canal en Telegram
Один из ведущих каналов по Data Science, Machine Learning и Big Data Сотрудничество: @bape_ads Прайс: @bape_media
Mostrar más3 056
Suscriptores
+424 horas
+117 días
+6730 días
Archivo de publicaciones
📰 RAG без фреймворков: руками и по шагам
В разборе показывают, как собрать RAG с нуля: чанки, эмбеддинги, векторный поиск, reranking и финальная генерация.
Всё на Python, без LangChain и LlamaIndex, с локальными моделями через Ollama.
⛓️ Читать статью
tags: #статья
➡ Data Scientist | Чат
🔖 Быстрый градиентный бустинг для больших данных
LightGBM умеет обучаться на CPU и GPU, поддерживает распределённый режим и рассчитан на большие объёмы данных при относительно небольшом расходе памяти.
Хороший инструмент для классификации, регрессии и ranking-задач.
⛓ Ссылка на GitHub
tags: #полезное
➡ Data Scientist | Чат
🗂 Пакет Безопасности — папка, которую админ собирал более 10 лет
⚡️ Слитые курсы по IT и ИБ
⚡️ Сервисы и тулзы для приватности
⚡️ Инструкции и шпаргалки
⚡️ Редкие книги и утилиты
⚡️ Гайды написанные автором
Большинство собирает такую базу годами.
Здесь все отсортировали и разбили в одном канале
ссылка действует 48 часов
📌 Подписывайся: @package_security
📰 Как устроены векторные базы данных под капотом
В статье разбирают путь от обычных векторов до полноценного semantic search: векторизацию, поиск ближайших соседей, индексацию, LSH и HNSW.
Плюс автор собирает рекомендательную систему на Weaviate и сравнивает её с поиском «в лоб» по расстоянию между векторами.
⛓️ Читать статью
tags: #статья
➡ Data Scientist | Чат
REKONFA: что интересного вас ждёт 15 октября
15 октября встречаемся на REKONFA — большой конференции Яндекс Рекламы.
На сцене:
— Глеб Доброрадных — о рекламном рынке и эффективности в сложных условиях
— Алексей Штоколов — о новых продуктах и технологиях
— Лиза Смирнова — о 360°-форматах и новых точках контакта
— Александр Пушной — о человеке и ИИ
— Александр Умаров — о персональном подходе, который помогает влюблять клиентов в бренд
— Яна Чурикова — об актуальных задачах предпринимателей
— Татьяна Мужицкая — о целях и энергии
— Антон Беляев — об индивидуальности и проектах, которые любят зрители
Вне сцены — зона продуктов Яндекс Рекламы, три игры, викторина, зоны Яндекс Ярда и eLama и нетворкинг.
15 октября, Москва, ВТБ Арена и онлайн. Участие бесплатное.
Зарегистрироваться
#реклама 16+
ya.rekonfa.ru
О рекламодателе
+1
🔖 Что изменилось в DeepEP V2.5
DeepSeek серьёзно обновила библиотеку коммуникаций для MoE:
🫡 ElasticBuffer разделили на отдельные буферы; 🫡 Добавили BufferAllocator для предварительного планирования VRAM; 🫡 Появились batch all-gather, reduce-scatter и all-reduce; 🫡 Добавили prefetch весов резервных экспертов через NVLink; 🫡 Engram теперь умеет работать в несколько уровней на GPU и CPU; 🫡 Доработали сценарии обучения; 🫡 Полностью удалили V1 API и NVSHMEM.⛓ Ссылка на GitHub tags: #полезное ➡ Data Scientist | Чат
📰 GraphRAG против обычного RAG
В разборе показывают, как графы знаний помогают сохранять связи между сущностями и лучше отвечать на сложные многошаговые вопросы.
Плюс есть сравнение GraphRAG и LightRAG и реальные тесты на трёх типах документации.
⛓️ Читать статью
tags: #статья
➡ Data Scientist | Чат
🔖 База по CUDA от NVIDIA
В CUDA Refresher объясняют, как GPU распределяет вычисления и как устроена CUDA-модель: ядра, сетки, блоки и потоки.
Плюс есть разбор библиотек и готовых инструментов.
tags: #полезное
➡ Data Scientist | Чат
Выспался, собрал чат-бота в течения дня → заработал 29 000₽
Это не развод, а обычный день работы, тех. спеца:
Взял схему от заказчика → собрал бота по шаблону → отдал клиенту → получил деньги👌
Работы — 2–4 часа.
Оплата — 20–50 000₽ за проект.
✅ Не надо рано вставать и ехать на "любимую работу"
✅ Никакого долгого обучения или знаний программирования
✅ Если умеешь пользоваться браузером, то легко справишься
И спрос на это сейчас огромный, заказов куча.
Бизнесу нужны ИИ, чат-боты и автоматизация уже сегодня.
Это одна из самых быстрорастущих ниш 2026 года, просто заходи и бери заказы.
Инструкции здесь, открой пока доступна:
👉 https://t.me/Alekseicoach_bot?start=testdrivetg209
Если ты хочешь реально хорошо зарабатывать, от 150к в месяц без начальников, нужно решать важные задачи бизнесов.
Сейчас это задачи по сборке ботов на конструкторах (да, у тебя по-любому получится).
Пробуй 👇
https://t.me/Alekseicoach_bot?start=testdrivetg209
📰 Как работает поиск в векторных базах
В статье показывают весь путь: текст → embedding → расстояние между векторами → поиск похожих документов.
А дальше начинается самое интересное — NSW и HNSW, которые позволяют не сравнивать запрос вообще со всей базой, а быстро находить ближайшие векторы через граф.
⛓️ Читать статью
tags: #статья
➡ Data Scientist | Чат
🔖 Архитектура GPU для тех, кто работает с LLM-инференсом
В руководстве разбирают, как современные GPU реально исполняют код и почему без этого сложно осмысленно оптимизировать ядра.
Основной фокус — NVIDIA и CUDA: execution model, occupancy, shared memory, конфликты банков и другие вещи, которые напрямую влияют на производительность инференса.
⛓ Ссылка на руководство
tags: #полезное
➡ Data Scientist | Чат
📰 Как дообучать LLM через Supervised Fine-Tuning
В статье разбирают SFT — один из ключевых этапов выравнивания LLM, где модель дообучают на качественных примерах «правильных» ответов.
Внутри — отличие SFT от pretraining и обычного fine-tuning, роль качества датасета, связь с RLHF и практический пример через Hugging Face TRL и
SFTTrainer.
⛓️ Читать статью
tags: #статья
➡ Data Scientist | Чат🔖 Запускаем LLM локально на Mac
MLX-LM позволяет запускать модели с Hugging Face одной командой, а затем дообучать их через LoRA или полноценный fine-tuning.
Есть поддержка квантованных моделей, длинного контекста, распределённых вычислений и кэша промптов.
⛓ Ссылка на GitHub
tags: #полезное
➡ Data Scientist | Чат
📰 RAG под капотом: от retrieval до генерации
Автор проходит весь путь: как документы режутся на чанки, превращаются в embeddings, ищутся через retrieval, реранжируются и попадают в промпт LLM.
Дальше уже начинается мясо: semantic chunking, HyDE, contextual retrieval, hybrid search и автоматизация RAG.
⛓️ Читать статью
tags: #статья
➡ Data Scientist | Чат
Бесплатный ChatGPT для работы прямо в Telegram
Личный ассистент для рабочих задач. Без зарубежных карт, бесконечных регистраций и десятка вкладок.
— Топовые модели без банов и ограничений — Анализ кода, текста и скриншотов — Написание функций, скриптов и парсеров — Бесплатный доступ сразу после стартаПолучи своего личного помощника: @callgpt
🔖 Открытый Jev почти догнал оригинал
Bespoke Labs выпустила Nimble — открытую модель на базе Qwen3.5-9B с опубликованными весами, данными и рецептом обучения.
Самое интересное — её не дистиллировали из Jev: его использовали только как ориентир для оценки. Nimble обучали на синтетических контрастных примерах, где один изменённый факт должен менять итоговое решение.
⛓ GitHub | Модель
tags: #полезное
➡ Data Scientist | Чат
Если ты ждёшь знака, что пора валить в IT за границу, то вот он.
IT — одна из немногих сфер, где можно сменить страну и валюту зарплаты без годов ожидания. Средняя цифра на руки среди трудоустроенных — 5 500$, а лучшие кейсы доходят до 13 750$.
А чтобы понять, как это делают другие — изучи @interview_hustlers
За 3,5 года через систему прошло 250+ учеников, которые трудоустроились за рубежом: Кипр, Германия, Ирландия, Канада, ОАЭ. География — 25+ стран.
На канале вы найдёте:
— Реальные кейсы трудоустройства с цифрами офферов и деталями переезда
— Истории тех, кто ушёл в IT без опыта и получил оффер за границей за несколько месяцев
— Сборку Linkedin под зарубеж, мок-собесы, подготовку к техничке и помощь с торгами, чтобы выбить оффер побольше
Огромный опыт, который ты можешь перенять абсолютно бесплатно. Переходи и изучай: @interview_hustlers
📰 Что можно запустить в три строки через Transformers
В статье есть примеры по:
🫡 Анализу тональности; 🫡 Суммаризации; 🫡 Question Answering; 🫡 Embeddings; 🫡 Переводу; 🫡 NER; 🫡 Классификации и генерации текста; 🫡 Другим задачам NLP и компьютерного зрения.Всего — 20 рабочих примеров, большая часть которых запускается даже без GPU. ⛓️ Читать статью tags: #статья ➡ Data Scientist | Чат
🔖 Дообучаем open-source модели прямо в Google Colab
С Unsloth можно дообучать 500+ открытых моделей прямо в бесплатном Google Colab.
Загружаете модель и датасет, запускаете обучение, а затем экспортируете результат. Плюс PDF и CSV можно превращать в синтетические датасеты для дальнейшего fine-tuning.
⛓ Ссылка на GitHub
tags: #полезное
➡ Data Scientist | Чат
