Запись эфира
Что обсудили:
Кодировки текста — почему английские промпты эффективнее
Сжатие Хаффмана, - аналогии с работой токенизатора
Сжатие с потерями (JPEG/MP3) как аналогия обучения моделей
Цепи Маркова — зависимость от предыдущих состояний
Нейронные сети — живые демо в браузере
Трансформеры — энкодер/декодер, слои внимания
Диффузеры — генерация от белого шума
Модели мира — 3D + текст + звук + физика
Звуковые модели — токенизация семплов
Токенизация — TF-IDF и BM-25
Эмбеддинги — косинусная близость, чанки, re-ranker
Рекомендованные материалы
Официальный FAQ Unicode: как работает UTF-кодирование, BOM-метки и почему текст на разных языках занимает разное количество байт.
unicode.org/faq/utf_bom.html
Русский перевод Hugging Face LLM Course: глава о токенизации и о том, как текст превращается в числа.
huggingface.co/learn/llm-course/ru/chapter1/4
Документация spaCy по лингвистическому анализу: токенизация, части речи, лемматизация и деревья зависимостей.
spacy.io/usage/linguistic-features
Документация scikit-learn по линейным моделям: от простой регрессии до Ridge, Lasso и ElasticNet — база, с которой начинается машинное обучение.
scikit-learn.org/stable/modules/linear_model.html
Google Machine Learning Crash Course: путь от линейной регрессии и классификации до нейронных сетей и эмбеддингов с видео и упражнениями.
developers.google.com/machine-learning/crash-course
Интерактивная песочница TensorFlow: браузерный симулятор нейронной сети, в котором можно выбирать слои и нейроны и наблюдать, как сеть учится классифицировать точки.
playground.tensorflow.org
Видео 3Blue1Brown с наглядным объяснением нейронных сетей, обратного распространения ошибки и представления смысла в числах.
3blue1brown.com/?topic=neural-networks
Официальные руководства PyTorch: от базовой работы с тензорами до распределённого обучения — всё с работающим кодом.
docs.pytorch.org/tutorials
Dive into Deep Learning: полный интерактивный учебник с кодом на PyTorch, JAX и TensorFlow — от основ математики до трансформеров и диффузионных моделей.
d2l.ai
Урок № 10
fast.ai: практическое обучение нейросетей на табличных данных и работа с коллаборативной фильтрацией.
course.fast.ai/Lessons/lesson10.html
Визуализатор эмбеддингов от Google: позволяет загрузить собственные векторы и посмотреть, как слова и объекты группируются в многомерном пространстве.
projector.tensorflow.org
Sentence-BERT Cross-Encoder: модель для переранжирования результатов поиска, которая оценивает пару «запрос — документ» и выдаёт числовую оценку релевантности.
sbert.net/docs/cross_encoder/usage/usage.html
«Attention Is All You Need» — статья Васвани и соавторов 2017 года, в которой была представлена архитектура трансформера.
arxiv.org/html/1706.03762v7
Интерактивная трёхмерная визуализация устройства большой языковой модели: показывает, как токены проходят через слои трансформера во время генерации ответа.
bbycroft.net/llm
«World Models» — статья Дэвида Ха и Юргена Шмидхубера 2018 года о том, как модель может строить внутреннее представление мира для планирования и принятия решений.
arxiv.org/pdf/1803.10122
#уроки
———
@tsingular