en
Feedback
Machine learning Interview

Machine learning Interview

Open in Telegram

ИИ, Rust, вайбкодинг, Data Science, Deep Learning и делюсь тем, что интересно и полезно! Вопросы - @workakkk РКН: clck.ru/3FmwRz

Show more

📈 Analytical overview of Telegram channel Machine learning Interview

Channel Machine learning Interview (@machinelearning_interview) in the Russian language segment is an active participant. Currently, the community unites 30 268 subscribers, ranking 4 300 in the Technologies & Applications category and 21 337 in the Russia region.

📊 Audience metrics and dynamics

Since its creation on невідомо, the project has demonstrated rapid growth, gathering an audience of 30 268 subscribers.

According to the latest data from 03 September, 2026, the channel demonstrates stable activity. Although there has been a change in the number of participants by 130 over the last 30 days and by 20 over the last 24 hours, overall reach remains high.

  • Verification status: Not verified
  • Engagement rate (ER): The average audience engagement rate is 12.41%. Within the first 24 hours after publication, content typically collects 7.38% reactions from the total number of subscribers.
  • Post reach: On average, each post receives 3 755 views. Within the first day, a publication typically gains 2 234 views.
  • Reactions and interaction: The audience actively supports content: the average number of reactions per post is 31.
  • Thematic interests: Content is focused on key topics such as claude, llm, контекст, hermes, nvidia.

📝 Description and content policy

The author describes the resource as a platform for expressing subjective opinions:
ИИ, Rust, вайбкодинг, Data Science, Deep Learning и делюсь тем, что интересно и полезно! Вопросы - @workakkk РКН: clck.ru/3FmwRz

Thanks to the high frequency of updates (latest data received on 04 September, 2026), the channel maintains relevance and a high level of publication reach. Analytics show that the audience actively interacts with content, making it an important point of influence in the Technologies & Applications category.

30 268
Subscribers
+2024 hours
+697 days
+13030 days
Posts Archive
Как обучить нейросеть с помощью Python? Расскажет дата-сайентист из Альфа-банка Мария Жарова на бесплатном онлайн-практикуме
Как обучить нейросеть с помощью Python? Расскажет дата-сайентист из Альфа-банка Мария Жарова на бесплатном онлайн-практикуме 13-14 сентября в 17:00 мск. За 2 дня вы: — узнаете как создать, а затем обучить нейросеть распознавать цифры по фотографии; — выполните практическое задание и получите обратную связь; — узнаете зарплатные ожидания и карьерные возможности в дата сайенс. За лучшее выполнение задания вас ждет подарок — доступ к тренажеру Power BI. Записывайтесь на бесплатный практикум: https://go.skillfactory.ru/&erid=2VtzqvcVkNL Реклама ООО "Скилфэктори", ИНН: 9702009530

🎯Подробный разбор механизма Self-attention больших языковых моделей В этой статье пошагово с прмиерами кода разобрана работа
🎯Подробный разбор механизма Self-attention больших языковых моделей В этой статье пошагово с прмиерами кода разобрана работа Self-attention механизма. Self-attention это механизм предназначенный для обработки последовательных данных с учётом контекста каждой метки времени. 📌Статья @machinelearning_interview

🔍 Выявление неявных связей при анализе графов или как увидеть незримое Неявные связи в графах. Что это и как с ними работать, разберу на примерах. Граф — множество узлов, объединенных множеством ребер. С узлами все понятно, взяли города России, клиентов банка или компьютеры в сети, и получили множество объектов, которые и будут узлами для графа. Что же с ребрами? На первый взгляд все просто: города соединены дорогами, клиенты совершают переводы денежных средств, а компьютеры постоянно обмениваются информацией. Все, что было перечислено, относится к явным типам связей. Существует факт взаимосвязи между объектами: если дороги нет, то ребро между узлами отсутствует. Что же относится к неявным связям? Неявные связи сложнее, они могут зависеть от явных связей или же быть самостоятельными. Например, возьмем двух людей, которые работают на абсолютно разных работах, живут в разных концах города. На первый взгляд, они не имеют ничего общего, но при этом они оба по выходным приходят на матч любимой команды – это и есть неявная связь. Теперь перейдем к практическому примеру. Есть 2 файла: ◾️Данные о мошенниках, их номерах телефонов, а также периоды их активности; ◾️Данные о клиентах и номерах телефонов с периодами активности. ◾️Данные с номерами телефонов сложно найти в открытом доступе, придется сгенерировать их самостоятельно. Код для генерации необходимых данных расположен по ссылке. Следующим этапом будет создание графа. Для этой задачи понадобятся следующие python-библиотеки: ▪️Pandas – для работы с файлами; ▪️NetworkX – для создания графа связей, его визуализации; ▪️Matplotlib и Numpy – нужны для настройки визуализации графа; ▪️Datetime – для операций над временными данными. Перед созданием графа взглянем на данные, с которыми нам предстоит работать. Описание данных: 📍index – id клиента / мошенника; 📍numbers – номер телефона; 📍Date_start – начало периода активности; 📍Date_end – окончание периода активности. ➡️ Продолжение

⭐️ «Каждому из нас пора вспомнить, что он еще и предприниматель, стоящий у руля как минимум одного растущего стартапа: своей
⭐️ «Каждому из нас пора вспомнить, что он еще и предприниматель, стоящий у руля как минимум одного растущего стартапа: своей собственной карьеры». Рид Хоффман, основатель LinkedIn Неожиданно, но Московский физико-технический институт (МФТИ) устойчиво возглавляет рейтинг предпринимательских университетов и бизнес-школ России Будучи элементом предпринимательской экосистемы, Онлайн-магистратура МФТИ «Технологическое Предпринимательство» (ТехПред) является образовательным пространством, объединяющим экспертов в технологиях и бизнесе для реализации проектов Мы разные: + Возраст студентов: от 20 до 50+ лет + Геолокация: от Тайбэя до Лондона + Отрасли проектов: от ИТ до биомедицины, от нанотехнологий до космоса Но нас объединяет: + Стремление к выходу на новый профессиональный и социальный уровень Помимо возможностей для обучения и саморазвития в сообществе ТехПреда можно найти подходящих партнеров и сотрудников для совместных проектов Стоит отметить, что онлайн-магистратура является очной, просто реализуется с применением дистанционных образовательных технологий. При успешном окончании выдается диплом МФТИ государственного образца Будет ли конкретно в вашей ситуации польза от обучения в МФТИ? Можно обсудить с преподавателями, а заодно получить контакты студентов и выпускников, которые поступали в похожих ситуациях Подробную информацию можно узнать на сайте: https://techpredonline.ru

Выберите правильный вариант
Anonymous voting

Что выведет код?
import numpy as np
Polynomial = np.polynomial.Polynomial
p = Polynomial([1, -1, 1])
q = Polynomial([2, -3])
print(int((p + q)(1)))

👉 Как с помощью методов ML можно очищать данные от выбросов? ЖДЕМ ВАС на 6 сентября в 20:00 мск на открытом уроке «Ищем выбр
👉 Как с помощью методов ML можно очищать данные от выбросов? ЖДЕМ ВАС на 6 сентября в 20:00 мск на открытом уроке «Ищем выбросы методами ML» в рамках курса «Machine Learning. Professional» от OTUS 🔹 Поговорим про задачу поиска аномалий и изучим, как с помощью методов ML можно очищать данные от выбросов 🔹 В теории разберем несколько алгоритмов и применим их на практике. 📌 Результаты урока: Вы освоите несколько методов поиска аномалий и на практике очистите данные от аномальных значений. 👉 РЕГИСТРАЦИЯ https://otus.pw/wnlx/ Нативная интеграция. Информация о продукте www.otus.ru

🖥 Как бы вы реализовали функцию потерь в PyTorch? В PyTorch функции потерь могут быть реализованы путем создания подкласса класса nn.Module и переопределения метода forward. Метод forward принимает на вход прогнозируемый выход и фактический выход и возвращает значение потерь. Приведем пример кода: import torch import torch.nn as nn class CustomLoss(nn.Module): def __init__(self): super(MyLoss, self).__init__() def forward(self, output, target): loss = ... # compute the loss return loss Теперь, чтобы использовать функцию потерь, необходимо инициализировать ее и передать в качестве аргумента параметру criterion оптимизатора в цикле обучения. model = ... optimizer = ... criterion = CustomLoss() # цикл обучения for epoch in range(num_epochs): optimizer.zero_grad() outputs = model(data) loss = criterion(outputs, labels) loss.backward() optimizer.step() ... #pytorch #junior @machinelearning_interview

☄️Открытый урок по языковым моделям от OTUS 4 сентября в 18:00 мск встречаемся на открытом уроке «Языковые модели: от статист
☄️Открытый урок по языковым моделям от OTUS 4 сентября в 18:00 мск встречаемся на открытом уроке «Языковые модели: от статистических до ChatGPT» в рамках курса «Natural Language Processing (NLP)» от OTUS. 📣 Кому подходит этот урок: - Практикующим Data Scientist и IT-специалистам, которые хотят глубже погрузиться в область NLP - Тем, кто хочет узнать, что делает ChatGPT таким умным - Людям, освоившим основы машинного обучения, но желающими развиваться в области DS 💪 Результаты урока: Вы узнаете, что такое языковые модели и как их использовать для решения NLP-задач, а также изучите подходы к обучению больших языковых моделей, таких как ChatGPT. Это отличная возможность совершенно бесплатно протестировать формат обучения и задать преподавателю любые вопросы в режиме реального времени 😎! Пройдите тестирование курса, чтобы зарегистрироваться на урок - https://otus.pw/dvKE/ Нативная интеграция. Информация о продукте www.otus.ru

📌Отличие рекуррентных нейронные сети от других методов машинного обучения? Назовите способы улучшения стандартных рекуррентных сетей? Рекуррентные нейронные сети (RNN) отличаются от других методов машинного обучения тем, что они способны обрабатывать серии событий во времени или последовательные логические цепочки. Рекуррентные нейронные сети могут использовать свою внутреннюю память для обработки последовательностей разной длины. RNN применимы в таких задачах как, например: распознавание рукописного текста, анализ текстов, распознавание речи и др. Кроме того, известно, что RNN являются полными по Тьюрингу, и поэтому имеют возможность имитировать произвольные программные процедуры. Но на практике это не всегда просто сделать. Рекуррентные нейронные сети хорошо справляются с задачами обучения на последовательностных данных и с задачами обучения с подкреплением, но очень ограничены в возможностях для решения задач, связанных с работой со структурами данных и переменными, а также хранением данных в течение длинных временных промежутков из-за отсутствия долгосрочной памяти. Одним из способов улучшения стандартных рекуррентных сетей для успешного решения алгоритмических задач является введение адресной памяти большого размера. В отличие от машины Тьюринга, нейронная машина Тьюринга (NTM) является полностью дифференцируемой моделью, которая может быть обучена модификациями метода градиентного спуска (например, RMSProp), что дает практический механизм для обучения программ на примерах. Модель NTM была предложена в 2014-ом году в работе. В этой работе не описаны подробно детали функционирования данной нейросетевой модели. Одной из задач выпускной квалификационной работы является предоставление детального описания работы нейронной машины Тьюринга. Основным фактором появления нейронных сетей с внешней памятью является изобретение дифференцируемых механизмов внимания. В 2016-ом году в работе была предложена усовершенствованная модель нейронной сети с внешней памятью под названием дифференцируемый нейронный компьютер. В ней также было лишь краткое описание принципов работы этой модели. В 2018-ом году в работе были предложены четыре модификации для дифференцируемого нейронного компьютера, которые позволяли улучшить качество решения задач, связанных с вопросно-ответными системами (QA tasks). Эти модификации были основаны на работах. На сегодняшний день очень высока актуальность создания новых рекуррентных нейросетевых моделей, способных хранить большие объёмы данных, а также успешно решать задачи, предъявляемые к вопросно-ответным системам (QA-задачи). К таким нейросетевым моделям предъявляются следующие требования: ▪наличие «долгосрочной» обучаемой памяти; ▪высокая скорость обучения; ▪устойчивость процесса обучения (процесс обучения не должен существенно зависеть от начальной инициализации); ▪прозрачность принятия решений моделью и интерпретируемость работы нейронной сети (попытка уйти от концепции «черного ящика»); способность решать QA-задачи; ▪модель должна содержать относительно небольшое количество обучаемых параметров; способность работать с переменными, а также со структурами данных (например, с графами), решать алгоритмические задачи. @machinelearning_interview

Как узнать больше об LLM? Large Language Models в последнее время стали слишком популярны, и многие строят свои ML-решения поверх таких LLM. Но не все знают, что злоумышленники могут делать инъекции через промты и нарушить работу модели или вообще сломать систему. Поэтому VK устраивает онлайн-семинар, где расскажет, какие могут быть опасности и как защитить решения, основанные на LLM. Регистрация по ссылке.

🚀Расскажите про архитектуры внедрения ML-пайплайна в real-time сервисы Подробнее остановимся на особенностях внедрения моделей в случае real-time предсказаний. 1. Монолит Кодовая база ML интегрирована в кодовую базу бэкэнда. Это требует тесного сотрудничества между ML-специалистами и владельцами кодовой базы бэкэнда. Процесс CI/CD замедляется из-за юнит-тестов сервиса машинного обучения, а размер модели и требования к вычислениям создают дополнительную нагрузку на серверы бэкэнда. Такой тип развертывания следует рассматривать только в том случае, если инференс модели очень легкий для запуска. 2. ML как один сервис Модель машинного обучения разворачивается на отдельном сервере, возможно, с использованием балансирования нагрузки в случае необходимости масштабирования. Этот подход позволяет ML-инженерам деплоить модель независимо от команд, ответственных за бизнес-сервис. Создание систем мониторинга и логирования будет намного проще. Структура кодовой базы будет более понятной. Модель может быть сложной, не нагружая остальную инфраструктуру. Обычно это самый простой способ развернуть модель с обеспечением масштабируемости, поддерживаемости и надежности. 3. Микросервисный подход Каждая часть пайплайна получает свой собственный сервис. Этот подход требует высокий уровень зрелости в области ML и MLOps. Такой подход может быть полезен, например, если компонент обработки данных используется несколькими моделями. Например, у нас может быть несколько моделей, которые ранжируют рекламу в разных поддоменах (реклама на Facebook, реклама в Instagram и т. д.). При этом они должны следовать одному и тому же процессу аукциона. Тогда эта часть пайплайна может быть обработна отдельным сервисом, отвечающим за аукцион. Важно использовать сервис для оркестрации, например, Kubernetes, для обработки возникающей сложности микросервисов. “Dependency Hell in Microservices and How to Avoid It“ @machinelearning_interview

Классная возможность для студентов-технарей продлить лето — Тинькофф приглашает на смену по машинному обучению в университете
Классная возможность для студентов-технарей продлить лето — Тинькофф приглашает на смену по машинному обучению в университете «Сириус». Всех, кто пройдет отбор (а набирают 20 человек), отвезут в Сочи из их города. Программа разделена на две части. С середины сентября участники прослушают онлайн-курс по ML. А очная смена пройдет в Сочи с 2 по 15 октября. В лучших традициях образовательных программ Тинькофф ребята будут учиться на прикладных задачах, о которых потом не стыдно будет рассказать в портфолио. Как попасть: отправить заявку и решить отборочные можно до 31 августа. С 1 сентября начнутся собеседования для тех, кто хорошо решит контест. Все подробности тут

📌 Расскажите про альтернативы ансамблированию при файнтюнинге моделей? Понятие «model soup»‎ было предложено в папере 2022 года «Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time», написанном в соавторстве Google Research, Meta AI Research и несколькими университетами. Для начала вспомним, как выглядит стандартный процесс обучения модели: мы обучаем модель с различными вариациями гиперпараметров, а затем выбираем лучшую из них, измерив качество на evaluation set. После этого все модели, кроме наилучшей, отправляются в корзину. Авторы статьи предлагают отказаться от такого расточительства и найти применение оставшимся моделям. Это можно сделать с помощью ансамблирования, например, бэггинга: усреднять logits всех моделей. Однако в таком случае время инференса ансамбля увеличивается пропорционально количеству вошедших в него моделей. Идея model soup заключается в том, чтобы усреднять не logits, а непосредственно веса моделей. В этом случае на инференсе мы запускаем лишь одну модель, и время не увеличивается. Сравнение с ансамблями Авторы приводят результаты тестирования бэггинга и различных рецептов «супов» при файнтюнинге модели CLIP ViT-B/32 на ImageNet. Accuracy оценивается как на тестовой выборке самого ImageNet, так и на distribution shift датасетах — ImageNet-V2, ImageNet-R, ImageNet-Sketch, ObjectNet, ImageNet-A. Функции потерь нейронных сетей не являются выпуклыми, и при их минимизации решение может сходиться к разным локальным минимумам. Так почему же усреднение весов в случае файнтюнинга приводит к адекватному решению? Ответ кроется в папере Google 2020 года «What is being transferred in transfer learning?». Его авторы приходят к выводу, что при файнтюнинге предобученных моделей решения всех моделей остаются в окрестности одного и того же локального минимума (авторы называют её «basin» — «впадина»). В то же время модели, обученные с нуля, даже если они инициализированы одинаково, таким свойством не обладают. Вдохновившись этим открытием, авторы model soup исследуют форму поверхности loss-функции и приходят к выводу, что среднее нескольких решений может лежать ближе к минимуму loss-функции, чем каждое из решений по отдельности. Среднее двух решений, полученных с помощью файнтюнинга, может находиться ближе к минимуму функции. Также можно заметить, что угол между решениями (обозначенный серыми стрелками на изображении выше) может влиять на точность среднего. Авторы предоставляют отдельное исследование данной зависимости и приходят к выводу, что чем ближе этот угол к 90°, тем больший выигрыш мы получаем при усреднении решений: В свою очередь на угол между решениями влияет то, какой гиперпараметр мы изменяем. На изображении выше видно, как влияет изменение random seed, learning rate и аугментаций. Подробнее. @machinelearning_interview

Освойте алгоритмы распознавания и генерации звука за 1,5 месяца 5 сентября стартует практический курс Нетологии — «Распознава
Освойте алгоритмы распознавания и генерации звука за 1,5 месяца 5 сентября стартует практический курс Нетологии — «Распознавание и генерация речи. Диалоговые системы» для тех, кто работает или хочет научиться работать с задачами по распознаванию и генерации звуков. Для обучения нужно знать классические методы машинного обучения, основы работы с нейросетями, NLP. Курс поможет разобраться в работе со звуком, обработке звуковых сигналов, транскрибации речи в текст. В программе 5 воркшопов, на котором вы реализуете 5 кейсов, один из которых — проект на основе ваших собственных данных. По нему вы получите личную консультацию эксперта из Сбера или JustAI. Курс ведут практикующие специалисты по ИИ и работе со звуком: • Илья Шигабеев, основатель сервиса по переозвучке видео Langswap.app • Артур Сапрыкин, NLP-разработчик, предприниматель, работал над созданием голосового робота, разрабатывал поиск аудио по фрагменту • Сергей Меньшов, ведущий специалист Nexgn.com, разработчик проектов Whisper и VOSK по распознаванию речи собеседника Изучить программу курса можно на сайте программы. Старт 5 сентября → https://netolo.gy/b3j8 Реклама. ООО «Нетология» LatgBsPqT

🚀 Расскажите про метод увеличения производительности обучения больших языковых моделей ReLoRA ? ReLoRA — это метод обучения больших языковых моделей-трансформеров с использованием матриц низкого ранга, который увеличивает производительность обучения. Эффективность метода возрастает с увеличением масштабов моделей. На модели с 1,3 миллиардами параметров использование памяти уменьшилось на 30%, а производительности обучения увеличилось на 52% по сравнению с обучением с полным рангом. Код доступен в открытом доступе на Github. Основная идея, лежащая в основе ReLoRA, заключается в разложении обновлений весов во время обучения на матрицы низкого ранга путем добавления новых обучаемых параметров к исходным весам модели. ReLoRA превзошла базовые методы обучения с низким рангом, такие как LoRA, на всех размерах моделей. ReLoRA использует несколько дополнительных техник во время обучения, чтобы увеличить эффективный ранг обновлений модели: Перезапуски обучения: После обучения матриц низкого ранга в течение нескольких шагов, ReLoRA объединяет низкоранговые факторы обратно с исходными весами модели. Это позволяет последующим низкоранговым факторам захватывать различные компоненты обновления весов. Сбросы оптимизатора: При повторном запуске обучения ReLoRA сбрасывает часть состояний оптимизатора Adam. Это предотвращает смещение новых низкоранговых факторов в сторону предыдущего пространства решений. Ступенчатое нарастание скорости обучения: При каждом перезапуске скорость обучения сбрасывается до нуля и плавно нарастает. Это стабилизирует процесс интеграции новых низкоранговых факторов в модель. Ключевая идея заключается в том, что каждый этап обучения низкого ранга будет ограничен низкомерным подпространством. Путем проведения нескольких перезапусков общее обновление модели на протяжении нескольких циклов может иметь более высокий ранг, чем любое отдельное обновление. Это позволяет ReLoRA выполнять обновления высокого ранга, одновременно обучая лишь небольшое количество параметров. Авторы оценили эффективность ReLoRA, предварительно обучив языковые модели трансформеров с до 350 миллионами параметров на датасете C4. Результаты показали, что ReLoRA достигла сравнимой перплексии с обычным полноранговым обучением трансформеров, и её эффективность улучшается с увеличением размера модели. Например, для модели с 350 миллионами параметров ReLoRA уменьшила количество обучаемых параметров на более чем 70%, сохраняя при этом конкурентоспособную перплексию: 22,48 против 20,40 соответсвенно. Эффективность метода существенно возрастает с увеличением размера модели. На модели с 350 миллионами параметров ReLoRA требовала всего 99 миллионов обучаемых параметров, что уменьшило количество обучаемых параметров на 70%. Анализ сингулярных значений обновлений весов показал, что ReLoRA качественно лучше аппроксимирует обновления с более высоким рангом при обучении с полным рангом, чем стандартные методы обучения с низким рангом, такие как LoRA. Это указывает на то, что ReLoRA способна выполнять обновления модели высокого ранга с помощью обучения с низким рангом. Разрыв в производительности между ReLoRA и обучением с полным рангом уменьшился с увеличением размеров моделей. Например, на модели с 60 миллионами параметров разрыв составлял более 5 пунктов перплексии, в то время как на модели с 350 миллионами параметров он уменьшился до менее чем 2 пунктов перплексии. Улучшения использования памяти и вычислительной эффективности существенно возрасли при оценке на модели с 1,3 миллиарда параметров. Оценки показали уменьшение использования памяти на 30% и повышение производительности обучения на 52% по сравнению с обучением с полным рангом. @machinelearning_interview

💻 Хочешь работать с масштабными цифровыми продуктами? Учись обрабатывать большие данные MLOps — все более популярный среди к
💻 Хочешь работать с масштабными цифровыми продуктами? Учись обрабатывать большие данные MLOps — все более популярный среди компаний способ повышения производительности и создания надежных моделей корпоративного уровня. ✅ Владение инструментами MLOps открывает новые карьерные горизонты специалистам ML, Data Scientist’ам и Software инженерам. 💪 Ответьте на 10 вопросов и проверьте, насколько вы готовы к обучению на продвинутом курсе «MLOps» от OTUS. Успей присоединиться к группе, курс стартует 31 августа! ✍️ ПРОЙТИ ТЕСТ: https://otus.pw/QFDU/ Нативная интеграция. Информация о продукте www.otus.ru

🖥 Как происходит обучение с нуля на собственных данных (LLM). Какую архитектуру выбрать для pre-training обучения? Такое обучение, которое ещё называется pre-training, решает задачу моделирования языка или, говоря проще, позволяет нашей модели выучить (насколько это возможно) язык, с которым она работает. Для этого обучение проходит в парадигме Masked Language Modeling, MLM (проходим по тексту, маскируем по очереди каждый токен и пытаемся по окружающим его токенам – контексту предсказать этот токен) и Next Sentence Prediction, NSP (предсказание по паре текстовых фрагментов, следуют они друг за другом или нет). Есть ещё также Casual Language Modeling, но MLM обычно используется чаще. На практике прибегнуть к процедуре pre-training может быть полезно, когда тексты, с которыми нужно работать, отличны от тех, на которых обучались общедоступные известные модели. Это может происходить в следующих случаях: специфичный стиль текста, его структура (яркий пример – юридические тексты, договора, сметы), наличие специфичных терминов (пример – медицинские тексты). На что стоит обратить внимание перед процедурой pre-training: данные, с которыми вы работаете, может быть недостаточно для эффективного обучения модели, поэтому даже обладая хорошим потенциалом, они могут не обучиться и показывать такое же либо даже худшее качество по сравнению с бейзлайном; хорошие эмбеддинги – это лишь один из этапов во всём пайплайне и вовсе не единственная точка роста. Поэтому если вы стоите перед выбором, стоит ли тратить ресурсы на pre-training, аренду видеокарт и т.д., возможно, стоит сначала сделать упор на другие вещи, например, на более качественный сбор/обработку/обогащение данных. Если решили идти по этому пути, то рабочим вариантом может быть следующий: взять веса общедоступной модели, обученной на таких текстах, как Википедия, затем обучить её на собственных текстах в парадигме MLM, дав возможность изучить тонкости именно ваших текстов. А затем снова дообучить в парадигме fine-tuning для решения целевой задачи. Можно взять классический Bert. Но c другой стороны, с его создания уже утекло много воды и появились более продвинутые архитектуры. Особенно заслуживают внимания следующие архитектуры. RoBERTa (A Robustly Optimized BERT Pre-training Approach) – это архитектура, основанная на BERT, но в которой оптимизировали параметры обучения, отказались от обучения в парадигме NSP и показали, что так качество будет выше. DeBERTa (Decoding-enhanced BERT with disentangled attention) – дословно BERT улучшенного декодирования с рассеянным вниманием. Это основанная на RoBERTa архитектура, в которой авторы дополнительно применили механизм кодирования слова двумя векторами (кодирующими его содержание и положение в тексте) и заменили выходной softmax-слоя усовершенствованным декодером. Вот пример успешного применения этой архитектуры. ELECTRA – архитектура (оригинальная статья), в которой отказались от обучения в парадигмах MLM и NSP и тренируют генератор и дискриминатор. Первая модель учится выборочно заменять токены в тексте, а вторая (которую и будем использовать после обучения) учится определять токены, которые были заменены, и таким образом осваивает структуру языка. Архитектура модели и её преимущества довольно подробно расписаны в статье Более эффективное предварительное обучение NLP моделей с ELECTRA. @machinelearning_interview

Действующий дата-инженер или планируете им стать? Хотите повысить квалификацию и перейти на новый карьерный уровень? Тогда вы
Действующий дата-инженер или планируете им стать? Хотите повысить квалификацию и перейти на новый карьерный уровень? Тогда выбирайте курс «Дата-инженер» от Слёрма! Он нацелен на практику, разбор реальных случаев и выполнение практических задач! А знаете почему еще мы рекомендуем пройти курс «Дата-инженер» в Слёрме? ✔️ Учим не только сбору данных, но и тому, как правильно интерпретировать их. ✔️ Научитесь строить дата-пайплайны и выстраивать эффективную работу дата-архитектуры ✔️ Будете уверенно разбираться в ландшафте инструментов для управления данными ✔️ Опытные спикеры-практики проведут за руку на через весь курс ✔️ На выходе выполните реальный проект на собственных данных 🤑 Дешевле, чем у других Старт потока 4 сентября! Запишитесь уже сейчас по выгодной цене! 💬Все подробности по «Data-инженеру» вы можете узнать в нашем чат-боте. Здесь мы в подробностях расписали программу, рассказали о спикерах. Также в боте можно узнать об актуальных акциях и получить консультацию от менеджера курса: @slurm_data_engineer_bot

Однако некоторые типы данных защищены нормами права. В основном это касается личных данных — фамилий, паспортных данных, контактов, мест, предпочтений в шопинге, видеозаписей людей, политических мнений и так далее. Например, принятый в ЕС закон General Data Protection Regulation (GDPR) применим к любой информации, которую можно использовать для идентификации европейского гражданина. Кроме того, стоит помнить о том, что многие онлайн-сервисы запрещают скрейпинг. Airbnb не разрешает использовать «любых роботов, пауков, краулеров, скрейперов и других автоматизированных средств или процессов доступа или сбора данных и другого контента, а также любые иные способы взаимодействия с платформой Airbnb Platform для любых целей». Поэтому перед запуском веб-бота следует тщательно изучить правила пользования веб-сайтом. Также можно собирать данные при помощи веб-форм, современных чат-ботов и других инструментов, или автоматически собирать их с датчиков, IoT-устройств и систем терминалов оплаты. Но как бы то ни было, сбор данных и его методики не могут быть успешными без наличия места для хранения данных. @machinelearning_interview