Data Science: Алгоритмы и Структуры данных
Open in Telegram
Мы не претендуем на оригинальность контента, мы лишь собираем материал из открытых источников. Ссылка: @Portal_v_IT Сотрудничество, авторские права: @oleginc, @tatiana_inc Канал на бирже: https://telega.in/c/structuredata
Show more7 723
Subscribers
-224 hours
-117 days
-1530 days
Posts Archive
Jira — тьюринг-полная
В фольклоре разработчиков встречаются утверждения о том, что Jira (система управления проектами, разработанная Atlassian) полна по Тьюрингу. Однако в таких заявлениях нет конкретики, лишь смутные упоминания фич автоматизации. В этой статье будет приведено доказательство с инструкциями по реализации и трассировкой исполнения.
https://habr.com/ru/articles/1039102/
Алгоритмы и Структуры данных
Шахматные программы V. Оценочная функция
В этой части мы рассмотрим вторую важную составляющую шахматных программ - оценочную функцию. Долгие годы она находилась в роли "пасынка" для процесса разработки. Но на то существовали объективные причины.
https://habr.com/ru/articles/1038608/
Алгоритмы и Структуры данных
Практический ИИ-агент Python: LangGraph + Qdrant
При разработке ИИ-агента для базы знаний, мне казалось, что задача почти типовая: складываем информацию в Qdrant, находим информацию через векторный поиск и поиск в интернете и формируем красивый ответ через LLM. На деле ИИ-агент начал уверенно галлюцинировать, приносить не только нерелевантные ответы, но и тупить с короткими пользовательскими запросами. И самое неприятное, при всем при этом метрика «похожести» similarity выглядела достаточно высокой, что сильно вводило в заблуждение.
После серии экспериментов и улучшений пришло понимание, что промышленный ИИ-агент — это не столько про LLM, сколько про качество извлечения информации и гибкую оркестрацию компонентов ИИ-агента. Что в итоге полностью поменяло архитектуру моей системы.
В статье расскажу, как я пришла от «просто добавь LLM» к промышленному графовому ИИ-агенту на LangGraph + Qdrant.
https://habr.com/ru/articles/1038190/
Алгоритмы и Структуры данных
Нейросети уже заменяют целые контент-команды. Но пока этим пользуются не все.
Пока одни тратят недели на дизайнеров, копирайтеров и съемки — другие делают продающий контент через нейросети за пару часов. А бизнес платит за это десятки тысяч, даже без опыта.
Сегодня с ИИ за вечер можно сделать:
— стильные рекламные визуалы
— продающие тексты
— персонажей и маскотов
— контент для соцсетей и карточек товаров
Освоить базовый навык можно за 3 для без сложных программ. На бесплатном мини-курсе вам покажут, как работать с ИИ так, чтобы получать качественный контент, который можно использовать для себя или продавать клиентам.
👉 Пока многие только смотрят ИИ-контент — вы можете начать его создавать. Переходите по ссылке и забирайте бесплатный доступ.
Реклама. Информация о рекламодателе по ссылкам в посте.
Как LLM научила рекомендательную модель видеть больше, чем историю взаимодействий
Привет, Хабр! Меня зовут Алексей Васильев, я тимлид команды «Рекомендательные системы и персонализация» Sber AI Lab — Центра практического искусственного интеллекта Сбера. В нашей команде мы занимаемся исследованиями в области рекомендаций на последовательностях (sequential recommendations). Например, прослушивания музыки или просмотры карточек товаров можно представить как последовательность взаимодействий пользователя. А для моделирования последовательностей, как мы знаем, отлично подходят трансформеры: популярные варианты в рекомендациях — SASRec и BERT4Rec. Эти модели прекрасно справляются с задачей рекомендаций на основе взаимодействий, но они ничего не знают о самих товарах.
https://habr.com/ru/companies/sberbank/articles/1038108/
Алгоритмы и Структуры данных
«Продай мне этот космолёт» или история любви к симуляторам. От космосима X-Tension до ActorModel/DoD/ECS архитектуры. Ч3
Это третья и финальная часть истории. По исходному плану их должно было быть две, потом я честно обещал уложиться в три после второй, и вот мы здесь. Будем считать это уроком: при оценке объёма любого личного проекта смело умножайте свою оценку на полтора, как учит классика. Спасибо тем, кто дочитал до этого момента, и отдельное уважение тем, кто пришёл сюда с первой части без перерывов.
https://habr.com/ru/articles/1037524/
Алгоритмы и Структуры данных
От фич и каскадов к генеративной модели: как мы переосмыслили рекомендации с помощью ARGUS
Классические рекомендательные системы в крупных компаниях — это десятки микросервисов, каскадная фильтрация и тысячи ручных признаков. Такой стек может надёжно работать годами, но неизбежно упирается в фундаментальную проблему: он перестаёт масштабироваться. Качество выходит на плато — всё меньше отдачи от новых фич, усложнения моделей и наращивания данных.
Генеративная постановка, когда модель восстанавливает целые последовательности пользовательских действий, обещает принести в рекомендации законы масштабирования, снизить операционную сложность и открыть путь к единой кросс‑сервисной модели. Но между обещанием и продакшеном — огромная дистанция. Нужно понять, какая токенизация работает, как устроить претрейн, что делать с контекстом, негативами и задержками в реальных распределённых системах.
Последний год мы адаптировали нашу генеративную модель персонализации ARGUS под разные домены внутри Яндекса, меняли архитектуру, пересобирали обучение и пробовали новые способы интеграции в продакшене. В этой статье я расскажу, какие решения сработали, какие — нет и что нам дала генеративная постановка в реальных рекомендательных системах.
https://habr.com/ru/companies/yandex/articles/1037766/
Алгоритмы и Структуры данных
Шахматные программы IV. Термины и методы
В этой части мы коснемся некоторых наиболее ходовых понятий, которые часто используются в терминологии компьютерных шахмат и без которых затруднительно конструктивное обсуждение вопросов перебора. Также рассмотрим некоторые второстепенные методы направленного перебора, которые тем не менее глубоко интегрированы в структуру поиска. И в концовке обсудим общий порядок обхода всего дерева перебора целиком.
https://habr.com/ru/articles/1037564/
Алгоритмы и Структуры данных
Фолдинг белка на ноутбуке. De novo дизайн KRAS G12D (Switch II) ингибитора. Докинг, валидация в AlfaFold Server и PyMOL
Здравствуй, Хабр! Разработка ингибиторов мутантного онкобелка KRAS ( особенно формы G12D)- одна из главных задач современной онкофармакологии. Используя наш проприетарный матаппарат мы рассчитали несколько секвенсов под целевой карман мишени. Мы оперировали секвенсами от 7 до 21 остатка на мишенях длиной от 102 до 188 остатков, полученные при докинге результаты ipTM в AlfaFold Server варьировались от 0.58 до 0.92.
https://habr.com/ru/articles/1037570/
Алгоритмы и Структуры данных
ИИ больше не про хобби — он становится обязательным навыком, чтобы оставаться востребованным на рынке труда.
По оценкам экспертов, в ближайшее время до 80% вакансий будут требовать умения работать с нейросетями:
— генерировать визуал, видео, тексты для любых ниш;
— создавать реалистичный ИИ-контент;
— автоматизировать рутину.
Хорошие новости — освоить базовый минимум в создании контента с помощью ИИ можно всего за 3 дня. Вы сделаете ИИ своим рабочим инструментом и сократите рабочее время без потери качества.
Переходите по ссылке и получайте персональный доступ к урокам и бонусным материалам.
Реклама. Информация о рекламодателе по ссылкам в посте.
ИИ против консервации музыкальных вкусов: обновление рекомендаций Яндекс Музыки
Компания «Яндекс» обновила в Яндекс Музыке главное преимущество сервиса — рекомендательный алгоритм «Моя волна» (Vibe для пользователей англоязычного интерфейса) на основе нового поколения ИИ-рекомендаций — генеративной модели ARGUS (Yandex presents a method for training large transformer recommenders with up to 1B parameters). И в 2026 году переработала дизайн интерфейса приложения с фокусом на ставший ещё мощнее рекомендательный потенциал. Генеративная модель ARGUS анализирует более длинную историю действий пользователя, находит неочевидные связи между действиями и учитывает внешние факторы, создавая то, что в «Яндексе» назвали «гиперконтекст». Теперь Моя волна рекомендуют не только треки, но и музыкальные сессии под момент. Вместо прежних настроек «Моей волны» — карусель цветных «волн» (предполагаемых алгоритмами подходящих пользователю контекстов), а также кнопка их перезагрузки. Ручные настройки «Моей волны» переехали в эту же карусель.
https://habr.com/ru/articles/1036220/
Алгоритмы и Структуры данных
Миллиард оценок за 45 секунд: GPU-подход к Max-SAT там, где CPU-решатели не тянут
На рынке софта для оптимизации есть две крайности.
С одной стороны — академические и промышленные решатели, которые невероятно мощны, но часто требуют либо очень аккуратной постановки, либо серьёзной экспертизы, либо терпения. С другой — бесконечный поток «революционных» продуктов, которые обещают всё, а в реальности оказываются очередной метаэвристикой с красивым лендингом.
https://habr.com/ru/articles/1045440/
Алгоритмы и Структуры данных
Мой bloom фильтр побил оригинальный в 200 раз
Не люблю я хэш-таблицы. Какой бы областью я не занимался — они везде просто “достаточно хорошее” решение. Где нужны объёмы — масштабируется линейно. Где нужна точность — даёт вероятность (высокую, но вероятность всё-таки).
Задача
Есть класс задач, где удобно заранее узнать включение паттерна в потоке. Например,
AB есть в DDDABEEE. И узнавать надо часто. Наивный подход — линейный скан на каждый запрос. Медленно.
https://habr.com/ru/articles/1037072/
Алгоритмы и Структуры данныхМой универсальный код
Зачем на число
1 я в типах u8, u16, u32 и так далее переплачиваю 7, 15 и 31 бит? Это же бред.
Однозначность декодирования? Быстрая адресация? Сейчас распишу до чего я допёр.
Проблема
Если биты лежат в потоке, то не совсем понятно что они значат без предварительной договорённости. Например:
https://habr.com/ru/articles/1036946/
Алгоритмы и Структуры данныхПреобразование числа в строку методом умножения на 10
В этом тексте рассматривается метод преобразование двоичного числа в строку без использования операций деления и остатка.
Обычно для преобразования целого числа в строку используется метод последовательного деления данного числа на основание требуемой системы исчисления и сбор остатков, которые соответствуют цифрам в десятичной системе.
https://habr.com/ru/articles/1044764/
Алгоритмы и Структуры данных
Когда метрики сходят с ума: автоматическая детекция аномалий во временных рядах в Yandex Monium
В инфраструктуре Яндекса работают тысячи микросервисов, которые каждую секунду генерируют миллионы временных рядов — метрик. Это могут быть количества запросов, принятых микросервисом, текущая загрузка процессора на сервере и так далее. Все эти метрики хранятся и обрабатываются в общеяндексовой системе Monium. Эта система предназначена для хранения и обработки метрик и логов.
Для контроля за метриками в системе Monium существует механизм алертов — небольших микропрограмм, которые анализируют временные ряды и, если значения ряда выходят за разрешённые пороги, отправляют дежурным сообщения об инциденте. Проблема в том, что для многих рядов сложно заранее определить разрешённые пороги. А для некоторых рядов сделать это попросту невозможно, потому что нормальное поведение ряда сильно зависит от дня недели, времени суток, сезона и ещё десятка факторов, которые сложно учесть. В результате контролировать такие временные ряды было довольно нетривиальной задачей.
https://habr.com/ru/companies/yandex/articles/1035520/
Алгоритмы и Структуры данных
Тестирование случайности самодельного ГПСЧ и сравнение с эталонами
Самодельный генератор псевдослучайных чисел (ГПСЧ) стал побочным продуктом работы над любительским шифром, а шифры для меня всего лишь хобби и поле для творчества и экспериментов. Поскольку в своём шифре я делал упор на заранее непредсказуемые динамические связи, которые зависят от промежуточных состояний шифра, сама собой напросилась идея о применении этой непредсказуемости для генерации псевдослучайных чисел. Нужно было лишь оценить степень случайности полученного генератора. Как выполнялась оценка, что показали тесты NIST и сравнение с известными «эталонами» — далее в статье.
https://habr.com/ru/articles/1036522/
Алгоритмы и Структуры данных
Гири, штрихкоды, роботы и AI: проверьте свои знания эволюции ретейла
Когда-то ретейл держался на продавцах, а вершиной технологий в магазине был кассовый аппарат. Сегодня всё изменилось: покупатели сами берут товар с полок, умные системы на весах распознают покупки. А если посмотреть на происходящее с точки зрения сети магазинов, то там давно уже технологии будущего: системы прогноза спроса, подбора цены и составление портрета покупателя по содержимому корзины.
В этом тесте вы прикоснётесь к разным эпохам ретейла. Вас ждут и торговые изобретения прошлого — от необычных до ставших привычными, и современные технологии Lenta Tech. Готовы проверить свою интуицию и пройти путь от сегодняшнего техстека торговой сети до первых касс? Тогда заглянем под капот магазина.
https://habr.com/ru/specials/1034800/
Алгоритмы и Структуры данных
Черную дыру фотографировали восемь телескопов. Фото собрал алгоритм
10 апреля 2019 года человечеству показали оранжевый бублик. Журналисты назвали его «первой фотографией черной дыры». Через час картинка была у всех — мемы про глаз Саурона, шутки про пончик, антропоморфизация, заголовки «ученые сфотографировали невидимое».
Проблема в том, что это не совсем фотография.Точнее сказать, это очень странная фотография: если бы вы использовали телескоп горизонта событий (англ. EHT — далее по тексту) «как камеру» и нажали кнопку, вы бы получили черный квадрат и никакого бублика. Потому что он делает измерения, из которых алгоритм уже собирает изображение… которого нет.
Вот про этот алгоритм и про то, как 3,5 петабайта данных летели в Бостон самолетом, и пойдет речь.
https://habr.com/ru/companies/selectel/articles/1033186/
Алгоритмы и Структуры данных
Шахматные программы III. Дерево перебора
В третьей части мы взглянем на дерево перебора в общем контексте поиска. Увидим, каким образом методы отсечений из предыдущей части влияют на дерево в целом или на значительные его части, а также для полноты картины оценим влияние этих методов в историческом контексте. Эту и следующую части можно пропустить, если общего описания основных методов ограничения перебора ранее кажется достаточным.
https://habr.com/ru/articles/1036214/
Алгоритмы и Структуры данных
