Data Science: Алгоритмы и Структуры данных
前往频道在 Telegram
Мы не претендуем на оригинальность контента, мы лишь собираем материал из открытых источников. Ссылка: @Portal_v_IT Сотрудничество, авторские права: @oleginc, @tatiana_inc Канал на бирже: https://telega.in/c/structuredata
显示更多7 725
订阅者
-224 小时
-117 天
-1530 天
帖子存档
Repost from The Экономист
Сбер отмечает постепенное оживление спроса на кредиты на фоне снижения ключевой ставки. При этом банк сохраняет прогноз по росту корпоративного кредитования в 2026 году на уровне 10–12%, заявил на Финконгрессе Банка России первый зампред правления Сбера Александр Ведяхин. В мае корпоративный кредитный портфель банка сократился примерно на 300 млрд рублей, при этом около половины снижения пришлось на валютную переоценку.
🤑 The Экономист
Проблема 3x+1: Задача для школьника, которая сломала величайших математиков
Представьте себе математическую задачу, условия которой можно объяснить восьмилетнему ребенку ровно за тридцать секунд. А теперь представьте, что эта же самая задача десятилетиями заставляет сдаваться величайших математиков современности. Звучит как преувеличение, но это реальность гипотезы Коллатца, которую чаще называют проблемой «3x+1».
Эта задача оказалась настолько неприступной, что один из самых выдающихся умов XX века, математик Пауль Эрдёш, однажды прямо заявил: «Математика еще не созрела для таких задач». Желая хоть как-то сдвинуть дело с мертвой точки, он предложил 500 долларов из собственного кармана тому, кто сможет ее доказать или опровергнуть. Спойлер: эта премия до сих пор остается невостребованной.
На первый взгляд, это всего лишь безобидная игра с простейшим делением и умножением. Но на деле проблема 3x+1 доказывает поразительную вещь: за самыми элементарными арифметическими правилами может скрываться абсолютно непредсказуемый хаос и бесконечная сложность.
https://habr.com/ru/articles/1042976/
Алгоритмы и Структуры данных
Искусство создания дорог в играх
Не знаю, только ли мне это свойственно, но я испытываю какой-то первобытную радость, когда вижу сложные паттерны, возникающие из сред, кажущихся хаотичными.
Представьте галереи колоний муравьёв, невероятно идеальные шестиугольники пчелиных сот или прожилки листьев. Никаких архитекторов или чертежей, лишь набор простых правил, приводящий к созданию великолепных узоров. Не знаю почему, но наблюдение за такими структурами всегда вызывает положительные ощущения.
Люди тоже их создают. Для меня один из самых удивительных паттернов, которые мы придумали — это дороги.
Иногда я представляю инопланетян из далёких галактик, которые откроют Землю уже спустя много времени после нашего ухода. Леса, снова занятые природой, города, превратившиеся в развалины; однако между ними всё равно заметен слабый паттерн — сеть дорог. Мне нравится думать, что они будут чувствовать то же самое, что и я, когда смотрю на природные паттерны: «Ого, кто-то действительно это продумал».
Не знаю, только ли мне это свойственно, но я испытываю какой-то первобытную радость, когда вижу сложные паттерны, возникающие из сред, кажущихся хаотичными.
Представьте галереи колоний муравьёв, невероятно идеальные шестиугольники пчелиных сот или прожилки листьев. Никаких архитекторов или чертежей, лишь набор простых правил, приводящий к созданию великолепных узоров. Не знаю почему, но наблюдение за такими структурами всегда вызывает положительные ощущения.
Люди тоже их создают. Для меня один из самых удивительных паттернов, которые мы придумали — это дороги.
Иногда я представляю инопланетян из далёких галактик, которые откроют Землю уже спустя много времени после нашего ухода. Леса, снова занятые природой, города, превратившиеся в развалины; однако между ними всё равно заметен слабый паттерн — сеть дорог. Мне нравится думать, что они будут чувствовать то же самое, что и я, когда смотрю на природные паттерны: «Ого, кто-то действительно это продумал».
Не знаю, только ли мне это свойственно, но я испытываю какой-то первобытную радость, когда вижу сложные паттерны, возникающие из сред, кажущихся хаотичными.
Представьте галереи колоний муравьёв, невероятно идеальные шестиугольники пчелиных сот или прожилки листьев. Никаких архитекторов или чертежей, лишь набор простых правил, приводящий к созданию великолепных узоров. Не знаю почему, но наблюдение за такими структурами всегда вызывает положительные ощущения.
Люди тоже их создают. Для меня один из самых удивительных паттернов, которые мы придумали — это дороги.
Иногда я представляю инопланетян из далёких галактик, которые откроют Землю уже спустя много времени после нашего ухода. Леса, снова занятые природой, города, превратившиеся в развалины; однако между ними всё равно заметен слабый паттерн — сеть дорог. Мне нравится думать, что они будут чувствовать то же самое, что и я, когда смотрю на природные паттерны: «Ого, кто-то действительно это продумал».
Не знаю, только ли мне это свойственно, но я испытываю какой-то первобытную радость, когда вижу сложные паттерны, возникающие из сред, кажущихся хаотичными.
Представьте галереи колоний муравьёв, невероятно идеальные шестиугольники пчелиных сот или прожилки листьев. Никаких архитекторов или чертежей, лишь набор простых правил, приводящий к созданию великолепных узоров. Не знаю почему, но наблюдение за такими структурами всегда вызывает положительные ощущения.
Люди тоже их создают. Для меня один из самых удивительных паттернов, которые мы придумали — это дороги.
Иногда я представляю инопланетян из далёких галактик, которые откроют Землю уже спустя много времени после нашего ухода. Леса, снова занятые природой, города, превратившиеся в развалины; однако между ними всё равно заметен слабый паттерн — сеть дорог. Мне нравится думать, что они будут чувствовать то же самое, что и я, когда смотрю на природные паттерны: «Ого, кто-то действительно это продумал».
https://habr.com/ru/articles/1040826/
Алгоритмы и Структуры данных
Сидеть и работать в корпорации — страшно, жизнь-то мимо проходит. Уходить строить бизнес — страшно, а вдруг прогорит. Один из вариантов — разрабатывать свой пет-проект по вечерам. Многие успешные компании, например, Twitter, создавались именно так. Это не значит, что ваш проект обязательно заработает миллиарды, но заработать больше, чем в найме, и получить ценный опыт — вполне реально.
Перед началом разработки появляется множество вопросов, например:
– Как выбрать идею для пет-проекта?
– Что нужно знать про маркетинг?
– Как запуститься и довести до первых продаж не имея бюджета на рекламу?
В телеграм-канале «Твой пет проект», Михаил Табунов делится своим опытом с разработчиками и менеджерами.
Он рассказывает, где искать идею для нового проекта, что нужно знать о маркетинге, как запустить стартап и привлечь первых 10 клиентов, а также о многих других важных вещах.
Подписывайтесь на «Твой пет проект», получайте пользу от практиков рынка!
Реклама. ИП Табунов Михаил Валерьевич ИНН 773379585100. erid: 2Vtzqw5HMMB
Как мы четыре раза неправильно чинили мерцание при рендеринге 4,4 миллиона полигонов на wgpu
Уже год мы небольшой командой пишем на Rust + wgpu редактор топологий интегральных схем — что-то вроде KLayout, только с прицелом на российский рынок. Команда — три человека. Я в роли CTO направляю архитектуру и принимаю основные технические решения. История ниже — про одну такую серию решений, которую я завёл в тупик четыре раза подряд, прежде чем мы поняли, в чём была ошибка.
Тестовый дизайн у нас — Caravel SkyWater SKY130, открытый чип на ~4,4 миллиона полигонов, 1014 уникальных ячеек и 22 уровня иерархии. Полный GDS-файл — 278 МБ.
Первая попытка отрендерить это на экране показала: всё работает, всё на месте. Только мерцает. Не «иногда подёргивается» — а так, что смотреть невозможно. Любой zoom или pan превращал картинку в стробоскоп: половина чипа есть, половина пропала, через кадр — наоборот.
Дальше — история про то, как мы четыре раза по-разному пытались это починить, и как пятая попытка наконец заработала. Если у кого-то такой же случай — может, сэкономлю недели две.
https://habr.com/ru/articles/1042962/
Алгоритмы и Структуры данных
Ускоряем в 10+ раз вычисление расстояния Хаусдорфа на упорядоченных контурах
Как-то, при имплементации на C++ нового алгоритма поиска дефектов, возникла потребность оптимизации вычисления расстояния Хаусдорфа между контурами. Контуры представляли собой упорядоченные точки, полученные из бинарной картинки. Необходимо было выделить кластеры похожих контуров с минимальным расстоянием Хаусдорфа.
Прежде чем перейти к разработанной мной оптимизации, вспомним, что представляет собой алгоритм вычисления расстояния Хаусдорфа и его известные оптимизации.
https://habr.com/ru/articles/1042704/
Алгоритмы и Структуры данных
Юридические коллизии внутренних регламентов IRecommend и федерального законодательства об авторском праве
Уже при самом беглом прочтении этого локального акта (Правилам пользования сайтом IRecommend) я заметил весьма примечательную особенность — скрытые внутренние противоречия документов платформы, а также их несоответствие федеральному законодательству, в частности, Гражданскому кодексу РФ (далее — ГК РФ) и Закону «О защите прав потребителей» (далее — ЗоЗПП). Более углублённый анализ локальных актов IRecommend.ru показал, что поскольку площадка стремится максимально защитить свои интересы, то её внутренние регламенты содержат несколько жёстких юридических коллизий, которые регулярно становятся предметов споров между авторами контента и администрацией ресурса.
https://habr.com/ru/articles/1042698/
Алгоритмы и Структуры данных
Автоматический отбор few_shot примеров для обучения модели
Нормализация справочников НСИ - головная боль аналитиков: в базе десятки тысяч записей, и каждая будто создана по своим правилам. И это еще не все трудности: в базе полно дублей, форматы данных пляшут, в полях то лишние символы, то транслитерация, то опечатки от ручного ввода. Мы не раз сталкивались с этим в своих проектах.
Решений хватает, но мы остановили выбор на LLM. Модель хорошо справляется с разбором неструктурированных строк на атрибуты, если правильно её настроить. Однако на практике мы столкнулись с тем, что успех LLM-нормализации на 90% определяется качеством few-shot примеров. Чем набор примеров репрезентативнее, тем стабильнее результат. Но как найти те самые, хорошие примеры в огромной массе разнородных записей? Вручную, особенно не имея достаточной экспертизы, проводить глубокий анализ трудоемко и неэффективно. Поэтому мы решили пойти другим путём - автоматизировать подбор.
В этой статье мы разберем два подхода к автоматизации процесса подбора примеров для обучения, проверим их на реальных данных и выясним, какой из них и в каких условиях работает лучше. Посмотрим, что нам покажут «автоматические эксперты».
https://habr.com/ru/articles/1042468/
Алгоритмы и Структуры данных
Эволюция 'More Like This'
Во многих поисковых сценариях пользователь начинает не с пустой строки запроса, а с существующего результата.
Пользователь открывает статью и хочет найти похожие материалы. Покупатель просматривает карточку товара и ищет близкие варианты. Инженер поддержки разбирает инцидент и хочет увидеть прошлые случаи с теми же симптомами. Во всех этих ситуациях у пользователя уже есть релевантный документ для начала поиска.
Этот сценарий традиционно называют More Like This (MLT): функцией поиска документов, похожих на выбранный. В статье под MLT понимается поиск от уже известного документа, а не от заново введённого запроса.
https://habr.com/ru/articles/1042190/
Алгоритмы и Структуры данных
Четыре простых шага до изделия: использование проектирования на основе моделей для программно-определяемых радиосистем 4
В предыдущих частях этой серии статей мы рассказали о платформе быстрого прототипирования Zynq SDR1, представили этапы использования MATLAB и Simulink для разработки алгоритма, который может успешно обрабатывать и декодировать передачи ADS-B2, а также показали, как проверить алгоритм как в симуляторе, так и с помощью реальных данных, полученных с платформы SDR3. Конечная цель всех этапов — создать проверенную модель, которую можно преобразовать в код на языках C и HDL и интегрировать в программно-аппаратную инфраструктуру платформы SDR.
Модель Simulink, о которой шла речь во второй части серии статей («Обнаружение и декодирование Mode S с помощью MATLAB и Simulink»)2, представляет собой имитационную модель, достаточно точно воспроизводящую аппаратное обеспечение, чтобы убедиться, что система успешно декодирует сообщения ADS-B. В этой статье мы рассмотрим последние шаги, необходимые для создания работающего приёмника на платформе быстрого прототипирования Zynq SDR. Как и в предыдущих статьях этой серии, для разработки этого рабочего проекта необходимы следующие навыки: владение MATLAB и Simulink, знание радиооборудования Zynq, а также навыки интеграции программного и аппаратного обеспечения.
https://habr.com/ru/articles/1026632/
Алгоритмы и Структуры данных
Изучите ИИ за несколько вечеров — и начните делать работу вдвое быстрее
Пока одни тратят часы на рутину, другие уже используют ИИ и освобождают время. Навыки работы с ИИ сегодня помогают работать меньше, а зарабатывать больше.
На бесплатном мини-курсе вы научитесь:
— Делать свою работу быстрее
— Делегировать ИИ тексты, аналитику и маркетинг
— Автоматизировать рутинные задачи
— Расти в профессии и карьере
Без сложного кода и бесконечной теории — только практика, мини-проекты и быстрые результаты. Переходите по ссылке и регистрируйтесь бесплатно.
Реклама. Информация о рекламодателе по ссылкам в посте.
Как мы боремся с галлюцинации AI Master: гибридный Guard на Embedding + LLM Extractor на примере AI-RPG «Стирая Грань»
Каждый, кто пробовал создавать текстовые RPG или симуляторы на базе LLM (будь то GPT-4, DeepSeek или локальная 70B), сталкивался с проблемой «Yes-And» проклятия. По своей природе современные языковые модели — это идеальные импровизаторы. Они обучены поддакивать пользователю и развивать его мысль.
В контексте игры это превращается в легальные читы. Игрок пишет: «Я достаю из кармана дымовую шашку и кидаю в охрану» или «Вообще-то я полковник ФСБ, пропустите». Что делает классический AI GM? Он послушно кивает: «Охрана кашляет в дыму, вы проходите», даже если по Game State игрок — бродяга в одних трусах, у которого в инвентаре только ржавый гвоздь.
https://habr.com/ru/articles/1042402/
Алгоритмы и Структуры данных
Масштабируемость ML-алгоритмов при увеличении вычислительных ресурсов
Говоря о машинном обучении, нейронных сетях и тому подобному, у многих появляется ассоциация с мощным железом, огромными вычислительными мощностями и невероятным количеством денег. На практике — многие ML (и не только) алгоритмы завязаны далеко не на тупой мощи вычислительной машины. Часть из них действительно ускоряется (и даже в разы) при добавлении ресурсов, другие — не реагируют, а некоторые могут даже создать лишние расходы и потерять в скорости.
В данной статье будет рассмотрено 5 разных алгоритмов машинного обучения, с наглядным сравнением их скорости работы на разных аппаратных ресурсах.
https://habr.com/ru/articles/1042254/
Алгоритмы и Структуры данных
Шахматные программы VII. Основной перебор Stockfish
Итак, мы добрались до самого сердца шахматной программы Стокфиш. Ее основной функции - search. Именно здесь бьется пульс этого движка.
Сейчас мы произведем разбор этой функции. О ее важности уже не раз говорилось на предыдущих страницах. Теперь нам предстоит понять, как основной поиск выглядит в реальной программе. Еще раз напомню, что функцию search можно найти в файле search.cpp. Обзорному описанию содержания этого файла была посвящена предыдущая часть
https://habr.com/ru/articles/1039732/
Алгоритмы и Структуры данных
Царский путь к пониманию комплексных чисел. Часть II
В предыдущей части была рассмотрена предыстория комплексных чисел: от их первого открытия до понимания и умения их широко использовать в науке прошли сотни лет. Комплексные числа впервые возникли как артефакт вычислений в работе Кардано 1545-го года и вплоть до конца XVIII века их статус оставался нестабильным, шли научные дискуссии об уместности их употребления и интерпретации.
Современные изложения теории комплексных чисел выглядят «магически» и непонятно для многих людей именно потому, что, как правило, разрыв между непониманием XVIII века и теориями XIX века не покрыт. Сначала предлагается изучить основы теории комплексных чисел в том виде, в которой они были сформулированы в середине XVIII века, а потом сразу делается скачок к теориям, созданным в середине XIX века.
https://habr.com/ru/articles/981814/
Алгоритмы и Структуры данных
ЕСППД-ИИ. Как описывать бизнес-процессы для работы с искусственным интеллектом
Я руковожу компанией, которая с 2012 года занимается описанием бизнес-процессов и внедрением систем класса ERP. За это время мы не раз сталкивались с одной и той же проблемой: бизнес-процесс вроде бы можно описать словами, можно нарисовать схему, можно составить таблицу операций, но в момент проверки выясняется, что документ не держит реальное исполнение. В нём не хватает предметов, состояний, источников, ролей, переходов, прикладных носителей, исключений и проверок. Такой документ выглядит убедительно, но не позволяет понять, как именно процесс должен работать в системе и как его проверить.
Когда появились LLM, эта проблема стала заметнее. Большая языковая модель умеет быстро собрать красивый текст, но если ей не дать структуру, она начинает достраивать недостающие связи сама. Она может придумать роли, маршруты, статусы и действия, которые выглядят правдоподобно, но не подтверждены предметной областью. Поэтому в какой-то момент стало ясно: для работы с ИИ недостаточно хорошего промпта. Нужна система документации, в которой предметная область описана так, чтобы человек мог её проверить, а ИИ мог на неё опираться.
https://habr.com/ru/articles/1041856/
Алгоритмы и Структуры данных
Как работает размытие в видеоиграх
Размытие — базовый строительный блок множества эффектов постобработки в видеоиграх, без него не обходятся красивые современные GUI. Оно используется в эффектах Depth of Field, Bloom или панелях с эффектом матового стекла современных пользовательских интерфейсов.
https://habr.com/ru/articles/1041710/
Алгоритмы и Структуры данных
Квантовые компьютеры — не угроза 128-битным симметричным ключам
Надвигающаяся угроза для криптографии со стороны квантовых компьютеров заставила срочно менять действующие примитивы асимметричной криптографии — обмен ключами (ECDH) и цифровые подписи (RSA, ECDSA, EdDSA) — которые уязвимы для квантового алгоритма Шора. Однако существующих симметричных методов криптографии (AES, SHA-2, SHA-3) или уровней их стойкости это не коснулось.
В индустрии бытует заблуждение, что квантовые компьютеры вдвое ослабят безопасность симметричных ключей, и для обеспечения того же 128-битного уровня защиты потребуется перейти на 256-битные ключи. Это неточная интерпретация ускорения, которое несут в себе квантовые алгоритмы. Она не отражена ни в одном из нормативных стандартов и рискует отвлечь внимание от реально необходимой работы по переходу к постквантовой системе криптографии. Обычно это заблуждение происходит из недопонимания применимости другого квантового метода — алгоритма Гровера.
https://habr.com/ru/companies/ruvds/articles/1040544/
Алгоритмы и Структуры данных
Тратите много времени на работу? ИИ уже умеет делать часть задач за Вас
Представьте: тексты пишутся быстрее, аналитика и отчёты собираются за минуты, а рутинные задачи больше не съедают вечер. Именно так сегодня работают специалисты с ИИ‑инструментами — и поэтому становятся востребованнее и дороже на рынке.
Этот бесплатный курс поможет быстро войти в тему без сложной подготовки. В игровом формате Вы внедрите ИИ под задачи бизнеса, выполните реальные проекты и научитесь автоматизировать процессы даже без навыков программирования.
Переходите по ссылке и регистрируйтесь бесплатно — пока навык ИИ не стал обязательным для всех.
Реклама. Информация о рекламодателе по ссылкам в посте.
Как работает адаптивный RAG, которому вообще не нужна LLM
Один из самых популярных способов снизить процент галлюцинаций языковых моделей — метод RAG, то есть схема, в которой модель при необходимости обращается к внешним данным, а не опирается исключительно на внутренние знания. Все LLM текущего поколения работают с RAG, но он делает систему затратнее по вычислениям и сам по себе может допускать ошибки, если внешний контекст оказался плохим или нерелевантным.
Сегодня я разберу исследование LLM-Independent Adaptive RAG: Let the Question Speak for Itself, в котором ученые из MWS AI, AIRI, Сколтеха и еще нескольких университетов предлагают решение этой проблемы через новый подход к adaptive retrieval, когда RAG запускается не автоматом, а только при необходимости.
https://habr.com/ru/companies/mts_ai/articles/1041078/
Алгоритмы и Структуры данных
