ru
Feedback
Data Science: Алгоритмы и Структуры данных

Data Science: Алгоритмы и Структуры данных

Открыть в Telegram

Мы не претендуем на оригинальность контента, мы лишь собираем материал из открытых источников. Ссылка: @Portal_v_IT Сотрудничество, авторские права: @oleginc, @tatiana_inc Канал на бирже: https://telega.in/c/structuredata

Больше
7 714
Подписчики
-424 часа
-177 дней
-2030 день
Архив постов
Архиватор рождённый из теории предельного сжатия вселенной В 1996 году, во время учёбы в военном институте по специальности «программирование», на занятиях по кодированию данных мне пришла идея. Что если построить бинарное преобразование по правилу: https://habr.com/ru/articles/1046081/ Алгоритмы и Структуры данных

Я попробовал считать нейросетевой слой в конечном поле Галуа GF(137): 4x по памяти, ARM NEON и честные ограничения В современных нейросетях критически важно, сколько физической памяти занимает каждый параметр. В этой работе я попытался уйти от классического float32 в нейросетевом слое к uint8 без квантования. Для этого все вычисления проводились сразу по правилам арифметики остатков в конечном поле Галуа GF(137). Стоит сказать, что это не замена обычному инференсу и не попытка доказать, что все должны срочно переписать модели на вычеты по модулю 137. Я взял небольшой слой, байтовые веса, нативное ядро, ARM NEON и несколько базовых реализаций для сравнения. Спойлер: на маленьком контрольном запуске байтовая модель заняла около 1.63 KB вместо 6.50 KB, при этом 1000 прямых проходов в ARM NEON режиме заняли всего 12.1 ms. В лучшем случае на выборке это дает около 4x по памяти и до 4.86x по времени относительно базовой NumPy float32-реализации. https://habr.com/ru/articles/1044172/ Алгоритмы и Структуры данных

Самый старый кирпич трансформера наконец переизобрели. DeepSeek взял матрицу из 1967 года За attention-механизм с 2017 года брались сотни раз: sparse attention, linear attention, MoE, MLA, скользящие окна, что только не. А вот residual connection, остаточная связь, та самая x + F(x) из ResNet 2016 года, простояла почти десять лет нетронутой. Её просто унаследовали из résnet'ов, воткнули в трансформер и забыли. 31 декабря 2025-го DeepSeek выложил на arXiv препринт, где взялся именно за этот кирпич. И что показательно, загрузил его на arXiv лично основатель компании Liang Wenfeng, он же в соавторах. Когда основатель сам публикует статью, это обычно значит, что она ляжет в следующую флагманскую модель. Так и вышло: mHC поехал в DeepSeek V4, который выкатили 24 апреля 2026-го. Разберём, что они сделали, почему это работает и при чём тут матрица из шестидесятых. https://habr.com/ru/articles/1044096/ Алгоритмы и Структуры данных

В умелых руках и sed — балалайка или пишем «Морской бой» на регулярках Морской бой — простая игра, в которую можно научить играть даже первоклассника. Тридцать лет назад реализацию этой игры на компьютере можно было продавать. Десять лет назад написание морского боя на любимом языке было хорошим упражнением для будущего программиста. Сегодня, когда с написанием такой игры справится и продвинутая нейронка, сложно кого-то удивить очередной ее реализацией. Но я все же попробую. Я решил написать морской бой на sed — потоковом текстовом редакторе из набора стандартных юниксовых утилит. Обычно его применяют для того, чтобы заменить в потоке или файле одну регулярку на другую. Но дополнительные директивы, которые есть в sed, формируют Тьюринг-полный язык, на котором теоретически можно написать что угодно. https://habr.com/ru/articles/1042940/ Алгоритмы и Структуры данных

Новый уровень ИИ-агентов OpenAI выкатили линейку GPT-5.6, разделив ее на три режима: Luna, Terra и продвинутый Sol. "Новый ур
Новый уровень ИИ-агентов OpenAI выкатили линейку GPT-5.6, разделив ее на три режима: Luna, Terra и продвинутый Sol. "Новый уровень" — это именно Sol в режиме Ultra. Модель запускает группу автономных ИИ-агентов, которые сами делят задачу на части, распределяют роли и исправляют ошибки на ходу. Я проверял Sol, через поиск в сети и работу с базой данных. Попросил собрать лучшую базу каналов по AI | IT. Модель разделила задачу между тремя субагентами:
Первый собрал базу на основе моих подписок и похожих ресурсов в Telegram • Второй проверил этот список через TGStat на вовлеченность и качество. Третий объединил данные, убрал повторы и отсеял каналы с сомнительным контентом.
Понравилось, что процесс шел наглядно — в логах было видно, как агенты спорили между собой и отклоняли варианты друг друга из-за неуникального контента. Итоговый результат работы ИИ собрал в одну подборку. Уверен, каждый найдет для себя пользу:
• ИИ и технологии: фишки нейрогенерации, библиотеки промптов и вайб-кодинг. • Автоматизация: как внедрять нейросети в бизнес-процессы и экономить время. • IT и карьера: как развивать свои проекты, расти в грейде и выходить на топовые офферы.
Подписаться в 1 клик: 👉 https://t.me/addlist/QMPYUBikhOZlMDcy

В умелых руках и sed — балалайка или пишем «Морской бой» на регулярках Морской бой — простая игра, в которую можно научить играть даже первоклассника. Тридцать лет назад реализацию этой игры на компьютере можно было продавать. Десять лет назад написание морского боя на любимом языке было хорошим упражнением для будущего программиста. Сегодня, когда с написанием такой игры справится и продвинутая нейронка, сложно кого-то удивить очередной ее реализацией. Но я все же попробую. Я решил написать морской бой на sed — потоковом текстовом редакторе из набора стандартных юниксовых утилит. Обычно его применяют для того, чтобы заменить в потоке или файле одну регулярку на другую. Но дополнительные директивы, которые есть в sed, формируют Тьюринг-полный язык, на котором теоретически можно написать что угодно. https://habr.com/ru/articles/1042940/ Алгоритмы и Структуры данных

⚡️ Все берут деньги вперёд. Этот трейдер не берёт ничего — пока ты не заработал Не курс. Не услуги. Только выгодное партнёрст
⚡️ Все берут деньги вперёд. Этот трейдер не берёт ничего — пока ты не заработал Не курс. Не услуги. Только выгодное партнёрство и реальная прибыль. ИИ-алгоритм Oracle делает 90% работы — тщательно анализирует рынок и выдает сделки с 93% успешности. Твоя задача: 30 минут в день и желание зарабатывать от 150 тыс. сверху з/п. ❗️За последние 5 месяцев 119 партнёров вышли на первый 1 млн. Средний доход остальных — 297 000 ₽ в месяц. Оплата — 10% только с реальной прибыли. Получайте доступ после диагностики вашего финансового потенциала 👉 https://t.me/+QNMWUFeoYXk1NmUy

Интервью с самим собой Надеюсь, что данная публикация не будет воспринята, как пиар. Просто мне хотелось поделиться некоторыми соображениями на тему технологического решения ориентированного на специалистов прикладников. Не секрет, что не так-то просто найти общий язык между специалистами различных специальностей, в том числе между специалистами предметниками и ИТ-специалистами реализующими прикладные задачи. Идеи, затронутые в интервью, могут быть использованы для реализации ваших собственных приложений совершенно свободно. Единственная просьба не забыть упомянуть об источнике информации. https://habr.com/ru/articles/1043834/ Алгоритмы и Структуры данных

Обучение универсальным навыкам в IT Дисклеймер: статья отражает личное мнение автора и не претендует на абсолютную истину. Если у вас есть дополнения, замечания или альтернативный взгляд — буду рад обсудить это в комментариях. По данным Stack Overflow Developer Survey 2024, более 65% разработчиков регулярно изучают новые технологии. Однако есть навыки, которые остаются актуальными независимо от языка программирования, стека или конкретной компании. Именно такие навыки я и хотел собрать в этой статье. Речь пойдёт о базовом понимании и обучению Linux, Git, SQL и NoSQL, алгоритмов и структур данных, а также английского языка. Это те вещи, которые, на мой взгляд, дают хороший фундамент практически для любого направления в IT. Дополнительно я постарался собрать как можно больше бесплатных или условно-бесплатных ресурсов, которыми либо пользовался сам, либо которые действительно часто рекомендуют разработчики и специалисты из индустрии. https://habr.com/ru/articles/1045808/ Алгоритмы и Структуры данных

⚡️Розыгрыш iPhone 17 Pro Max Совместно разыгрываем самый (пока что) актуальный iPhone 17 Pro Max среди наших подписчиков. Усл
⚡️Розыгрыш iPhone 17 Pro Max Совместно разыгрываем самый (пока что) актуальный iPhone 17 Pro Max среди наших подписчиков. Условия простые: 1. Быть подписанным на: Че по бизнесу? Ценная бумага и вода питьевая. 2. Нажать "🎁Участвую!" под этим постом Победителей бот-рандомайзер выберет 7 августа в 20:00. Всем удачи! По секрету: шанс на победу увеличивается если дать буст.

Консольный рендерер Мандельброта с методом возмущений с 1e-308 Я сделал это! Это огромный повод для гордости. Теперь программа работает по тем же математическим принципам, что и самые передовым фрактальным в мире! Но в самый первый я скажу вот: Благодарности Этот проект использует передовые математические алгоритмы и идеи динамического управления фазой орбит, разработанные фрактальным сообществом. Особая благодарность авторам и исследователям с Fractal Forums, чей совместный труд лег в основу этого движка: https://habr.com/ru/articles/1045660/ Алгоритмы и Структуры данных

OSDEV: Разработка аллокатора на С++ часть 3. Финальный аллокатор со списками свободных блоков Оглавление Часть 1 Часть 2 Часть 4 Весь код можно найти в этом репозитории В третьей статье пойдет речь уже о готовом аллокаторе который вполне пригоден для распределения памяти. Он полностью переписан, но идея та же самая, неявный список свободных блоков с граничными тегами сверху и снизу, но с массивом списков свободных блоков. Т.е. по сути с бинами. https://habr.com/ru/articles/1045692/ Алгоритмы и Структуры данных

Итеративное декодирование LDPC/турбо, полярные коды — разбираем на C++ и сравниваем с MATLAB Когда моделируешь помехоустойчивые коды, декодер обычно остаётся чёрным ящиком: пишешь ldpcDecode(llr, cfg, 30), comm.TurboDecoder или dvbs2ldpc(1/2) — и получаешь красивый «водопад» BER, не заглядывая внутрь. А самое интересное в современных кодах именно там: не в том, как закодировать, а в том, как декодер из зашумлённого сигнала достаёт правильные биты. Первая часть заканчивалась предложением: «если интересно разобрать итеративное декодирование LDPC/турбо в деталях или полярные коды с последовательным отменением — пишите в комментариях». Написали — так что эта статья и есть ответ на запрос из комментариев. Читать первую часть необязательно: там мы прошли эволюцию кодов в сотовой связи от GSM до 5G по BER‑кривым в MATLAB, а всё нужное я напомню по ходу. Здесь — вскрываем сами декодеры. https://habr.com/ru/articles/1043922/ Алгоритмы и Структуры данных

Изоляция рунета произошла быстрее, чем ты думал
Loading ██████████████] 99%
Роскомнадзору воспользовался карт-бланшем на блокировку, а «белые списки» сайтов внедрены уже во всех регионах. И гайки будут закручиваться только сильнее. Чтобы в одночасье не лишиться доступа к свободному Интернету, просто сохрани Only Hack. Тут профессиональный хакер делится фишками, с которыми доступ к глобальной сети у тебя будет даже в случае ядерного апокалипсиса. Не жди момента «Х». Перестрахуйся подпиской.

Основы информатики для всех Всем привет, я сделал обучающую платформу shlyk.tech постарался акцент сделать на визуализации идей и структур. Графы, системы счисления, логику, комбинаторику, индукцию здесь можно потрогать, покрутить, прошагать, увидеть, как оно устроено внутри и понять почему оно так работает. На платформе будет минимум 3 курса: основы информатики, уже открыт и вы или микровы, можете прямо сейчас приступить к учебе. Второй это C++ с нуля до стажировок, часть уже сделана, но там создание визуализаций намного сложнее чем в первом. Третий пока секрет, но он далеко от них не ушел по профилю. Регистрация открытая, денег не прошу, рекламы внутри нет. https://habr.com/ru/articles/1043816/ Алгоритмы и Структуры данных

Торговля на отклонениях: почему мы вернулись к тесту Дики-Фуллера (ADF) Как бы мы ни пытались отказаться от этого инструмента в поисках более изящных алгоритмических решений, каждый раз мы к нему возвращаемся. В прошлой статье про Гамма-флип я вскользь касался механики работы с отклонениями (Mean Reversion), но не раскрыл тему до конца. К тому же, в комментариях справедливо заметили, что текст вышел перегруженным терминологией, применимой скорее к американскому опционному рынку. В этой статье мы углубимся в стохастический анализ и рассмотрим методы определения стационарности временных рядов в реальном времени. Разберем математический аппарат расширенного теста Дики-Фуллера (ADF), причины его интеграции в ядро нашей торговой системы и особенности реализации на Python при работе с большими массивами данных. https://habr.com/ru/articles/1043810/ Алгоритмы и Структуры данных

🧐 Лень считать ночной дожор? Навел телефон — и он сам посчитал калории. Без взвешиваний и таблиц. Просто фото еды → и через
🧐 Лень считать ночной дожор? Навел телефон — и он сам посчитал калории.
Без взвешиваний и таблиц. Просто фото еды → и через пару секунд видишь калории, белки, жиры и углеводы.
Качать ничего не нужно — всё прямо в Telegram Попробуй, это правда похоже на магию 👇

Как шахматный подход помог разобраться с фотолентой Яндекс Диска Когда вы загружаете фотографии на Яндекс Диск, они не просто лежат в облаке: ML‑модели анализируют снимки, группируют их в альбомы и выбирают хайлайты для фотоленты в Яндекс Диске. Но чтобы улучшать такую систему, нужно уметь измерять качество её работы. И здесь начинается проблема: модель выбирает «красивые» и «удачные» кадры, а эстетика — вещь субъективная. Одному важны насыщенные цвета, другому — композиция, третьему — эмоции и лица в кадре. Если попросить асессоров ставить оценки от 1 до 10, мы быстро получим не объективную шкалу, а смесь личных вкусов, разной строгости и шума. Поэтому мы подошли к задаче не как к обычной разметке, а как к исследованию. Вместо абсолютных оценок использовали шахматный подход. Каждая фотография стала «игроком», который соревнуется с другими по 16 признакам эстетики — цветам, фокусу, геометрии, эмоциональности и другим параметрам. Это позволило получить не просто рейтинг кадров, а инструмент для анализа того, какие визуальные признаки учитывают ML‑модели Диска. Всем привет! Я Всеволод Мещеряков из службы разметки Yandex Crowd Solutions. Мы собираем и размечаем фото, видео, тексты — в общем, готовим данные, на которых учатся ML‑модели. В этой статье расскажу, как подход из мира шахмат помог нам связать субъективное восприятие фотографий с математическими оценками и сделать фотоленту Яндекс Диска ещё красивее. https://habr.com/ru/companies/yandex/articles/1042040/ Алгоритмы и Структуры данных

📣 Портативный монитор 15.6 Laptomo Цена: ~6500₽ Рейтинг: 4.8 😀 Отзывов: 503 💬 🖱 Заказать Портативный монитор 15.6" с IPS
📣 Портативный монитор 15.6 Laptomo Цена: ~6500₽ Рейтинг: 4.8 😀 Отзывов: 503 💬 🖱 Заказать Портативный монитор 15.6" с IPS FHD (1920×1080) и Ultra HDR обеспечивает яркое и четкое изображение с широкими углами обзора. Оснащен матовым антибликовым экраном, защитой зрения Low Blue Light и Flicker-Free. Тонкий (8.9 мм) и легкий (697 г), комплектуется чехлом-подставкой. Подключается через USB-C и mini HDMI, совместим с ноутбуками, ПК, смартфонами, PS5, Xbox и Nintendo Switch. Поддерживает режимы дублирования и расширения экрана, работает по Plug & Play без установки драйверов. #монитор #laptomo Еще товары: Находки Программиста

Почему маленькие модели побеждают большие – и что это значит для вашего стека Есть такое устойчивое интеллектуальное заблуждение: если модель больше — значит, она лучше. Больше параметров, больше обучающих данных, больше денег в предобучении — и вот вам SOTA. Гонка за размером казалась единственной игрой в городе. Но в 2025–2026 годах что‑то сломалось в этой логике. И сломалось публично, с цифрами и бенчмарками. Я хочу рассказать три истории, которые произошли практически одновременно и складываются в одну картину. Первая — про то, как Microsoft заткнула за пояс «самую опасную» языковую модель Anthropic с помощью ста специализированных агентов. Вторая — про MIT‑трюк, позволяющий маленькой GPT-5-mini обогнать полноразмерный GPT-5 вдвое на сложных задачах. Третья — про китайскую модель Qwen, которую сделала небольшая команда с ограниченными ресурсами, и которая сейчас работает в 200 000 продуктах по всему миру. В каждой истории маленький (или менее очевидный) игрок побеждает «большого». И каждый раз причина примерно одна и та же. https://habr.com/ru/articles/1043590/ Алгоритмы и Структуры данных