Дата канальи
Open in Telegram
Данные / ML / AI / аналитика в корпорациях. Для связи @NikitaZelinskiy (реклама и консультации по AI/ML для бизнеса)
Show more6 200
Subscribers
+124 hours
+277 days
+4730 days
Posts Archive
6 200
#ML #корпшизв
Про регэкспы
В комментах к посту про IFы в проде вспомнили про регэкспы.
Есть у меня история и про них
Итак, задача разметки транзакций бухгалтерских полупроводок (движений между балансами) почти десять лет назад.
Миллиард-два полупроводок в месяц, у каждой 100+ важных полей (не только же назначения платежа, десяток текстовых полей и еще больше категорийных и численных)
Опечатки, технические ошибки и 12 методистов рисков размечали 2 недели в эксельки на классы (которые потом несколько раз пришлось поменять).
Мне досталась уже готовая модель (с очень негативным фидбеком от заказчиков) + разметка в файлах s3.xls и s4.xls (искренне благодарен людям что они хотя бы .csv не использовали — таким посылаю лучи поноса, ибо встретить перенос строки или спецсимвол в назначении платежа — проще простого).
Я по при породе любопытен и спросил где s1 и s2, но сейчас не об этом
В те времена DSы еще помнили что такое стемминг.
И модель радостно использовала pymystem3. Который при попытке запустить его в закрытом контуре (где собственно модели и нужно было разрабатывать) радостно лез в интернет (cdn.yandex.net) и умирал, получая отказ. SnowballStemmer этих недостатков был лишен и тут же мною использован — и тогда я впервые понял что корпоративный арбитраж может быть не только злом (модель попала ко мне потому как шеф в результате агрессивных поступательных действий добился роспуска целого центра в соседнем блоке за профнепригодность).
Но, к сожалению, стеммер не лечит опечатки.
И вот автор той модели лечил их регулярками.
Тысячи строк вида:
r'\b\w\b' : 'xyz'
Которые применялись последовательно в цикле for через re.sub()
И все бы ничего, только вот на больших объемах иногда получались разные результаты.
Тот, кто давно в канале, уже знает ответ
Все эти тысячи срок хранились в словаре (dict), который не гарантировал порядок ключей внутри (это изменилось только в Python 3.7), а паттерны опечаток частично перекрывались.
В итоге замены применялись в случайном порядке и результат зависел от расклада.
И это ответ на вопрос почему DS должен для своей модели готовить данные сам а не доверять аналитику или кому-н другому6 200
Из серии «подслушано у кулера»
— У нас в проектном офисе уже больше 50 человек! — А почему из них только 3 проектных менеджера?Я, честно говоря, путаюсь, когда одновременно в одном направлении работают: — Product Owner — Product Manager — Project Manager Что их вообще объединяет? Вопрос с их собеседования «Как ты используешь ИИшечку в работе?» И в ответ ожидают не рассказ про промтинг gpt, а чего-о поинтереснее. Знакомую Senior Product попросили мультиагентную систему построить на публичных MCP Меня от «иишечки» коробит немного, но по сути помочь можем. Как вы помните, мы с Максом ведем курс по AI-агентам на ФКН ВШЭ и ВШПИ МФТИ и выкладывал свою лекцию по RAG Так вот, в этот раз мы собрали собратьев по агентам — топовых продактов из Авито, exYandex, Beeline Cloud, Typeform и МТС чтобы они показали и рассказали — как они решают свои day2day продуктовые задачи «иишечкой», почему это работает лучше простого промтинга, в каких кейсах вообще стоит эту «иишечку» использовать а в каких не совсем. Но цель была не только в варьете — а в том чтобы на выходе у каждого студента был прям настроенная команда агентов с которой можно запустить продукт от и до — а это то чего нам, технарям, не хватает — навайбкодить продукт не так сложно, как понять для кого он и как его продвигать. Встречайте — курс по AI-агентам для продактов от продактов. 7 живых онлайн-семинара в диалоге с предподавателями, раз в неделю, материалы целый год доступны после курса PS Ну а если кто-то хочет поботать именно базу ML/AI, то вот N айтишниц в честь первого сентября отгрузили подборку материалов
6 200
стати, про IFы
Есть у меня знакомый, очень талантливый парень из Ростова/Москвы, 10 лет работает лидом в большой и уважаемой ИТ-компании, отвечает за антифрод.
Раз в пару лет где-то как-то пересекаемся, спрашиваю что нового в науке антифрода.
Каждый раз он честно и серьезно отвечает что пишет SQL-запросы и логику на IF/CASE WHEN.
Но сейчас чуть другой сюжет.
Представьте задачу определения вероятности дефолта юрлиц (часто называют банковским скорингом, хотя владельцы облигаций знают эту задачу чуть в других терминах).
Юр лицо, особенно крупное, это достаточно сложная сущность с единым исполнительным органом — например:
хозяином в ООО УРК (ИНН 6670534016)
, верховным атаманом (ИНН 7708364030, 7702376889 и 5036056729)
, предводителем (ИНН 3906081950) и ООО СИМПЛИМЭДЖИН (ИНН 7714908584)
, верховным шаманом (ИНН 1701062776) — все ссылки на сайт ФНС, ищите должность на второй странице выписки ЕГРЮЛ.
Еще юр лица часто живут в группах (не только для дробления бизнеса по выручке для налоговой оптимизации), имеют сложные схемы владения (иногда вообще кольцевые), неочевидных бенефициаров, сложные аффилированности и экономические отношения, через некоторые идут миллионы транзакции в месяц, а по другим наоборот, никаких данных нет (а около 600 ЮЛ даже ИНН не имеют, как и код иностранного ЮЛ).
Как поступают в таких случаях?
Делают отдельные модели по каждому домену данных:
— модель по данным арбитражей
— модель по данным транзакций
— модель по данным финансовой отчетности
— графовая модель, работающая на связях (юридических, экономических и каких только не придумается) — и назначающая финальный скор.
Вопрос только в том какой скор подавать на вход графовой модели и вообще как объединять предикты моделей для конкретного ЮЛ в зависимости от того какие данные были доступны.
Итак, лет 10 назад, когда нейронки только переживали очередной расцвет после зимы, самое высокое начальство потребовало чтобы DS не городили огород а сделали уже одну большую нейронyю сеть, которая все данные скушает и откалиброванный скор выплюнет (заодно и резервы сама посчитает, что уж).
Естественно, переубеждать высокое начальство смерти подобно, но в банках куча проверяющих органов, которые и сами не работают и другим не дают.
Как быть в ситуации когда:
⁃ нужна обязательно нейронка и это проверят
⁃ Которая пройдет строгую валидацию и статтесты в отдельном департаменте
⁃ Времени на разработку нет — сами витрины данных еще толком не появились в хадупе, про GPU и среды обучения нейронок инфраструктурщики даже по радио не слышали
?
Мы все учились понемногу, чему-нибудь и как-нибудь.
Как выглядит самая простая нейронная сеть с одним нейроном?
Правильно, это логистическая регрессия!
Итого, мы объединили скоры логрегом, на слайде для начальства гордо написали что модель выполнена в нейросетевой архитектуре — и все были довольны:
— риски получили хорошую понятную стабильную модель
— валидаторы дали зеленый свет и подтвердили архитектуру
— начальство уверенно вещало на страну про нейронную сеть
Так что часто в самых сложных и современных системах куча логики в портянках с IF / case when и это вполне нормально.
6 200
Когда думаешь, что в продакте всё закатали в идеальные пайплайны и автоматизировали, жизнь (она же жиза) приносит утренний алерт: «А почему у нас вчерашний A/B-тест упал, потому что прод не выдержал нагрузки от двух дополнительных пользователей?» Или классика: «Заказчик утверждает, что хотел кнопку, но на ревью говорит, что всегда имел в виду слайдер».
Короче, Т-Банк собрал эту самую жизу на карточках. Всё то, о чём молчат в резюме, но ржут в курилках (или в созвонах с выключенной камерой).
А если хотите обсудить эти истории уже не в ленте, а вживую (и заодно понять, как не попадать в такие ситуации), добро пожаловать на конференцию «Продукты 24×ffdd2d». Будет больно, весело и полезно — обещают кучу пользователей, которые знают, чего хотят.
Регистрация тут (не потеряйте ссылку): https://producty24-ffdd2d.ru
И да, будет круто, если в комментах накидаете любимые мемы, которые идеально ложатся на надписи на карточках, — устроим баттл гифок и пикчей.
6 200
An Alien Mind
Это бьет тревогу Jakub Pachocki, Chief Scientist at OpenAI
Верим 🤔
или маркетинг 😄 ?
6 200
На фоне новостей про супер-модель Astra и достижение AGI хотите доказательство что эта картинка про AI более чем точная?
Легко, ниже служебный шаблон системного промпта последнего
Qwen3.8-Flash-Next:
{%- set image_count = namespace(value=0) %}
{%- set video_count = namespace(value=0) %}
{%- macro render_content(content, do_vision_count, is_system_content=false) %}
{%- if content is string %}
{{- content }}
{%- elif content is iterable and content is not mapping %}
{%- for item in content %}
{%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
{%- if is_system_content %}
{{- raise_exception('System message cannot contain images.') }}
{%- endif %}
{%- if do_vision_count %}
{%- set image_count.value = image_count.value + 1 %}
{%- endif %}
{%- if add_vision_id %}
{{- 'Picture ' ~ image_count.value ~ ': ' }}
{%- endif %}
{{- '<|vision_start|><|image_pad|><|vision_end|>' }}
{%- elif 'video' in item or item.type == 'video' %}
{%- if is_system_content %}
{{- raise_exception('System message cannot contain videos.') }}
{%- endif %}
{%- if do_vision_count %}
{%- set video_count.value = video_count.value + 1 %}
{%- endif %}
{%- if add_vision_id %}
{{- 'Video ' ~ video_count.value ~ ': ' }}
{%- endif %}
{{- '<|vision_start|><|video_pad|><|vision_end|>' }}
{%- elif 'text' in item %}
{{- item.text }}
{%- else %}
{{- raise_exception('Unexpected item type in content.') }}
{%- endif %}
{%- endfor %}
{%- elif content is none or content is undefined %}
{{- '' }}
{%- else %}
{{- raise_exception('Unexpected content type.') }}
{%- endif %}
{%- endmacro %}
это первые строки, дальше все тот же if-then-else
Шутка6 200
Repost from Machinelearning
🙂 Цену покупки Hugging Face выбрали не случайно
Объявляя о покупке Hugging Face, сооснователь компании Томас Вольф написал:
... особые поздравления тому, кто найдёт отсылки к Hugging Face и Nvidia, спрятанные в цене сделки - 12 930 300 000 долларов.Разгадывать бросились всем твиттером и первую нашли быстро. Число 129 303 - это десятичная запись Unicode U+1F917, то есть эмодзи 🤗, который официально так и называется: Hugging Face. Вольф подтвердил догадку и намекнул, что есть и вторая, связанная с Nvidia. С ней помучались. Число разобрали на составные части 12, 93 и 03, объясняя, что двенадцать - это цена акции Nvidia на IPO 1999 года, девяносто три - год основания компании, ноль три - три сооснователя: Дженсен Хуанг, Крис Малаховски и Кёртис Прием. Версия красивая, стройная и неверная. Правильный ответ подсказал гендиректор Hugging Face Клеман Деланг, отправив комментатору ссылку на реестр названий цветов. Если записать то же число как шестнадцатеричный код цвета #129303, получится зелёный, цвет Nvidia.
Педантичности ради - официальный зелёный Nvidia это #76B900, оттенок другой. Так что отсылка тут не к точному фирменному цвету бренда, а к зелёному цвету как таковому.@ai_machinelearning_big_data #news #ai #ml
6 200
Вспомнил тут сколько эмоций возникло у поступающих в ШАД МТС отсылка к кодированию цвета. Хотя ту задачу и решали более успешно чем другие три.
Мы кстати потихоньку начинаем готовить новые вступительные — если у кого есть крытые идеи — велком в комменты
Не прошло и года как популярность именно этой пасхкалки в IT показали парни посереьезнее — более того, показали именно что деньгами: код зеленого цвета — цвета NVidia — определил сумму сделки по покупке Hugging Face (и это объяснение от самого гендиректора Hugging Face):
6 200
🎓18 сентября 2026 — Конференция дата-аналитиков на ЭФ МГУ
Совет молодых учёных ЭФ МГУ совместно с магистерской программой «Анализ данных в экономике» приглашает специалистов по прикладному анализу данных из академии и индустрии, а также студентов старших курсов обсудить методы машинного обучения, эксперименты и оценку причинно-следственных связей при принятии бизнес-решений
Обязательная регистрация:
– Дедлайн: 15 сентября 2026
– Регистрация
– При большом количестве заявок оргкомитет оставляет за собой возможность ограничить число слушателей, отдавая предпочтение участникам с непосредственным опытом в прикладном анализе данных
– 16 сентября всем зарегистрировавшимся придёт письмо с подтверждением участия или информацией о возможном ограничении числа слушателей
В программе четыре тематических блока:
– ИИ-инструменты
– Маркетинг
– Эксперименты
– Машинное обучение
Среди спикеров конференции специалисты из Яндекса, Сбера, Wildberries, Ozon, Т-Банка, NtechLab и Raiffeisenbank Operations
Подробности, расписание и полная программа конференции
6 200
Всегда было интересно как проверить что с аукционом второй цены не кинули. Как оказалось — никак
6 200
Всегда было интересно как проверить что с аукционом второй цены не кинули. Как оказалось — никак
