ch
Feedback
Trisigma — про эксперименты

Trisigma — про эксперименты

前往频道在 Telegram

Канал про эксперименты, статистику и анализ данных Черемисинов Виталий: @vitche (сотрудничество) Мирмахмадов Искандер: @iskndr_m (гл. автор) Trisigma — https://trisigma.io A/B платформа Sigma — https://expf.ru/sigma Консалтинг — https://expf.ru

显示更多
7 342
订阅者
-324 小时
-127
-4030

数据加载中...

标签云
无数据
有任何问题?请刷新页面或联系我们的客服
进出提及
---
---
---
---
---
---
吸引订阅者
八月 '26
八月 '26
+2
在0个频道中
七月 '26
+42
在0个频道中
Get PRO
六月 '26
+747
在1个频道中
Get PRO
五月 '26
+612
在7个频道中
Get PRO
四月 '26
+25
在3个频道中
Get PRO
三月 '26
+25
在1个频道中
Get PRO
二月 '26
+79
在3个频道中
Get PRO
一月 '26
+29
在0个频道中
Get PRO
十二月 '25
+13
在1个频道中
Get PRO
十一月 '25
+27
在1个频道中
Get PRO
十月 '25
+10
在0个频道中
Get PRO
九月 '25
+52
在4个频道中
Get PRO
八月 '250
在0个频道中
Get PRO
七月 '250
在2个频道中
Get PRO
六月 '250
在0个频道中
Get PRO
五月 '250
在0个频道中
Get PRO
四月 '250
在0个频道中
Get PRO
三月 '250
在0个频道中
Get PRO
二月 '250
在0个频道中
Get PRO
一月 '250
在0个频道中
Get PRO
十二月 '24
+1
在0个频道中
Get PRO
十一月 '24
+22
在0个频道中
Get PRO
十月 '24
+80
在4个频道中
Get PRO
九月 '24
+95
在0个频道中
Get PRO
八月 '24
+64
在0个频道中
Get PRO
七月 '24
+147
在0个频道中
Get PRO
六月 '24
+107
在0个频道中
Get PRO
五月 '24
+106
在0个频道中
Get PRO
四月 '24
+140
在2个频道中
Get PRO
三月 '24
+141
在1个频道中
Get PRO
二月 '24
+247
在1个频道中
Get PRO
一月 '24
+1 947
在3个频道中
Get PRO
十二月 '23
+138
在1个频道中
Get PRO
十一月 '23
+117
在0个频道中
Get PRO
十月 '23
+143
在0个频道中
Get PRO
九月 '23
+88
在0个频道中
Get PRO
八月 '23
+290
在0个频道中
Get PRO
七月 '23
+141
在0个频道中
Get PRO
六月 '23
+96
在0个频道中
Get PRO
五月 '23
+590
在0个频道中
Get PRO
四月 '23
+47
在0个频道中
Get PRO
三月 '23
+52
在0个频道中
Get PRO
二月 '23
+56
在0个频道中
Get PRO
一月 '23
+100
在0个频道中
Get PRO
十二月 '22
+101
在0个频道中
Get PRO
十一月 '22
+53
在0个频道中
Get PRO
十月 '22
+76
在0个频道中
Get PRO
九月 '22
+91
在0个频道中
Get PRO
八月 '22
+122
在0个频道中
Get PRO
七月 '22
+96
在0个频道中
Get PRO
六月 '22
+133
在0个频道中
Get PRO
五月 '22
+53
在0个频道中
Get PRO
四月 '22
+72
在0个频道中
Get PRO
三月 '22
+55
在0个频道中
Get PRO
二月 '22
+79
在0个频道中
Get PRO
一月 '22
+49
在0个频道中
Get PRO
十二月 '21
+43
在0个频道中
Get PRO
十一月 '21
+116
在0个频道中
Get PRO
十月 '21
+111
在0个频道中
Get PRO
九月 '21
+120
在0个频道中
Get PRO
八月 '21
+61
在0个频道中
Get PRO
七月 '21
+66
在0个频道中
Get PRO
六月 '21
+119
在0个频道中
Get PRO
五月 '21
+36
在0个频道中
Get PRO
四月 '21
+47
在0个频道中
Get PRO
三月 '21
+69
在0个频道中
Get PRO
二月 '21
+82
在0个频道中
Get PRO
一月 '21
+61
在0个频道中
Get PRO
十二月 '20
+1 777
在0个频道中
日期
订阅者增长
提及
频道
02 八月0
01 八月+2
频道帖子
Привет! Это Вит. Выпустили на Хабре AvitoTech короткое интервью. Короткое, потому что это — выжимка из выпуска AviTalk. Внутри для себя можно найти ответы на эти вопросы: — если идти в свое дело, то каким может быть путь; — можно ли делать бизнес с друзьями; — каким может быть предпринемательский Оскар; — практические советы тем, кто хочет свой бизнес. Как и всегда, жду в комментариях после прочтения 👇 Trisigma — канал про A/B-тестирование #trisigma

2
Всем привет, это Искандер. 🔵 Предлагаю вам взглянуть на пейпер Airbnb про interleaving. Проблема Airbnb улучшает поиск по жилью, метрики у них конверсионные, вплоть до бронирования. Бронируют редко, куда реже, чем кликают в обычном e-commerce. Значит A/B нужно много трафика и много недель, а идей по ранжированию всегда больше, чем свободных слотов под тесты. В классических A/B физически сложно это все уместить. Что предлагают авторы Пользователей не делят на контроль и тест. Выдачу двух ранкеров смешивают и показывают одному человеку сразу, поэтому сравнение идёт внутри одного пользователя, а не между группами. Смешивают через team drafting. Т.к. пользователю мы показываем результаты обоих ранкеров, то все что делает сплиттер, это рандомизация порядковых номеров для каждого элемента в выдаче (AABABB, BABBAB и т.п.) Победителя определяют по preference margin и обычному одновыборочному t-тесту. Когда это реально нужно Когда узкое горлышко именно в A/B: много гипотез по ранжированию или рекомендациям, и при этом мало трафика или редкая конверсия. У Airbnb interleaving дал 50x ускорение, эксперимент забирает около 6% A/B-трафика и треть длительности, а с A/B сходится в 82% случаев. По сути это способ дёшево отсеять слабые идеи до полноценного теста. От себя Interleaving это не замена A/B, а предварительный фильтр для полноценного A/B. Он меряет относительное предпочтение между двумя ранкерами, а не абсолютный прирост бизнес-метрики. Разработка и интеграция tdi достаточно дорогостоящее занятие, поэтому к этой практике имеет смысл переходить только тогда, когда количество АБ над ранжированием достаточно емкое. Trisigma — канал про A/B-тестирование #trisigma
1 565
3
Привет, это Вит. 🔵Я уже рассказывал вам про то, что мы запустили блог на сайте Trisigma. Сегодня про две статьи оттуда, которые помогут точно ответить на вопрос: Когда останавливать A/B-тест. Первая, а точнее первая часть про MDE (Minimum Detectable Effect). В ней про то, что такое MDE, почему без него невозможно понять, сколько на самом деле должен длиться тест, и как не тратить недели на эксперименты, которые изначально не способны дать полезный результат. Вторая — про Монте-Карло, метод с помощью которого можно оценить возможные результаты чего угодно. В его основе — многократное симулированное моделирование исходов каких-либо событий (всё, как в рулетке, собственно оттуда и название). Trisigma — канал про A/B-тестирование #trisigma
2 527
4
Всем привет, это Искандер. 🔵И я к вам с новым обзором. Сегодня предлагаю взглянуть на пейпер Netflix «Evaluating Decision Rules Across Many Weak Experiments», как оценивать правила принятия решений по множеству слабых A/B‑тестов. Проблема Компания гоняет тысячи экспериментов, но правило «когда катить фичу» методологически прорабатывается без должного внимания. Катим, «если стат.значимо». Или «катим, если аплифт положительный». А сколько эта политика приносит в сумме по всему корпусу экспериментов, никто не считает. Что предлагают авторы Netflix взяли исторические эксперименты, на них применили правила «катим/не катим» по двум подходам (старый подход с вынесением вердикта по результатам и новый). Сложили по всем тестам вердикты (катим/не катим) и получили, сколько метрики каждое правило принесло бы суммарно. Хорошее правило катит больше реально плюсовых фич и меньше минусовых. Загвоздка в том, что истинный эффект вы не знаете, у вас только замер с шумом. Наивный путь — взять замер сразу и как критерий отбора, и как размер выигрыша. Тогда вылезает winner's curse: тесты, которые выглядят лучшими, наполовину просто везучий шум, и суммарную отдачу вы завышаете сами себе. Авторы чинят это через cross-validation. Данные каждого теста режут на две части. На одной половине правило решает «катить / не катить», на другой меряют, сколько north star реально набежало от этого решения. Отбор и подсчёт выигрыша идут по независимым данным, поэтому шум, из-за которого тест «выстрелил», больше не подкручивает оценку вверх. Так по всей истории получают честную суммарную отдачу каждого правила и сравнивают правила между собой. Когда это реально нужно Когда у вас много серых экспериментов и вы хотите настроить саму политику раскатки. На 123 исторических тестах Netflix новое правило дало +33% к накопленному north star против прежнего, и его в итоге внедрили. Выигрыш тут не в новом стат.методе, а в том, что порог принятия решения подобрали по реальной отдаче корпусу. От себя На мой взгляд, тут ловушка вот в чём: как только вы начинаете подбирать правило под свои данные, вы сами создаёте winner's curse уже на уровне корпуса. Методологически я бы страховался историческим holdout'ом и сравнением корпуса с ним, т.к. основной проблемой выбранного правила раскатки (не важно какого) является отсутствие перевалидации себя же. Можно, в принципе, тогда катить treatment всех серых тестов (и это возможно будет лучше по % выигрыша в north star, чем другое правило), но должен быть механизм перевалидации правил на эмпирических данных. Лучше holdout мне ничего в голову не пришло. Trisigma — канал про A/B-тестирование #trisigma
2 952
5
Привет, на связи Вит. Давно не было рубрики «Не утверждаем — а обсуждаем». Sequential testing убивает воспроизводимость результатов. Согласны или нет? Почему? Ждём в комментариях 👇 Trisigma — канал про A/B-тестирование #trisigma
3 697
6
Привет! На связи Вит. Мы ищем старшего аналитика данных в Trisigma. Команда у нас одна из самых сильных на рынке. Поэтому и з
Привет! На связи Вит. Мы ищем старшего аналитика данных в Trisigma. Команда у нас одна из самых сильных на рынке. Поэтому и задачи ждут интересные: — проводить R&D; — проектировать дизайн продуктовых инкрементов, развивать движок Semantic Layer и документацию (подходы, best practices, статьи); — проектировать аналитические решения для клиентов и внедрять их. 🔵Откликайтесь напрямую на карьерном сайте. И обязательно пересылайте знакомым, которым может быть интересна позиция. Trisigma — канал про A/B-тестирование #trisigma
4 062
7
Привет! Это Даня Никольский, бэкенд-инженер Trisigma. Недавно я рассказывал, как мы в внедрили Switchback в нашу платформу. С
Привет! Это Даня Никольский, бэкенд-инженер Trisigma. Недавно я рассказывал, как мы в внедрили Switchback в нашу платформу. Сейчас мы вместе с коллегами написали большой гайд про такие эксперименты. Рассказали, как они устроены, почему для них не подходит обычный t-тест и какая инфраструктура нужна, чтобы проводить их в промышленном масштабе. 🔵Читайте по этой ссылке. А вопросы — оставляйте в комментариях 👇 Trisigma — канал про A/B-тестирование #trisigma
2 994
8
Ребят, это Вит, и я к вам с очень крутой новостью! 🔵У нас в EXPF был блог на Medium с максимально прикладными статьями. И во
Ребят, это Вит, и я к вам с очень крутой новостью! 🔵У нас в EXPF был блог на Medium с максимально прикладными статьями. И вот наконец-то мы перенесли материалы оттуда на сайт Trisigma. Так что встречайте и читайте Trisigma блог! Конкретные материалы рекомендовать не буду, они все хороши. А все новые будем анонсировать тут. Так что stay tuned! Trisigma — канал про A/B-тестирование #trisigma
3 354
9
Ребят, это Вит, и я к вам с очень крутой новостью! 🔵У нас в EXPF был блог на Medium с максимально прикладными статьями. И во
Ребят, это Вит, и я к вам с очень крутой новостью! 🔵У нас в EXPF был блог на Medium с максимально прикладными статьями. И вот наконец-то мы перенесли материалы оттуда на сайт Trisigma. Так что встречайте и читайте Trisigma блог! Конкретные материалы рекомендовать не буду, они все хороши. А все новые будем анонсировать тут. Так что stay tuned!
3
10
Есть мнение, что CUPED переоценён — в большинстве кейсов он не даёт значимого выигрыша. Согласны? Сталкивались? Ждём в комментариях 👇 Trisigma — канал про A/B-тестирование #trisigma
3 670
11
Привет! На связи Вит. 🔵Не так давно выступал на KARPOF.CONF, делюсь записью и удобным конспектом. Говорил про AI, а точнее про то, как выстроить аналитическую инфраструктуру, чтобы он был активом. Запись есть только в ВК (смотреть можно без регистрации), а конспект — прикрепил в пдф. Буду рад вашим кейсам с AI и в экспериментах, и в аналитике в целом. Делитесь, как используете и насколько это эффективно.
3 481
12
Привет! Это Вит. 🔵Ещё весной рассказали «Коммерсанту», как устроен рынок платформ для экспериментов в России. Если кратко и по интересным цифрам: половина компаний ещё не поняла, зачем им культура данных, а создание своей платформы обойдется от 150 млн руб. за три года. При этом готовое решение — от 2,5 млн в год. И да, 80% гипотез не дают значимого эффекта, но именно 10% негативных спасают бизнес от факапов. Почему так, и в целом про экономику, VPC, on‑prem и почему все хотят не готовое решение, а консалтинг — читайте тут. А мнения/вопросы/комментарии туда 👇 Trisigma — канал про A/B-тестирование #trisigma
4 071
13
Всем привет, это Искандер. 🔵В прошлый раз я поделился с вами пейпером про подход с ARMA-Design от нескольких международных университетов. Следующий пейпер, который хочу обсудить, снова про нарушение SUTVA, но уже не во времени, а в пространстве. Откуда проблема Запускаете A/B на социальной сети: часть пользователей получает новый тип реакций, часть — нет. Казалось бы, всё чисто. Но контрольные пользователи видят, что их друзья из treatment что-то делают иначе. Они, в свою очередь, меняют свое поведение. ATE по итогу будет смещён, и авторы оценивают это смещение в 30%+. Очевидно перед нами сетевой эффект. Но стандартные способы с ним бороться работают плохо. Наиболее популярных подход и его проблемы Чаще всего используется сплиттование через Cluster randomization: назначаем воздействие кластерам пользователей, а не индивидуально. Тогда spillover-эффект внутри кластера, но не между ними. Проблема: теряется мощность за счет перехода на новый уровень рандомизации, и кластеры часто плохо соответствуют тому, как реально распространяется воздействие от A/B. Что предлагают авторы Двухшаговый метод, который автоматизирует задание exposure mapping. Шаг первый: для каждого пользователя строится вектор — causal network motif. Он описывает топологию ближайшего окружения с учётом того, кто из соседей обработан. Важна не просто доля обработанных, а структура связей между ними. «4 друга, 2 обработаны, и они между собой связаны» — это другой мотив, чем «2 из 4 обработаны, но изолированы друг от друга». Плотный кластер обработанных давит на поведение иначе, чем рассеянные. Шаг второй: эти векторы кластеризуются алгоритмом ближайших соседей. На выходе — автоматически найденные группы с разными паттернами интерференции. Целевая метрика — GATE: что было бы, если бы все получили фичу, против состояния, где никто ничего не получил. Не "насколько лучше у тех, кому показали" — а глобальный эффект с учётом spillover эффекта. Проверка Протестировали на синтетике и на реальном крупном тесте. По точности оценки GATE — выше cluster randomization. Когда это нужно Продукты с механиками социального взаимодействия с вирусным компонентом: реакции, шеринг, рекомендации «добавить в друзья». Двусторонние маркетплейсы, где обработка продавца влияет на покупателей. В общем — всё, где SUTVA нарушается через явные связи в графе, а не через время. От себя Практически важнее самого алгоритма — диагностика. Большинство команд вообще не проверяют, есть ли интерференция. Обычно просто говорят – «у нас есть сетевой эффект». Если граф пользователей доступен, тест на отсутствие spillover — несложная операция, которая может перевернуть интерпретацию уже прошедших экспериментов. Если есть мысли, пишите в комментах. Trisigma — канал про A/B-тестирование #trisigma
4 414
14
Привет! Продолжаем рубрику «Не утверждаем — а обсуждаем». На повестке пятницы вот такой вопрос: Стратифицированная рандомизация — когда помогает а когда вредит? Что думаете? Ждём в комментариях 👇 Trisigma — канал про A/B-тестирование #trisigma
4 154
15
Всем привет, это Искандер. 🔵Предлагаю вам взглянуть на новый пейпер про подход с ARMA-Design сразу от нескольких международных университетов. Есть допущение, которое большинство A/B платформ делают молча: юниты независимы. В маркетплейсах это почти никогда не так. Проблема Когда тестируется алгоритм выдачи заказов в ride-tech-продуктах (например, в Uber или DoorDash), эффект не исчезает в момент назначения заказа. Водитель оказался в другом районе и он, вероятно, возьмёт или не возьмёт следующий заказ через час. Это так называемый carryover-эффект: воздействие сегодня меняет состояние системы завтра. Стандартный switchback это частично решает, но молча предполагает, что данные «марковские». Авторы проверили это на реальных данных из двух городов и заметили, что PACF остатков дохода водителей показал значимые лаги 5-го, 6-го порядка. Иначе говорят это не марков. Что предлагают авторы Данные экспериментов моделируются через контролируемую VARMA-модель. AR-часть ловит carryover, MA-часть компенсирует то, что вы не наблюдаете в состоянии системы. После этого задача дизайна эксперимента формулируется как: найди последовательность назначений групп A/B, которая минимизирует дисперсию оценки ATE. Это решается двумя способами: constrained optimization и RL. Оба смотрят на всю историю назначений, а не только на текущий период. Сравнивали с тремя базовыми дизайнами — alternating-day, uniform random, switchback. — Alternating-day: по сути чередование между днями в гео-локе, A в понедельник, B во вторник, A в среду... — Uniform random: в каждом периоде бросаем монетку — Switchback с фиксированным окном Все три показывают плохие результаты. Когда это реально нужно Если тестируете что-то, что меняет состояние маркетплейса — dispatch-алгоритмы, pricing, балансировку supply/demand — и эксперимент короткий при слабом сигнале (допустим, ATE 0.5–2%). Switchback не спасает, если проблема в частичной наблюдаемости. От себя Switchback стал стандартом для маркетплейсов, и это шаг вперёд. Но он не решает проблему, о которой говорится в пейпере, что часть состояния системы просто не записывается. Прогнать PACF на остатках ваших операционных метрик до начала дизайна эксперимента — это достаточно простая проверка, которую мало кто делает. Если увидите значимые лаги 4+, switchback с фиксированным окном уже не будет подходить для ваших A/B. Если есть мысли, пишите в комментах. Trisigma — канал про A/B-тестирование #trisigma
3 962
16
🔵Делимся записью вчерашнего митапа 📱 YouTube 📱 VK Обязательно оставляйте в комментах свои вопросы. И хороших выходных! Trisigma — канал про A/B-тестирование #trisigma
3 464
17
Сегодня наш онлайн-митап про неклассические инструменты для экспериментов Поэтому, если ещё не зарегистрировались, то самое в
Сегодня наш онлайн-митап про неклассические инструменты для экспериментов Поэтому, если ещё не зарегистрировались, то самое время это исправить. После регистрации вам придёт индивидуальная ссылка на стрим. В программе три кейса от коллег из Авито, Finom и ex. Lamoda Tech, Ozon Tech. 🔵Подробности и регистрация тут. До встречи в 18:30.  #trisigma
3 145
18
Есть мнение — Long-term эффекты эксперимента всегда противоречат краткосрочным. Что думаете? #trisigma
2 598
19
Привет, это Вит Черемисинов. Под недавним постом у нас с вами случилась классная дискуссия. Поэтому решил ввести рубрику «Не утверждаем — а обсуждаем». Буду делиться вопросами, которые мы получаем от наших клиентов и партнеров. И вместе разбирать их, думать, спорить. Первый — в следующем посте👇 Жду в комментариях! P.S. Кстати, у меня есть мой личный тг. В нём я пишу про всё — и про A/B, и про рынок в целом, и про личное.
2 444
20
Не забывайте зарегистрироваться на наш онлайн-митап 21 мая Будем обсуждать три кейса, в которых нужно было выйти за рамки привычных инструментов A/B. 🔵Подробности и регистрация тут. Trisigma — канал про A/B-тестирование #trisigma
2 772