Trisigma — про эксперименты
رفتن به کانال در Telegram
Канал про эксперименты, статистику и анализ данных Черемисинов Виталий: @vitche (сотрудничество) Мирмахмадов Искандер: @iskndr_m (гл. автор) Trisigma — https://trisigma.io A/B платформа Sigma — https://expf.ru/sigma Консалтинг — https://expf.ru
نمایش بیشتر7 282
مشترکین
+124 ساعت
-147 روز
-7330 روز
در حال بارگیری داده...
کانالهای مشابه
ابر برچسبها
هیچ دادهای
مشکلی وجود دارد؟ لطفاً صفحه را تازه کنید یا با مدیر پشتیبانی ما تماس بگیرید.
اشارات ورودی و خروجی
---
---
---
---
---
---
جذب مشترکین
اوت '26
اوت '26
+18
در 0 کانالها
ژوئیه '26
+42
در 0 کانالها
Get PRO
ژوئن '26
+747
در 1 کانالها
Get PRO
مه '26
+612
در 7 کانالها
Get PRO
آوریل '26
+25
در 3 کانالها
Get PRO
مارس '26
+25
در 1 کانالها
Get PRO
فوریه '26
+79
در 3 کانالها
Get PRO
ژانویه '26
+29
در 0 کانالها
Get PRO
دسامبر '25
+13
در 1 کانالها
Get PRO
نوامبر '25
+27
در 1 کانالها
Get PRO
اکتبر '25
+10
در 0 کانالها
Get PRO
سپتامبر '25
+52
در 4 کانالها
Get PRO
اوت '250
در 0 کانالها
Get PRO
ژوئیه '250
در 2 کانالها
Get PRO
ژوئن '250
در 0 کانالها
Get PRO
مه '250
در 0 کانالها
Get PRO
آوریل '250
در 0 کانالها
Get PRO
مارس '250
در 0 کانالها
Get PRO
فوریه '250
در 0 کانالها
Get PRO
ژانویه '250
در 0 کانالها
Get PRO
دسامبر '24
+1
در 0 کانالها
Get PRO
نوامبر '24
+22
در 0 کانالها
Get PRO
اکتبر '24
+80
در 4 کانالها
Get PRO
سپتامبر '24
+95
در 0 کانالها
Get PRO
اوت '24
+64
در 0 کانالها
Get PRO
ژوئیه '24
+147
در 0 کانالها
Get PRO
ژوئن '24
+107
در 0 کانالها
Get PRO
مه '24
+106
در 0 کانالها
Get PRO
آوریل '24
+140
در 2 کانالها
Get PRO
مارس '24
+141
در 1 کانالها
Get PRO
فوریه '24
+247
در 1 کانالها
Get PRO
ژانویه '24
+1 947
در 3 کانالها
Get PRO
دسامبر '23
+138
در 1 کانالها
Get PRO
نوامبر '23
+117
در 0 کانالها
Get PRO
اکتبر '23
+143
در 0 کانالها
Get PRO
سپتامبر '23
+88
در 0 کانالها
Get PRO
اوت '23
+290
در 0 کانالها
Get PRO
ژوئیه '23
+141
در 0 کانالها
Get PRO
ژوئن '23
+96
در 0 کانالها
Get PRO
مه '23
+590
در 0 کانالها
Get PRO
آوریل '23
+47
در 0 کانالها
Get PRO
مارس '23
+52
در 0 کانالها
Get PRO
فوریه '23
+56
در 0 کانالها
Get PRO
ژانویه '23
+100
در 0 کانالها
Get PRO
دسامبر '22
+101
در 0 کانالها
Get PRO
نوامبر '22
+53
در 0 کانالها
Get PRO
اکتبر '22
+76
در 0 کانالها
Get PRO
سپتامبر '22
+91
در 0 کانالها
Get PRO
اوت '22
+122
در 0 کانالها
Get PRO
ژوئیه '22
+96
در 0 کانالها
Get PRO
ژوئن '22
+133
در 0 کانالها
Get PRO
مه '22
+53
در 0 کانالها
Get PRO
آوریل '22
+72
در 0 کانالها
Get PRO
مارس '22
+55
در 0 کانالها
Get PRO
فوریه '22
+79
در 0 کانالها
Get PRO
ژانویه '22
+49
در 0 کانالها
Get PRO
دسامبر '21
+43
در 0 کانالها
Get PRO
نوامبر '21
+116
در 0 کانالها
Get PRO
اکتبر '21
+111
در 0 کانالها
Get PRO
سپتامبر '21
+120
در 0 کانالها
Get PRO
اوت '21
+61
در 0 کانالها
Get PRO
ژوئیه '21
+66
در 0 کانالها
Get PRO
ژوئن '21
+119
در 0 کانالها
Get PRO
مه '21
+36
در 0 کانالها
Get PRO
آوریل '21
+47
در 0 کانالها
Get PRO
مارس '21
+69
در 0 کانالها
Get PRO
فوریه '21
+82
در 0 کانالها
Get PRO
ژانویه '21
+61
در 0 کانالها
Get PRO
دسامبر '20
+1 777
در 0 کانالها
| تاریخ | رشد مشترکین | اشارات | کانالها | |
| 29 اوت | 0 | |||
| 28 اوت | +2 | |||
| 27 اوت | 0 | |||
| 26 اوت | 0 | |||
| 25 اوت | 0 | |||
| 24 اوت | +3 | |||
| 23 اوت | 0 | |||
| 22 اوت | 0 | |||
| 21 اوت | +1 | |||
| 20 اوت | 0 | |||
| 19 اوت | 0 | |||
| 18 اوت | 0 | |||
| 17 اوت | +1 | |||
| 16 اوت | 0 | |||
| 15 اوت | +1 | |||
| 14 اوت | 0 | |||
| 13 اوت | 0 | |||
| 12 اوت | 0 | |||
| 11 اوت | +2 | |||
| 10 اوت | +2 | |||
| 09 اوت | 0 | |||
| 08 اوت | +2 | |||
| 07 اوت | 0 | |||
| 06 اوت | 0 | |||
| 05 اوت | 0 | |||
| 04 اوت | +1 | |||
| 03 اوت | +1 | |||
| 02 اوت | 0 | |||
| 01 اوت | +2 |
پستهای کانال
Всем привет! На связи Вит и это пост по следам вчерашней FuckUp Night.
🔵 Вчера мы собрали друзей, и каждый из них поделился своей фейл-историей — из регулярной работы или больших профессиональных событий.
➖Беслан Курашов, сооснователь Karpov.Courses — рассказал, как его компанию продали без него. ➖Роман Нестер, Segmento (продан Сберу) и Arteus LLM — про то, как создавал стартап и продавал его Сберу. И поделился, какие сложности вообще возникают при продаже своего бизнеса корпорации. ➖Валерий Бабушкин, BP — рассказал историю из регулярной практики: как проблема прогнозирования спроса сказывается на наличии товаров на полках.Про такие провалы обычно не говорят, а, если и обсуждают, то тихо и за закрытыми дверями. А рассказывать про них важно и нужно! Именно в таких кейсах больше опыта и профессионализма, открытости и глубины. Нравится, как про это сказал Роман Нестер:
«Надоели всем истории успеха, потому что все вроде уже понимают, сколько в них вранья, натяжек, недосказанностей. А факап заставляет тебя не просто встать на тумбочку и рассказать стих, какой ты молодец, а оказаться уязвимым и от этого настоящим. Ненастоящее нам и ИИ расскажет».А как вам такой формат? Что запомнилось? Что понравилось, а что нет? Жду в комментах 👇 Trisigma — канал про A/B-тестирование #trisigma
| 2 | Привет!
Сегодня встречаемся на FuckUp Night в 18:00 по Москве.
Записи не будет, поэтому ждём всех на эфире!
🔵 Главное, не забудьте зарегистрироваться.
Trisigma — канал про A/B-тестирование
#trisigma | 1 324 |
| 3 | Привет! Это Вит.
Мы с Романом Нестером, Валерием Бабушкиным и Бесланам Курашовым (plevako.ai и karpov.courses) приглашаем вас на наш FuckUp Night 26 августа.
От формата отходить не будем — поделимся своими историями, где всё пошло не по плану. И поговорим про культуру ошибок: как не зацикливаться на промахах и использовать их в свою пользу.
Встречу проведём онлайн, поэтому подключиться можно из любой точки и всем, кто принимает решения на основе данных.
🔵 Важно! Записи не будет, поэтому приходите на эфир. Главное, не забудьте зарегистрироваться.
Trisigma — канал про A/B-тестирование
#trisigma | 2 601 |
| 4 | Привет! Это Вит.
Выпустили на Хабре AvitoTech короткое интервью. Короткое, потому что это — выжимка из выпуска AviTalk. Внутри для себя можно найти ответы на эти вопросы:
— если идти в свое дело, то каким может быть путь;
— можно ли делать бизнес с друзьями;
— каким может быть предпринемательский Оскар;
— практические советы тем, кто хочет свой бизнес.
Как и всегда, жду в комментариях после прочтения 👇
Trisigma — канал про A/B-тестирование
#trisigma | 2 794 |
| 5 | Всем привет, это Искандер.
🔵 Предлагаю вам взглянуть на пейпер Airbnb про interleaving.
Проблема
Airbnb улучшает поиск по жилью, метрики у них конверсионные, вплоть до бронирования. Бронируют редко, куда реже, чем кликают в обычном e-commerce. Значит A/B нужно много трафика и много недель, а идей по ранжированию всегда больше, чем свободных слотов под тесты. В классических A/B физически сложно это все уместить.
Что предлагают авторы
Пользователей не делят на контроль и тест. Выдачу двух ранкеров смешивают и показывают одному человеку сразу, поэтому сравнение идёт внутри одного пользователя, а не между группами.
Смешивают через team drafting. Т.к. пользователю мы показываем результаты обоих ранкеров, то все что делает сплиттер, это рандомизация порядковых номеров для каждого элемента в выдаче (AABABB, BABBAB и т.п.)
Победителя определяют по preference margin и обычному одновыборочному t-тесту.
Когда это реально нужно
Когда узкое горлышко именно в A/B: много гипотез по ранжированию или рекомендациям, и при этом мало трафика или редкая конверсия. У Airbnb interleaving дал 50x ускорение, эксперимент забирает около 6% A/B-трафика и треть длительности, а с A/B сходится в 82% случаев. По сути это способ дёшево отсеять слабые идеи до полноценного теста.
От себя
Interleaving это не замена A/B, а предварительный фильтр для полноценного A/B. Он меряет относительное предпочтение между двумя ранкерами, а не абсолютный прирост бизнес-метрики. Разработка и интеграция tdi достаточно дорогостоящее занятие, поэтому к этой практике имеет смысл переходить только тогда, когда количество АБ над ранжированием достаточно емкое.
Trisigma — канал про A/B-тестирование
#trisigma | 2 713 |
| 6 | Привет, это Вит.
🔵Я уже рассказывал вам про то, что мы запустили блог на сайте Trisigma. Сегодня про две статьи оттуда, которые помогут точно ответить на вопрос: Когда останавливать A/B-тест.
Первая, а точнее первая часть про MDE (Minimum Detectable Effect). В ней про то, что такое MDE, почему без него невозможно понять, сколько на самом деле должен длиться тест, и как не тратить недели на эксперименты, которые изначально не способны дать полезный результат.
Вторая — про Монте-Карло, метод с помощью которого можно оценить возможные результаты чего угодно. В его основе — многократное симулированное моделирование исходов каких-либо событий (всё, как в рулетке, собственно оттуда и название).
Trisigma — канал про A/B-тестирование
#trisigma | 3 183 |
| 7 | Всем привет, это Искандер.
🔵И я к вам с новым обзором. Сегодня предлагаю взглянуть на пейпер Netflix «Evaluating Decision Rules Across Many Weak Experiments», как оценивать правила принятия решений по множеству слабых A/B‑тестов.
Проблема
Компания гоняет тысячи экспериментов, но правило «когда катить фичу» методологически прорабатывается без должного внимания. Катим, «если стат.значимо». Или «катим, если аплифт положительный». А сколько эта политика приносит в сумме по всему корпусу экспериментов, никто не считает.
Что предлагают авторы
Netflix взяли исторические эксперименты, на них применили правила «катим/не катим» по двум подходам (старый подход с вынесением вердикта по результатам и новый). Сложили по всем тестам вердикты (катим/не катим) и получили, сколько метрики каждое правило принесло бы суммарно. Хорошее правило катит больше реально плюсовых фич и меньше минусовых.
Загвоздка в том, что истинный эффект вы не знаете, у вас только замер с шумом. Наивный путь — взять замер сразу и как критерий отбора, и как размер выигрыша. Тогда вылезает winner's curse: тесты, которые выглядят лучшими, наполовину просто везучий шум, и суммарную отдачу вы завышаете сами себе.
Авторы чинят это через cross-validation. Данные каждого теста режут на две части. На одной половине правило решает «катить / не катить», на другой меряют, сколько north star реально набежало от этого решения. Отбор и подсчёт выигрыша идут по независимым данным, поэтому шум, из-за которого тест «выстрелил», больше не подкручивает оценку вверх. Так по всей истории получают честную суммарную отдачу каждого правила и сравнивают правила между собой.
Когда это реально нужно
Когда у вас много серых экспериментов и вы хотите настроить саму политику раскатки. На 123 исторических тестах Netflix новое правило дало +33% к накопленному north star против прежнего, и его в итоге внедрили. Выигрыш тут не в новом стат.методе, а в том, что порог принятия решения подобрали по реальной отдаче корпусу.
От себя
На мой взгляд, тут ловушка вот в чём: как только вы начинаете подбирать правило под свои данные, вы сами создаёте winner's curse уже на уровне корпуса. Методологически я бы страховался историческим holdout'ом и сравнением корпуса с ним, т.к. основной проблемой выбранного правила раскатки (не важно какого) является отсутствие перевалидации себя же. Можно, в принципе, тогда катить treatment всех серых тестов (и это возможно будет лучше по % выигрыша в north star, чем другое правило), но должен быть механизм перевалидации правил на эмпирических данных. Лучше holdout мне ничего в голову не пришло.
Trisigma — канал про A/B-тестирование
#trisigma | 3 058 |
| 8 | Привет, на связи Вит.
Давно не было рубрики «Не утверждаем — а обсуждаем».
Sequential testing убивает воспроизводимость результатов.
Согласны или нет? Почему? Ждём в комментариях 👇
Trisigma — канал про A/B-тестирование
#trisigma | 3 733 |
| 9 | Привет! На связи Вит.
Мы ищем старшего аналитика данных в Trisigma. Команда у нас одна из самых сильных на рынке. Поэтому и задачи ждут интересные:
— проводить R&D;
— проектировать дизайн продуктовых инкрементов, развивать движок Semantic Layer и документацию (подходы, best practices, статьи);
— проектировать аналитические решения для клиентов и внедрять их.
🔵Откликайтесь напрямую на карьерном сайте. И обязательно пересылайте знакомым, которым может быть интересна позиция.
Trisigma — канал про A/B-тестирование
#trisigma | 4 062 |
| 10 | Привет! Это Даня Никольский, бэкенд-инженер Trisigma.
Недавно я рассказывал, как мы в внедрили Switchback в нашу платформу. Сейчас мы вместе с коллегами написали большой гайд про такие эксперименты. Рассказали, как они устроены, почему для них не подходит обычный t-тест и какая инфраструктура нужна, чтобы проводить их в промышленном масштабе.
🔵Читайте по этой ссылке. А вопросы — оставляйте в комментариях 👇
Trisigma — канал про A/B-тестирование
#trisigma | 2 994 |
| 11 | Ребят, это Вит, и я к вам с очень крутой новостью!
🔵У нас в EXPF был блог на Medium с максимально прикладными статьями. И вот наконец-то мы перенесли материалы оттуда на сайт Trisigma. Так что встречайте и читайте Trisigma блог!
Конкретные материалы рекомендовать не буду, они все хороши. А все новые будем анонсировать тут. Так что stay tuned!
Trisigma — канал про A/B-тестирование
#trisigma | 3 354 |
| 12 | Ребят, это Вит, и я к вам с очень крутой новостью!
🔵У нас в EXPF был блог на Medium с максимально прикладными статьями. И вот наконец-то мы перенесли материалы оттуда на сайт Trisigma. Так что встречайте и читайте Trisigma блог!
Конкретные материалы рекомендовать не буду, они все хороши. А все новые будем анонсировать тут. Так что stay tuned! | 3 |
| 13 | Есть мнение, что
CUPED переоценён — в большинстве кейсов он не даёт значимого выигрыша.
Согласны? Сталкивались? Ждём в комментариях 👇
Trisigma — канал про A/B-тестирование
#trisigma | 3 670 |
| 14 | Привет! На связи Вит.
🔵Не так давно выступал на KARPOF.CONF, делюсь записью и удобным конспектом. Говорил про AI, а точнее про то, как выстроить аналитическую инфраструктуру, чтобы он был активом.
Запись есть только в ВК (смотреть можно без регистрации), а конспект — прикрепил в пдф.
Буду рад вашим кейсам с AI и в экспериментах, и в аналитике в целом. Делитесь, как используете и насколько это эффективно. | 3 481 |
| 15 | Привет! Это Вит.
🔵Ещё весной рассказали «Коммерсанту», как устроен рынок платформ для экспериментов в России. Если кратко и по интересным цифрам: половина компаний ещё не поняла, зачем им культура данных, а создание своей платформы обойдется от 150 млн руб. за три года. При этом готовое решение — от 2,5 млн в год. И да, 80% гипотез не дают значимого эффекта, но именно 10% негативных спасают бизнес от факапов.
Почему так, и в целом про экономику, VPC, on‑prem и почему все хотят не готовое решение, а консалтинг — читайте тут.
А мнения/вопросы/комментарии туда 👇
Trisigma — канал про A/B-тестирование
#trisigma | 4 071 |
| 16 | Всем привет, это Искандер.
🔵В прошлый раз я поделился с вами пейпером про подход с ARMA-Design от нескольких международных университетов. Следующий пейпер, который хочу обсудить, снова про нарушение SUTVA, но уже не во времени, а в пространстве.
Откуда проблема
Запускаете A/B на социальной сети: часть пользователей получает новый тип реакций, часть — нет. Казалось бы, всё чисто. Но контрольные пользователи видят, что их друзья из treatment что-то делают иначе. Они, в свою очередь, меняют свое поведение. ATE по итогу будет смещён, и авторы оценивают это смещение в 30%+. Очевидно перед нами сетевой эффект. Но стандартные способы с ним бороться работают плохо.
Наиболее популярных подход и его проблемы
Чаще всего используется сплиттование через Cluster randomization: назначаем воздействие кластерам пользователей, а не индивидуально. Тогда spillover-эффект внутри кластера, но не между ними. Проблема: теряется мощность за счет перехода на новый уровень рандомизации, и кластеры часто плохо соответствуют тому, как реально распространяется воздействие от A/B.
Что предлагают авторы
Двухшаговый метод, который автоматизирует задание exposure mapping.
Шаг первый: для каждого пользователя строится вектор — causal network motif. Он описывает топологию ближайшего окружения с учётом того, кто из соседей обработан. Важна не просто доля обработанных, а структура связей между ними. «4 друга, 2 обработаны, и они между собой связаны» — это другой мотив, чем «2 из 4 обработаны, но изолированы друг от друга». Плотный кластер обработанных давит на поведение иначе, чем рассеянные.
Шаг второй: эти векторы кластеризуются алгоритмом ближайших соседей. На выходе — автоматически найденные группы с разными паттернами интерференции. Целевая метрика — GATE: что было бы, если бы все получили фичу, против состояния, где никто ничего не получил. Не "насколько лучше у тех, кому показали" — а глобальный эффект с учётом spillover эффекта.
Проверка
Протестировали на синтетике и на реальном крупном тесте. По точности оценки GATE — выше cluster randomization.
Когда это нужно
Продукты с механиками социального взаимодействия с вирусным компонентом: реакции, шеринг, рекомендации «добавить в друзья». Двусторонние маркетплейсы, где обработка продавца влияет на покупателей. В общем — всё, где SUTVA нарушается через явные связи в графе, а не через время.
От себя
Практически важнее самого алгоритма — диагностика. Большинство команд вообще не проверяют, есть ли интерференция. Обычно просто говорят – «у нас есть сетевой эффект». Если граф пользователей доступен, тест на отсутствие spillover — несложная операция, которая может перевернуть интерпретацию уже прошедших экспериментов.
Если есть мысли, пишите в комментах.
Trisigma — канал про A/B-тестирование
#trisigma | 4 414 |
| 17 | Привет! Продолжаем рубрику «Не утверждаем — а обсуждаем». На повестке пятницы вот такой вопрос:
Стратифицированная рандомизация — когда помогает а когда вредит?
Что думаете? Ждём в комментариях 👇
Trisigma — канал про A/B-тестирование
#trisigma | 4 154 |
| 18 | Всем привет, это Искандер.
🔵Предлагаю вам взглянуть на новый пейпер про подход с ARMA-Design сразу от нескольких международных университетов.
Есть допущение, которое большинство A/B платформ делают молча: юниты независимы. В маркетплейсах это почти никогда не так.
Проблема
Когда тестируется алгоритм выдачи заказов в ride-tech-продуктах (например, в Uber или DoorDash), эффект не исчезает в момент назначения заказа. Водитель оказался в другом районе и он, вероятно, возьмёт или не возьмёт следующий заказ через час. Это так называемый carryover-эффект: воздействие сегодня меняет состояние системы завтра.
Стандартный switchback это частично решает, но молча предполагает, что данные «марковские». Авторы проверили это на реальных данных из двух городов и заметили, что PACF остатков дохода водителей показал значимые лаги 5-го, 6-го порядка. Иначе говорят это не марков.
Что предлагают авторы
Данные экспериментов моделируются через контролируемую VARMA-модель. AR-часть ловит carryover, MA-часть компенсирует то, что вы не наблюдаете в состоянии системы. После этого задача дизайна эксперимента формулируется как: найди последовательность назначений групп A/B, которая минимизирует дисперсию оценки ATE.
Это решается двумя способами: constrained optimization и RL. Оба смотрят на всю историю назначений, а не только на текущий период. Сравнивали с тремя базовыми дизайнами — alternating-day, uniform random, switchback.
— Alternating-day: по сути чередование между днями в гео-локе, A в понедельник, B во вторник, A в среду...
— Uniform random: в каждом периоде бросаем монетку
— Switchback с фиксированным окном
Все три показывают плохие результаты.
Когда это реально нужно
Если тестируете что-то, что меняет состояние маркетплейса — dispatch-алгоритмы, pricing, балансировку supply/demand — и эксперимент короткий при слабом сигнале (допустим, ATE 0.5–2%). Switchback не спасает, если проблема в частичной наблюдаемости.
От себя
Switchback стал стандартом для маркетплейсов, и это шаг вперёд. Но он не решает проблему, о которой говорится в пейпере, что часть состояния системы просто не записывается. Прогнать PACF на остатках ваших операционных метрик до начала дизайна эксперимента — это достаточно простая проверка, которую мало кто делает. Если увидите значимые лаги 4+, switchback с фиксированным окном уже не будет подходить для ваших A/B.
Если есть мысли, пишите в комментах.
Trisigma — канал про A/B-тестирование
#trisigma | 3 962 |
| 19 | 🔵Делимся записью вчерашнего митапа
📱 YouTube
📱 VK
Обязательно оставляйте в комментах свои вопросы. И хороших выходных!
Trisigma — канал про A/B-тестирование
#trisigma | 3 464 |
| 20 | Сегодня наш онлайн-митап про неклассические инструменты для экспериментов
Поэтому, если ещё не зарегистрировались, то самое время это исправить. После регистрации вам придёт индивидуальная ссылка на стрим.
В программе три кейса от коллег из Авито, Finom и ex. Lamoda Tech, Ozon Tech.
🔵Подробности и регистрация тут. До встречи в 18:30.
#trisigma | 3 145 |
