Trisigma — про эксперименты
Kanalga Telegram’da o‘tish
Канал про эксперименты, статистику и анализ данных Черемисинов Виталий: @vitche (сотрудничество) Мирмахмадов Искандер: @iskndr_m (гл. автор) Trisigma — https://trisigma.io A/B платформа Sigma — https://expf.ru/sigma Консалтинг — https://expf.ru
Ko'proq ko'rsatish7 252
Obunachilar
+224 soatlar
-177 kun
-4630 kun
Postlar arxiv
Привет! Это Вит.
1 октября мы проведём первый митап в Ташкенте — Trisigma to Tashkent. Это смелый и важный для нас шаг. Да и для комьюнити тех, кто делает A/B-культуру в России и СНГ, думаю, тоже.
Программу собрали на весь день. Среди спикеров — TBC и Uzum. Вот о чём будем говорить:
— Как культура экспериментов превращает продуктовую команду в data-driven, а не data-informed.
— Как выстроить аналитику так, чтобы она помогала, а не мешала бизнесу.
— Как в разных компаниях устроен процесс работы с данными, и почему в одной он работает как нужно, а в другой нет.
— Как оценить экономический эффект от внедрения A/B-культуры в бизнесе.
После дискуссии и обсуждений проведём демо Trisigma.
Буду рад видеть вас очно. Также можно подключиться из любой точки онлайн.
🔵Регистрируйтесь и отправляйте коллегам — ждём всех, кто работает с продуктом и данными.
И до встречи в Ташкенте 1 октября!
Trisigma — канал про A/B-тестирование
#trisigma
Всем привет, это Искандер
🔵 Предлагаю вам взглянуть на пейпер Amazon и Northeastern «Agent A/B: Automated and Scalable A/B Testing on Live Websites with Interactive LLM Agents». Исследование предлагает систему, которая использует LLM-агентов с разными персонажами для автоматизированного и масштабируемого A/B-тестирования веб-интерфейсов — агенты имитируют поведение реальных пользователей (поиск, клики, покупки), что позволяет обойти ограничения традиционных тестов.
Проблема Авторы сначала опросили шесть практиков из екома, которые регулярно катят тесты на аудитории от миллиона человек. Картина знакомая до боли: путь от идеи до финального решения занимает от трёх месяцев до года, трафика на всех не хватает, тесты на пересекающиеся куски интерфейса приходится ставить в очередь. В итоге до теста доезжает мало гипотез, а ранние прототипы не проверяются никак, кроме как «показали коллегам и спросили, все ли ок». Что предлагают авторы Авторы предлагают вставить перед тестом фазу симуляции. LLM генерит 100 000 персон с возрастом, доходом, профессией и привычками в покупках, из них сэмплят 1000 штук и раскидывают 500/500 на контроль и тритмент. Дальше каждый агент через Selenium ходит по живому Amazon.com: ищет, кликает товар, применяет фильтр, покупает или уходит. Страницу парсят не в скриншот и не в сырой HTML, а в урезанный JSON только с товарами, ценами и фильтрами. Сессия обрезается на 20 действиях. Под капотом Claude 3.5 Sonnet. Тестировали сокращение панели фильтров: в тритменте выбрасывали опции, у которых похожесть на поисковый запрос ниже 80%. Агенты в тритменте купили 414 раз против 403 в контроле, χ²(1)=5.51, p=0.03. Средний чек подрос с $55 до $61, но незначимо. Параллельно тот же тест крутили на 2 млн живых пользователей, и направление эффекта совпало. Когда это реально нужно Когда у вас очередь из гипотез и дефицит трафика, а решать, что катить первым, приходится на глазок. Тысяча агентов обошлась в 875 млн токенов и примерно $2900, и это заметно быстрее, чем ждать две недели набора трафика. От себя Я придерживаюсь такого мнения, что пока не наступила эпоха AGI и у агентов будет отсутствовать скилл к обобщению, то ценность от симуляционных пользователей низкая и они не заменят живой трафик даже в грубом приближении. Однако, идея использования агентов для приоритезации и чистки бэклога, замер приблизительного импакта и ускорение продуктового груминга выглядит очень даже неплохо.Trisigma — канал про A/B-тестирование #trisigma
Всем привет! На связи Вит и это пост по следам вчерашней FuckUp Night.
🔵 Вчера мы собрали друзей, и каждый из них поделился своей фейл-историей — из регулярной работы или больших профессиональных событий.
➖Беслан Курашов, сооснователь Karpov.Courses — рассказал, как его компанию продали без него. ➖Роман Нестер, Segmento (продан Сберу) и Arteus LLM — про то, как создавал стартап и продавал его Сберу. И поделился, какие сложности вообще возникают при продаже своего бизнеса корпорации. ➖Валерий Бабушкин, BP — рассказал историю из регулярной практики: как проблема прогнозирования спроса сказывается на наличии товаров на полках.Про такие провалы обычно не говорят, а, если и обсуждают, то тихо и за закрытыми дверями. А рассказывать про них важно и нужно! Именно в таких кейсах больше опыта и профессионализма, открытости и глубины. Нравится, как про это сказал Роман Нестер:
«Надоели всем истории успеха, потому что все вроде уже понимают, сколько в них вранья, натяжек, недосказанностей. А факап заставляет тебя не просто встать на тумбочку и рассказать стих, какой ты молодец, а оказаться уязвимым и от этого настоящим. Ненастоящее нам и ИИ расскажет».А как вам такой формат? Что запомнилось? Что понравилось, а что нет? Жду в комментах 👇 Trisigma — канал про A/B-тестирование #trisigma
Привет!
Сегодня встречаемся на FuckUp Night в 18:00 по Москве.
Записи не будет, поэтому ждём всех на эфире!
🔵 Главное, не забудьте зарегистрироваться.
Trisigma — канал про A/B-тестирование
#trisigma
+1
Привет! Это Вит.
Мы с Романом Нестером, Валерием Бабушкиным и Бесланам Курашовым (plevako.ai и karpov.courses) приглашаем вас на наш FuckUp Night 26 августа.
От формата отходить не будем — поделимся своими историями, где всё пошло не по плану. И поговорим про культуру ошибок: как не зацикливаться на промахах и использовать их в свою пользу.
Встречу проведём онлайн, поэтому подключиться можно из любой точки и всем, кто принимает решения на основе данных.
🔵 Важно! Записи не будет, поэтому приходите на эфир. Главное, не забудьте зарегистрироваться.
Trisigma — канал про A/B-тестирование
#trisigma
Привет! Это Вит.
Выпустили на Хабре AvitoTech короткое интервью. Короткое, потому что это — выжимка из выпуска AviTalk. Внутри для себя можно найти ответы на эти вопросы:
— если идти в свое дело, то каким может быть путь;
— можно ли делать бизнес с друзьями;
— каким может быть предпринемательский Оскар;
— практические советы тем, кто хочет свой бизнес.
Как и всегда, жду в комментариях после прочтения 👇
Trisigma — канал про A/B-тестирование
#trisigma
Всем привет, это Искандер.
🔵 Предлагаю вам взглянуть на пейпер Airbnb про interleaving.
Проблема Airbnb улучшает поиск по жилью, метрики у них конверсионные, вплоть до бронирования. Бронируют редко, куда реже, чем кликают в обычном e-commerce. Значит A/B нужно много трафика и много недель, а идей по ранжированию всегда больше, чем свободных слотов под тесты. В классических A/B физически сложно это все уместить. Что предлагают авторы Пользователей не делят на контроль и тест. Выдачу двух ранкеров смешивают и показывают одному человеку сразу, поэтому сравнение идёт внутри одного пользователя, а не между группами. Смешивают через team drafting. Т.к. пользователю мы показываем результаты обоих ранкеров, то все что делает сплиттер, это рандомизация порядковых номеров для каждого элемента в выдаче (AABABB, BABBAB и т.п.) Победителя определяют по preference margin и обычному одновыборочному t-тесту. Когда это реально нужно Когда узкое горлышко именно в A/B: много гипотез по ранжированию или рекомендациям, и при этом мало трафика или редкая конверсия. У Airbnb interleaving дал 50x ускорение, эксперимент забирает около 6% A/B-трафика и треть длительности, а с A/B сходится в 82% случаев. По сути это способ дёшево отсеять слабые идеи до полноценного теста. От себя Interleaving это не замена A/B, а предварительный фильтр для полноценного A/B. Он меряет относительное предпочтение между двумя ранкерами, а не абсолютный прирост бизнес-метрики. Разработка и интеграция tdi достаточно дорогостоящее занятие, поэтому к этой практике имеет смысл переходить только тогда, когда количество АБ над ранжированием достаточно емкое.Trisigma — канал про A/B-тестирование #trisigma
Привет, это Вит.
🔵Я уже рассказывал вам про то, что мы запустили блог на сайте Trisigma. Сегодня про две статьи оттуда, которые помогут точно ответить на вопрос: Когда останавливать A/B-тест.
Первая, а точнее первая часть про MDE (Minimum Detectable Effect). В ней про то, что такое MDE, почему без него невозможно понять, сколько на самом деле должен длиться тест, и как не тратить недели на эксперименты, которые изначально не способны дать полезный результат.
Вторая — про Монте-Карло, метод с помощью которого можно оценить возможные результаты чего угодно. В его основе — многократное симулированное моделирование исходов каких-либо событий (всё, как в рулетке, собственно оттуда и название).
Trisigma — канал про A/B-тестирование
#trisigma
Всем привет, это Искандер.
🔵И я к вам с новым обзором. Сегодня предлагаю взглянуть на пейпер Netflix «Evaluating Decision Rules Across Many Weak Experiments», как оценивать правила принятия решений по множеству слабых A/B‑тестов.
Проблема Компания гоняет тысячи экспериментов, но правило «когда катить фичу» методологически прорабатывается без должного внимания. Катим, «если стат.значимо». Или «катим, если аплифт положительный». А сколько эта политика приносит в сумме по всему корпусу экспериментов, никто не считает. Что предлагают авторы Netflix взяли исторические эксперименты, на них применили правила «катим/не катим» по двум подходам (старый подход с вынесением вердикта по результатам и новый). Сложили по всем тестам вердикты (катим/не катим) и получили, сколько метрики каждое правило принесло бы суммарно. Хорошее правило катит больше реально плюсовых фич и меньше минусовых. Загвоздка в том, что истинный эффект вы не знаете, у вас только замер с шумом. Наивный путь — взять замер сразу и как критерий отбора, и как размер выигрыша. Тогда вылезает winner's curse: тесты, которые выглядят лучшими, наполовину просто везучий шум, и суммарную отдачу вы завышаете сами себе. Авторы чинят это через cross-validation. Данные каждого теста режут на две части. На одной половине правило решает «катить / не катить», на другой меряют, сколько north star реально набежало от этого решения. Отбор и подсчёт выигрыша идут по независимым данным, поэтому шум, из-за которого тест «выстрелил», больше не подкручивает оценку вверх. Так по всей истории получают честную суммарную отдачу каждого правила и сравнивают правила между собой. Когда это реально нужно Когда у вас много серых экспериментов и вы хотите настроить саму политику раскатки. На 123 исторических тестах Netflix новое правило дало +33% к накопленному north star против прежнего, и его в итоге внедрили. Выигрыш тут не в новом стат.методе, а в том, что порог принятия решения подобрали по реальной отдаче корпусу. От себя На мой взгляд, тут ловушка вот в чём: как только вы начинаете подбирать правило под свои данные, вы сами создаёте winner's curse уже на уровне корпуса. Методологически я бы страховался историческим holdout'ом и сравнением корпуса с ним, т.к. основной проблемой выбранного правила раскатки (не важно какого) является отсутствие перевалидации себя же. Можно, в принципе, тогда катить treatment всех серых тестов (и это возможно будет лучше по % выигрыша в north star, чем другое правило), но должен быть механизм перевалидации правил на эмпирических данных. Лучше holdout мне ничего в голову не пришло.Trisigma — канал про A/B-тестирование #trisigma
Привет, на связи Вит.
Давно не было рубрики «Не утверждаем — а обсуждаем».
Sequential testing убивает воспроизводимость результатов.
Согласны или нет? Почему? Ждём в комментариях 👇
Trisigma — канал про A/B-тестирование
#trisigma
Привет! На связи Вит.
Мы ищем старшего аналитика данных в Trisigma. Команда у нас одна из самых сильных на рынке. Поэтому и задачи ждут интересные:
— проводить R&D; — проектировать дизайн продуктовых инкрементов, развивать движок Semantic Layer и документацию (подходы, best practices, статьи); — проектировать аналитические решения для клиентов и внедрять их.🔵Откликайтесь напрямую на карьерном сайте. И обязательно пересылайте знакомым, которым может быть интересна позиция. Trisigma — канал про A/B-тестирование #trisigma
Привет! Это Даня Никольский, бэкенд-инженер Trisigma.
Недавно я рассказывал, как мы в внедрили Switchback в нашу платформу. Сейчас мы вместе с коллегами написали большой гайд про такие эксперименты. Рассказали, как они устроены, почему для них не подходит обычный t-тест и какая инфраструктура нужна, чтобы проводить их в промышленном масштабе.
🔵Читайте по этой ссылке. А вопросы — оставляйте в комментариях 👇
Trisigma — канал про A/B-тестирование
#trisigma
Ребят, это Вит, и я к вам с очень крутой новостью!
🔵У нас в EXPF был блог на Medium с максимально прикладными статьями. И вот наконец-то мы перенесли материалы оттуда на сайт Trisigma. Так что встречайте и читайте Trisigma блог!
Конкретные материалы рекомендовать не буду, они все хороши. А все новые будем анонсировать тут. Так что stay tuned!
Trisigma — канал про A/B-тестирование
#trisigma
Ребят, это Вит, и я к вам с очень крутой новостью!
🔵У нас в EXPF был блог на Medium с максимально прикладными статьями. И вот наконец-то мы перенесли материалы оттуда на сайт Trisigma. Так что встречайте и читайте Trisigma блог!
Конкретные материалы рекомендовать не буду, они все хороши. А все новые будем анонсировать тут. Так что stay tuned!
Есть мнение, что
CUPED переоценён — в большинстве кейсов он не даёт значимого выигрыша.
Согласны? Сталкивались? Ждём в комментариях 👇
Trisigma — канал про A/B-тестирование
#trisigma
Привет! На связи Вит.
🔵Не так давно выступал на KARPOF.CONF, делюсь записью и удобным конспектом. Говорил про AI, а точнее про то, как выстроить аналитическую инфраструктуру, чтобы он был активом.
Запись есть только в ВК (смотреть можно без регистрации), а конспект — прикрепил в пдф.
Буду рад вашим кейсам с AI и в экспериментах, и в аналитике в целом. Делитесь, как используете и насколько это эффективно.
Привет! Это Вит.
🔵Ещё весной рассказали «Коммерсанту», как устроен рынок платформ для экспериментов в России. Если кратко и по интересным цифрам: половина компаний ещё не поняла, зачем им культура данных, а создание своей платформы обойдется от 150 млн руб. за три года. При этом готовое решение — от 2,5 млн в год. И да, 80% гипотез не дают значимого эффекта, но именно 10% негативных спасают бизнес от факапов.
Почему так, и в целом про экономику, VPC, on‑prem и почему все хотят не готовое решение, а консалтинг — читайте тут.
А мнения/вопросы/комментарии туда 👇
Trisigma — канал про A/B-тестирование
#trisigma
Всем привет, это Искандер.
🔵В прошлый раз я поделился с вами пейпером про подход с ARMA-Design от нескольких международных университетов. Следующий пейпер, который хочу обсудить, снова про нарушение SUTVA, но уже не во времени, а в пространстве.
Откуда проблема Запускаете A/B на социальной сети: часть пользователей получает новый тип реакций, часть — нет. Казалось бы, всё чисто. Но контрольные пользователи видят, что их друзья из treatment что-то делают иначе. Они, в свою очередь, меняют свое поведение. ATE по итогу будет смещён, и авторы оценивают это смещение в 30%+. Очевидно перед нами сетевой эффект. Но стандартные способы с ним бороться работают плохо. Наиболее популярных подход и его проблемы Чаще всего используется сплиттование через Cluster randomization: назначаем воздействие кластерам пользователей, а не индивидуально. Тогда spillover-эффект внутри кластера, но не между ними. Проблема: теряется мощность за счет перехода на новый уровень рандомизации, и кластеры часто плохо соответствуют тому, как реально распространяется воздействие от A/B. Что предлагают авторы Двухшаговый метод, который автоматизирует задание exposure mapping. Шаг первый: для каждого пользователя строится вектор — causal network motif. Он описывает топологию ближайшего окружения с учётом того, кто из соседей обработан. Важна не просто доля обработанных, а структура связей между ними. «4 друга, 2 обработаны, и они между собой связаны» — это другой мотив, чем «2 из 4 обработаны, но изолированы друг от друга». Плотный кластер обработанных давит на поведение иначе, чем рассеянные. Шаг второй: эти векторы кластеризуются алгоритмом ближайших соседей. На выходе — автоматически найденные группы с разными паттернами интерференции. Целевая метрика — GATE: что было бы, если бы все получили фичу, против состояния, где никто ничего не получил. Не "насколько лучше у тех, кому показали" — а глобальный эффект с учётом spillover эффекта. Проверка Протестировали на синтетике и на реальном крупном тесте. По точности оценки GATE — выше cluster randomization. Когда это нужно Продукты с механиками социального взаимодействия с вирусным компонентом: реакции, шеринг, рекомендации «добавить в друзья». Двусторонние маркетплейсы, где обработка продавца влияет на покупателей. В общем — всё, где SUTVA нарушается через явные связи в графе, а не через время. От себя Практически важнее самого алгоритма — диагностика. Большинство команд вообще не проверяют, есть ли интерференция. Обычно просто говорят – «у нас есть сетевой эффект». Если граф пользователей доступен, тест на отсутствие spillover — несложная операция, которая может перевернуть интерпретацию уже прошедших экспериментов.Если есть мысли, пишите в комментах. Trisigma — канал про A/B-тестирование #trisigma
Привет! Продолжаем рубрику «Не утверждаем — а обсуждаем». На повестке пятницы вот такой вопрос:
Стратифицированная рандомизация — когда помогает а когда вредит?
Что думаете? Ждём в комментариях 👇
Trisigma — канал про A/B-тестирование
#trisigma
Всем привет, это Искандер.
🔵Предлагаю вам взглянуть на новый пейпер про подход с ARMA-Design сразу от нескольких международных университетов.
Есть допущение, которое большинство A/B платформ делают молча: юниты независимы. В маркетплейсах это почти никогда не так.
Проблема Когда тестируется алгоритм выдачи заказов в ride-tech-продуктах (например, в Uber или DoorDash), эффект не исчезает в момент назначения заказа. Водитель оказался в другом районе и он, вероятно, возьмёт или не возьмёт следующий заказ через час. Это так называемый carryover-эффект: воздействие сегодня меняет состояние системы завтра. Стандартный switchback это частично решает, но молча предполагает, что данные «марковские». Авторы проверили это на реальных данных из двух городов и заметили, что PACF остатков дохода водителей показал значимые лаги 5-го, 6-го порядка. Иначе говорят это не марков. Что предлагают авторы Данные экспериментов моделируются через контролируемую VARMA-модель. AR-часть ловит carryover, MA-часть компенсирует то, что вы не наблюдаете в состоянии системы. После этого задача дизайна эксперимента формулируется как: найди последовательность назначений групп A/B, которая минимизирует дисперсию оценки ATE. Это решается двумя способами: constrained optimization и RL. Оба смотрят на всю историю назначений, а не только на текущий период. Сравнивали с тремя базовыми дизайнами — alternating-day, uniform random, switchback. — Alternating-day: по сути чередование между днями в гео-локе, A в понедельник, B во вторник, A в среду... — Uniform random: в каждом периоде бросаем монетку — Switchback с фиксированным окном Все три показывают плохие результаты. Когда это реально нужно Если тестируете что-то, что меняет состояние маркетплейса — dispatch-алгоритмы, pricing, балансировку supply/demand — и эксперимент короткий при слабом сигнале (допустим, ATE 0.5–2%). Switchback не спасает, если проблема в частичной наблюдаемости. От себя Switchback стал стандартом для маркетплейсов, и это шаг вперёд. Но он не решает проблему, о которой говорится в пейпере, что часть состояния системы просто не записывается. Прогнать PACF на остатках ваших операционных метрик до начала дизайна эксперимента — это достаточно простая проверка, которую мало кто делает. Если увидите значимые лаги 4+, switchback с фиксированным окном уже не будет подходить для ваших A/B.Если есть мысли, пишите в комментах. Trisigma — канал про A/B-тестирование #trisigma
