en
Feedback
Статистика с Марией

Статистика с Марией

Open in Telegram

Канал для тех, кто когда-то учил статистику в универе, но ничего не понял. Для связи @mchernigovskaya

Show more
Russia907 723The category is not specified
236
Subscribers
No data24 hours
No data7 days
No data30 days
Posts Archive
Когда я смотрю на данные, я иногда сомневаюсь в своих действиях. Мне кажется, что придут настоящие большие статистики (например, ревьюеры статьи) и скажут, что все нужно было делать иначе 🫠 В такие моменты я стараюсь вспоминать публикацию “Many Analysts, One Data Set: Making Transparent How Variations in Analytic Choices Affect Results”. Вкратце, один и тот же датасет раздали 29 командам статистиков и спросили у них, правда ли футбольные судьи чаще дают красные карточки людям с темным цветом кожи. Результаты оказались диаметрально противоположными: одни команды нашли статистическую связь с цветом кожи, другие — не нашли никакой связи. Стоит отметить, что все команды смотрели на данные честно, и разница в результатах, скорее всего, объясняется разными субъективными решениями, которые они принимали в процессе работы Получается, нет единственного ✨идеального✨ способа проанализировать ваши данные. Именно поэтому так важно честно и подробно описывать, как именно вы анализировали данные, какие предположения или допущения вы делали в процессе и, в идеале, выкладывать свой код

🏋️‍♀️📊
Anonymous voting

Статистика в тренажерном зале 🏋️‍♀️ Возможно, вы замечали, что люди выбирают веса на тренажерах особым образом. По затертост
Статистика в тренажерном зале 🏋️‍♀️ Возможно, вы замечали, что люди выбирают веса на тренажерах особым образом. По затертостям видно, что средние веса используются чаще, чем самые легкие и самые тяжелые. Если представить выбор веса как случайную величину, то закон по которому человек выбирает вес, будет называться распределение случайной величины. А как вам кажется, какое распределение описывает выбор весов в тренажере?

В прошлом посте я пересказала основные моменты из отчета Королевского статистического общества о врачах-убийцах. Теперь поговорим о том, какие претензии у статистиков к делу Люси Летби 1. Отсутствие статистического анализа Повторюсь, “из графика/таблицы очевидно, что…” не является статистическим анализом! 2. Субъективный выбор подозрительных смертей Обвинение основывается на 24 подозрительных случаев, и только Люси дежурила во все эти разы. Однако, к выбору именно этих 24 случаев есть вопросы. Во-первых, в одном случае, график показывает что Люси дежурила ночью, хотя на хотя на самом деле она работала днем. Во-вторых, профессор права Эдинбургского университета Буркхард Шафер Шафера считает, что диаграмма должна была охватывать более длительный период времени и включать все смерти. В-третьих, эксперт обвинения Дьюи Эванс указал на еще 25 потенциально подозрительных случаев, которые были проигнорированы. В общем, складывается ощущение, что данные подгонялись под вывод “Люси виновна”, а не вывод был сделан на основе всех имеющихся данных. Такой подход в статистике называется cherry picking или ошибка меткого стрелка 3. Игнорирование скрытых факторов Люси была опытной медсестрой, которая часто работала с более тяжелыми пациентами, что могло повлиять на увеличение смертности. Также высокая детская смертность могла быть связана с плохими условиями в больнице: переработками персонала, усталостью, нехваткой сотрудников, недостатком финансирования и другими систематическими проблемами NHS. Все эти обстоятельства были проигнорированы судом Вместо заключения Мы не знаем, виновна ли Люси Летби в убийствах новорожденных. Однако на основе сомнительного "статистического анализа" она была приговорена к пожизненному заключению без права на досрочное освобождение. Приговор обжалован, и Люси ожидает решения апелляционного суда. Надеюсь, когда-нибудь я напишу последнюю часть этого поста, в которой расскажу, как статистики собрали полные данные, учли скрытые факторы и непредвзято показали, является ли дело Люси Летби статистической случайностью или нет

Продолжение истории Люси Летби: Что статистики думают о врачах-убийцах Начало истории здесь Конечно, дело Люси Летби не первое дело о врачах-убийцах. За месяц до начала процесса, Королевское статистическое общество выпустило отчет, в котором рассматриваются два случая, когда медсестер ошибочно обвинили в убийстве пациентов на основе “статистического анализа” графика их дежурств. Также в этом отчете статистики обсуждают частые ошибки, допускаемые при использовании статистики в судебных делах, и дают рекомендации, как их избежать. Отчет небольшой, написан очень понятным языком, и я горячо рекомендую прочитать его всем, кто занимается здравоохранением (студенты PHS, привет!). Вот несколько основных проблем, которые отметило Королевское статистическое общество: 1. Непонимание случайности Даже очень редкие события с кем-то случаются. Например, пара из Калифорнии однажды выиграла две лотереи в один день, хотя вероятность такого случайного события 1 на 23 000 000 000 000. В случае с лотереями нам это не кажется невозможным, потому что миллионы людей играют в лотереи каждый день, а значит, кто-то может случайно выиграть. Но с врачами эта интуиция почему-то не работает. Если у врача умирает необычно много пациентов, мы думаем, что именно с этим врачом что-то не так. Хотя в мире есть миллионы врачей, которые тоже “играют в лотерею” каждый день, и кому-то из них может случайно не повезти. 2. Корреляция не показывает причинно-следственные связи Ретроспективно можно показать что во время дежурств человека Х смертность была значимо выше. Однако сама по себе высокая смертность не доказывает, что человек Х убийца. Это происходит из-за так называемых скрытых факторов (confounding factors), которые связаны с временем дежурства и с повышенной смертностью. Например, люди чаще умирают утром, а значит врачи, работающие по утрам, могут быть ассоциированы с более высокой смертностью. Более опытные врачи работают с более тяжелыми пациентами, у которых выше вероятность умереть. Увеличение смертей может быть даже связано с заменой поставщика медицинского оборудования. Отследить и учесть все такие скрытые факторы очень сложно. 3. Предвзятость подтверждения (confirmation bias) и другие предвзятости Наш мозг так устроен, что он выдает желаемое за действительно и не замечает факты, которые противоречат нашей теории. В делах о врачах-убийцах часто рассматриваются только “подозрительные смерти”. Однако решение о том, какая смерть подозрительная, принимает судебный патологоанатом. В одном исследовании было показано, что судебный патологоанатом чаще считает гипотетическую смерть подозрительной, если ему сказать что это черный ребенок находившийся с отчимом, чем если это белый ребенок находившийся с бабушкой. Дополнительная информация и контекст могут влиять на "независимое" решение эксперта. 4. Ошибки в анализе данных Если от статистического анализа зависит судьба человека, его нужно делать тщательно. В отчете приводится пример дела Люсии де Берк, в котором криминалист подсчитал, что вероятность того, что смерти были случайными, составляет 1 из 342 000 000. Когда статистики пересмотрели данные, они обнаружили ошибку: были перемножены три p-value, которые нельзя перемножать. При повторном анализе тех же данных шансы составили 1 из 50. 🤷‍♀️

👀 Сегодня расскажу вам о канале Человек наук, который ведет Вова Шитов, PhD-студент по вычислительной биологии в Helmholtz Munich. Вова делится красотой науки и окружающего мира и рассказывает про математику, биологию, статистику и многое другое На канале Вовы вы узнаете: - Как еще можно лгать с помощью статистики - Как найти числа Фибоначчи в растениях - Чем занимается молекулярная биология А для ученых и студентов может быть полезно исследование Вовы о том, как лучше писать письма для стажировок или PhD-программ В общем, канал — супер, Вова — супер. Подписывайтесь! Это партнерский пост

Я сейчас на конференции в Порту, слушаю про любимую вычислительную иммунологию. Сегодня была постерная сессия, и я принесла в
+2
Я сейчас на конференции в Порту, слушаю про любимую вычислительную иммунологию. Сегодня была постерная сессия, и я принесла вам еще несколько примеров не очень хороших графиков 👹 (1) Stacked barplot, в котором слишком много групп и цветов (2) Почти одинаковые пайчарты, которые почти невозможно сравнить между собой на глаз (3) Наши любимые боксплоты по 4 точкам. Особенно хорош сплющенный боксплот, построенный на четырёх нулевых значениях

Пока я пару дней не открывала статью, мой соавтор успел нарисовать в нее боксплотов по четырем точкам 🫠🫠🫠 На всякий случай
Пока я пару дней не открывала статью, мой соавтор успел нарисовать в нее боксплотов по четырем точкам 🫠🫠🫠 На всякий случай напомню, что не имеет смысла рисовать боксплот, если у вас меньше 5 наблюдений в данных (потому что боксплот описывает данные с помощью 5 значений). Вместо боксплота в этом случае можно просто нарисовать эти точки Подробно про боксплоты рассказывала тут https://telegra.ph/Boksploty-05-06

Та самая таблица
Та самая таблица

Возможно, вы слышали, что год назад суд в Великобритании приговорил медсестру Люси Летби к пожизненному заключению. Присяжные признали её виновной в убийстве семи младенцев и покушении на жизнь ещё шести младенцев в 2015-2016 годах. Спустя год вышло журналистское расследование, в котором эта страшная история раскрывается с неожиданной стороны. Что, если Люси Летби не серийная убийца и "ангел смерти", а пострадавшая от обвинения, основанного на некачественном анализе данных? Я не буду пересказывать детали судебного дела (его можно прочитать тут или тут), но хотела бы остановиться на статистической части происходящего. Обвинение Люси Летби было почти полностью построено на "анализе" таблицы, в которой были перечислены 24 подозрительных случая ухудшения состояния детей и график дежурств 38 медсестёр. Оказалось, что только Люси дежурила все 24 раза из 24. Из этой таблицы всем, включая присяжных, стало очевидно, что таких совпадений не бывает, и Люси — убийца. Как сказал один из обвинителей, "If you look at the table overall, the picture is, we suggest, self-evidently obvious." Вот и всё, вот и весь статистический анализ 🤡 Чем больше я думаю про этот случай, тем больше хочется воскликнуть: "А что, так можно было?!" Для сравнения, нельзя опубликовать научную статью без какого-либо анализа данных, просто сославшись на то, что вам всё очевидно. А чтобы опубликовать статью в приличном журнале, недостаточно просто проанализировать данные, необходимо дополнительно провалидировать получившийся результат. То есть показать другими (например, биологическими) методами, что результат вашего анализа не является случайностью или ошибкой. В следующем посте расскажу, какие ещё вопросы есть у статистиков к делу Люси Летби и к подобным делам о серийных врачах-убийцах.

Совет/мем дня: не забывайте подписывать оси на графиках! 👹
Совет/мем дня: не забывайте подписывать оси на графиках! 👹

Бонус: вот так выглядит мой ящик с усами 🥰
+1
Бонус: вот так выглядит мой ящик с усами 🥰

Ящики с усами 📦🐈 В новом конспекте разбираемся с определением боксплота, кто его придумал, и как же правильно рисовать усы https://telegra.ph/Boksploty-05-06

Как рисуют усы в ящике с усами (он же box plot, он же box and whisker plot)?
Anonymous voting

Квиз! Можно выбрать несколько вариантов ответа
Квиз! Можно выбрать несколько вариантов ответа

Парадокс дней рождения 🎂🤯 Скорее всего, в вашем классе была пара человек, которые отмечали день рождения в один день. Более того, теория вероятностей утверждает, что если в классе было хотя бы 23 человека, то вероятность совпадения двух ДР была более 50%. Этот факт называется парадоксом дней рождения. На первый взгляд, парадокс дней рождения может показаться удивительным. Интуиция (ошибочно) подсказывает нам, что если мы хотим, чтобы два человека родились в один день с вероятностью 50%, то и людей в такой группе должно быть 50% от всех возможных дней в году, то есть хотя бы 365/2 = 183 человека. В чем же обман? Обмана нет, парадокс дней рождения называется парадоксом только потому, что кажется нам контринтуитивным. Фактически нас интересуют совпадение ДР у любых двух человек. То есть, нужно сравнить все возможные пары, и в каждой паре должны быть разные ДР. А количество всевозможных пар в группе очень быстро растет, в этом и кроется разгадка парадокса. Есть формула, которая позволяет рассчитать, количество уникальных пар в группе из N человек: 0.5 * N * (N-1). То есть, 2 человека составляют всего 1 пару, 10 человек — 45 пар, 20 человек — 190 пар, и так далее. Получается, что всего лишь 23 человека образуют 253 уникальные пары, и именно такое большое количество пар делает вероятность совпадения дней рождения 50.73%. Кстати, в группе из 57 человек (1596 пары) вероятность совпадения будет уже 99%. Парадокс дней рождения это не только забавный факт, который можно рассказать на вечеринке. На основе этого парадокса существует метод взлома шифров, который в криптографии называется атака «дней рождения». C помощью парадокса, ученые создали модель, которая рассчитывала риски заразиться COVID-19 в публичных местах. Также парадокс дней рождения внезапно появляется в криминалистике. Оказывается, случайные совпадения могут происходить и при идентификации личности по ДНК.

Привет! Давно не писала в канал. За время своего «отпуска» я дописала диссер, переехала в Стокгольм, начала работать в Karolinska Institute, завела кошку и даже начала петь в хоре. Сегодня по пути на работу я как обычно слушала подкасты. Внезапно в одном из них услышала рекламу того самого подкаста по статистике, в котором приняла участие зимой. Подкаст называется «Нормальное распределение» и вышел на МТС строках (это бесплатно). Говорят, что через некоторое время подкаст выйдет на всех остальных платформах. Если что, я в третьем эпизоде, но советую послушать подкаст целиком. Там всего 6 эпизодов и каждый — базовая база. Вот ссылка на эпизод со мной https://stroki.mts.ru/podcast/episode/margarin-razvody-i-nikolas-keydzh-ili-korrelyatsiya-nekorreliruyemogo-240021 PS К сожалению, в последнее время в мире все чаще происходят чудовищные события, из-за которых все остальное, в том числе наука и образование, порой кажется неуместным и бессмысленным. Хочется верить, что это скоро закончится. Обнимаю 🖤

Сегодня хочу поделиться рекомендацией интерактивного учебника по теорверу и статистике https://seeing-theory.brown.edu/ Если вам проще один раз посмотреть на картинку, чем десять раз прочитать формулу, то вам должно понравиться 😏️️️️️️ В учебнике пока всего 6 глав, но они постепенно дополняются. В каждой главе небольшой кусок теории и интерактивная часть, в которой можно что-то покрутить-повертеть и посмотреть, что изменится На мой вкус, это лучший ресурс, чтобы понять центральную предельную теорему (глава Probability Distributions) и доверительные интервалы (глава Frequentist Inference). Но остальные части тоже хорошие Советую открывать в десктопной версии, с телефона не так красиво и удобно!

С наступающим!🎄✨ Как говорила моя преподавательница, желаю, чтобы каждый аутлаер нашёл свое распределение 😬 Спасибо, дорогие подписчики, что читаете мой канал! Если у меня получилось помочь хотя бы одному из вас, то все было не зря 🩵 Я буду стараться писать больше постов в новом году (обещаю пост про p-value и про тесты!!) Если хочется, чтобы я рассказала про какую-то конкретную тему, напишите, пожалуйста, в комментариях. А я постараюсь начать в новом году именно с этих тем 👩‍💻

Пока готовилась к подкасту, вспомнила свой любимый мем про причинно-следственные связи 🙈
Пока готовилась к подкасту, вспомнила свой любимый мем про причинно-следственные связи 🙈