MedData Lab
رفتن به کانال در Telegram
О работе с данными в медицинских и биомедицинских исследованиях. Анализ, интерпретация, ограничения, аналитические решения. R • Python • научная практика Автор канала @phlenyxa Курс по анализу данных в R ↓ meddatalab.ru
نمایش بیشترکشور مشخص نشده استدسته بندی مشخص نشده است
383
مشترکین
+224 ساعت
+177 روز
+6330 روز
آرشیو پست ها
383
Хорошие новости ⚡️⚡️⚡️
Мой научный проект получил поддержку Российского научного фонда!
Это значит, что впереди — несколько лет интересной исследовательской работы: новые эксперименты, анализ данных, поиски ответов (и, наверняка, новые вопросы😁).
Постараюсь время от времени рассказывать здесь не только о результатах, но и о том, как рождаются научные идеи, как устроена работа над проектом и что обычно остается «за кадром» научных публикаций.
Впереди много интересного!!
Поехали! 🚀
383
Главная проблема ИИ — не ошибки. А убедительность.
Когда речь заходит об ИИ, я всё чаще замечаю две крайности.
Одни уверены, что он скоро заменит исследователей.
Другие считают, что доверять ему нельзя вовсе.
Мне кажется, обе позиции слишком упрощают ситуацию.
ИИ — это инструмент. Он не делает науку вместо человека. Он делает быстрее то, что человек способен критически оценить.
В своей работе я использую его для поиска литературы, отладки кода, обсуждения идей, подготовки черновиков и редактирования текстов. Это действительно экономит время.
Но есть вещи, которые я не готова делегировать.
Постановку научного вопроса. Выбор методов. Интерпретацию результатов. Именно здесь нужна экспертиза, понимание контекста и способность заметить, когда красивая формулировка не соответствует данным.
И, пожалуй, главная проблема ИИ — не то, что он ошибается. Ошибки неизбежны. Гораздо опаснее то, что убедительно сформулированный ответ легко принять за правильный, особенно если не хватает собственных знаний, чтобы его проверить.
Есть ещё одна особенность. Качество ответа зависит не только от того, насколько хорошо сформулирован запрос. Оно зависит и от того, насколько хорошо вы сами понимаете предмет.
Если знаний недостаточно, ИИ становится источником очень правдоподобных ошибок.
Если же вы хорошо разбираетесь в теме, он превращается в собеседника, который помогает посмотреть на задачу с другой стороны, проверить логику, найти слабые места в аргументации или подобрать более точную формулировку.
Поэтому главный вопрос для меня не «может ли ИИ помочь исследователю?».
Главный вопрос — достаточно ли вы понимаете предмет, чтобы спорить с ним, а не просто соглашаться.
383
Разбор голосовалки
Большинство участников выбрали правильный ответ: если реальный эффект окажется меньше, чем показало пилотное исследование, основное исследование действительно может оказаться недостаточно мощным.
Почему так происходит?
«Пилот был статистически значим — значит, эффект подтвердится»
Не совсем.
Статистическая значимость в небольшом пилотном исследовании не гарантирует, что эффект воспроизведётся в более крупной работе.
В небольших исследованиях величина эффекта оценивается менее точно.
Если исследование всё же получает статистически значимый результат, наблюдаемый эффект нередко оказывается завышенным просто из-за случайных колебаний данных.
«Чем больше эффект в пилоте, тем меньше риск ошибки при расчёте выборки»
На первый взгляд это кажется логичным, но на практике часто происходит наоборот.
Если использовать завышенную оценку эффекта для расчёта размера выборки, основное исследование будет рассчитано на слишком "оптимистичный" сценарий.
Если реальный эффект окажется меньше, выборки может просто не хватить, чтобы его обнаружить.
Что происходит на практике
Представьте, что пилотное исследование показало снижение риска на 50%, а истинный эффект составляет 15–20%.
Если рассчитать размер выборки, исходя из 50%, исследование получится слишком маленьким. В результате оно может не достичь статистической значимости — не потому, что препарат не работает, а потому, что мощности оказалось недостаточно.
Именно поэтому результаты небольших пилотных исследований интерпретируют очень осторожно. Их основная задача — проверить реализуемость исследования и получить предварительную оценку эффекта, но не определить его точную величину.
383
Немного выпала из привычного ритма канала.
Последние несколько дней провела на Петербургском международном онкологическом форуме.
Получилось очень насыщенно: постеры, доклады, много интересных обсуждений и, конечно, новые идеи для исследований.
Уже возвращаюсь домой, а в понедельник наконец разберём голосовалку. На самом деле в ней есть один очень важный момент, который часто становится причиной ошибок при планировании исследований!
383
Winner's curse: почему маленькое исследование со «значимым» результатом — не повод расслабляться
В прошлом посте мы говорили о том, что небольшое исследование может не обнаружить реальный эффект из-за низкой статистической мощности.
Но есть и обратная ситуация, о которой вспоминают гораздо реже.
А что, если небольшое исследование всё-таки получило статистически значимый результат?
Кажется, что это хорошая новость.
На самом деле — не всегда.
Если исследование имеет низкую статистическую мощность, то большинство его возможных повторений не достигнут статистической значимости. Лишь небольшая часть окажется «успешной». И успешными становятся, как правило, те выборки, в которых случайные колебания увеличили наблюдаемый эффект по сравнению с его истинным значением.
В результате опубликованная оценка эффекта оказывается систематически завышенной.
Этот феномен получил название winner's curse («проклятие победителя»).
Важно понимать: это не ошибка исследователей и не следствие плохого дизайна исследования.
Даже при идеально проведенной работе случайная вариабельность может привести к тому, что единственный статистически значимый результат окажется переоценкой истинного эффекта.
И чем ниже статистическая мощность, тем сильнее обычно выражена эта переоценка.
Именно поэтому к ярким результатам небольших исследований стоит относиться с осторожностью.
Если небольшое исследование сообщает о впечатляющем эффекте, не стоит сразу воспринимать его как окончательную истину.
Такой результат — не столько повод праздновать открытие, сколько повод ждать независимого воспроизведения в более крупных исследованиях.
Именно поэтому первые публикации нередко сообщают о более впечатляющих эффектах, чем последующие крупные исследования. Это не обязательно означает, что первоначальная работа была ошибочной — чаще всего так проявляются особенности статистики при исследованиях с низкой статистической мощностью.
Источник
Button KS, Ioannidis JPA, Mokrysz C, et al. Power failure: why small sample size undermines the reliability of neuroscience. Nature Reviews Neuroscience. 2013;14:365–376.
383
Почему «не нашли различий» — не всегда означает, что их нет
В исследованиях часто можно встретить вывод:
«Статистически значимых различий между группами не выявлено».На первый взгляд кажется, что всё просто: если различий нет, значит и эффекта нет. Но это не всегда так. Возможно, исследование просто не обладало достаточной мощностью, чтобы обнаружить существующий эффект. Вероятность обнаружить эффект, если он действительно существует, называют мощностью исследования (statistical power). Обычно исследователи стремятся к мощности не менее 80%. От чего она зависит? Прежде всего — от размера выборки. Но не только. На необходимое число участников также влияют ожидаемый размер эффекта, вариабельность данных и выбранный уровень статистической значимости. Например, если ожидаемый эффект небольшой, для его обнаружения потребуется больше участников. Если данные сильно различаются между собой — тоже. Именно поэтому расчет размера выборки выполняют до начала исследования. Если участников окажется слишком мало, исследование может не выявить реальный эффект — не потому, что его нет, а потому, что данных оказалось недостаточно. Поэтому отсутствие статистически значимого результата — это далеко не всегда доказательство отсутствия эффекта. Иногда это лишь означает, что исследование не смогло этот эффект обнаружить. Именно поэтому при чтении статьи важно обращать внимание не только на p-значение, но и на то, как был рассчитан размер выборки и обладало ли исследование достаточной мощностью.
383
Healthy user bias: почему наблюдательные исследования ошиблись
В течение многих лет результаты наблюдательных исследований выглядели очень убедительно: женщины, принимающие заместительную гормональную терапию (ЗГТ), реже сталкивались с сердечно-сосудистыми заболеваниями.
Казалось, что ЗГТ оказывает кардиопротективный эффект.
Однако в 2002 году были опубликованы результаты одного из крупнейших рандомизированных клинических исследований — Women's Health Initiative (WHI). Они не подтвердили ожидаемого защитного действия ЗГТ и показали повышение риска некоторых сердечно-сосудистых осложнений.
Как такое могло произойти?
Одним из наиболее обсуждаемых объяснений расхождения результатов наблюдательных исследований и RCT является healthy user bias («смещение здорового пользователя»).
Женщины, которые выбирали ЗГТ, изначально отличались от тех, кто её не принимал. В среднем они чаще занимались физической активностью, внимательнее относились к питанию, регулярно проходили профилактические обследования и в целом больше заботились о своём здоровье.
Все эти особенности сами по себе связаны с более низким риском сердечно-сосудистых заболеваний.
Можно ли решить эту проблему с помощью регрессионной модели?
Лишь частично.
Если физическая активность, курение или индекс массы тела измерены, их можно включить в анализ. Но полностью описать и количественно оценить «здоровое поведение» практически невозможно.
Всегда остаются неизмеренные или грубо измеренные факторы.
Поэтому даже самая аккуратная статистическая корректировка не гарантирует, что влияние всех смешивающих факторов устранено.
Именно поэтому одна из важных идей клинической эпидемиологии звучит так:
Регрессия позволяет учитывать измеренные конфаундеры, но не устраняет неизмеренный конфаундинг.Источники Rossouw JE, Anderson GL, Prentice RL, et al. Risks and benefits of estrogen plus progestin in healthy postmenopausal women: principal results from the Women's Health Initiative randomized controlled trial. JAMA. 2002;288(3):321–333. Shrank WH, Patrick AR, Brookhart MA. Healthy User and Related Biases in Observational Studies of Preventive Interventions: A Primer for Physicians. Journal of General Internal Medicine. 2011;26(5):546–550.
383
Регрессия и конфаундер: что на самом деле учитывается
В одном из предыдущих постов был пример: пациенты, получавшие определённый препарат, умирали чаще, чем пациенты без лечения. На первый взгляд это выглядело как эффект препарата.
Но возможное объяснение было другим: препарат могли чаще назначать пациентам с более тяжёлым течением болезни. Тяжесть состояния связана и с назначением лечения, и с риском смерти — это и есть смешивающий фактор (confounder).
Один из способов учитывать такие факторы — регрессионные модели.
В упрощённом виде модель можно представить так:
исход = эффект препарата + эффект тяжести состояния
Коэффициент при препарате в такой модели оценивает его связь с исходом при одинаковом значении тяжести состояния. Иными словами, модель условно сравнивает пациентов со схожей тяжестью заболевания, но разным статусом лечения.
Конкретная модель (линейная, логистическая, Кокса) зависит от типа исхода, но принцип остаётся тем же: оценить эффект одного фактора с учётом
других.
Однако у такого подхода есть важные ограничения.
Во-первых, учесть можно только те факторы, которые измерены. Если тяжесть состояния не была зафиксирована, добавить её в модель невозможно.
Во-вторых, модель учитывает переменную только в том виде, в котором она измерена. Если тяжесть описана слишком грубо, часть различий между пациентами останется неучтённой — это называют остаточным конфаундингом.
Наконец, не любую переменную стоит включать в модель. Если она является следствием лечения и одновременно влияет на исход, её корректировка может не уменьшить, а увеличить смещение оценки.
Поэтому вопрос «что включить в регрессию» — это не просто техническая настройка модели. Он требует понимания дизайна исследования и причинно-следственных связей между переменными.
Именно поэтому регрессия — это инструмент учёта измеренных факторов, а не доказательство того, что учтены все возможные причины различий между группами.
383
Когда данные не убеждают сообщество
В начале 1980-х годов язвенную болезнь в основном связывали со стрессом и избыточной секрецией соляной кислоты. Лечение было направлено прежде всего на снижение кислотности, уменьшение симптомов и профилактику рецидивов.
Австралийские исследователи Барри Маршалл и Робин Уоррен предложили другую гипотезу: причиной может быть бактерия Helicobacter pylori.
Идея противоречила тогдашним представлениям. Многие специалисты не верили, что бактерия способна выживать в кислой среде желудка и играть ключевую роль в развитии язвенной болезни.
В 1984 году Маршалл и Уоррен опубликовали результаты в The Lancet. Они описали изогнутые бактерии в слизистой желудка у большинства пациентов с гастритом и язвенной болезнью и предположили, что эта находка может быть связана с развитием заболевания.
Но одной публикации оказалось недостаточно, чтобы изменить клиническое мышление.
Тогда Маршалл решился на необычный эксперимент: он выпил культуру H. pylori. Через несколько дней у него появились тошнота и рвота, а гастроскопия подтвердила развитие острого гастрита.
Это был не просто эффектный жест. Эксперимент стал попыткой приблизиться к выполнению постулатов Коха — классического способа доказать, что конкретный микроорганизм вызывает конкретное заболевание.
Но даже после этого признание не наступило сразу.
Понадобились годы дополнительных исследований, прежде чем связь между H. pylori, гастритом и язвенной болезнью стала частью клинической практики.
К началу 1990-х годов подход к лечению начал меняться: вместо контроля только кислотности всё большее значение стала приобретать эрадикация бактерии.
В 2005 году Барри Маршалл и Робин Уоррен получили Нобелевскую премию по физиологии и медицине.
Эта история показывает важную особенность науки.
Данные сами по себе не всегда меняют представления — даже если они верны.
Новая идея должна пройти через проверку, воспроизведение результатов и накопление доказательств.
И только потом меняются учебники, рекомендации и клиническая практика.
Иногда для этого требуются годы.
Источники:
Marshall BJ, Warren JR. Unidentified curved bacilli in the stomach of patients with gastritis and peptic ulceration. Lancet. 1984;1(8390):1311–1315.
Marshall BJ, Armstrong JA, McGechie DB, Glancy RJ. Attempt to fulfil Koch's postulates for pyloric Campylobacter. Med J Aust. 1985;142(8):436–439.
The Lancet. Nobel Prize winners Robin Warren and Barry Marshall. Lancet. 2005;366(9495):1429.
383
Разбор голосовалки.
Правильный ответ — все формулировки верны.
На первый взгляд кажется, что в вопросе должен быть один неправильный вариант. Но в этом вопросе подвох не в арифметике, а в восприятии: все три описания корректны, просто они показывают результат с разных сторон.
Препарат снизил риск инфаркта с 2% до 1%.
Абсолютный риск снизился на 1 процентный пункт:
2% − 1% = 1%.
Относительный риск снизился на 50%:
риск уменьшился вдвое — с 2% до 1%.
NNT составил 100.
NNT — это number needed to treat: число пациентов, которых нужно пролечить, чтобы предотвратить один дополнительный неблагоприятный исход.
В нашем примере абсолютное снижение риска составляет 1%, или 0,01.
Значит, NNT = 1 / 0,01 = 100.
То есть в среднем нужно пролечить 100 человек, чтобы предотвратить один инфаркт по сравнению с группой без лечения.
Математически все три формулировки описывают одну и ту же ситуацию.
Но воспринимаются они по-разному.
«Снижает риск на 50%» звучит впечатляюще.
«Снижение на 1 процентный пункт» — гораздо скромнее.
«NNT = 100» — ещё более сдержанно.
Именно поэтому при оценке результатов исследования важно смотреть не только на относительное снижение риска, но и на абсолютные цифры.
Формулировка может быть корректной — и при этом создавать совсем другое впечатление о размере эффекта.
383
50% — это много или мало?
«Препарат снижает риск инфаркта на 50%».
Звучит впечатляюще.
Но чтобы оценить этот результат, одной цифры недостаточно.
Дело в том, что 50% — это относительное снижение риска.
Оно показывает, насколько риск в группе лечения меньше по сравнению с контрольной группой.
Но ничего не говорит о том, каким этот риск был изначально.
Рассмотрим два примера.
В первом случае риск инфаркта в контрольной группе составляет 40%, а в группе лечения — 20%.
Абсолютное снижение риска — 20 процентных пунктов.
Во втором случае риск составляет 2% и 1% соответственно.
Абсолютное снижение риска — всего 1 процентный пункт.
При этом относительное снижение риска в обоих случаях одинаково — 50%.
Именно поэтому при оценке результатов исследований важно смотреть не только на относительный риск, но и на абсолютное снижение риска, а также на показатель NNT (number needed to treat) — число пациентов, которых необходимо пролечить, чтобы предотвратить один неблагоприятный исход.
Относительный риск удобен для сравнения эффектов.
Но без абсолютных цифр он может создавать впечатление более сильного эффекта, чем показывают данные.
383
После завершения первого потока хочу поделиться несколькими фрагментами отзывов.
На курсе учились врачи и исследователи с разным опытом: кто-то только начинал знакомство с R, кто-то давно работал со статистикой и научными данными.
Ольга, к.м.н., зав. лабораторией - врач КЛД, доцент:
«Мне было очень интересно на этом курсе. Вы хорошо и достаточно подробно погружали постепенно в новую для меня программу.»Среди первых вопросов после завершения курса был и такой:
«Вы не планируете ещё сделать курс по сложным методам статистики?»Евгения, врач-эндоскопист:
«Этот курс был полезен мне тем, что помог систематизировать разрозненные знания, которые я получила раньше, изучая методы статистического анализа.»
«Удобно построение курса: он состоит из небольших блоков, которые значительно проще изучать, чем долгие и сложные лекции по статистике.»Дмитрий, врач-офтальмолог, Иркутский филиал МНТК:
«Я как-то давно пытался самостоятельно разобраться в R, дошёл до слов "вектор" и "датафрейм" и на этом остановился.»
«С вашей подачей стало многое понятно, и самое главное — не так страшен R, как мне раньше казалось.»
«А графики… я таких нигде не видел. А настраивается за 5 минут.»
«Спасибо за курс! Надеюсь, последует продолжение.»Спасибо всем участникам за доверие, вопросы, идеи и рекомендации по улучшению. Многие из них уже учтены при подготовке второго потока. Интересно, что сразу несколько участников после завершения курса спросили о возможности продолжения, посвящённого более сложным статистическим методам. Пожалуй, это один из самых приятных видов обратной связи для преподавателя 😊 Старт второго потока — 15 июня.
383
Сегодня представила доклад на The 5th International Electronic Conference on Cancers (IECC 2026).
Спасибо организаторам за возможность выступить и познакомиться с интересными работами коллег из разных исследовательских групп.
Такие конференции — хорошая возможность не только поделиться собственными результатами, но и увидеть, над какими задачами сейчас работают другие исследователи.
Было интересно!
383
Первый поток курса по практическому анализу клинических данных в R завершён.
Открывается запись на второй поток.
За время обучения участники прошли путь от подготовки данных и построения первых графиков до статистического анализа и интерпретации результатов.
Но если говорить о главной задаче курса, она была не в освоении отдельных команд или статистических тестов.
Главная цель — научиться понимать анализ.
Почему выбран именно этот метод.
Какие ограничения есть у исследования.
Какие выводы можно делать на основании данных — а какие уже нет.
Именно поэтому курс построен как последовательный процесс работы с данными: от первого знакомства с набором данных до получения и интерпретации результатов.
На курсе мы разбираем:
— подготовку и очистку данных;
— описательную статистику и её интерпретацию;
— сравнение групп с учётом структуры данных;
— корреляционный анализ;
— визуализацию данных в ggplot2;
— логику выбора статистических методов.
Курс подойдёт врачам, аспирантам и исследователям, которые хотят самостоятельно работать со своими данными и понимать результаты анализа, а не только получать готовые цифры.
Старт второго потока — 15 июня.
Формат обучения — онлайн, материалы открываются поэтапно.
Стоимость участия — 23 000 ₽.
Оплата — после первого занятия.
Подробная программа:
meddatalab.tilda.ws
383
Разбор голосовалки: почему рецензент не принял вывод
В прошлом посте мы обсуждали ситуацию:
В ретроспективном исследовании у пациентов, получавших препарат X, частота осложнений оказалась ниже.
Авторы сделали вывод:
«Препарат X снижает риск осложнений».
Однако рецензент с таким выводом не согласился.
Правильный ответ — «всё перечисленное».
На первый взгляд вывод авторов выглядит логично.
У пациентов, получавших препарат X, частота осложнений была ниже.
Значит препарат работает?
Не обязательно.
Начнём с самого очевидного.
Препарат могли чаще назначать пациентам с более лёгким течением заболевания.
В этом случае более низкая частота осложнений отражает не эффект лечения, а исходные различия между группами.
Это пример смешивания (конфаундинга): фактор связан и с назначением лечения, и с исходом.
Но проблема не только в этом.
Исследование было ретроспективным.
А значит исследователь не контролировал распределение пациентов по группам.
Мы наблюдаем ассоциацию между лечением и исходом, но не можем уверенно утверждать, что именно лечение стало причиной различий.
Кроме того, группы могли различаться и по другим характеристикам: возрасту, тяжести состояния, сопутствующим заболеваниям.
Именно поэтому все варианты ответа были верными.
На самом деле речь идёт не о трёх независимых ошибках, а об одном фундаментальном ограничении наблюдательных исследований:
группы формируются не случайно.
Поэтому корректный вывод в такой ситуации звучал бы осторожнее:
«У пациентов, получавших препарат X, частота осложнений была ниже. Однако ретроспективный дизайн исследования не позволяет исключить влияние конфаундеров и установить причинно-следственную связь».
Это не слабый вывод.
Это хороший научный вывод.
Потому что задача исследователя — не доказать эффект любой ценой.
А честно показать, что позволяют утверждать данные.
383
Однако рецензент не согласился с таким выводом.
Как вы думаете, почему?
383
«Рецензент вернул статью»
Одна из самых неприятных ситуаций в исследовательской работе.
В комментариях рецензента:
— обоснуйте выбор статистического метода
— почему не учтён этот фактор?
— покажите распределение данных
— объясните выбор модели
И вдруг оказывается, что ответить непросто.
Не потому что анализ неправильный.
А потому что анализ выполнялся по принципу:
«посчитали — получили результат».
Без понимания, почему были приняты именно эти решения.
В этот момент становится понятно, что проблема не в незнании конкретной команды в R.
И даже не в выборе теста.
Проблема в том, что результаты нужно уметь защищать.
Объяснить, почему выбран именно этот подход.
Какие ограничения есть у анализа.
Какие выводы можно делать — а какие уже нет.
Именно поэтому анализ данных в исследованиях — это не только получение результата.
Это способность понимать и аргументировать каждое принятое решение.
Есть простой тест.
Представьте, что рецензент попросил вас обосновать каждый шаг анализа.
Если на какие-то вопросы сложно ответить уже сейчас, возможно, именно там находятся самые уязвимые места исследования.
383
Сколько переменных помещается в один график?
На этом графике одновременно показаны:
— возраст
— уровень холестерина
— наличие артериальной гипертензии
— ИМТ
— пол
В таблице эти показатели обычно находятся в разных столбцах.
Здесь они собраны в одном пространстве.
Поэтому график позволяет увидеть не только отдельные значения, но и взаимосвязи между ними.
Именно за это я люблю визуализацию данных.
Не за красивые картинки.
А за возможность понять структуру данных до любых расчётов.
На курсе мы последовательно проходим весь путь работы с данными: от подготовки и очистки исходных таблиц до визуализации, статистического анализа и интерпретации результатов.
Этот график построен в ggplot2 менее чем в 15 строк кода.
Второй поток курса стартует в июне.
Программа и запись:
meddatalab.tilda.ws
