MedData Lab
前往频道在 Telegram
О работе с данными в медицинских и биомедицинских исследованиях. Анализ, интерпретация, ограничения, аналитические решения. R • Python • научная практика Автор канала @phlenyxa Курс по анализу данных в R ↓ meddatalab.ru
显示更多未指定国家未指定类别
383
订阅者
+224 小时
+177 天
+6330 天
帖子存档
383
Что такое смешивающий фактор — и почему его сложно устранить
В наблюдательных исследованиях связь между двумя переменными не всегда означает то, чем кажется.
Например, при анализе данных обнаруживается:
пациенты, получавшие определённый препарат, умирали чаще.
На первый взгляд это выглядит как эффект самого препарата.
Но есть нюанс: этот препарат могли чаще назначать пациентам с более тяжёлым течением болезни.
Тяжесть состояния в таком случае связана и с назначением препарата, и с риском смерти.
То есть наблюдаемая связь отражает не обязательно эффект лечения — а то, кому именно это лечение назначалось.
Так работает смешивающий фактор, или confounder.
И это не редкая ситуация.
В ретроспективных исследованиях такие связи возникают постоянно —
именно потому, что исследователь не контролирует распределение по группам.
Смешивающие факторы можно учитывать статистически:
через стратификацию, регрессионные модели и другие методы.
Но есть важное ограничение:
учесть можно только то, что было измерено.
Неизмеренные confounders остаются вне анализа —
и это одна из главных причин, почему ассоциация не всегда означает причинно-следственную связь.
Поэтому при чтении любой статьи полезно задавать вопрос: что ещё, кроме изучаемого фактора, могло повлиять на результат?
383
Множественные сравнения: когда значимость появляется сама по себе
Представим ситуацию: исследование большое, показателей много.
Возраст, индекс массы тела, десятки лабораторных параметров, подгруппы, дополнительные исходы.
И вдруг появляется несколько результатов с p < 0.05.
На первый взгляд это выглядит как серия находок.
Но здесь есть важный нюанс.
При уровне значимости 0.05 каждая отдельная проверка имеет вероятность ложноположительного результата около 5% — даже если реального эффекта нет.
Это не ошибка в расчётах.
Это математика.
Если проверяется одна гипотеза — вероятность ложноположительного результата составляет 5%.
Если двадцать — вероятность получить хотя бы один случайный «значимый» результат уже приближается к 64%.
В исследованиях это может выглядеть по-разному.
Несколько исходов анализируются без поправки на множественность.
Подгруппы анализируются отдельно.
В модель последовательно добавляются разные переменные.
Важно: это не обязательно означает манипуляцию.
Скорее, процесс анализа часто допускает множество допустимых решений — и каждое из них может влиять на итоговый результат.
Именно поэтому существуют поправки на множественные сравнения: Бонферрони, Холма, Беньямини–Хохберга.
Они по-разному балансируют между риском ложного открытия и риском пропустить реальный эффект.
Когда в статье много сравнений и несколько значимых результатов — это ещё не означает несколько реальных находок. Иногда это один реальный эффект среди нескольких случайных.
Поэтому при интерпретации важно понимать не только результат. Но и сколько проверок было сделано — и учитывалась ли множественность сравнений.
383
Когда рандомизация не спасает
РКИ считается золотым стандартом — и это действительно так.
Рандомизация лучше других дизайнов снижает влияние посторонних факторов.
Но у неё есть пределы.
Например, если участники знают, что получают активный препарат, они могут начать вести себя иначе: лучше соблюдать рекомендации, внимательнее относиться к симптомам, менять повседневное поведение.
Это называется эффектом Хоторна.
И рандомизация сама по себе его не устраняет — потому что проблема возникает уже после распределения по группам.
«Ослепление» помогает, но возможно не всегда.
Например, невозможно ослепить человека в исследованиях хирургических техник, диет, физической нагрузки или образа жизни.
Есть и другая проблема: рандомизация не гарантирует, что группы окажутся идеально сопоставимыми.
Особенно при небольших выборках. Даже случайное распределение может дать дисбаланс по важным характеристикам — просто из-за случайности.
Поэтому РКИ — это не идеальный дизайн. Это дизайн, который снижает риск определённых смещений.
Дизайн снижает одни риски. Но не отменяет необходимость думать об остальных.
383
Ответ к вчерашнему посту.
Это case-control исследование.
Группы здесь сформированы по исходу: есть депрессия или нет.
После этого исследователи сравнили состав микробиоты между группами.
Из-за того что есть две группы и сравнение показателя, такие исследования иногда путают с когортными.
Но логика дизайна здесь другая.
В когортном исследовании группы формируют по воздействию и наблюдают, что будет происходить дальше.
Здесь — наоборот:
исход уже известен, а исследователи смотрят на возможные связанные факторы.
Теперь про вывод авторов.
Фраза:
«изменения микробиоты связаны с развитием депрессии»
звучит сильнее, чем позволяет этот дизайн.
Исследование действительно показало различия между группами.
Но оно не может ответить на вопрос,
что было первичным.
Изменения микробиоты возникли раньше и повлияли на развитие депрессии?
Или сама депрессия, образ жизни, питание, препараты и другие факторы повлияли на микробиоту?
По этим данным это разделить невозможно.
И это не проблема конкретной статьи —
это ограничение самого дизайна.
Case-control исследования полезны и широко используются.
Но обычно они позволяют говорить об ассоциации,
а не о причинно-следственной связи.
383
Дизайн исследования определяет, какие выводы из него возможны.
Рандомизированное контролируемое исследование позволяет говорить о причинно-следственной связи — при соблюдении ряда условий.
Участники случайно распределяются по группам, что позволяет контролировать влияние посторонних факторов.
Ретроспективное когортное — нет.
Не потому что оно «хуже».
А потому что отвечает на другой вопрос. Оно описывает, что происходило с группами, которые уже сформировались — без контроля над тем, почему они сформировались именно так.
Case-control исследование позволяет оценить ассоциацию между воздействием и исходом.
Но группы в нём формируются по исходу — есть заболевание или нет — а воздействие оценивается ретроспективно.
Поэтому направление связи задано дизайном заранее, а не следует из данных.
Поэтому когда в ретроспективном исследовании пишут «лечение снижало риск» —
это не вывод из данных.
Это интерпретация, которая выходит за пределы того, что дизайн позволяет утверждать.
Тип дизайна — это не формальность в разделе Methods.
Он задаёт границы того, что вообще можно заключить из результатов — до того, как смотреть на p-value.
383
Данные, которые не могли быть реальными
В октябре 2005 года в The Lancet была опубликована работа норвежского онколога Йона Суддбё — о связи между длительным приёмом противовоспалительных препаратов и снижением риска рака полости рта.
Подозрения возникли по методологической причине: исследование ссылалось на базу данных, которая на тот момент ещё не была открыта для внешних исследователей.
Когда начали разбираться, обнаружили следующее: из 908 участников исследования 250 имели одинаковую дату рождения. В реальных данных такого не бывает.
Автор признал полную фабрикацию. Статья была отозвана в 2006 году.
Этот случай хорошо иллюстрирует один принцип, который редко обсуждается явно: понимание того, как устроены реальные данные — само по себе аналитический инструмент.
Иногда несоответствие видно до любых расчётов — на уровне структуры, распределений, здравого смысла.
Sudbø J. et al. Lancet. 2005;366:1359–66. Retracted: Lancet. 2006;367:382. DOI: 10.1016/S0140-6736(06)68120-8
383
Сегодня я хочу порекомендовать канал для всех интересующихся биологией — Liza Loves Biology! Его автор, молекулярный и клеточный биолог, научный журналист Елизавета Минина собирает последние новости из мира наук о жизни, публикует интересные истории и факты из биологии и смежных наук. Например, знаете ли вы, что...
🔸 Лошади чувствуют запах людей, испытывающих страх;
🔸 Аксолотли умеют отращивать полностью функциональный тимус с нуля;
🔸 Куколки и гусеницы некоторых бабочек могут издавать звуки, похожие на шипение;
🔸 У некоторых архей генетический код включает только два стоп-кодона, а третий стоп-кодон кодирует аминокислоту пирролизин;
🔸 Крайне низкая частота рака у гренландского кита обусловлена очень эффективной системой репарации повреждений в ДНК.
Подписывайтесь и оставайтесь в курсе всего самого интересного из наук о жизни!
383
Корреляция: что она показывает — и чего не показывает
Корреляционный анализ описывает, как совместно изменяются два показателя.
Это полезный инструмент.
Но у него есть ограничения,
которые важно учитывать при интерпретации.
Например, высокая корреляция между двумя показателями не означает, что один из них влияет на другой.
Иногда оба связаны с третьим фактором.
В клинических данных это встречается очень часто.
Коэффициент Пирсона чувствителен к выбросам.
Одно экстремальное наблюдение может существенно изменить результат.
В таких ситуациях коэффициент Спирмена устойчивее: он работает с рангами, а не с исходными значениями.
Ещё один важный момент:
корреляция описывает линейную связь.
Поэтому коэффициент, близкий к нулю, не всегда означает отсутствие зависимости — нелинейная связь при этом может быть выраженной.
И наконец: статистически значимая корреляция
не обязательно означает клинически значимую.
При большой выборке даже слабая связь может дать p < 0.05.
Практически это означает:
интерпретация корреляции требует учёта структуры данных, типа связи и контекста исследования —
а не только значения коэффициента и p-value.
383
Наверное, пора нормально представиться — канал читают новые люди, а я до сих пор этого толком не сделала🙂
Меня зовут Елена Филиппова. Я кандидат медицинских наук, работаю в области молекулярной онкологии и эпигенетики, занимаюсь анализом биомедицинских данных. Участвую в грантах РНФ как исполнитель и руководитель — сейчас веду уже третий грант как руководитель. Наши работы опубликованы в Scopus/WoS, включая журналы Q1, я соавтор 4 патентов.
Этот канал вырос из практики: я заметила, что одно и то же объясняю коллегам, аспирантам и врачам снова и снова. Многие сложности в исследованиях начинаются ещё до расчётов — на этапе понимания данных, постановки вопроса, интерпретации результатов. Поэтому здесь не просто «про методы», а про логику анализа и то, как это реально устроено в biomedical research.
Параллельно веду курс по анализу клинических данных в R для врачей и исследователей.
И думаю, со временем здесь будет больше не только про статистику, но и в целом про исследовательскую работу, biomedical data и инструменты, которые помогают с этим работать на практике.
Рада всем, кто здесь 👋
383
Пропущенные значения — почему это не технический вопрос
Пропущенные значения часто воспринимаются как помеха,
которую нужно устранить перед анализом.
Удалить строки.
Заменить средним.
Перейти к расчётам.
Но пропуски в клинических данных редко возникают случайно.
Показатель отсутствует,
потому что пациент не пришёл на визит.
Лабораторный результат не внесён, потому что анализ не назначили.
Значение отсутствует,
потому что его не было в протоколе на этом этапе.
В каждом из этих случаев
пропуск несёт информацию.
Если удалить все строки с пропусками, в анализе останутся только наблюдения
с полными данными.
Это не случайная подвыборка — у неё своя структура.
Если заменить пропуски средним, вариабельность уменьшится, а распределение станет искусственно сглаженным.
Практически это означает:
прежде чем решать,
что делать с пропусками,
важно понять, почему они возникли.
Именно это определяет,
какой подход будет обоснованным.
383
Что в статье обычно не читают — и зря
При чтении исследования внимание
чаще всего сосредоточено на abstract,
таблицах результатов и p-value.
Однако значительная часть информации,
которая определяет надёжность вывода,
находится в других разделах статьи.
В частности:
— Methods:
как сформированы группы,
какие критерии включения и исключения использовались
— Results:
сколько наблюдений исключено из анализа,
как выглядят исходные характеристики групп
— Statistical analysis:
какие методы применялись
и какие допущения были приняты
— Limitations:
какие ограничения исследования признают сами авторы
Именно эти детали часто объясняют, почему результат выглядит убедительно —
или наоборот, почему его интерпретация ограничена.
Практически это означает:
оценка исследования начинается не с поиска «значимого результата»,
а с понимания того,
как этот результат был получен.
383
Анализ данных редко начинается со статистического теста.
До расчётов есть множество решений, которые влияют на результат:
— какие данные анализируются
— сопоставимы ли группы
— как устроено распределение
— что именно сравнивается
— насколько результат устойчив
Именно из этих шагов
в реальности складывается анализ данных.
Чтобы сделать этот процесс более наглядным, я создала Telegram-бот MedDataFlow.
Это не “автоматический подбор теста”, а скорее попытка показать сам процесс анализа:
от структуры данных до выбора метода и интерпретации.
В боте есть:
— подбор статистического метода
— проверка нормальности распределения
— чек-листы перед анализом
— тренажёр R
— справочник статистики
— работа с ggplot
— предварительный анализ CSV
Бот бесплатный:
https://t.me/meddataflow_bot
383
Как читать результаты исследования
При чтении исследования внимание
часто сразу переходит к p-value.
Однако это не первый вопрос,
на который нужно ответить.
Прежде всего важно последовательно понять:
1. Что сравнивается
Разность средних, риски, выживаемость —
это разные задачи и разные выводы.
2. Какие группы анализируются
Сопоставимы ли они и отвечают ли на один вопрос.
3. Какой показатель используется
Среднее, медиана, отношение рисков —
каждый отражает разные характеристики данных.
4. Какой метод применён и соответствует ли он структуре данных
Параметрический или непараметрический,
учтены ли выбросы и форма распределения.
Только после этого имеет смысл
смотреть на числовые значения.
Без этого контекста
p-value интерпретируется неверно —
вне зависимости от его значения.
Практически это означает:
чтение результатов начинается
не с цифр,
а с понимания структуры анализа.
383
Что в статье на самом деле является результатом
В научных публикациях результат
обычно представлен в виде таблиц и p-value.
Именно на этом чаще всего сосредоточено внимание.
Однако сами по себе эти показатели
не являются результатом в полном смысле.
Они отражают результат применения
конкретного метода к конкретным данным —
но не говорят о том, насколько этот результат устойчив,
воспроизводим и клинически значим.
Результат включает:
— какие данные анализируются
— как сформированы группы
— какие допущения приняты
— какой метод использован и почему
Без этого контекста
числовые значения теряют смысл.
Практически это означает:
результат в статье — это не только цифры,
но и то, как они получены и интерпретированы.
383
Почему t-test дал значимость
В предыдущем примере один и тот же набор данных дал разные результаты:
t-test → p = 0.045
Mann–Whitney → p = 0.073
Причина не в том, что один метод «правильный», а другой нет.
Методы отвечают на разные аналитические задачи.
t-test сравнивает средние значения
и предполагает нормальность распределения.
При достаточном объёме выборки он относительно устойчив
к умеренным отклонениям от нормальности —
но чувствителен к выбросам, влияющим на среднее.
Если в одной из групп есть выраженные выбросы,
среднее может смещаться.
На графике это видно:
в группе B несколько высоких значений тянут среднее вверх.
Mann–Whitney работает с рангами, а не со средними.
Поэтому он менее чувствителен к отдельным экстремальным значениям.
Практически это означает:
в этом примере t-test зафиксировал различие средних,
которое во многом обусловлено выбросами,
а не сдвигом распределения в целом.
Поэтому перед выбором метода важно смотреть
не только на p-value,
но и на структуру данных.
383
Один набор данных — разные результаты
В примере на изображении
используются два метода для сравнения групп.
t-test → p = 0.045
Mann–Whitney → p = 0.073
Данные при этом не меняются.
Меняется только способ анализа.
Разница связана с тем,
что методы по-разному учитывают структуру данных:
t-test сравнивает средние
и предполагает нормальность распределения.
Манн–Уитни работает с рангами
и не делает этого предположения.
Кроме того, среднее чувствительно к выбросам,
в то время как ранговые методы — более устойчивы.
Практически это означает:
выбор метода — это аналитическое решение,
которое влияет на результат.
Оно должно быть обосновано до анализа,
а не после просмотра p-value.
383
Что делать, если данные не распределены нормально
Отклонение от нормального распределения —
частая ситуация в реальных данных.
Это не ошибка
и не всегда требует «исправления».
Важно понять,
влияет ли форма распределения
на выбранный метод и интерпретацию результата.
Возможны разные подходы:
✔️ Использовать методы, не требующие нормальности
Непараметрические тесты не требуют предположения
о нормальности распределения.
✔️ Преобразовать данные
В некоторых случаях применяют логарифмирование
или другие преобразования.
При этом интерпретация результатов ведётся
уже в преобразованной шкале,
что необходимо учитывать.
✔️ Использовать устойчивые показатели
Медиана и квартильный размах
менее чувствительны к асимметрии и выбросам.
✔️ Учитывать задачу анализа
В ряде случаев отклонение от нормальности
не влияет на итоговые выводы.
Практически это означает:
важно не «привести данные к норме»,
а выбрать подход,
соответствующий их структуре.
383
Как понять, нормально ли распределены данные
Предположение о нормальности
часто используется при выборе статистических методов.
Но само по себе оно не является обязательным требованием —
важно понять, насколько отклонения от нормального распределения
влияют на анализ.
Поэтому задача — не просто проверить нормальность,
а оценить форму распределения данных
и её значимость для интерпретации.
На что можно опираться:
✔️ Визуализация
Гистограмма или график плотности позволяют увидеть
симметрию, асимметрию и выбросы.
✔️ Q–Q график
Показывает отклонения от теоретического распределения
и их характер.
✔️ Статистические тесты
Например, тест Шапиро–Уилка.
При больших выборках он выявляет
даже незначительные отклонения.
При малых — может не обнаружить реальные
из-за низкой мощности.
✔️ Контекст данных
Форма распределения часто определяется природой показателя
и может быть ожидаемой.
Практически это означает:
вопрос не в том,
«нормально ли распределены данные»,
а в том,
насколько отклонение от нормальности
влияет на выводы.
