MedData Lab
رفتن به کانال در Telegram
О работе с данными в медицинских и биомедицинских исследованиях. Анализ, интерпретация, ограничения, аналитические решения. R • Python • научная практика Автор канала @phlenyxa Курс по анализу данных в R ↓ meddatalab.ru
نمایش بیشترکشور مشخص نشده استدسته بندی مشخص نشده است
383
مشترکین
+224 ساعت
+177 روز
+6330 روز
آرشیو پست ها
383
Нормальное распределение — скорее исключение
Во многих статистических методах предполагается, что данные распределены нормально.
Это удобно:
такая форма распределения позволяет использовать
широкий набор аналитических инструментов.
Однако на практике реальные данные часто отклоняются от нормального распределения.
Они могут быть:
— асимметричными
— иметь несколько пиков
— содержать выбросы
В таких условиях предположение о нормальности не выполняется.
Применение параметрических методов
в этих случаях может приводить к некорректным выводам.
Практически это означает:
выбор метода и интерпретация результата
зависят не только от задачи,
но и от формы распределения данных.
383
Почему график — часть анализа, а не только оформление
Визуализация часто воспринимается как финальный этап работы с данными.
Как способ «показать результат».
Но на практике график — это один из первых инструментов анализа.
Он позволяет увидеть то, что не видно в таблице:
— распределение значений
— разброс
— выбросы
— структуру данных
Именно на этом этапе часто становится понятно, что данные устроены иначе, чем предполагалось.
Практически это означает:
график — это не только иллюстрация результата, но и способ понять данные до расчётов.
383
Что показывает величина эффекта
В анализе данных часто фокусируются на наличии различия.
Но не менее важно понять,
насколько оно выражено.
Величина эффекта — это мера размера различия между группами или изменения показателя.
В отличие от p-value,
она не зависит от объёма выборки.
Именно поэтому она отражает масштаб эффекта независимо от того, на какой выборке он получен.
Даже при наличии различия
его величина может быть настолько мала, что не влияет на интерпретацию.
Возможна и обратная ситуация:
при малой выборке клинически значимый эффект может не достигать статистической значимости. Это не означает его отсутствия.
Практически это означает:
результат анализа — это не только факт различия, но и его масштаб.
383
Почему статистически значимый результат ≠ ответ на вопрос
Статистически значимый результат часто воспринимается как вывод.
Если p < 0.05 — значит эффект есть.
Но это не тот вывод, который даёт анализ.
Статистическая значимость означает только то, что наблюдаемые данные маловероятны при отсутствии эффекта
в рамках выбранной модели.
Она не показывает:
— насколько выражен эффект
— имеет ли он практическое значение
— насколько результат устойчив
Практически это означает:
статистически значимый результат —
это не ответ на вопрос, а лишь основание для дальнейшей интерпретации.
Вывод формируется не из p-value, а из совокупности факторов:
данных, дизайна исследования и контекста.
383
Что проверять перед сравнением групп
После того как становится понятно, что группы могут быть несопоставимы, возникает практический вопрос:
что именно нужно оценить до анализа.
Есть несколько ключевых моментов.
✔️ Исходные характеристики
Возраст, тяжесть состояния, сопутствующие факторы.
Если группы различаются уже на этом этапе, важно понять, связано ли это с целью исследования или может влиять на интерпретацию результата.
✔️ Как сформированы группы
Рандомизация или отбор пациентов в группы приводят к разному их составу и, соответственно, к разной степени сопоставимости.
✔️ Объём данных и вариабельность
Малые выборки усиливают неопределённость
и делают результат менее устойчивым.
✔️ Логика сравнения
Действительно ли группы отвечают на один и тот же вопрос.
Практически это означает:
анализ начинается не с выбора теста, а с оценки того, корректно ли вообще сравнивать эти данные.
383
Коллеги, завтра начинаем курс по анализу клинических данных в R.
Курс построен последовательно: от понимания структуры данных — к статистическому анализу и интерпретации результатов.
Материал открывается поэтапно, чтобы была возможность не просто посмотреть, а разобраться и применить на практике.
Показываю, как устроен доступ к занятиям.
Курс подойдёт тем, кто работает с данными и хочет понимать результаты, а не только получать цифры.
Если вы планировали присоединиться — это можно сделать сейчас.
383
Что делать, если группы несопоставимы
Если группы изначально различаются, это не всегда можно «исправить» на этапе анализа.
Статистические методы могут учитывать часть различий
(например, через корректировку в модели),
но они не устраняют проблему полностью.
Результат в таком случае остаётся зависимым от структуры исходных данных и принятых допущений.
Практически это означает:
— необходимо оценивать сопоставимость до анализа
— учитывать ограничения при интерпретации
— и в ряде случаев отказываться от прямого сравнения
Анализ данных — это не только расчёт, но и понимание того, что именно можно интерпретировать.
383
Почему группы оказываются несопоставимыми
Несопоставимость групп редко возникает случайно.
Чаще она связана с тем, как формируются данные.
Критерии включения, условия наблюдения и различия в исходных характеристиках пациентов приводят к тому, что группы изначально имеют разную структуру.
Например, при сравнении пациентов, получающих и не получающих определённое лечение, терапия нередко назначается более тяжёлым пациентам.
В таком случае различия между группами отражают не эффект лечения, а исходную тяжесть состояния.
Аналогичная ситуация возникает при ретроспективных исследованиях, где распределение по группам не контролируется исследователем.
В таких условиях проблема сопоставимости формируется ещё на этапе сбора данных
и не может быть полностью устранена на этапе анализа.
383
Сравнение групп начинается до статистики
В анализе данных внимание часто сосредоточено на выборе методов.
Однако результат во многом определяется тем, какие группы сравниваются.
Если группы изначально различаются по важным характеристикам, анализ будет отражать эти различия, а не изучаемый эффект.
В таких случаях статистический метод не исправляет проблему, а лишь формализует её.
Поэтому корректность сравнения определяется не только выбором метода, но и тем, как сформированы данные.
383
Как выглядят данные до статистики
Анализ данных часто начинается с расчётов.
Но до этого есть более базовый вопрос:
как устроены сами данные.
На графике — распределение показателя в двух группах.
Видно не только различие между группами, но и разброс значений, форму распределения, выбросы.
Эти характеристики невозможно полноценно оценить по одной таблице.
Поэтому визуализация — это не оформление результата, а часть анализа.
В программе работа с данными рассматривается последовательно —
от структуры и подготовки данных до выбора методов и оценки результатов.
Визуализация (в том числе с использованием ggplot2)
используется как инструмент для анализа и интерпретации данных.
Старт — 20 числа.
383
Когда доверительный интервал включает ноль
Если доверительный интервал включает ноль, результат часто интерпретируют как «эффекта нет».
Это упрощение.
Интервал показывает диапазон значений, согласующихся с данными.
Если он включает ноль, это означает, что данные не позволяют исключить отсутствие эффекта.
При этом важно учитывать, что речь идёт о нейтральном значении параметра:
для разностей (например, разности средних или рисков) это ноль, для отношений (OR, RR) — единица.
Логика интерпретации остаётся той же, меняется только точка отсчёта.
При этом сам интервал может включать как отсутствие эффекта, так и клинически значимые значения.
Практически это означает следующее:
вы не получили доказательство отсутствия эффекта — вы получили неопределённый результат.
Проще:
это не «эффекта нет»
это — «мы не знаем».
383
Что показывает доверительный интервал
Точечная оценка параметра не отражает неопределённость, связанную с вариабельностью данных.
Любая статистическая оценка является приближённой и зависит от конкретной выборки.
Доверительный интервал задаёт диапазон значений, согласующихся с данными при заданном уровне доверия.
Это не означает, что истинный параметр находится внутри конкретного интервала с вероятностью 95% — это свойство метода, а не отдельной оценки.
Ширина интервала определяется вариабельностью данных и объёмом выборки.
Более широкий интервал указывает на большую неопределённость оценки, более узкий — на её устойчивость.
Поэтому интерпретация результатов требует учёта не только оценки, но и доверительного интервала.
383
SD меняет интерпретацию данных
Помимо центральных характеристик, данные описываются степенью разброса значений.
Стандартное отклонение (SD) отражает, насколько наблюдения отклоняются от центра распределения.
Даже при схожих общих характеристиках данные могут существенно различаться по вариабельности.
В одном случае значения сосредоточены в узком диапазоне, в другом — значительно варьируют.
Это влияет на устойчивость результатов и их интерпретацию.
Показатели вариабельности также описываются через дисперсию, однако стандартное отклонение используется чаще, так как выражается в тех же единицах, что и исходные данные.
Поэтому анализ данных требует учёта не только структуры, но и степени разброса значений.
383
ggplot2 — это не только графики
Иногда достаточно нескольких геометрических фигур,
чтобы получить визуальный результат
Даже если это ракета 🚀
Вопрос не в инструментах
а в том, как мы с ними работаем
Разбираю это на курсе:
https://meddatalab.tilda.ws
meddatalab.tilda.ws
Образовательная программа по R для врачей-исследователей
383
Выбросы: удалять или нет
Выбросы часто рассматриваются как ошибка и автоматически исключаются из анализа.
Однако это не всегда корректно.
В некоторых случаях выбросы отражают реальные, пусть и редкие, наблюдения.
Их удаление меняет распределение данных и может влиять на результаты анализа.
Поэтому решение об исключении выбросов должно основываться на понимании данных и контекста исследования.
383
Почему среднее ещё хуже
Среднее значение часто используется как основной показатель.
Однако оно чувствительно к отдельным наблюдениям, особенно к выбросам.
Даже небольшое число экстремальных значений может существенно изменить среднее, не меняя при этом основную структуру данных.
В таких ситуациях среднее перестаёт отражать типичные значения.
Поэтому при интерпретации данных важно учитывать распределение, а не только среднее значение.
383
Что не так с медианой
Медиана часто используется как устойчивый показатель центральной тенденции.
Однако она отражает только положение центра распределения и не показывает его форму.
Два набора данных могут иметь одинаковую медиану, но существенно отличаться по вариабельности, распределению значений и наличию выбросов.
Поэтому использование одной медианы без дополнительного анализа может быть недостаточным для корректной интерпретации.
383
О p-hacking
Значение p-value зависит не только от данных, но и от принятых аналитических решений.
Изменение критериев включения, исключение наблюдений, выбор модели или параметров анализа могут приводить к различным значениям p-value.
При множественных проверках вероятность получения статистически значимого результата увеличивается.
Этот эффект известен как p-hacking.
Важно, что речь не обязательно идёт о намеренной манипуляции.
Скорее о том, что процесс анализа допускает множество допустимых решений, каждое из которых может повлиять на итоговый результат.
Поэтому p-value следует интерпретировать в контексте всего анализа, а не как изолированное значение.
383
Когда статистику лучше не считать
Не каждый набор данных требует статистического анализа.
При небольших выборках, несопоставимых группах или слабом дизайне исследования статистические методы не делают результат более обоснованным.
В таких условиях они могут создавать видимость обоснованности и приводить к неверным выводам.
Отсутствие статистического анализа в подобных ситуациях не является недостатком, а может быть более корректным решением.
383
О «сырых» данных
Понятие «сырых данных» часто используется как обозначение исходной точки анализа.
Однако даже на этом этапе данные уже формируются в результате принятых решений.
Метод измерения, настройки прибора, условия эксперимента и способ записи определяют, какие значения будут получены и как они будут интерпретированы.
Поэтому «сырые данные» не являются нейтральной отправной точкой.
