fa
Feedback
MedData Lab

MedData Lab

رفتن به کانال در Telegram

О работе с данными в медицинских и биомедицинских исследованиях. Анализ, интерпретация, ограничения, аналитические решения. R • Python • научная практика Автор канала @phlenyxa Курс по анализу данных в R ↓ meddatalab.ru

نمایش بیشتر
کشور مشخص نشده استدسته بندی مشخص نشده است
383
مشترکین
+224 ساعت
+177 روز
+6330 روز
آرشیو پست ها
Нормальное распределение — скорее исключение Во многих статистических методах предполагается, что данные распределены нормаль
Нормальное распределение — скорее исключение Во многих статистических методах предполагается, что данные распределены нормально. Это удобно: такая форма распределения позволяет использовать широкий набор аналитических инструментов. Однако на практике реальные данные часто отклоняются от нормального распределения. Они могут быть: — асимметричными — иметь несколько пиков — содержать выбросы В таких условиях предположение о нормальности не выполняется. Применение параметрических методов в этих случаях может приводить к некорректным выводам. Практически это означает: выбор метода и интерпретация результата зависят не только от задачи, но и от формы распределения данных.

Почему график — часть анализа, а не только оформление Визуализация часто воспринимается как финальный этап работы с данными.
Почему график — часть анализа, а не только оформление Визуализация часто воспринимается как финальный этап работы с данными. Как способ «показать результат». Но на практике график — это один из первых инструментов анализа. Он позволяет увидеть то, что не видно в таблице: — распределение значений — разброс — выбросы — структуру данных Именно на этом этапе часто становится понятно, что данные устроены иначе, чем предполагалось. Практически это означает: график — это не только иллюстрация результата, но и способ понять данные до расчётов.

Что показывает величина эффекта В анализе данных часто фокусируются на наличии различия. Но не менее важно понять, насколько
Что показывает величина эффекта В анализе данных часто фокусируются на наличии различия. Но не менее важно понять, насколько оно выражено. Величина эффекта — это мера размера различия между группами или изменения показателя. В отличие от p-value, она не зависит от объёма выборки. Именно поэтому она отражает масштаб эффекта независимо от того, на какой выборке он получен. Даже при наличии различия его величина может быть настолько мала, что не влияет на интерпретацию. Возможна и обратная ситуация: при малой выборке клинически значимый эффект может не достигать статистической значимости. Это не означает его отсутствия. Практически это означает: результат анализа — это не только факт различия, но и его масштаб.

Почему статистически значимый результат ≠ ответ на вопрос Статистически значимый результат часто воспринимается как вывод. Ес
Почему статистически значимый результат ≠ ответ на вопрос Статистически значимый результат часто воспринимается как вывод. Если p < 0.05 — значит эффект есть. Но это не тот вывод, который даёт анализ. Статистическая значимость означает только то, что наблюдаемые данные маловероятны при отсутствии эффекта в рамках выбранной модели. Она не показывает: — насколько выражен эффект — имеет ли он практическое значение — насколько результат устойчив Практически это означает: статистически значимый результат — это не ответ на вопрос, а лишь основание для дальнейшей интерпретации. Вывод формируется не из p-value, а из совокупности факторов: данных, дизайна исследования и контекста.

Что проверять перед сравнением групп После того как становится понятно, что группы могут быть несопоставимы, возникает практи
Что проверять перед сравнением групп После того как становится понятно, что группы могут быть несопоставимы, возникает практический вопрос: что именно нужно оценить до анализа. Есть несколько ключевых моментов. ✔️ Исходные характеристики Возраст, тяжесть состояния, сопутствующие факторы. Если группы различаются уже на этом этапе, важно понять, связано ли это с целью исследования или может влиять на интерпретацию результата. ✔️ Как сформированы группы Рандомизация или отбор пациентов в группы приводят к разному их составу и, соответственно, к разной степени сопоставимости. ✔️ Объём данных и вариабельность Малые выборки усиливают неопределённость и делают результат менее устойчивым. ✔️ Логика сравнения Действительно ли группы отвечают на один и тот же вопрос. Практически это означает: анализ начинается не с выбора теста, а с оценки того, корректно ли вообще сравнивать эти данные.

Коллеги, завтра начинаем курс по анализу клинических данных в R. Курс построен последовательно: от понимания структуры данных — к статистическому анализу и интерпретации результатов. Материал открывается поэтапно, чтобы была возможность не просто посмотреть, а разобраться и применить на практике. Показываю, как устроен доступ к занятиям. Курс подойдёт тем, кто работает с данными и хочет понимать результаты, а не только получать цифры. Если вы планировали присоединиться — это можно сделать сейчас.

Что делать, если группы несопоставимы Если группы изначально различаются, это не всегда можно «исправить» на этапе анализа. С
Что делать, если группы несопоставимы Если группы изначально различаются, это не всегда можно «исправить» на этапе анализа. Статистические методы могут учитывать часть различий (например, через корректировку в модели), но они не устраняют проблему полностью. Результат в таком случае остаётся зависимым от структуры исходных данных и принятых допущений. Практически это означает: — необходимо оценивать сопоставимость до анализа — учитывать ограничения при интерпретации — и в ряде случаев отказываться от прямого сравнения Анализ данных — это не только расчёт, но и понимание того, что именно можно интерпретировать.

Почему группы оказываются несопоставимыми Несопоставимость групп редко возникает случайно. Чаще она связана с тем, как формир
Почему группы оказываются несопоставимыми Несопоставимость групп редко возникает случайно. Чаще она связана с тем, как формируются данные. Критерии включения, условия наблюдения и различия в исходных характеристиках пациентов приводят к тому, что группы изначально имеют разную структуру. Например, при сравнении пациентов, получающих и не получающих определённое лечение, терапия нередко назначается более тяжёлым пациентам. В таком случае различия между группами отражают не эффект лечения, а исходную тяжесть состояния. Аналогичная ситуация возникает при ретроспективных исследованиях, где распределение по группам не контролируется исследователем. В таких условиях проблема сопоставимости формируется ещё на этапе сбора данных и не может быть полностью устранена на этапе анализа.

Сравнение групп начинается до статистики В анализе данных внимание часто сосредоточено на выборе методов. Однако результат во
Сравнение групп начинается до статистики В анализе данных внимание часто сосредоточено на выборе методов. Однако результат во многом определяется тем, какие группы сравниваются. Если группы изначально различаются по важным характеристикам, анализ будет отражать эти различия, а не изучаемый эффект. В таких случаях статистический метод не исправляет проблему, а лишь формализует её. Поэтому корректность сравнения определяется не только выбором метода, но и тем, как сформированы данные.

Как выглядят данные до статистики Анализ данных часто начинается с расчётов. Но до этого есть более базовый вопрос: как устро
Как выглядят данные до статистики Анализ данных часто начинается с расчётов. Но до этого есть более базовый вопрос: как устроены сами данные. На графике — распределение показателя в двух группах. Видно не только различие между группами, но и разброс значений, форму распределения, выбросы. Эти характеристики невозможно полноценно оценить по одной таблице. Поэтому визуализация — это не оформление результата, а часть анализа. В программе работа с данными рассматривается последовательно — от структуры и подготовки данных до выбора методов и оценки результатов. Визуализация (в том числе с использованием ggplot2) используется как инструмент для анализа и интерпретации данных. Старт — 20 числа.

Когда доверительный интервал включает ноль Если доверительный интервал включает ноль, результат часто интерпретируют как «эффекта нет». Это упрощение. Интервал показывает диапазон значений, согласующихся с данными. Если он включает ноль, это означает, что данные не позволяют исключить отсутствие эффекта. При этом важно учитывать, что речь идёт о нейтральном значении параметра: для разностей (например, разности средних или рисков) это ноль, для отношений (OR, RR) — единица. Логика интерпретации остаётся той же, меняется только точка отсчёта. При этом сам интервал может включать как отсутствие эффекта, так и клинически значимые значения. Практически это означает следующее: вы не получили доказательство отсутствия эффекта — вы получили неопределённый результат. Проще: это не «эффекта нет» это — «мы не знаем».

Что показывает доверительный интервал Точечная оценка параметра не отражает неопределённость, связанную с вариабельностью дан
Что показывает доверительный интервал Точечная оценка параметра не отражает неопределённость, связанную с вариабельностью данных. Любая статистическая оценка является приближённой и зависит от конкретной выборки. Доверительный интервал задаёт диапазон значений, согласующихся с данными при заданном уровне доверия. Это не означает, что истинный параметр находится внутри конкретного интервала с вероятностью 95% — это свойство метода, а не отдельной оценки. Ширина интервала определяется вариабельностью данных и объёмом выборки. Более широкий интервал указывает на большую неопределённость оценки, более узкий — на её устойчивость. Поэтому интерпретация результатов требует учёта не только оценки, но и доверительного интервала.

SD меняет интерпретацию данных Помимо центральных характеристик, данные описываются степенью разброса значений. Стандартное о
SD меняет интерпретацию данных Помимо центральных характеристик, данные описываются степенью разброса значений. Стандартное отклонение (SD) отражает, насколько наблюдения отклоняются от центра распределения. Даже при схожих общих характеристиках данные могут существенно различаться по вариабельности. В одном случае значения сосредоточены в узком диапазоне, в другом — значительно варьируют. Это влияет на устойчивость результатов и их интерпретацию. Показатели вариабельности также описываются через дисперсию, однако стандартное отклонение используется чаще, так как выражается в тех же единицах, что и исходные данные. Поэтому анализ данных требует учёта не только структуры, но и степени разброса значений.

ggplot2 — это не только графики Иногда достаточно нескольких геометрических фигур, чтобы получить визуальный результат Даже если это ракета 🚀 Вопрос не в инструментах а в том, как мы с ними работаем Разбираю это на курсе: https://meddatalab.tilda.ws meddatalab.tilda.ws Образовательная программа по R для врачей-исследователей

Выбросы: удалять или нет Выбросы часто рассматриваются как ошибка и автоматически исключаются из анализа. Однако это не всегд
Выбросы: удалять или нет Выбросы часто рассматриваются как ошибка и автоматически исключаются из анализа. Однако это не всегда корректно. В некоторых случаях выбросы отражают реальные, пусть и редкие, наблюдения. Их удаление меняет распределение данных и может влиять на результаты анализа. Поэтому решение об исключении выбросов должно основываться на понимании данных и контекста исследования.

Почему среднее ещё хуже Среднее значение часто используется как основной показатель. Однако оно чувствительно к отдельным наб
Почему среднее ещё хуже Среднее значение часто используется как основной показатель. Однако оно чувствительно к отдельным наблюдениям, особенно к выбросам. Даже небольшое число экстремальных значений может существенно изменить среднее, не меняя при этом основную структуру данных. В таких ситуациях среднее перестаёт отражать типичные значения. Поэтому при интерпретации данных важно учитывать распределение, а не только среднее значение.

Что не так с медианой Медиана часто используется как устойчивый показатель центральной тенденции. Однако она отражает только
Что не так с медианой Медиана часто используется как устойчивый показатель центральной тенденции. Однако она отражает только положение центра распределения и не показывает его форму. Два набора данных могут иметь одинаковую медиану, но существенно отличаться по вариабельности, распределению значений и наличию выбросов. Поэтому использование одной медианы без дополнительного анализа может быть недостаточным для корректной интерпретации.

О p-hacking Значение p-value зависит не только от данных, но и от принятых аналитических решений. Изменение критериев включения, исключение наблюдений, выбор модели или параметров анализа могут приводить к различным значениям p-value. При множественных проверках вероятность получения статистически значимого результата увеличивается. Этот эффект известен как p-hacking. Важно, что речь не обязательно идёт о намеренной манипуляции. Скорее о том, что процесс анализа допускает множество допустимых решений, каждое из которых может повлиять на итоговый результат. Поэтому p-value следует интерпретировать в контексте всего анализа, а не как изолированное значение.

Когда статистику лучше не считать Не каждый набор данных требует статистического анализа. При небольших выборках, несопоставимых группах или слабом дизайне исследования статистические методы не делают результат более обоснованным. В таких условиях они могут создавать видимость обоснованности и приводить к неверным выводам. Отсутствие статистического анализа в подобных ситуациях не является недостатком, а может быть более корректным решением.

О «сырых» данных Понятие «сырых данных» часто используется как обозначение исходной точки анализа. Однако даже на этом этапе данные уже формируются в результате принятых решений. Метод измерения, настройки прибора, условия эксперимента и способ записи определяют, какие значения будут получены и как они будут интерпретированы. Поэтому «сырые данные» не являются нейтральной отправной точкой.