В Части III мы разобрали статью по разделам и вывели три вопроса Users' Guides. Теперь применим их к самому важному для клинициста жанру — рандомизированному контролируемому исследованию о лечении. Именно на таких статьях чаще всего строятся решения «делать так или иначе». Три вопроса остаются те же, но внутри каждого появляются конкретные подвопросы, характерные для РКИ. Хирургическая специфика вынесена в отдельный раздел в конце.

4.1 Почему именно РКИ

РКИ — центральный жанр доказательной медицины о лечении, потому что рандомизация решает главную проблему любого сравнения методов: как убедиться, что группы различались только вмешательством, а не чем-то ещё. Если пациентов распределяют по группам случайно, то в среднем группы уравниваются по всем характеристикам — и известным, и неизвестным. Различие в исходах тогда можно приписать вмешательству, а не тому, что в одну группу попали пациенты полегче.

Что делает рандомизация
Подходящие пациенты
Рандомизация случайная последовательность + скрытое распределение
Вмешательство
Контроль
Группы уравниваются по всем факторам сразу — и по тем, о которых исследователь знает, и по тем, о которых не догадывается. Именно это отличает РКИ от наблюдательного исследования.

Наблюдательные исследования этого гарантировать не могут (см. Часть II про остаточное смешивание). Поэтому именно РКИ отвечает на вопрос «работает ли метод» с наибольшей уверенностью — при условии, что оно правильно спланировано и проведено. Проверка этого «при условии» и есть первый вопрос Users' Guides.

Серия Users' Guides посвящает чтению статей о лечении две центральные работы: одну про валидность, вторую про интерпретацию результатов и применимость (Guyatt, Sackett, Cook, JAMA 1993; JAMA 1994). Дальнейший разбор идёт по их логике.

4.2 Вопрос 1: можно ли доверять результатам

Это вопрос о том, защищено ли исследование от систематических ошибок. Даже большой и красивый результат ничего не стоит, если дизайн допускает искажение. Вот ключевые подвопросы.

Была ли рандомизация настоящей и скрытой

Мало написать «пациентов рандомизировали». Важны две отдельные вещи:

  • Генерация случайной последовательности — как именно определялось распределение (компьютерный генератор, таблица случайных чисел). «Рандомизация» по чётным/нечётным дням, по номеру карты или по дню недели — это псевдорандомизация, она предсказуема и уязвима.
  • Скрытие распределения (allocation concealment) — знал ли врач, включающий пациента, в какую группу тот попадёт. Это критично: если врач знает или может угадать, что следующий пациент попадёт в группу вмешательства, он может (осознанно или нет) отложить включение более тяжёлого пациента, сдвинув состав групп.
Распределение предсказуемо
  • чётные/нечётные дни или номера карт
  • открытый список распределения в ординаторской
  • прозрачные конверты
  • врач может угадать, что будет дальше
Распределение скрыто
  • центральная рандомизация по телефону или через веб
  • аптека, готовящая неразличимые упаковки
  • пронумерованные непрозрачные запечатанные конверты
  • включающий врач не знает следующего назначения

Разница между этими двумя понятиями не академическая. Классическое исследование методологического качества 250 РКИ показало: в испытаниях с неадекватным или неясным скрытием распределения оценки эффекта лечения были в среднем на ~40% больше, чем в испытаниях с адекватным скрытием (Schulz et al., JAMA 1995). То есть плохое allocation concealment систематически завышает эффект. Это одна из причин, по которой CONSORT требует отдельно описывать и генерацию последовательности, и её скрытие.

Было ли ослепление и кого именно ослепили

Ослепление (blinding) защищает от субъективных искажений на этапе лечения и оценки исхода. Ослеплять можно несколько сторон:

Пациент защита от эффекта плацебо и от разницы в поведении обычно можно
Оператор защита от разницы в сопутствующем ведении в хирургии — нет
Оценщик исхода защита от предвзятой оценки «мягких» исходов можно и нужно
Статистик защита от подгонки анализа под ожидаемый результат можно

Не все исходы одинаково чувствительны к ослеплению. «Жёсткий» исход — смерть — трудно оценить предвзято. «Мягкий» исход — интенсивность боли, оценка заживления, шкала качества жизни — сильно зависит от того, знает ли оценщик распределение. Для хирургии это особенно важно (см. 4.5): ослепить оператора почти никогда нельзя, но ослепить оценщика исхода — часто можно и нужно.

Все ли пациенты учтены: intention-to-treat и полнота наблюдения

Два связанных подвопроса.

Анализ по intention-to-treat (ITT). Принцип «once randomized — always analyzed»: каждый пациент учитывается в той группе, куда был рандомизирован, независимо от того, что произошло дальше — сменил ли он лечение, нарушил ли протокол, отказался ли от вмешательства. Это кажется нелогичным («зачем считать пациента в группе операции, если её так и не сделали?»), но именно ITT сохраняет то равновесие групп, ради которого делалась рандомизация (Gupta, 2011; Tripepi et al., 2020).

Один и тот же пациент, два способа посчитать
Intention-to-treat
считаем так, как рандомизировали
A
B
Пациент, перешедший на другое лечение, остаётся в своей группе. Рандомизация сохранена, оценка консервативная и честная.
Per-protocol
считаем только «правильно пролеченных»
A
B
Отклонившийся пациент выпадает из анализа. Группы больше не случайны — рандомизация сломана, эффект может быть завышен.

Альтернатива — per-protocol анализ (только «правильно пролеченные» пациенты) — выглядит логичнее, но ломает рандомизацию: пациенты, отклонившиеся от протокола, отличаются от приверженных по причинам, которые могут быть связаны с исходом.

Классическая иллюстрация — Coronary Drug Project, где смертность среди приверженных приёму плацебо оказалась ниже, чем среди неприверженных тому же плацебо. Приверженность сама по себе оказалась маркером более благополучных пациентов, а не эффектом таблетки (Coronary Drug Project Research Group, NEJM 1980; разбор — Detry & Lewis, JAMA 2014).

Практический вывод: если основной анализ в РКИ — per-protocol, а не ITT, к выводам стоит относиться осторожнее. ITT даёт консервативную, но честную оценку; per-protocol может завышать эффект.

Полнота наблюдения. Сколько пациентов «потерялось» к моменту оценки исхода?

Потеря наблюдения < 5% вряд ли исказит результат
Потеря наблюдения 5–20% требует внимания к причинам выбывания
Потеря наблюдения > 20% серьёзная угроза достоверности

Важно и почему пациенты выбывали: если в группе вмешательства многие ушли из-за побочных эффектов, а их исключили из анализа — эффект будет казаться лучше, чем есть.

Были ли группы одинаковы в начале и в ходе исследования

  • В начале: Table 1 должна показывать сопоставимость групп (см. Часть III). При правильной рандомизации различия случайны и невелики.
  • В ходе: получали ли группы одинаковое сопутствующее лечение, кроме изучаемого вмешательства? Если экспериментальная группа попутно получала больше внимания, обследований или сопутствующей терапии (co-intervention), эффект может быть приписан вмешательству ошибочно.

4.3 Вопрос 2: что именно показано

Если валидность признана достаточной, переходим к цифрам. Здесь работает всё, что разобрано в Части III (размер эффекта, доверительные интервалы, абсолютные vs относительные показатели), но с несколькими акцентами, важными именно для РКИ о лечении.

Насколько велик эффект

Первый вопрос — не «значимо ли», а «насколько велико». Размер эффекта (разница рисков, отношение рисков, отношение шансов, разница средних) показывает клинический масштаб. Как обсуждалось в Части III, полезно переводить относительные показатели в абсолютные и в NNT — «метод снижает риск на 30%» звучит иначе, чем «нужно пролечить 100 пациентов, чтобы предотвратить одно событие».

Насколько точна оценка

Доверительный интервал показывает диапазон правдоподобных значений эффекта. Три ситуации:

Как читать доверительный интервал
нет эффекта
Узкий CI,
не пересекает
оценка точная
Широкий CI,
не пересекает
величина груба
CI пересекает
линию
незначимо
← лучше вмешательство лучше контроль →
Ромб — точечная оценка эффекта, полоса — доверительный интервал. Чем уже полоса, тем точнее оценка.
Ключевой момент, о котором часто забывают: статистически незначимый результат — это не доказательство отсутствия эффекта. Это может означать, что эффекта нет, а может — что исследование было слишком мало, чтобы его обнаружить. Отличить одно от другого помогает ширина CI: если верхняя граница включает клинически важный эффект, отсутствие значимости может быть просто нехваткой мощности.

Superiority или non-inferiority: разные вопросы

Особый момент, критичный для хирургии. Большинство РКИ — это исследования превосходства (superiority): они проверяют, лучше ли новый метод старого. Но многие хирургические РКИ имеют другую логику — non-inferiority (не хуже). Типичный случай: новый метод, вероятно, не превосходит старый по главному исходу, но имеет другие преимущества (меньше травма, быстрее восстановление, меньше боль), и вопрос ставится так: «не проигрывает ли он старому больше, чем на заранее заданную величину?»

Такое исследование устроено принципиально иначе:

  • заранее задаётся граница non-inferiority (margin) — максимальная разница, которую ещё считают клинически приемлемой;
  • вывод делается по тому, где лежит доверительный интервал разницы относительно этой границы, а не относительно нуля (Schumi & Wittes, 2011).
Non-inferiority: всё решает граница
нет разницы
граница
CI левее
границы
не уступает
CI левее
нуля
превосходит
CI заходит
за границу
не доказано
Очень
широкий CI
мало данных
← новый метод лучше новый метод хуже →
Non-inferiority показана, только если весь доверительный интервал лежит левее заранее заданной границы. Третий и четвёртый случаи — не доказательство эквивалентности.

Здесь легко ошибиться при чтении. «Различий между методами не найдено» в non-inferiority испытании — не то же самое, что «методы эквивалентны». Более того, отсутствие статистической значимости различий не является доказательством non-inferiority: если исследование маленькое, широкий CI может одновременно не пересекать ноль и выходить за границу.

Практический навык. Увидев в хирургическом РКИ вывод «метод не уступает стандарту», проверьте три вещи: (1) была ли граница non-inferiority задана заранее и обоснована клинически; (2) не слишком ли она широка — щедрая граница легко «доказывает» non-inferiority даже для заметно худшего метода; (3) где именно лежит доверительный интервал относительно этой границы.

4.4 Вопрос 3: применимы ли результаты к моим пациентам

Даже валидное исследование с ясным результатом может не подходить конкретной практике. Здесь клиническое суждение врача незаменимо.

1 Похожи ли пациенты исследования на моих? РКИ часто набирает относительно «чистых» пациентов — без тяжёлой сопутствующей патологии, определённого возраста, из специализированных центров. Вопрос не «точно ли мой пациент подходит под критерии», а «есть ли веская причина ожидать у него принципиально другого ответа на лечение».
2 Все ли важные исходы учтены? Оценивали ли то, что действительно важно пациенту (выживаемость, качество жизни, функция), или только суррогатные исходы — лабораторный показатель, размер образования на снимке? Суррогатный исход удобно измерять, но он не всегда переводится в реальную клиническую пользу.
3 Перевешивает ли польза вред и стоимость? Полная картина требует сопоставить пользу с рисками, побочными эффектами, сложностью и стоимостью метода. Метод с NNT 100 и серьёзными осложнениями у части пациентов может проигрывать более скромному, но безопасному.
4 Реализуем ли метод в моих условиях? Результат, полученный в центре с большим потоком и специальным оборудованием, не всегда воспроизводится в другой обстановке. Для хирургии это особенно остро — см. следующий раздел.

4.5 Хирургическая специфика чтения РКИ

Всё сказанное выше применимо к любому РКИ о лечении. Но у хирургических испытаний есть особенности, которые меняют то, на что смотреть. Многие из них учтены в расширении CONSORT для нефармакологических вмешательств — CONSORT-NPT (Boutron et al., Ann Intern Med 2008; 2017), которое стоит держать как чек-лист при чтении хирургического РКИ.

Кто оперировал и насколько был опытен

В фармакологическом РКИ таблетка одинакова везде. В хирургическом «доза» зависит от рук оператора: результат может отражать не метод, а мастерство конкретных хирургов. Хорошее хирургическое РКИ отчитывается об опыте операторов и объёме процедур — своём и центра.

Проверить: если этих данных нет, применимость результата к рукам другого хирурга под вопросом.
Кривая обучения

Если новый метод осваивали по ходу исследования, ранние результаты хуже поздних не из-за метода, а из-за обучения.

Проверить: требовался ли минимальный опыт для участия и как учитывалась кривая обучения.
Что именно ослеплено

Ослепить оператора нельзя. Но можно и нужно ослепить оценщика исхода и пациента — там, где это этично. Для «мягких» исходов (боль, удовлетворённость, функциональные шкалы) отсутствие ослеплённой оценки — серьёзное ограничение; для «жёстких» (смертность, объективные осложнения) — менее критично.

Как описано вмешательство

Операция — сложное вмешательство со множеством деталей: доступ, техника, детали ведения. Достаточно ли подробно описаны обе процедуры, чтобы понять, что именно сравнивали, и воспроизвести это?

Equipoise и набор пациентов

Хирургические РКИ часто трудно набираются: если хирург убеждён в превосходстве одного метода, ему тяжело рандомизировать. Это может искажать, каких пациентов реально включали.

Проверить: в flow diagram — какая доля подходящих пациентов реально вошла в исследование.

Non-inferiority как типичный дизайн. Как отмечено в 4.3, многие хирургические РКИ (например, лапароскопический доступ против открытого) построены как non-inferiority: минимально инвазивный метод обычно не обещает лучшей выживаемости, но даёт меньше травмы и более быстрое восстановление. Читать такие статьи нужно с полным вниманием к границе non-inferiority.

4.6 Короткий чек-лист для чтения РКИ

Свод всего вышесказанного в виде вопросов, которые полезно задать к любому РКИ о лечении:

Валидность
Как генерировалась случайная последовательность и было ли скрыто распределение?
Кто был ослеплён — пациент, оператор, оценщик исхода?
Проведён ли анализ по intention-to-treat?
Какова полнота наблюдения и почему выбывали пациенты?
Сопоставимы ли группы в Table 1 и не различались ли в сопутствующем лечении?
Результаты
Каков размер эффекта в абсолютных величинах (и NNT)?
Насколько узок доверительный интервал?
Это superiority или non-inferiority дизайн, и где лежит CI относительно границы?
Применимость
Похожи ли пациенты исследования на моего?
Оценивались ли исходы, важные для пациента, а не только суррогатные?
Перевешивает ли польза вред, сложность и стоимость?
Для хирургии: описаны ли опыт операторов, кривая обучения и что именно ослеплено?

Источники

  1. Guyatt GH, Sackett DL, Cook DJ. Users' guides to the medical literature. II. How to use an article about therapy or prevention. A. Are the results of the study valid? JAMA. 1993;270(21):2598–601.
  2. Guyatt GH, Sackett DL, Cook DJ. Users' guides to the medical literature. II. B. What were the results and will they help me in caring for my patients? JAMA. 1994;271(1):59–63.
  3. Schulz KF, Chalmers I, Hayes RJ, Altman DG. Empirical evidence of bias. Dimensions of methodological quality associated with estimates of treatment effects in controlled trials. JAMA. 1995;273(5):408–12.
  4. Gupta SK. Intention-to-treat concept: A review. Perspect Clin Res. 2011;2(3):109–12.
  5. Tripepi G, Chesnaye NC, Dekker FW, Zoccali C, Jager KJ. Intention to treat and per protocol analysis in clinical trials. Nephrology (Carlton). 2020;25(7):513–7.
  6. Detry MA, Lewis RJ. The intention-to-treat principle: how to assess the true effect of choosing a medical treatment. JAMA. 2014;312(1):85–6.
  7. Schumi J, Wittes JT. Through the looking glass: understanding non-inferiority. Trials. 2011;12:106.
  8. Mauri L, D'Agostino RB Sr. Challenges in the Design and Interpretation of Noninferiority Trials. N Engl J Med. 2017;377(14):1357–67.
  9. Boutron I, Moher D, Altman DG, Schulz KF, Ravaud P; CONSORT Group. Extending the CONSORT statement to randomized trials of nonpharmacologic treatment: explanation and elaboration. Ann Intern Med. 2008;148(4):295–309.
  10. Boutron I, Altman DG, Moher D, Schulz KF, Ravaud P; CONSORT NPT Group. CONSORT Statement for Randomized Trials of Nonpharmacologic Treatments: A 2017 Update. Ann Intern Med. 2017;167(1):40–7.