В Части III мы разобрали статью по разделам и вывели три вопроса Users' Guides. Теперь применим их к самому важному для клинициста жанру — рандомизированному контролируемому исследованию о лечении. Именно на таких статьях чаще всего строятся решения «делать так или иначе». Три вопроса остаются те же, но внутри каждого появляются конкретные подвопросы, характерные для РКИ. Хирургическая специфика вынесена в отдельный раздел в конце.
4.1 Почему именно РКИ
РКИ — центральный жанр доказательной медицины о лечении, потому что рандомизация решает главную проблему любого сравнения методов: как убедиться, что группы различались только вмешательством, а не чем-то ещё. Если пациентов распределяют по группам случайно, то в среднем группы уравниваются по всем характеристикам — и известным, и неизвестным. Различие в исходах тогда можно приписать вмешательству, а не тому, что в одну группу попали пациенты полегче.
Наблюдательные исследования этого гарантировать не могут (см. Часть II про остаточное смешивание). Поэтому именно РКИ отвечает на вопрос «работает ли метод» с наибольшей уверенностью — при условии, что оно правильно спланировано и проведено. Проверка этого «при условии» и есть первый вопрос Users' Guides.
Серия Users' Guides посвящает чтению статей о лечении две центральные работы: одну про валидность, вторую про интерпретацию результатов и применимость (Guyatt, Sackett, Cook, JAMA 1993; JAMA 1994). Дальнейший разбор идёт по их логике.
4.2 Вопрос 1: можно ли доверять результатам
Это вопрос о том, защищено ли исследование от систематических ошибок. Даже большой и красивый результат ничего не стоит, если дизайн допускает искажение. Вот ключевые подвопросы.
Была ли рандомизация настоящей и скрытой
Мало написать «пациентов рандомизировали». Важны две отдельные вещи:
- Генерация случайной последовательности — как именно определялось распределение (компьютерный генератор, таблица случайных чисел). «Рандомизация» по чётным/нечётным дням, по номеру карты или по дню недели — это псевдорандомизация, она предсказуема и уязвима.
- Скрытие распределения (allocation concealment) — знал ли врач, включающий пациента, в какую группу тот попадёт. Это критично: если врач знает или может угадать, что следующий пациент попадёт в группу вмешательства, он может (осознанно или нет) отложить включение более тяжёлого пациента, сдвинув состав групп.
- чётные/нечётные дни или номера карт
- открытый список распределения в ординаторской
- прозрачные конверты
- врач может угадать, что будет дальше
- центральная рандомизация по телефону или через веб
- аптека, готовящая неразличимые упаковки
- пронумерованные непрозрачные запечатанные конверты
- включающий врач не знает следующего назначения
Разница между этими двумя понятиями не академическая. Классическое исследование методологического качества 250 РКИ показало: в испытаниях с неадекватным или неясным скрытием распределения оценки эффекта лечения были в среднем на ~40% больше, чем в испытаниях с адекватным скрытием (Schulz et al., JAMA 1995). То есть плохое allocation concealment систематически завышает эффект. Это одна из причин, по которой CONSORT требует отдельно описывать и генерацию последовательности, и её скрытие.
Было ли ослепление и кого именно ослепили
Ослепление (blinding) защищает от субъективных искажений на этапе лечения и оценки исхода. Ослеплять можно несколько сторон:
Не все исходы одинаково чувствительны к ослеплению. «Жёсткий» исход — смерть — трудно оценить предвзято. «Мягкий» исход — интенсивность боли, оценка заживления, шкала качества жизни — сильно зависит от того, знает ли оценщик распределение. Для хирургии это особенно важно (см. 4.5): ослепить оператора почти никогда нельзя, но ослепить оценщика исхода — часто можно и нужно.
Все ли пациенты учтены: intention-to-treat и полнота наблюдения
Два связанных подвопроса.
Анализ по intention-to-treat (ITT). Принцип «once randomized — always analyzed»: каждый пациент учитывается в той группе, куда был рандомизирован, независимо от того, что произошло дальше — сменил ли он лечение, нарушил ли протокол, отказался ли от вмешательства. Это кажется нелогичным («зачем считать пациента в группе операции, если её так и не сделали?»), но именно ITT сохраняет то равновесие групп, ради которого делалась рандомизация (Gupta, 2011; Tripepi et al., 2020).
Альтернатива — per-protocol анализ (только «правильно пролеченные» пациенты) — выглядит логичнее, но ломает рандомизацию: пациенты, отклонившиеся от протокола, отличаются от приверженных по причинам, которые могут быть связаны с исходом.
Практический вывод: если основной анализ в РКИ — per-protocol, а не ITT, к выводам стоит относиться осторожнее. ITT даёт консервативную, но честную оценку; per-protocol может завышать эффект.
Полнота наблюдения. Сколько пациентов «потерялось» к моменту оценки исхода?
Важно и почему пациенты выбывали: если в группе вмешательства многие ушли из-за побочных эффектов, а их исключили из анализа — эффект будет казаться лучше, чем есть.
Были ли группы одинаковы в начале и в ходе исследования
- В начале: Table 1 должна показывать сопоставимость групп (см. Часть III). При правильной рандомизации различия случайны и невелики.
- В ходе: получали ли группы одинаковое сопутствующее лечение, кроме изучаемого вмешательства? Если экспериментальная группа попутно получала больше внимания, обследований или сопутствующей терапии (co-intervention), эффект может быть приписан вмешательству ошибочно.
4.3 Вопрос 2: что именно показано
Если валидность признана достаточной, переходим к цифрам. Здесь работает всё, что разобрано в Части III (размер эффекта, доверительные интервалы, абсолютные vs относительные показатели), но с несколькими акцентами, важными именно для РКИ о лечении.
Насколько велик эффект
Первый вопрос — не «значимо ли», а «насколько велико». Размер эффекта (разница рисков, отношение рисков, отношение шансов, разница средних) показывает клинический масштаб. Как обсуждалось в Части III, полезно переводить относительные показатели в абсолютные и в NNT — «метод снижает риск на 30%» звучит иначе, чем «нужно пролечить 100 пациентов, чтобы предотвратить одно событие».
Насколько точна оценка
Доверительный интервал показывает диапазон правдоподобных значений эффекта. Три ситуации:
не пересекает
не пересекает
линию
Superiority или non-inferiority: разные вопросы
Особый момент, критичный для хирургии. Большинство РКИ — это исследования превосходства (superiority): они проверяют, лучше ли новый метод старого. Но многие хирургические РКИ имеют другую логику — non-inferiority (не хуже). Типичный случай: новый метод, вероятно, не превосходит старый по главному исходу, но имеет другие преимущества (меньше травма, быстрее восстановление, меньше боль), и вопрос ставится так: «не проигрывает ли он старому больше, чем на заранее заданную величину?»
Такое исследование устроено принципиально иначе:
- заранее задаётся граница non-inferiority (margin) — максимальная разница, которую ещё считают клинически приемлемой;
- вывод делается по тому, где лежит доверительный интервал разницы относительно этой границы, а не относительно нуля (Schumi & Wittes, 2011).
границы
нуля
за границу
широкий CI
Здесь легко ошибиться при чтении. «Различий между методами не найдено» в non-inferiority испытании — не то же самое, что «методы эквивалентны». Более того, отсутствие статистической значимости различий не является доказательством non-inferiority: если исследование маленькое, широкий CI может одновременно не пересекать ноль и выходить за границу.
4.4 Вопрос 3: применимы ли результаты к моим пациентам
Даже валидное исследование с ясным результатом может не подходить конкретной практике. Здесь клиническое суждение врача незаменимо.
4.5 Хирургическая специфика чтения РКИ
Всё сказанное выше применимо к любому РКИ о лечении. Но у хирургических испытаний есть особенности, которые меняют то, на что смотреть. Многие из них учтены в расширении CONSORT для нефармакологических вмешательств — CONSORT-NPT (Boutron et al., Ann Intern Med 2008; 2017), которое стоит держать как чек-лист при чтении хирургического РКИ.
В фармакологическом РКИ таблетка одинакова везде. В хирургическом «доза» зависит от рук оператора: результат может отражать не метод, а мастерство конкретных хирургов. Хорошее хирургическое РКИ отчитывается об опыте операторов и объёме процедур — своём и центра.
Если новый метод осваивали по ходу исследования, ранние результаты хуже поздних не из-за метода, а из-за обучения.
Ослепить оператора нельзя. Но можно и нужно ослепить оценщика исхода и пациента — там, где это этично. Для «мягких» исходов (боль, удовлетворённость, функциональные шкалы) отсутствие ослеплённой оценки — серьёзное ограничение; для «жёстких» (смертность, объективные осложнения) — менее критично.
Операция — сложное вмешательство со множеством деталей: доступ, техника, детали ведения. Достаточно ли подробно описаны обе процедуры, чтобы понять, что именно сравнивали, и воспроизвести это?
Хирургические РКИ часто трудно набираются: если хирург убеждён в превосходстве одного метода, ему тяжело рандомизировать. Это может искажать, каких пациентов реально включали.
Non-inferiority как типичный дизайн. Как отмечено в 4.3, многие хирургические РКИ (например, лапароскопический доступ против открытого) построены как non-inferiority: минимально инвазивный метод обычно не обещает лучшей выживаемости, но даёт меньше травмы и более быстрое восстановление. Читать такие статьи нужно с полным вниманием к границе non-inferiority.
4.6 Короткий чек-лист для чтения РКИ
Свод всего вышесказанного в виде вопросов, которые полезно задать к любому РКИ о лечении:
Источники
- Guyatt GH, Sackett DL, Cook DJ. Users' guides to the medical literature. II. How to use an article about therapy or prevention. A. Are the results of the study valid? JAMA. 1993;270(21):2598–601.
- Guyatt GH, Sackett DL, Cook DJ. Users' guides to the medical literature. II. B. What were the results and will they help me in caring for my patients? JAMA. 1994;271(1):59–63.
- Schulz KF, Chalmers I, Hayes RJ, Altman DG. Empirical evidence of bias. Dimensions of methodological quality associated with estimates of treatment effects in controlled trials. JAMA. 1995;273(5):408–12.
- Gupta SK. Intention-to-treat concept: A review. Perspect Clin Res. 2011;2(3):109–12.
- Tripepi G, Chesnaye NC, Dekker FW, Zoccali C, Jager KJ. Intention to treat and per protocol analysis in clinical trials. Nephrology (Carlton). 2020;25(7):513–7.
- Detry MA, Lewis RJ. The intention-to-treat principle: how to assess the true effect of choosing a medical treatment. JAMA. 2014;312(1):85–6.
- Schumi J, Wittes JT. Through the looking glass: understanding non-inferiority. Trials. 2011;12:106.
- Mauri L, D'Agostino RB Sr. Challenges in the Design and Interpretation of Noninferiority Trials. N Engl J Med. 2017;377(14):1357–67.
- Boutron I, Moher D, Altman DG, Schulz KF, Ravaud P; CONSORT Group. Extending the CONSORT statement to randomized trials of nonpharmacologic treatment: explanation and elaboration. Ann Intern Med. 2008;148(4):295–309.
- Boutron I, Altman DG, Moher D, Schulz KF, Ravaud P; CONSORT NPT Group. CONSORT Statement for Randomized Trials of Nonpharmacologic Treatments: A 2017 Update. Ann Intern Med. 2017;167(1):40–7.