sábado, 2 de março de 2019

A Arte de Ler um Subestudo: PROMISE, falsa promessa em diabéticos



Este é mais um texto da série “A Arte de Ler um Artigo Científico”. Nesta postagem abordaremos artigos construídos a partir de subanálises de grande estudos. 
No texto original desta série, propusemos um momento de preparação mental antes da leitura, no qual tentamos controlar nossos vieses pessoais e ao mesmo tempo identificar situações onde nosso ceticismo deve estar mais aguçado. Esta postagem exemplifica uma frequente situação em que devemos estar muito atentos: análises secundárias de estudos originalmente negativos. 

Devemos aguçar o ceticismo pois este tipo de publicação representa, na maioria das vezes, tentativa de positivar um estudo originalmente negativo. E há tantas forma de positivar (P-hacking, statistical fishing) que o resultado é quase garantido se for suficientemente procurado. Isto ocorre principalmente quando as análises não são predeterminadas (pois isso dá margem a um grande número de tentativas) e quando se combina várias estratégias para dar "chance ao acaso" se apresentar. Assim, publicações secundariamente originadas de grandes estudos representam grande fonte de ilusões mediadas por erros aleatórios, sistemáticos e baixa probabilidade pré-teste de hipóteses. 

Enquanto grandes estudos originais, independente da especialidade, são usualmente publicados nas grandes revistas de medicina interna (NEJM, JAMA, Lancet, BMJ), suas análises secundárias aparecem nas melhores revistas das especialidades. No caso de minha especialidade, cardiologia, as subanálises de grandes estudos são frequentemente publicadas no renomados Journal of the American College of Cardiology e Circulation, revistas com fator de impacto 17 e 19, respectivamente. Se nos parece frequente problemas de veracidade em estudos publicados nas grandes revistas de medicina, fica ainda mais evidente a tolerância com desvios de integridade científica pelas revistas top das especialidades. E esta tolerância é acompanhada pela comunidade de especialistas, que sofrendo do viés de citação espalham entusiasticamente notícias de trabalhos (pseudo) positivos.  

O exemplo didático, nos presenteado esta semana, é o subestudo do PROMISE que retestou a hipótese original no subgrupo de diabéticos. O PROMISE, publicado originalmente em 2015, foi um grande (N = 10.000) ensaio clínico randomizado que comparou duas estratégias de investigação de doença coronária em pacientes sintomáticos: pesquisa anatômica (angiotomografia) versus métodos funcionais. O estudo não encontrou diferença de desfechos clínicos entre os dois métodos (estudo negativo). 

Agora, quatro anos depois é publicada a subanálise sugerindo que em diabéticos a angiotomografia é superior a métodos funcionais.

Contextualização Clínico-Científica


O PROMISE original (NEJM) estudo foi motivo de postagem neste Blog, na qual eu mencionava que não havia razão para o ônus da prova de superioridade estar apenas na tomografia. Deveria ser uma hipótese científica bidirecional. E se o fosse, a conclusão adequada seria que não foi encontrada superioridade de nenhum dos métodos. Em minha interpretação, aquele estudo derrubava o mito (implausível e não baseado em evidências) de que métodos indiretos de pesquisa de isquemia seriam melhores do que estudo da anatomia (veja post Reflexo Óculo-isquêmico). O PROMISE foi uma evidência de qualidade, capaz de colocar a estratégia anatômica, do ponto de vista de desfechos, como um método tão bom quanto os métodos “funcionais”. 

Em minha opinião clínica, o resultado do PROMISE alinhado à comprovadas vantagens de se conhecer anatomia (acometimento de tronco, noção de número de vasos acometidos, carga aterosclerótica, sem falar da “extrema normalidade da tomografia normal”) faz deste o método não invasivo de escolha em pacientes com suspeita de doença coronária, que não tenham probabilidade alta de calcificação coronária extrema. 

Emito aqui minha visão clínica dois motivos: primeiro, acho que já temos informações científicas suficientes para não precisar fabricar mais dados em prol de nenhum dos lados; segundo, proponho sempre que avaliemos nossas “evidências internas” antes de avaliar evidências externas. Neste caso, minha tendência é pela avaliação anatômica. Até mesmo porque, salvo exceções, alterações em métodos funcionais são meras consequências de obstruções anatômicas. Melhor olhar a fonte do problema, as coronárias. Por mais grosseira que esta colocação pareça aos românticos ouvidos clínicos, é um pensamento que resulta da interface entre evidências e raciocínio clínico. 

Vamos à subanálise do PROMISE que, como perceberão, de promessa não tem nada. Esta nova publicação representa uma confluência de problemas com multiplicidade, viés de confusão e baixa racionalidade da hipótese testada.

Sabemos que análises de subgrupo positivas são problemáticas em estudos negativos por variadas razões que se somam: multiplicidade de testes, amostras menores que a original, implausibilidade de interações. Tudo isso aumenta a probabilidade do erro aleatório tipo I (se valer do acaso para afirmar algo falso). Mas não bastou fazer uma análise de subgrupo, estes estudo combinou a análise com uma série de problemas, listados abaixo:

  1. Esta não é simplesmente uma análise de subgrupo (diabetes versus não diabetes). É uma análise de subgrupo de um desfecho secundário. Sabemos que análise de um desfecho secundário é outra forma de fabricar significância estatística. Pois bem, o estudo combina em uma única análise duas maneiras de fabricar o erro tipo I.
  1. Para piorar, o estudo fez a análise de subgrupo não apenas de um desfecho secundário, mas de dois desfechos secundários. O primeiro deu negativo (P da interação = 0.10) e o outro deu positivo (P da interação = 0.02). Portanto, multiplicou ainda mais a multiplicidade já contida na combinação de subgrupo com desfecho secundário.
  1. A análise do subgrupo "diabetes" não foi definida a priori. No protocolo publicado, a análise pré-especificada se referia ao desfecho “DAC equivalente” (combinado de diabetes, doença vascular periférica e doença cérebro vascular), que foi negativa no estudo primário. Portanto, essa é uma análise post hoc (inventada depois - nunca se sabe quantas invenções se tenta nos bastidores), o que inflaciona o problema das múltiplas comparações. 
  1. Finalmente, os autores criam um erro sistemático (viés): diferente do que foi feito no trabalho original, esta é não é uma análise por “intenção de testar” (equivalentemente à “intenção de tratar dos estudos de tratamento), a qual preveniria viés de confusão a posteriori da randomização. Na verdade, eles fazem uma “análises por protocolo” na medida em que excluem 1.000 pacientes que julgaram inadequados para a interpretação do exame. Exclusão de pacientes após a randomização traz risco de eliminar a homogeneidade das amostras. Principalmente quando o critério de exclusão carrega consigo pacientes de maior risco: um dos maiores motivos da dificuldade de análise da angiotomografia é a presença de calcificação coronária, a qual traduz carga aterosclerótica. Portanto no grupo tomografia provavelmente foram excluídos pacientes com maior carga aterosclerótica do que a média do grupo. Por outro lado, isso não acontece nos demais métodos não invasivos, nos quais as dificuldades de interpretação decorrem de problemas extra-cardíacos como janela ecocardiográfica ou atenuações mamárias/diafragmáticas. Sendo assim, a exclusão de pacientes da análise retirou indivíduos com maior carga aterosclerótica do grupo tomografia e retirou pacientes aleatórios do grupo funcional. Isso pode ter sido responsável pela pequena diferença absoluta de 1.5% observada no PROMISE. É bem verdade que esse viés pode ter ocorrido também no grupo de não diabéticos, onde não foi observada a diferença entre os métodos. No entanto, diabéticos podem ter mais calcificação do que não diabéticos, o que faria com que o viés da "análise por protocolo" fosse mais forte nos diabéticos. 

Desta forma, este é um trabalho secundário com alto risco de erro aleatório e viés. Trabalhos secundários nunca devem ser vistos como confirmatórios, porém a esses pode restar um valor de sugerir uma ideia. No caso presente, fica difícil dar qualquer credibilidade ao subestudo. 

Até aqui apresentei uma simples e quase óbvia discussão metodológica da validade interna deste trabalho. Porém esta discussão se torna mais interessante quando vamos além do metodológico,  abordando a qualidade da ideia testada. Pois o valor preditivo positivo de um estudo depende não só da qualidade do trabalho, como também da qualidade da ideia. 


A Qualidade da Ideia


Em primeiro lugar, devemos nos lembrar que o fenômeno de interação (modificação de efeito) é raro no campo científico biomédico (vejam post A Ilusão de Interação). Percebam como as análises de subgrupo de estudos positivos ou negativos quase sempre mostram consistência de resultado. Isto ocorre pois medidas relativas de risco não sofrem modificação com o risco absoluto da população. Para diferentes estratos de risco absoluto, a regra é observamos uma mesma redução relativa de risco, que representa a propriedade intrínseca da intervenção. Para quem continua na dúvida dessa propriedade, comparem a redução do risco relativo da estatina ou aspirina de pacientes de prevenção primária versus secundária. É a mesma redução relativa de risco, o que muda é o NNT, que é uma medida de impacto individual. 

Portanto, em geral uma análise de subgrupo de um estudo negativo já parte de uma baixa probabilidade pré-teste.

Partimos agora para a plausibilidade específica da ideia. Qual a diferença de diabéticos em relação a não diabéticos que poderia ter motivado estudar aquele subgrupo específico? Os autores comentam na introdução que diabéticos têm maior risco absoluto. Aí está o erro da hipótese. Risco absoluto não promove interação! Não há porque a tomografia ser um método igual aos demais em não diabéticos e se mostrar melhor em não diabéticos. A não ser que diabéticos tivessem menos calcificação, o que não é o caso.

Em geral, um verdadeiro efeito de interação é pouco provável em um estudo originalmente negativo. Há exceções em casos de grande plausibilidade. Neste presente caso, estamos diante da possibilidade de um diagnóstico que leva a um tratamento para doença coronariana, beneficiando o paciente no final da cascata de causalidade. Não há razão biológica para “acreditar” que a uma abordagem não teria efeito algum nos pacientes em geral, mas em diabéticos surgiria um efeito evidente. Muito mais provável o resultado encontrado ser decorrente de acaso + viés.

A maioria dos fenômenos naturais que fazem sentido a olho nu decorrem de acaso ou viés. Daí a importância de um filtro desses ruídos que se confundem com sinais verdadeiros. O filtro é o método científico, que originalmente foi criado para eliminar estes problemas, e não para criar falsas ideias (o problema da integridade cientÍfica). 

Finalmente, na análise bayesiana deste trabalho, o subPROMISE testa uma hipótese de baixa probabilidade pré-teste em um desenho de estudo de baixa qualidade, o qual não consegue elevar essa probabilidade para níveis intermediários. Portanto, esse é mais um estudo de baixíssimo valor preditivo positivo. 

Não precisava ...


Os Problemas nas Entrelinhas


A nossa análise de validade interna do subestudo PROMISE traduz erros metodológicos grosseiros. No entanto, grosseiro não é sinômino de claro. Embora falhas metodológicas grosseiras não sejam omitidas, boa parte deles não está explícito do texto do artigo, mais sim implícito de uma forma descritiva, cabendo ao leitor elaborar um pensamento do que se tratam certas descrições. Seria quase como ler nas entrelinhas. 

Neste subestudo do PROMISE não está explícito que esta é uma “análise por protocolo, de subgrupo, definida a posteriori, de um desfecho secundário". Vejamos ponto por ponto no texto como está escrito no artigo:

Análise de Subgrupo

Para um leitor desavisado, que costuma ler apenas o título, objetivo e conclusão, este estudo facilmente passaria por um trabalho feito apenas em diabéticos. 

Título: Stress Testing Versus CT Angiography in Patients With Diabetes and Suspected Coronary Artery Disease
Objetivo: The purpose of this study was to assess whether a diagnostic strategy based on coronary computed tomographic angiography (CTA) is superior to functional stress testing in reducing adverse cardiovascular (CV) outcomes (CV death or myocardial infarction [MI]) among symptomatic patients with diabetes.
Conclusão: In diabetic patients presenting with stable chest pain, a CTA strategy resulted in fewer adverse CV outcomes than a functional testing strategy.

Observem, nestas que são as mais importantes sentenças do artigo, que em nenhum momento há menção de que o estudo se trata da comparação do resultado do ensaio clínico entre diabéticos e não diabéticos (interação). Faz parecer que a tomografia foi comparada a métodos funcionais em uma única população de diabéticos. Não está explícito de que esta é uma análise secundária. 

Falo sobre leitores desavisados, porém eu mesmo sou um deles. Na verdade, leio poucos artigos por semana da forma ideal. Nos demais, passo o olho só para saber o que está acontecendo. Este particularmente me chamou atenção, pois eu já conhecia o PROMISE, portanto notei logo que seria um análise de subgrupo. Mas eu poderia ser enganado. 

Deveria constar no título que um trabalho representa uma subanálise de um estudo original. Isso daria plena transparência. A propósito, esta é uma  falha do checklist do CONSORT, que orienta apenas que o desenho geral do estudo (randomizado) seja mencionado no título.

Seria simples deixar isso transparente escrevendo algo como: Effect of diabetes in the comparison between Stress Testing Versus CT Angiography in Patients With Suspected Coronary Artery Disease: a PROMISE Substudy.

Na descrição do trabalho também não está explícito de que esta é uma análise de subgrupo, nem explícito que é não era predefinida. Vejam o momento em que percebemos que é uma análise que compara diabetes com não diabetes:

"We used contemporary data from PROMISE (Prospective Multicenter Imaging Study for Evaluation of Chest Pain), a randomized trial of diagnostic evaluation strategy in stable outpatients with symptoms suggestive of CAD. We assessed symptomatic patients with and without diabetes."

Análise de Desfecho Secundário

"The clinical outcomes of interest included time to death/MI/unstable angina hospitalization (UAH) and CV death/MI."


Apenas mencionam dois desfechos, não determinam hierarquia entre eles. Qual o primário, qual o secundário? Resposta: nenhum dos dois, pois o desfecho primário do estudo é o combinado de quatro desfechos. Para saber isso eu precisei voltar à publicação original e relembrar qual era do desfecho primário. 

Esta é uma violação da recomendação do CONSORT, que pede que desfechos sejam definidos em primários ou secundários. 

Análise por protocolo

"For the present analysis, the population of patients with an interpretable testing result was used."

Precisamos a partir disso notar que foram excluídos pacientes depois de randomizados, e que estas exclusões tendem selecionar pacientes com graus diferentes de risco. Mais uma vez, não está explícito. 


Plausibilidade da hipótese

O lugar de explicitar plausibilidade da ideia é na introdução do trabalho. No entanto, a introdução do estudo fala tudo menos porque o exame poderia ter um impacto diferente em diabéticos. 

Discussão

Costumo sugirir a meus alunos que não percam tempo lendo a discussão. Na verdade, o tópico “discussão” tem servido mais para atenuar defeitos do que para discutir de forma transparente o valor preditivo de um estudo. Na medida em que o autor reconhece algumas falhas, gera um senso de transparência, de confiabilidade.  Mas observe que a cada questão mencionada, há sempre uma frase seguinte como se dissesse “mas isso não é um grande problema”.

Menção ao defeito: itálico
Correção do defeito: negrito

“Although our study is post hoc and is subject to the inherent limitations of this type of analysis, evaluation of testing modality and outcomes in patients with diabetes was prespecified." 

Seria pior se os desfechos não fossem pré-especificados. Mas serem desfechos pré-especificados (embora secundários) não atenua o estudo ser análise de subgrupo não pré-especificada. Uma coisa é uma coisa, outra coisa é outra coisa. 

“The identification of reduced risk of CV death/MI in patients with diabetes associated with CTA randomization was based on small numbers. The trends toward reduced risk of death/MI/UAH and CV death/MI/ UAH in patients with diabetes undergoing CTA versus functional testing reinforce the findings seen with the endpoint of CV death/MI.”

Foi erro grosseiro ter avaliado vários desfechos e não ter dito qual seria o primário. Tentou em vários para ver qual dava significativo, o que é errado. Mas ele pega essas múltiplas comparações e faz parecer que as não significativas servem de confirmação para a significativa. 

“Slight statistical differences in some of the baseline characteristics were seen in patients without diabetes who were randomized to CTA versus functional stress testing; however, the absolute differences were small and likely not clinically relevant."

Tentando mais uma vez atenuar heterogeneidades surgidas da análise de subgrupo. 

Por fim, a frase final da conclusão, que fecha tudo: "In evaluating stable patients with diabetes who have symptoms suggestive of CAD, physicians should consider these benefits of using CTA as the initial diagnostic strategy."


Mensagem Final

Subestudos positivos de estudos originalmente negativos nascem como uma intenção científica questionável. Devemos contrabalançar o viés da positividade (procura incessante por dados positivos) como um viés de proteção hipótese nula, a premissa científica básica. 

-------------------------------------------------------------------------------------------------------------------------

O que piora a qualidade de Subestudos

- Baixa plausibilidade da nova hipótese testada (qualidade da ideia) 
- Análises não predeterminada
- Combinação de multiplicidades (subgrupo + desfecho secundário)
- Mais de um desfecho secundário testado simultaneamente, sem hierarquia estabelecida
- Criação de vieses não contidos nos estudos originais

-------------------------------------------------------------------------------------------------------------------------

Acesse nosso Curso Online de MBE, clicando aqui. 




sexta-feira, 15 de fevereiro de 2019

O verdadeiro sentido de um “estudo negativo”



Voltando à nossa série de postagens sobre a “arte de ler um artigo científico”, iniciaremos a discussão de como interpretar um “estudo negativo”. Mas antes de abordar o julgamento da veracidade deste tipo de estudo (próximo post), precisamos discutir o que significa um estudo negativo. Essa discussão é quase filosófica. 

Neste contexto, “negativo” não quer dizer ruim, nem que foi demonstrado um efeito deletério de uma conduta médica. “Negativo” significa que o estudo não conseguiu comprovar a existência de um fenômeno. Mas aqui vai a ideia central: na verdade, não existe estudo negativo. 

Não existe estudo negativo, pois um estudo não é planejado para negar a veracidade de uma ideia. Por dois motivos: (1) negar existência é impossível; (2) seria inútil negar existência.

Primeiro, nenhum experimento é capaz de negar a possibilidade de existência. Em analogia, há sempre possibilidade de que algo seja menor do que a potência da lente do microscópio; ou esteja além da lente do telescópio; ou tenha aparecido em um momento anterior ou posterior à observação realizada. Por exemplo, é impossível provar que disco voador não existe. Simplesmente, a gente ainda pode não ter conseguido detectar sua existência. 

Sendo impossível provar inexistência, o ônus da prova está da existência de um fenômeno, dando origem ao princípio da hipótese nula: partimos da premissa da inexistência e ficaremos com esse pensamento até que alguma evidência comprove existência, rejeitando a nulidade. 

Partindo da premissa inicial de inexistência, o ônus da prova está na existência.

Segundo, diante da teoria da hipótese nula, negar existência é inútil, pois já partimos da inexistência. Um estudo é necessário para rejeitar a hipótese nula e evoluir para o conhecimento de que algo existe. 

A nulidade não precisa ser comprovada, apenas precisa ser rejeitada. 

Não há motivo em “acreditar” em disco voador se isto não está comprovado. Eu pessoalmente, pouco me importo com isso. Simplesmente, não sei. A gente precisa se importar menos com o que não está comprovado. Portanto, estudos não são desenhados para provar que algo não existe. 

Um estudo negativo é um estudo desenhado para ser positivo, mas que não conseguiu ser positivo. 
Quando um estudo de resultado negativo contraria a crença ou conduta vigente, entusiastas da crença ou conduta costumam criticar o estudo negativo como se este fosse um estudo limitado para provar a ausência: “este estudo não é suficiente para provar que tal tratamento não funciona”. Este tipo de argumentação carece da percepção de que um estudo é desenhado para provar a existência do fenômeno. Apesar deste desenho, o estudo negativo não conseguiu provar. 

Cuidado com a inversão do ônus da prova. 

Do ponto de vista científico, é um erro (teórico e pragmático) propor um estudo no intuito de provar que algo não existe ou algo não funciona. Isto ocorreu recentemente, quando oncologistas, sabendo que a eficácia da fosfoetanolamina não fazia sentido, propuseram um estudo para confirmar que aquilo não passava de uma falácia. O estudo foi negativo,  claro. No entanto, entusiastas da fosfoetanolamina argumentaram que aquele estudo não era suficiente para provar que a droga não funcionava. Tinham razão … não pode haver prova que não funciona. Este é um exemplo de estudo inútil pois nunca conseguirá provar uma inexistência que não precisa ser provada.

Oncologistas, com um intuito válido de combater anti-ciência, se propuseram a algo impossível: provar inexistência. Apesar da boa intenção científica, caíram na própria armadilha.

Não se pode dizer que um estudo “demonstrou ausência de benefício”. O correto é dizer que o estudo não demostrou benefício. 

Cuidado com a semântica. 

Ontem eu explicava a importância da postura cética em respeito à hipótese nula, quando um perspicaz aluno me interrompeu e questionou: “professor, como nós estudantes, ainda sem grande experiência, podemos contestar um médico experiente que implementa uma conduta sem comprovação científica.” A pergunta vai ao cerne da questão e me permitiu o insight: “não cabe a vocês provar que a conduta implementada não funciona, cabe ao médico demonstrar que a conduta funciona.” Repetindo, o ônus da prova está na demonstração de benefício. Desta forma, sugeri aos meus alunos que apenas questionem: “professor, qual o embasamento científico desta conduta.” Meus alunos não precisam provar que o preceptor está errado. O preceptor que precisa provar que está correto. 

A responsabilidade do argumento está em quem defende a conduta. 

Esta discussão é essencial para a interpretação adequada de um estudo negativo: a existência do fenômeno não foi comprovada. Um bom estudo é desenhado para ter sensibilidade e especificidade da detecção do fenômeno. A especificidade depende do método científico que previne contra erro aleatório tipo I (afirmar casualmente o falso) e vieses de positividade. A sensibilidade é obtida pelo recrutamento de amostra populacional de tamanho ideal (previne erro tipo II - deixar de afirmar casualmente o verdadeiro), característica ideal, dose ideal, competência ideal dos profissionais, monitoramento da correta aplicação da conduta. Tudo isso melhor do que ocorre no mundo real. 

Sendo assim, quando um bom estudo não consegue provar um conceito, a probabilidade deste conceito ser verdadeiro se reduz. E os estudos negativos vão diminuindo a probabilidade até um ponto em que se julga que não vale mais a pena insistir na comprovação da hipótese. Servem para nos fazer desistir de comprovar uma ideia, o que não é o mesmo de provar inexistência.

Em conclusão, na análise de um artigo negativo, será inadequado concluir que aquele trabalho é insuficiente para provar inexistência.  A interpretação correta é que o trabalho não conseguiu provar existência. A utilidade deste trabalho reside na redução da probabilidade da ideia vir a ser comprovada no futuro. O impacto na redução da probabilidade é proporcional à qualidade do estudos. Isto abre caminho para nossa próxima postagem da "arte de ler um artigo científico": como analisar a qualidade metodológica de um estudo negativo?

---------------------------------------------------------------------------------

Acesse nosso Curso Online de MBE, clicando aqui. 

terça-feira, 29 de janeiro de 2019

Brumadinho e a Lógica Científica do Cisne Negro


* Artigo publicado no Jornal A Tarde em 01 de fevereiro de 2019

A lógica do cisne negro é um conceito proposto pelo cientista da incerteza Nassim Taleb, que define eventos (1) raros, (2) imprevisíveis e (3) de grande impacto. São os “cisnes negros” que mudam o curso da humanidade: queda da bolsa de 1929, surgimento de Hitler, descobrimento casual dos antibióticos, surgimento do iPhone, internet, 11 de setembro. Nenhum desses raros eventos poderia ser previsto, portanto não poderiam ser prevenidos, nem planejados. E o impacto deste eventos é proporcional a sua imprevisibilidade.

Em ciência, a lógica do cisne negro torna cientistas atentos ao papel da serendipidade (ideia que surge do nada) e do acaso nas grandes descobertas. Verdadeiros cientistas não se garantem apenas com  plausibilidade, focalizam o máximo na experimentação e reconhecem resultados inusitados como geradores de hipóteses. Respeitam o cisne negro.

Na interpretação da história social ou clínica, a falta de reconhecimento do conceito do cisne negro faz com que interpretemos eventos com base em falaciosas hipóteses causais criadas pelo fenômeno de “previsibilidade retrospectiva”: contamos a história de frente para trás, inventando sentido para um fato. 

Por outro lado, nossa elaboração mental deve perceber quando o evento não se trata de um cisne negro. Assim, a diferenciação entre cisnes brancos e negros deve estar no cerne da alfabetização científica da sociedade. 

Quando ocorreu o desastre de Mariana, pensei: será que este foi um cisne negro? Embora analistas responsabilizassem a Vale por não ter prevenido aquele evento, eu me questionava se a impressão de que aquela catástrofe seria evitável não seria uma falácia narrativa. Aquele foi um evento raro e impactante. E como ninguém previu, poderia ser um evento imprevisível. Os três critérios do cisne negro estariam presentes. 

Brumadinho desvendou o dilema: o desabamento das barragens da Vale não são cisnes negros. Ao ocorrer o mesmo evento em curto período, este deixou de ser raro e imprevisível. Um único evento inusitado pode decorrer do acaso, mas fica menos provável que dois eventos inusitados repetidos em pouco tempo decorram do acaso. Cientificamente, reprodutibilidade reduz a probabilidade do acaso. 

A percepção de que isso não foi por acaso implica na possibilidade de prevenção a partir da identificação de causas. Portanto, abre-se o caminho para que isto nunca mais ocorra. 

No entanto, surge uma preocupação ...

Se por um lado, o impacto local foi devastador, a perda do inusitado reduz o impacto histórico daquele evento. De acordo com a lógica do cisne negro, quanto mais inusitado, mais impactante é o evento. Brumadinho deixou de ser imprevisível, inusitado. Assim, passado o trauma da semana, o assunto naturalmente se diluirá entre tantos outros e a probabilidade de mudança de atitude pode ser menor do que após o inusitado desastre de Mariana. 

Portanto, fiquemos atentos, Brumadinho não é um cisne negro!

domingo, 27 de janeiro de 2019

A arte de ler um artigo científico


Neste ano planejo uma série de postagens que denominarei de “bússolas” para a interpretação crítica de trabalhos científicos. Normalmente discuto interpretação científica no contexto de algum artigo ou assunto controverso. Pretendo agora revisar estes conceitos de forma estruturada, em postagens definidas por tipos de estudo e tipos de resultado. 

Não gosto muito da conotação burocrática e simplista dos termos “guia” ou “checklist” de análise de uma evidência científica. A leitura de um artigo requer não apenas a “checagem” de detalhes. Checklist é para avião que vai decolar ou cirurgia que vai começar. Não basta checklist na interpretação científica. É necessário visão do todo, envolvimento com o assunto, percepção intuitiva trazida pela experiência, capacidade de reflexão, um equilíbrio entre ceticismo e pragmatismo. É como ler um livro ou assistir a um filme, nossa interpretação não se resume a um checklist. 

Imaginem um crítico de cinema que analisa filmes pela forma estruturada de um checklist. Não chegaria ao seu objetivo. Por outro lado, na análise de uma evidência científica não podemos ter liberdade artística para interpretar como quisermos pois isso seria um convite ao viés de confirmação de crenças ou valorização seletiva de resultados. Precisamos controlar nossos vieses pessoais durante a leitura; precisamos saber como procurar componentes ilusórios dos trabalhos, perceber quando ruídos se confundem com sinais; precisamos seguir princípios científicos. Estes princípios devem nos nortear como uma bússola.

A leitura de um artigo não é um processo passivo. Mais do que uma leitura, é um processo de pensamento baseado em dados. Pensamos primeiro, depois procuramos a resposta no trabalho. E assim vamos construindo uma ideia mental do quanto aquela evidência deve influenciar nosso pensamento. 

Com estas colocações não quero transmitir a ideia de que a interpretação de uma evidência é difícil ou laboriosa. Pelo contrário, a leitura de um artigo deve ser atividade leve, natural, e até divertida.

Como tenho proposto ao longo de múltiplas postagens, a leitura do artigo começa antes do artigo. Começa dentro de nós, com a procura de vieses pessoais que atrapalhem uma análise racional. Precisamos nos preparar mentalmente para a análise de qualquer evidência externa, pois esta pode vir de encontro a nossas perspectivas internas. Essa preparação passa pelo questionamento de quais são nossas evidências internas (crenças) a respeito do assunto que está exposto no título do trabalho de interesse. Esta proposta de aquecimento mental foi tema de postagem prévia no Blog. 

Prosseguindo com a reflexão pré-artigo, precisamos saber do que o artigo trata. Para isso teremos um contato inicial com o conteúdo do trabalho, pela leitura de apenas duas sentenças do resumo:  objetivo e conclusão. Esses são os pilares de nossa análise. O objetivo mostra a hipótese testada ou a realidade descrita. A conclusão reflete o que o autor quer que você acredite como mensagem final do artigo. Neste momento exercitaremos o ceticismo, pois a leitura do artigo deve ser uma tentativa de refutar a conclusão. Uma rigorosa análise de ruído (viés, acaso) versus sinal (verdade). Uma baixa relação sinal/ruído trará dúvida quanto à veracidade da conclusão do trabalho. 

A leitura da conclusão também nos permite um importante insight do quanto o autor é enviesado. Refiro-me ao diagnóstico de spin, quando o autor reconhece um resultado primário negativo, mas logo em seguida gera uma tendência positiva a partir da apresentação de um resultado secundário. Por exemplo, “na análise global não houve diferença entre os grupos quanto à fração de ejeção do ventrículo esquerdo [desfecho primário], porém houve melhora da troponina [desfecho secundário]”. Spin é um forte marcador de tendenciosidade. A detecção desde o início nos fará mais atentos.  

Ainda na leitura pré-artigo, vale apenas observar se (1) o estudo é uma iniciativa do fabricante do produto testado, (2) se é realizado por grupo independente, porém recebe ajuda de custo do fabricante ou (3) se o trabalho não possui nenhuma relação de financiamento com o fabricante. Essa numeração representa uma escala do grau de envolvimento do fabricante com o trabalho científico. Teoricamente, quanto menor o envolvimento, mais isento seria o estudo. Recente trabalho publicado no Annals of Internal Medicine demonstrou que quanto maior a vinculação com indústria farmacêutica, mais utilização de métodos estatísticos inadequados com objetivo de obter o resultado desejado. 

Devemos também investigar se os autores possuem conflito de interesses, seja relação com indústria, seja conflitos assistenciais ou intelectuais. Conflito de interesses assistencial é aquele desejo do autor em provar uma hipótese que fortaleça sua atividade profissional. Esse pode ser um conflito maior do que o daqueles que recebem um dinheirinho da indústria. Por exemplo, trabalhos que testam acurácia de métodos diagnósticos ou eficácia de tratamentos podem ser feitos por profissionais cuja atividade principal é ligada ao método ou tratamento. Já conflito de interesses intelectual ocorre quando um autor faz parte de uma legião de estudiosos e crentes a respeito de um assunto. Por exemplo, no caso do escândalo do estudo PREDIMED, os autores fazem parte de uma legião de crentes na dieta do mediterrâneo. 

Não proponho aqui invalidar o estudo se este tiver fonte financiadora interessada ou conflito de interesses. Mas devemos aumentar nosso grau de atenção. Revisão sistemática da Cochrane mostra que trabalhos com conflito de interesses apresentam maior probabilidade de resultados positivos do que trabalhos sem financiamento do fabricante, um viés que não deveria existir. Interessante notar que, pela avaliação tradicional de risco de viés da Cochrane, o estudo não detectou maior risco de viés nos trabalhos com conflito de interesses. Isto ocorre porque estudos financiados pela indústria são "bem feitos" de acordo com uma avaliação metodológica superficial: seguem a metodologia padrão (tamanho amostral, randomização, cego). Os ruídos destes trabalhos usualmente são detectados pelo tipo de leitura que propomos, algo que vai além de um checklist presente em revisões sistemáticas. 

Portanto, até aqui analisamos primeiro a nossa tendenciosidade como leitor, depois a tendenciosidade do autor.

Em se tratando de um trabalho analítico, o próximo passo é a análise da probabilidade pré-teste da hipótese testada. O experimento científico é o teste, enquanto o pré-teste é o conhecimento que existe antes do trabalho. Há dois componentes da probabilidade pré-teste: a plausibilidade da hipótese (mecanismo lógico, conhecimento de ciência básica que suporta este mecanismo) e trabalhos prévios que testaram a hipótese. 

Esta etapa é importante pois o valor preditivo do resultado do trabalho depende não só do trabalho, como também da probabilidade pré-teste da ideia sugerida pelo trabalho. Ao final da leitura de um artigo, queremos saber qual a probabilidade daquela conclusão ser verdadeira. Isso depende também da qualidade pré-teste da ideia. 

Trabalhos cujo resultado propõe ideias sem sentido terão baixo valor preditivo positivo, independente da força da evidência. Assim como trabalhos negativos terão menor valor preditivo negativo quando a ideia for muito promissora. Esta é a perspectiva bayesiana que defendo para o processo de análise crítica de uma evidência. Uma evidência não deve ser analisada no vácuo, mas sim no contexto da ideia. 

Além de analisar qualidade da hipótese testada, devemos analisar a probabilidade pré-teste do resultado encontrado. Resultado improváveis possuem menor probabilidade pré-teste e menor valor preditivo positivo. Precisamos avaliar se estamos diante de um resultado "bom demais para ser verdade".

A próxima etapa será a procura dos registros prévios do protocolo, com o intuito de saber: o protocolo foi publicado a priori (bases de protocolos ou revistas)? O protocolo a priori coincide com método publicado no artigo ou houve mudanças a posteriori? Respostas “sim” para a primeira pergunta e “não” para a segunda pergunta trarão credibilidade aos resultados. Não é frequente com grosseiras mudanças de protocolo, como exemplificadas por duas postagens prévias (ISCHEMIA E SCOT-HEART). Uma recente varredura nos registros do clinicaltrials.org demonstrou que 30% dos trabalhos modificam o desfecho primário definido a priori. Estas mudanças reduzem substancialmente o valor preditivo do estudo, ou seja, sua credibilidade.

Chegamos finalmente à leitura do artigo. Agora, procuraremos por erros sistemáticos (vieses) e aleatórios (acaso) que promovam ruídos e resultados ilusórios. Esta leitura do artigo se resume a “métodos” e “resultados”. 

Um parêntese: “introdução” e “discussão” não precisam ser lidas. Eu quase nunca leio. Não que seja ruim ler, é que minha preguiça não me deixa perder tempo com o desnecessário. Mas se lerem, não simplesmente acreditem (fé) nos argumentos do autor para a ideia do trabalho (introdução), nem na interpretação dos resultados (discussão). Não leiam acreditando, leiam duvidando. Mesmo que ao final concordem.

Temos que saber o que procurar em métodos e resultados. O que procurar depende do objetivo do estudo: eficácia de tratamento, acurácia diagnóstica, acurácia prognóstica. A análise também depende de se o estudo for positivo ou negativo. A direção da leitura do artigo é diferente a depender da direção do resultado. Coisas diferentes causam falsos-negativos ou falsos-positivos.

Outra questão interessante é o diferente nível de atenção que devemos ter em métodos e resultados. Em métodos avaliamos predominantemente erros sistemáticos. Em resultados avaliamos erros aleatórios. P

Detectamos potenciais vieses quando notamos falhas no desenho do estudo descritos nos métodos. 

Mas é nos resultados que veremos o grau de significância estatística ou a imprecisão dos intervalos de confiança, aspectos que representam o risco de erro aleatório. Nos resultados que perceberemos se a amostra cumpriu com as premissas do cálculo do tamanho amostral descrito nos métodos. Por exemplo, o cálculo (métodos) está perfeito e supõe uma certa incidência do desfecho, porém veremos em resultados que esta premissa não foi obedecida. Portanto, este seria um trabalho com maior risco de erro aleatório. Também será nos resultamos que veremos desvios de integridade científica que predispõem a erro aleatório: o estudo foi interrompido precocemente pois o resultado aparentou positivo (truncado), o autor começa a valorizar descrição de desfechos secundários ou análise de subgrupo (reporting bias).

Depois de toda essa análise, na ausência de mudanças de protocolo e quando observamos baixo risco de viés ou acaso, concluiremos que temos um estudo com alto nível de evidência. 

Por fim, a resposta final será bayesiana: devemos calcular a probabilidade pós-teste. Quando temos uma hipótese moderadamente provável a priori, um estudo de baixo risco de viés e erro aleatório é suficiente para gerar um valor preditivo positivo alto. No caso de hipótese pouco provável, um bom estudo terá valor preditivo positivo moderado e requeremos um segundo estudo para confirmar a ideia (reprodutibilidade).

No caso do estudo negativo, quando desistir da ideia? Normalmente, se a hipótese não for promissora, temos uma tendência a julgar que não vale mais a pena insistir na ideia. Mas se a ideia for muito provável, precisaremos de mais de um estudo negativo para nos fazer desistir do conceito. 

Ciência não prova inexistência, ciência prova existência de conceitos. Como é impossível provar que algo não existe, o que está em jogo na análise de um estudo negativo é se este deve nos fazer desistir de provar a ideia ou se devemos continuar tentando provar. Devemos avaliar quando estamos sendo teimosos ou quando abandonar a ideia. Isso depende do valor preditivo negativo do estudo, que depende da probabilidade pré-teste e da relação sinal/ruído do estudo. 

Resumindo, devemos avaliar:

  • Tendenciosidade do leitor (minhas crenças internas)
  • Tendenciosidade intrínseca do autor (spin)
  • Tendenciosidade extrínseca do autor (conflito de interesses)
  • Probabilidade pré-teste da ideia
  • Mudanças de protocolo a posteriori
  • Relação sinal/ruído do estudo (métodos e resultados)
  • E finalmente, calcularemos mentalmente o valor preditivo do trabalho

Após esta introdução genérica de como ler artigos científicos, trabalharei em uma a série de postagens ao longo desse ano, com as especificidades de cada tipo de análise crítica:

  • Como avaliar probabilidade pré-teste de uma ideia
  • Como julgar se premissas do cálculo amostral foram obedecidas
  • Como julgar trabalhos negativos sobre condutas médicas
  • Como julgar trabalhos positivos sobre condutas médicas
  • Como julgar trabalhos de acurácia diagnóstica
  • Como julgar estudos de coorte para marcadores prognósticos
  • Como julgar estudos de coortes para causalidade
  • Como julgar estudos caso-controle para causalidade

Bem, não será exatamente nessa ordem, pois a inspiração vem de diferentes fontes, de trabalhos que surgem para ser analisados, de aulas que dou, de perguntas desafiadoras de alunos, de discussões interessantes com colegas e de casos clínicos que um provocam reflexões (skin in the game, como diria Taleb). Textos assim ficam bons mesmo quando surgem do sentimento de nossa “pele no jogo”, de nossa experiência clínica.

Portanto, não esperem nada previsível, pois esse blog é imprevisível, como já devem ter percebido.

Denominarei estes posts de “bússolas”, pois não há mapas precisos ou GPSs quando se trata do verdadeiro pensamento científico. Nossas “bússolas de análise crítica” estimularão um pensamento reflexivo, livre de dogmas, repleto de perguntas e com poucas certezas. 

________________________________________________________________________________


_______________________________________________________________________

Conheça nosso curso online de medicina baseada em evidências, clicando aqui.

quinta-feira, 17 de janeiro de 2019

Analfabetismo Científico e o Escândalo do Médium-Cirurgião




* Texto de Luis Correia recentemente publicado no Jornal A Tarde

Ceticismo é desejo de explorar antes de aceitar uma verdade. Ceticismo promove dúvida, que por sua vez promove a curiosidade necessária para o início da investigação. 

Crença é o alicerce do pensamento religioso, cuja proposta se distancia da curiosidade. 

Os paradigmas do ceticismo e da crença representam dois modelos mentais essenciais na vida humana, porém com funções diversas. Não faz sentido aplicar ceticismo a questões religiosas, assim como é inadequado aplicar crença a questões científicas. 

Inteligência científica não é o mesmo que conhecimento científico. É prevalente a coexistência de conhecimento científico e analfabetismo científico. Saber transitar entre os paradigmas dogmático e cético é o que caracteriza uma pessoa alfabetizada cientificamente.

Quando uma abordagem espiritual se intitula “cirurgia” com objetivo de beneficiar o prognóstico clínico de um paciente, devemos abandonar o paradigma religioso e adotar o paradigma científico. Produtos ou condutas médicas requerem demonstração experimental de eficácia e segurança.

É válido acreditar em benefícios espirituais de uma intervenção espiritual. Porém falta inteligência científica para conseguir dar crédito ao um indivíduo que promove “cirurgias espirituais” com instrumentos perfuro-cortantes sob a premissa de benefício clínico, a despeito da ausência de comprovação experimental da eficácia de suas abordagens; falta inteligência científica para não perceber que uma afirmação extraordinária requer evidência extraordinária. 

Violar o paradigma científico pode ter consequências não intencionais imprevisíveis. A confiança nas propostas curativas do médium-cirurgião promoveu uma santificação de sua pessoa, deixando a sociedade cega a respeito do óbvio. Não se pode confiar em indivíduos que se propõem a tais condutas sem antes realizar os devidos testes científicos. O mundo tem alguns exemplos clássicos de tragédias promovidas por líderes carismáticos. Estamos diante de mais uma dessas tragédias, sofrida por centenas de mulheres que procuravam alívio de algum sofrimento. 

Inteligência científica é uma questão de responsabilidade social. Como sociedade, precisamos assumir parte da responsabilidade, pois não bastou um indivíduo com baixa integridade moral, foi necessária uma sociedade de baixa “integridade científica” para aceitar uma fantasia curativa inaceitável.

Uma sociedade evoluída cognitivamente não utiliza o paradigma da fé para questões científicas, nem o ceticismo em questões de crença. Uma sociedade evoluída tem religião ou espiritualidade como valores essenciais, mas sabe dar o protagonismo necessário à visão cético-científica.




Conheça nosso curso online de medicina baseada em evidências, clicando aqui.