Wprowadzenie do metaanalizy: kiedy ma sens i jak czytać jej wyniki

0
48
3/5 - (1 vote)

Spis Treści:

Od czego zacząć: kiedy metaanaliza ma sens, a kiedy lepiej się wstrzymać

Najpierw pytanie badawcze: spójność według PICO

Metaanaliza działa najlepiej, gdy łączy badania odpowiadające na to samo pytanie PICO: Populacja, Interwencja (lub ekspozycja), Comparator (porównanie) i Outcome (wynik). Jeśli PICO w poszczególnych badaniach znacząco się różni, łączenie efektów może przypominać mieszanie jabłek z pomarańczami.

Krok 1: zdefiniuj precyzyjnie, kogo dotyczą wnioski (np. osoby dorosłe z łagodną depresją, a nie „wszyscy pacjenci psychiatryczni”). Krok 2: upewnij się, że interwencja i komparator mają porównywalne dawki, czas trwania i sposób podania. Krok 3: sprawdź, czy wyniki (miary efektu) są podobne albo możliwe do przełożenia na wspólną skalę.

Co sprawdzić: czy przynajmniej 70–80% włączonych badań rzeczywiście pasuje do wspólnego pytania? Pojedyncze odchylenia mogą być akceptowalne, ale gdy różnice dominują, metaanaliza traci sens poznawczy.

Kiedy łączenie danych jest uzasadnione

Metaanaliza ma sens, gdy: (1) istnieje co najmniej kilka badań o zbliżonej metodologii, (2) kierunek efektu jest podobny lub uzasadnione są niewielkie różnice, (3) jakość badań jest przynajmniej umiarkowana, (4) rozbieżności w populacjach i interwencjach można wyjaśnić a priori w protokole (np. planowane analizy podgrup).

Dobrym sygnałem jest, gdy badania raportują kompatybilne miary efektu (np. wszędzie ryzyko względne), a wyniki nie są skrajnie rozproszone. Uzasadnienie bywa silniejsze, gdy dostępna jest rejestracja protokołu i szerokie, systematyczne wyszukiwanie, zmniejszające ryzyko pominięcia badań z nieistotnymi wynikami.

Co sprawdzić: czy autorzy metaanalizy jasno uzasadnili wybory metod (miara efektu, model łączenia), a także czy przeprowadzili analizy czułości potwierdzające stabilność wniosków.

Kiedy lepiej się wstrzymać lub ograniczyć się do syntezy jakościowej

Wstrzymaj entuzjazm, jeśli: (1) heterogeniczność jest skrajnie wysoka i niewyjaśniona (np. I2 powyżej 80–90% bez wiarygodnych źródeł), (2) badania są bardzo słabe metodologicznie lub obciążone poważnym ryzykiem stronniczości, (3) w zestawie dominują małe, słabo zaprojektowane prace, z których wyciągnięto duże efekty, (4) interwencje są różne do tego stopnia, że wspólna miara efektu nie odzwierciedla rzeczywistości klinicznej.

Czasem lepsza jest narracyjna synteza wyników i wskazanie warunków, w których efekt może występować, niż pozorna precyzja jednego łącznego wskaźnika. Metaanaliza nie jest obowiązkowa w każdym przeglądzie systematycznym; powinna być narzędziem, nie rytuałem.

Co sprawdzić: czy autorzy sami rozważyli rezygnację z łączenia lub zastosowali przedział predykcji, który ujawnia szeroką zmienność spodziewanych efektów w przyszłych badaniach.

Najczęstsze pytania czytelników i użytkowników wyników

  • Czy wysoki I2 przekreśla metaanalizę? Nie zawsze. Ważne są źródła różnic, spójność kierunku efektu i przedział predykcji.
  • Jak czytać wykres lasu? Warto rozumieć miarę efektu, osie i wagi badań, a także to, co oznacza romb łącznego efektu.
  • Który model wybrać: efekty stałe czy losowe? Zależy od pytania i heterogeniczności; często sensowniejszy jest model losowy.
  • Skąd mam wiedzieć, czy wynik jest praktycznie istotny? Przelicz efekt na skalę kliniczną lub użytkową (np. NNT, różnica bezwzględna).
  • Jak rozpoznać błąd publikacyjny? Wstępnie: funnel plot, testy asymetrii i poszukiwanie szarej literatury.

Jak czytać wyniki metaanalizy krok po kroku

Wprowadzenie do metaanalizy: kiedy ma sens i jak czytać jej wyniki
Źródło: Pexels | Autor: Engin Altundağ

Miary efektu: OR, RR, MD, SMD i co dalej

Miara efektu to język, którym metaanaliza opisuje różnicę między interwencją a komparatorem. Najczęściej spotkasz:

  • RR (relative risk) – ryzyko względne; łatwiejsze klinicznie, gdy znasz ryzyko bazowe.
  • OR (odds ratio) – iloraz szans; przydatny w modelach logistycznych, ale mniej intuicyjny.
  • MD (mean difference) – różnica średnich w tej samej skali pomiarowej.
  • SMD (standardized mean difference) – ujednolica różne skale; interpretacja w jednostkach odchylenia standardowego (np. d Cohena).

Krok 1: zidentyfikuj miarę i sprawdź kierunek korzyści (czy wartości poniżej 1 oznaczają korzyść czy szkodę). Krok 2: odnieś ją do kontekstu – dla RR i OR poszukaj ryzyka bazowego, aby przełożyć wynik na różnicę bezwzględną. Krok 3: dla SMD oceń, czy przyjęte progi efektu (np. 0,2; 0,5; 0,8) mają sens w danej dziedzinie, a nie tylko statystyczny standard.

Co sprawdzić: czy autorzy nie mieszali nieporównywalnych miar bez odpowiednich transformacji oraz czy skale wyników były ustawione w ten sam kierunek (większa wartość = lepiej/gorzej).

Wykres lasu: co oznaczają linie, kwadraty i romb

Wykres lasu pokazuje każdy wynik badania jako kwadrat (estymata) z poziomym odcinkiem (przedział ufności). Wielkość kwadratu odzwierciedla wagę badania (często związaną z precyzją). Na dole widzisz romb – łączny efekt, którego szerokość to 95% CI.

Krok 1: oceń, czy większość odcinków przechodzi przez linię braku efektu (np. RR = 1). Krok 2: zobacz, jak szeroki jest romb i czy obejmuje brak efektu. Krok 3: porównaj rozrzut pozycji kwadratów – duży rozrzut to sygnał heterogeniczności. Jeśli jest podany przedział predykcji, traktuj go jako prognozę efektu w nowym, podobnym badaniu; bywa znacznie szerszy niż 95% CI.

Co sprawdzić: czy duże badania nie dominują w sposób, który zamazuje rzeczywiste różnice podgrup (np. inna populacja w największym RCT).

Znaczenie kliniczne i praktyczne: więcej niż p-wartość

Statystyczna istotność nie równa się użyteczności. RR = 0,95 przy p = 0,04 może nie mieć znaczenia klinicznego, jeśli różnica bezwzględna wynosi promil. Z drugiej strony, skromny, ale stabilny efekt przy niskich kosztach i wysokim bezpieczeństwie może być ważny.

Przeliczanie efektów na liczby bezwzględne i NNT/NNH

Miary względne są zwięzłe, ale decyzje zapadają w liczbach bezwzględnych. Krok 1: ustal realistyczne ryzyko bazowe (p0) dla swojej populacji i horyzontu czasu – nie zawsze jest to średnia z badań; czasem lepiej użyć lokalnych rejestrów lub ramienia kontrolnego z najbardziej zbliżonych badań. Krok 2: przelicz efekt względny na ryzyko po interwencji (p1). Dla RR: p1 ≈ RR × p0; dla OR zastosuj przeliczenie na ryzyko, bo OR przeszacowuje efekt przy wyższych p0. Krok 3: policz różnicę bezwzględną (ARR/ARI = p0 − p1) i NNT/NNH = 1/|ARR|, z dopisanym horyzontem (np. 1 rok, 6 miesięcy).

Przykład praktyczny: jeżeli RR = 0,75, a ryzyko bazowe wynosi 20% w rok, to p1 ≈ 15%, ARR = 5 punktów procentowych, NNT = 20 w rok. Ta sama relacja przy p0 = 5% daje ARR = 1,25 p.p. i NNT = 80 – kliniczna interpretacja zmienia się diametralnie.

Co sprawdzić: czy autorzy podają NNT/NNH z przedziałami ufności i jasno definiują horyzont czasowy; czy przeliczenia nie używają OR jakby był RR; czy ryzyko bazowe odpowiada Twojej populacji.

Heterogeniczność w praktyce: I2, tau² i przedział predykcji

I2 mówi, jaka część zróżnicowania pochodzi z różnic między badaniami, ale nie mówi o skali tej zmienności – tę lepiej oddaje tau² oraz przedział predykcji. Krok 1: spójrz na kierunek efektu – czy większość badań wskazuje w tę samą stronę, nawet jeśli siła efektu się waha? Krok 2: oceń szerokość przedziału predykcji; jeżeli obejmuje zarówno korzyść, jak i szkodę, wnioski powinny być warunkowe. Krok 3: wykonaj szybkie testy odporności: wyklucz badanie wysoce odstające (leave-one-out) i zobacz, czy wniosek się odwraca; jeżeli tak, komunikuj to jako wrażliwy wynik.

Gdy heterogeniczność jest znaczna i ma potencjalne źródła (np. dawka, czas trwania, populacja), uzasadnij analizy podgrup zdefiniowane w protokole. Gdy źródeł brak albo są słabe, lepiej przyjąć model losowy i ograniczyć pewność wniosków zamiast nadmiernie „dopasowywać” model do danych.

Co sprawdzić: jaki estymator wariancji zastosowano (REML, Paule–Mandel, DerSimonian–Laird) i czy użyto korekty Hartunga–Knappa w małych metaanalizach; czy raportowany jest przedział predykcji obok 95% CI.

Decyzje metodologiczne, które najbardziej wpływają na wnioski

Model łączenia: efekty stałe, losowe i podejścia wielopoziomowe

Model efektów stałych zakłada jeden „prawdziwy” efekt; model losowy dopuszcza rozrzut efektów pomiędzy badaniami. Krok 1: zestaw pytanie badawcze z realiami – jeśli populacje i interwencje różnią się sensownie, model losowy bywa bezpieczniejszy. Krok 2: gdy w jednym badaniu jest wiele powiązanych efektów (np. kilka ramion dawki lub wiele miar tego samego wyniku), unikaj wielokrotnego zliczania tej samej próby. Rozważ uśrednienie wewnątrzbadawcze, modele wielopoziomowe lub metaanalizę z odporną wariancją (RVE). Krok 3: w sieciach porównań (network meta-analysis) pamiętaj o założeniu spójności; gdy jest naruszone, wynik łączny może być mylący.

Co sprawdzić: czy zastosowany model pasuje do pytania i heterogeniczności; czy autorzy poradzili sobie z zależnościami wewnątrz badań (uniknięto podwójnego liczenia tej samej grupy kontrolnej).

Analizy podgrup i metaregresja: jak nie polować na „znaczące” różnice

Analizy podgrup potrafią wyjaśnić heterogeniczność, ale są pułapką, gdy projektuje się je po obejrzeniu danych. Krok 1: trzymaj się hipotez z protokołu; nowe eksploracje oznacz jako generujące hipotezy. Krok 2: liczba badań ma znaczenie – metaregresja przy 6–10 badaniach rzadko jest wiarygodna, a współzmienne na poziomie badania niosą ryzyko błędu ekologicznego. Krok 3: interpretuj interakcje przez pryzmat różnicy efektów między podgrupami (test interakcji), a nie przez porównywanie osobnych p‑wartości.

Krótki scenariusz: jeśli efekt jest wyraźniejszy w krótkich badaniach niż w długich, rozważ mechanizmy (np. spadek adherencji) i przeprowadź analizę czułości tylko dla badań powyżej określonego czasu, zamiast ogłaszać, że „działa tylko w krótkim terminie”.

Co sprawdzić: czy liczba testów podgrup nie jest nadmierna; czy różnice potwierdzają się w analizach czułości i czy są klinicznie sensowne, a nie wyłącznie statystyczne.

Ryzyko stronniczości i błąd publikacyjny: ocena wpływu na wynik

Jakość badań bywa ważniejsza niż liczba. Krok 1: oceń ryzyko stronniczości narzędziem adekwatnym do projektu (np. RoB 2 dla RCT, ROBINS-I dla badań nierandomizowanych) i sprawdź metaanalizę ograniczoną do badań o niskim ryzyku. Krok 2: poszukaj oznak efektu „małych badań”: asymetria wykresu lejkowego, test Eggera, różnice w efektach między badaniami prerejestrowanymi i nie. Krok 3: unikaj automatycznego „korygowania” metodą trim-and-fill; stosuj ją ostrożnie, obok szerszego przeszukania literatury (rejestry, szara literatura, kontakty z autorami).

Co sprawdzić: czy wyniki są stabilne po wykluczeniu badań o wysokim ryzyku; czy autorzy rozróżniają small-study effects od błędu publikacyjnego; czy strategia wyszukiwania była wystarczająco szeroka.

Przełożenie wyników na praktykę i komunikację

Formułowanie wniosków warunkowych zamiast kategorycznych

Silny, ale zmienny efekt wymaga komunikatu z warunkiem: „U dorosłych z łagodną depresją, przy dawkach X–Y i interwencji trwającej ≥8 tygodni, średnia korzyść jest umiarkowana; w populacjach z niższym ryzykiem bazowym efekt bywa mniejszy”. Taki opis łączy liczby z zakresem stosowalności.

Co sprawdzić: czy wniosek zawiera informację o populacji, interwencji, komparatorze, wyniku, horyzoncie czasu i niepewności (CI oraz ewentualny przedział predykcji).

Ocena pewności oszacowania w skrócie (GRADE)

GRADE porządkuje pewność dowodów na cztery poziomy: bardzo niska, niska, umiarkowana, wysoka, biorąc pod uwagę ryzyko stronniczości, niespójność, nieprecyzję, niebezpośredniość i publikacyjną stronniczość. Krok 1: powiąż pewność z kluczowym wynikiem (nie „dla całej metaanalizy”). Krok 2: pokaż, jak niepewność wpływa na zakres NNT/NNH. Krok 3: jeżeli pewność jest niska, akcentuj potrzebę kolejnych badań zanim zmienisz praktykę.

Co sprawdzić: czy w tabeli oceny GRADE źródła obniżania/awansowania są jawnie uzasadnione i spójne z wcześniejszą oceną jakości oraz heterogeniczności.

Krótka checklista użytkownika metaanalizy

  • Krok 1: Czy PICO jest spójne i zgodne z Twoją populacją?
  • Kiedy łączenie badań ma sens, a kiedy lepiej się wstrzymać

    Krok 1: zdefiniuj decyzję, dla której szukasz odpowiedzi (np. wdrożenie interwencji u konkretnej grupy pacjentów w określonym horyzoncie). Krok 2: sprawdź, czy badania rzeczywiście odpowiadają na to samo pytanie PICO i w podobnym punkcie czasowym. Krok 3: oceń, czy różnice w populacjach, dawkach i definicjach wyników są mniejsze niż ewentualne korzyści z łączenia.

    Kiedy łączenie ma sens: kilka RCT o zbliżonej interwencji i komparatorze, zgodne definicje wyników, podobny czas obserwacji, niski/umiarkowany rozrzut efektów. Kiedy lepiej się wstrzymać: zlepek populacji o skrajnie różnych ryzykach bazowych i mechanizmach, mieszanie dawek i schematów bez uzasadnienia, zasadniczo odmienne miary wyników, dominacja badań o wysokim ryzyku stronniczości.

    Przykład krótki: interwencja w chorobie przewlekłej oceniana po 4 i 52 tygodniach to często dwa różne pytania. Zamiast łączyć wszystko „bo się da”, lepiej raportować dwa zestawy wyników albo ograniczyć się do horyzontu zgodnego z decyzją kliniczną.

    Co sprawdzić: czy autorzy uzasadnili kliniczną jednorodność; czy czas obserwacji i definicje wyników są spójne; czy ewentualne „szerokie” łączenie ma równoległe analizy czułości w węższych kryteriach.

    Specjalne przypadki: rzadkie zdarzenia i zera w komórkach

    Krok 1: zidentyfikuj częstość wyniku – przy rzadkich zdarzeniach proste korekty 0,5 mogą zniekształcać wnioski. Krok 2: dobierz metodę: modele oparte na liczbach całkowitych (np. beta–binomial, GLMM) lub Peto OR w ściśle spełnionych warunkach (rzadkie zdarzenia, małe i zbalansowane efekty, brak dużych dysproporcji wielkości grup). Krok 3: nie wykluczaj automatycznie badań z zerami w obu ramionach – bywają informacyjne przy modelach właściwych dla danych binarnych.

    Typowy błąd: mieszanie OR z RR i niewłaściwe stosowanie stałej 0,5 przy dużych dysproporcjach liczności grup, co faworyzuje mniejsze badania.

    Co sprawdzić: czy metoda dla rzadkich zdarzeń jest jawnie opisana; czy wykluczano badania z zerami i z jakim uzasadnieniem; czy użyta miara efektu jest zgodna z charakterystyką danych.

    Wyniki ciągłe: MD, SMD i minimalnie istotna różnica

    Krok 1: gdy skale są identyczne i klinicznie interpretowalne, użyj MD (różnicy średnich). Krok 2: gdy skale są różne, użyj SMD, ale postaraj się o back‑transformację do jednostek klinicznych lub odnieś efekt do minimalnie istotnej różnicy (MID), by uniknąć „efektów w odchyleniach standardowych” bez znaczenia dla praktyki. Krok 3: uważaj na różnice w wariancjach między badaniami – SMD bywa wtedy niestabilne.

    Przykład krótki: SMD = 0,25 na skalach bólu może brzmieć obiecująco, ale jeśli odpowiada ~5 punktom na 100‑punktowej skali, a MID wynosi 10 punktów, efekt jest subkliniczny mimo istotności statystycznej.

    Co sprawdzić: czy autorzy prezentują MD tam, gdzie to możliwe; czy SMD jest zinterpretowane względem MID lub przeliczone z powrotem; czy różnice w SD między badaniami nie wyjaśniają „magicznie” dużych SMD.

    Jednostka analizy: klastery, przekroczenia i wiele punktów czasowych

    Krok 1: przy badaniach klastrowych uwzględnij efekt klastra (ICC) lub skorygowane błędy standardowe; inaczej metaanaliza przeszacuje precyzję. Krok 2: przy badaniach krzyżowych użyj różnic wewnątrzosobniczych i sprawdź efekty przeniesienia. Krok 3: dla wielu punktów czasowych wybierz jeden zaplanowany punkt pierwotny na analizę główną; pozostałe traktuj jako czułość/eksplorację, by uniknąć wielokrotnego liczenia tej samej próby.

    Co sprawdzić: czy dostosowano wyniki klastrowe do jednostki randomizacji; czy w badaniach krzyżowych uwzględniono parowanie; czy wielokrotne pomiary nie zostały zsumowane bez kontroli zależności.

    Szybka ścieżka: od metaanalizy do decyzji

    Krok 1: ustaw własne ryzyko bazowe i priorytety (skuteczność vs bezpieczeństwo vs koszty). Krok 2: przelicz efekt względny na bezwzględny dla Twojej populacji i horyzontu czasu; policz NNT/NNH z zakresem wynikającym z CI. Krok 3: sprawdź heterogeniczność i przedział predykcji – jeśli obejmuje zarówno korzyść, jak i szkodę, decyzja powinna być warunkowa (np. „stosuj u pacjentów wysokiego ryzyka, rozważ u pozostałych po ocenie preferencji”).

    Krótki scenariusz: w profilaktyce zdarzeń sercowych, ten sam RR może przekładać się na duże ARR u pacjentów z wyjściowo wysokim ryzykiem, a na marginalne korzyści u młodszych z niskim ryzykiem; decyzja o leczeniu będzie inna mimo „tej samej metaanalizy”.

    Co sprawdzić: czy masz lokalne dane dla p0; czy uwzględniasz szkody i koszty w tym samym horyzoncie; czy zakres niepewności nie zmienia rekomendacji w typowych podgrupach.

    Metaanaliza to mapa: wskazuje kierunek i możliwy rozrzut efektów, ale to kontekst – ryzyko bazowe, wartości pacjentów i realia wdrożenia – decyduje o trasie. Łącz liczby z praktyką, a wyniki będą wspierać decyzje zamiast je zaciemniać.

    Dobór modelu i miary efektu: decyzje, które zmieniają wniosek

    Krok 1: ustal cel estymacji. Jeśli chcesz oszacować „wspólny” efekt dla praktycznie identycznych badań, model efektu stałego ma sens. Jeśli spodziewasz się realnych różnic między badaniami (typowo w badaniach klinicznych), wybierz model efektów losowych i raportuj zarówno efekt średni, jak i przedział predykcji. Pamiętaj: model losowy nie „naprawia” heterogeniczności – jedynie ją uwzględnia w niepewności.

    Krok 2: wybierz estymator i sposób wyznaczania niepewności. Klasyczny DerSimonian–Laird bywa zbyt „pewny”, zwłaszcza przy małej liczbie badań; preferuj REML lub inne nowocześniejsze estymatory wariancji międzybadaniowej oraz korektę Hartunga–Knappa dla przedziałów ufności. Przy 3–5 badaniach różnica potrafi zmienić interpretację (z „istotne” na „niejednoznaczne”).

    Krok 3: dopasuj miarę efektu do decyzji i częstości wyniku. RR jest intuicyjne przy komunikacji klinicznej i stabilniejsze niż RD, ale RD ułatwia przejście do efektów bezwzględnych i NNT/NNH. OR może być użyteczne modelowo, lecz dla częstych wyników bywa mylące interpretacyjnie – jeżeli używasz OR, jednocześnie pokaż przeliczenie na ARR dla typowego ryzyka bazowego.

    Krótki przykład: cztery małe RCT wskazują na korzyść interwencji. Model stałego efektu oraz DL-da bez korekty pokazują wąski 95% CI i „pewną” korzyść. Po przejściu na REML + Hartung–Knapp i dodaniu przedziału predykcji widać, że w nowym badaniu efekt może wahać się od małej korzyści do braku różnicy – rekomendacja staje się warunkowa.

    Co sprawdzić: czy model (stały vs losowy) jest uzasadniony klinicznie; czy użyto nowoczesnego estymatora τ² i korekty HK; czy podano przedział predykcji; czy miara efektu nie utrudnia późniejszego przełożenia na wartości bezwzględne.

    Metaanaliza sieciowa: kiedy porównania pośrednie są użyteczne

    Krok 1: oceń założenie przechodniości. Populacje, dawki, czas obserwacji i modyfikatory efektu muszą być porównywalne między wszystkimi gałęziami sieci. Jeśli lek D testowano wyłącznie u cięższych chorych, a A i B u łagodniejszych, wniosek A vs D przez B będzie obciążony.

    Krok 2: sprawdź spójność (incoherence). Użyj metod lokalnych (node‑splitting) i globalnych (design‑by‑treatment), aby porównać wyniki bezpośrednie i pośrednie. Brak spójności podważa ranking; najpierw rozwiąż przyczynę (różnice populacji, dawki), dopiero potem interpretuj efekty.

    Krok 3: raportuj efekty absolutne i niepewność rankingu. SUCRA lub „ranking zwycięzców” bez przedziałów nie mówi, o ile lepszy jest dany lek. Pokaż różnice względem komparatora referencyjnego z 95% CI/CrI oraz w miarę możliwości przeliczenia na ARR dla typowych ryzyk bazowych. Pamiętaj o prawidłowym ujęciu badań wieloramiennych (współzależność porównań).

    Krótki scenariusz: sieć A–B–C w migrenie. Po rozdzieleniu punktów czasowych (2 h vs 24 h) i sprawdzeniu spójności okazuje się, że przewaga C nad A dotyczy tylko krótkiego horyzontu, a ranking po 24 h jest płaski – decyzja terapeutyczna może różnić się w zależności od priorytetu pacjenta (szybkość vs trwałość ulgi).

    Co sprawdzić: czy założenie przechodniości jest wiarygodne; czy testy spójności są raportowane i interpretowane; czy ranking ma pokazane przedziały niepewności; czy uwzględniono różnice w dawkach i czasie obserwacji w oddzielnych analizach.

    Najczęściej zadawane pytania (FAQ)

    Kiedy metaanaliza ma sens, a kiedy lepiej jej nie robić?

    Ma sens, gdy badania odpowiadają na to samo pytanie PICO, raportują porównywalne miary efektu i mają przynajmniej umiarkowaną jakość. Dobrze, gdy kierunek efektu jest podobny, a rozbieżności da się wyjaśnić wcześniej zdefiniowanymi analizami podgrup. Przykład: kilka RCT zbliżonych dawek i czasu trwania interwencji u dorosłych z łagodną depresją.

  • krok 1: oceń spójność PICO (≥70–80% badań musi realnie pasować).
  • krok 2: sprawdź jakość i ryzyko stronniczości (np. randomizacja, zaślepienie).
  • krok 3: przejrzyj heterogeniczność i miary efektu; rozważ model losowy.

Co sprawdzić: czy autorzy rozważyli rezygnację z łączenia przy bardzo wysokiej, niewyjaśnionej heterogeniczności oraz czy istnieje zarejestrowany protokół i szerokie wyszukiwanie literatury.

Jak sprawdzić spójność PICO przed łączeniem badań?

Najpierw doprecyzuj pytanie: Populacja, Interwencja/Ekspozycja, Comparator, Outcome. Różnice w którymkolwiek z tych elementów mogą wypaczyć łączny wynik. Np. „wszyscy pacjenci psychiatryczni” to zbyt szeroka populacja dla interwencji celowanej w łagodną depresję.

  • krok 1: Populacja — wiek, rozpoznanie, nasilenie, warunki opieki.
  • krok 2: Interwencja/Comparator — dawka, czas trwania, droga podania, standard opieki.
  • krok 3: Outcome — ta sama skala lub poprawnie przeliczona na wspólną (MD vs SMD) i ten sam kierunek efektu.

Co sprawdzić: proporcję badań naprawdę zgodnych z PICO, zgodność definicji punktów końcowych i to, czy różne miary przeliczono poprawnie na wspólną skalę.