Najważniejsze wnioski
- Projekt ewaluacji wybiera się do pytania, sposobu przydziału, wielkości populacji, dojrzałości programu i możliwych decyzji. Nie zaczyna się od deklaracji „zrobimy RCT” albo „zrobimy wywiady”.
- Monitoring odpowiada, co dostarczono i co się zmienia. Ewaluacja procesu bada, jak program wdrożono. Ewaluacja wyniku opisuje zmianę. Ewaluacja wpływu próbuje ustalić, jaki wynik powstał dzięki programowi.
- Zmiana przed–po nie jest sama w sobie wpływem. Uczestnicy mogliby zmienić się wskutek dojrzewania, selekcji, innych usług, odstraszania, regresji do średniej albo zmiany kontekstu.
- Kontrfaktyczne pytanie brzmi: co stałoby się z tymi samymi osobami w tym samym czasie bez badanego programu? Ponieważ tego nie obserwujemy, projekt tworzy przybliżenie.
- Randomizacja dobrze ogranicza zakłócenie przyczynowe, jeśli jest wykonalna, etyczna, ma wystarczającą próbę i jest prawidłowo wdrożona. Nie naprawia słabego pomiaru, dużej utraty danych, spillover ani niejasnej interwencji.
- Grupa kontrolna nie musi pozostawać bez pomocy. Można porównywać standardową usługę, dwa warianty, kolejność wdrożenia lub dodatkowy moduł.
- Quasi-eksperyment może być bardzo wiarygodny, gdy wykorzystuje jasny mechanizm przydziału i sprawdzalne założenia. Samo nazwanie historycznej grupy „kontrolną” nim nie jest.
- Dopasowanie równoważy tylko cechy zmierzone. Nie usuwa różnic w motywacji, ukrywaniu, relacji ani jakości skierowania, jeśli ich nie zmierzono.
- Regresja nieciągłości jest mocna wokół progu, lecz odpowiada głównie o osobach blisko granicy. Różnica w różnicach wymaga wiarygodnego założenia równoległych trendów.
- Szereg przerywany potrzebuje wielu punktów przed i po oraz kontroli równoczesnych zmian. Dwa pomiary nie tworzą szeregu.
- Przy małej próbie priorytetem jest bogata teoria zmiany, powtarzane pomiary, analiza przypadku, proces tracing, replikacja między przypadkami i jawna niepewność — nie mnożenie testów.
- Studium przypadku może wspierać wnioskowanie przyczynowe, jeśli szuka sekwencji, mechanizmu, dowodów przeciwnych i alternatyw. Historia sukcesu wybrana przez wykonawcę nie jest takim studium.
- Realist evaluation bada konfiguracje kontekst–mechanizm–wynik. Analiza wkładu ocenia, czy program wiarygodnie przyczynił się do zmiany w pakiecie przyczyn. Nie dostarczają prostego procentu wpływu.
- Metody mieszane są wartościowe tylko wtedy, gdy dane ilościowe i jakościowe odpowiadają na powiązane pytania i są wspólnie integrowane. Dwie osobne części raportu nie wystarczą.
- Obliczenie mocy wykonuje się przed zbiorem danych dla głównego wyniku, realistycznego efektu, jednostki przydziału, korelacji, utraty i rzadkości zdarzenia.
- Brak istotności statystycznej nie dowodzi braku efektu. Może oznaczać małą próbę, duży szum albo efekt zbyt mały, by go odróżnić.
- Istotność statystyczna nie dowodzi znaczenia praktycznego, braku szkód ani poprawności projektu.
- Selekcja do programu, odmowa, wykluczenie, przerwanie i brak follow-up są wynikami procesu i możliwymi źródłami błędu. Trzeba raportować cały lejek.
- Protokół, główne pytania, wyniki, reguły wyłączeń i plan analizy powinny powstać przed obejrzeniem wyników. Odstępstwa są dopuszczalne, ale jawne.
- Prerejestracja nie gwarantuje jakości. Ogranicza swobodę dopasowywania hipotez i pokazuje, co było potwierdzające, a co eksploracyjne.
- Ewaluator potrzebuje niezależności organizacyjnej, dostępu do danych i prawa publikacji wniosków. Zapłata przez zamawiającego nie musi niszczyć niezależności, jeśli struktura chroni metodę i raport.
- Program wysokiej stawki wymaga oceny etycznej, minimalizacji danych, świadomej zgody tam, gdzie jest właściwa, ochrony przed odwetem i planu reakcji na ujawnione zagrożenie.
- Dane operacyjne i badawcze mają różne cele. Ich połączenie wymaga jawnej podstawy i granic; uczestnik nie powinien wierzyć, że poufny wywiad badawczy wpłynie na zwolnienie, jeśli nie wpływa.
- Wynik negatywny, zerowy albo niejednoznaczny powinien być publikowany. Ukrywanie go zniekształca bazę wiedzy i skazuje kolejne programy na powtarzanie błędu.
- Bezpieczna publikacja może usuwać szczegóły identyfikujące bez ukrywania metod, liczebności, braków, konfliktów i ograniczeń.
- Najuczciwszy wniosek czasem brzmi: program został wdrożony, obserwowano poprawę, lecz projekt nie pozwala ustalić, czy ją spowodował.
Najpierw pytanie decyzyjne
Pytanie opisowe
Kto trafia do programu i jakie ma potrzeby?
Metody:
- rejestry;
- ankieta;
- audyt;
- wywiady;
- analiza skierowań.
Pytanie o wdrożenie
Czy mentoring został dostarczony zgodnie z modelem?
Metody:
- dokumentacja;
- obserwacja;
- nagrania, gdy zgodne z prawem;
- superwizja;
- wywiady;
- dane o dawce.
Pytanie o zmianę
Czy u uczestników zmieniła się akceptacja przemocy i funkcjonowanie?
Metody:
- pomiar bazowy i kolejne;
- wiele źródeł;
- analiza trajektorii.
Pytanie o wpływ
Czy moduł mentoringu spowodował zmianę wobec tego, co nastąpiłoby bez niego?
Potrzebne jest wiarygodne porównanie albo inne jawne podejście do przyczynowości.
Pytanie o mechanizm
Czy moduł działał przez relację zaufania i nową sieć?
Metody:
- teoria zmiany;
- pomiar mechanizmu;
- czasowa sekwencja;
- wywiady;
- analiza mediacji przy odpowiedniej próbie;
- proces tracing.
Pytanie o heterogeniczność
Dla kogo i w jakich warunkach?
Metody:
- planowane podgrupy;
- interakcje;
- porównanie przypadków;
- realist evaluation;
- QCA przy odpowiedniej liczbie przypadków.
Pytanie ekonomiczne
Jaki jest koszt dodatkowego bezpiecznego wyniku wobec alternatywy?
Wymaga danych kosztowych i wiarygodnego efektu.
Obiekt ewaluacji
Moduł
Na przykład:
- mentor;
- rozmowa teologiczna;
- wsparcie pracy;
- terapia.
Najłatwiej zdefiniować interwencję i porównanie.
Pełny program
Pakiet wielu modułów dopasowywanych do osoby. Trudniej oddzielić składniki.
System
Skierowanie, ocena, wymiana danych, usługi i nadzór. Wyniki mogą powstawać na kilku poziomach.
Polityka
Zmiana prawa lub obowiązku obejmująca całą populację. Randomizacja jednostek może być niemożliwa.
Pilotaż
Ma sprawdzić:
- wykonalność;
- akceptację;
- jakość danych;
- mechanizm;
- bezpieczeństwo.
Mały pilotaż rzadko daje wiarygodny szacunek wpływu na rzadką przemoc.
Ewaluowalność
Przed projektem warto przeprowadzić ocenę ewaluowalności.
Pytania
- Czy cel jest określony?
- Czy grupa jest zdefiniowana?
- Czy istnieje teoria zmiany?
- Czy interwencja jest względnie stabilna?
- Czy można opisać dawkę?
- Czy wyniki da się mierzyć?
- Czy jest punkt bazowy?
- Czy istnieje porównanie?
- Czy dane można legalnie połączyć?
- Czy próba wystarczy?
- Czy wynik będzie użyty?
- Czy szkody są monitorowane?
Wyniki oceny
Program może być:
- gotowy do ewaluacji wpływu;
- gotowy do ewaluacji procesu i wyniku;
- wymagający przebudowy danych;
- zbyt niestabilny;
- niewłaściwy do obiecanego pytania.
Odmowa wykonania pozornie precyzyjnej ewaluacji może być oznaką jakości.
Cztery rodzaje trafności
Trafność konstruktu
Czy interwencja i wynik odpowiadają pojęciom?
Przykładowe błędy:
- frekwencja nazwana zaangażowaniem;
- brak skazania nazwany brakiem przemocy;
- zmiana odpowiedzi nazwana zmianą ideologii;
- zatrudnienie nazwane reintegracją;
- mentoring rozumiany inaczej w każdym miejscu.
Zabezpieczenia:
- definicja;
- teoria zmiany;
- kilka miar;
- pilotaż;
- obserwacja jakości;
- wywiad poznawczy;
- sprawdzenie, czy interwencja faktycznie zmieniła zakładany mechanizm.
Trafność wewnętrzna
Czy obserwowaną różnicę można wiarygodnie przypisać interwencji?
Zagrożenia:
- selekcja;
- historia;
- dojrzewanie;
- regresja;
- utrata;
- zmiana pomiaru;
- spillover;
- inne usługi.
Projekt kontrfaktyczny przede wszystkim wzmacnia ten rodzaj trafności.
Trafność zewnętrzna
Czy wynik dotyczy innych:
- uczestników;
- ośrodków;
- ideologii;
- krajów;
- okresów;
- wykonawców?
RCT z jednego dobrego ośrodka może mieć wysoką trafność wewnętrzną i ograniczoną zewnętrzną.
Trafność wnioskowania statystycznego
Czy analiza właściwie ocenia wielkość i niepewność?
Zagrożenia:
- mała moc;
- błędny model;
- zależne obserwacje;
- wielokrotne testy;
- odstające przypadki;
- wybiórcza analiza;
- naruszenie założeń.
Nie wymieniać jednej za drugą
Duża próba nie naprawia złej definicji. Randomizacja nie gwarantuje przenośności. Głęboki wywiad nie izoluje średniego efektu. Dobra ewaluacja mówi, który rodzaj trafności wzmacnia i gdzie pozostaje słaba.
Przyczynowość i kontrfaktyczny wynik
Dla każdej osoby istnieją dwa potencjalne wyniki:
- z programem;
- bez programu.
Obserwujemy tylko jeden. Grupa porównawcza ma przybliżyć drugi.
Wymiana
Wiarygodne porównanie wymaga, by grupy różniły się zasadniczo interwencją, a nie:
- motywacją;
- ryzykiem;
- regionem;
- czasem;
- dostępem;
- prowadzącym;
- nadzorem.
Założenia
Każdy projekt przyczynowy ma założenia. Różni się tym, czy są:
- projektowo wymuszone;
- empirycznie sprawdzalne częściowo;
- wiarygodne teoretycznie;
- ukryte.
Randomizacja wzmacnia wymianę średnio. Dopasowanie zakłada brak ważnych niezmierzonych różnic. Szereg zakłada brak równoczesnego przełomu.
Randomizowane badanie
World Bank przedstawia randomizację, zmienne instrumentalne, regresję nieciągłości, różnicę w różnicach i dopasowanie jako odrębne sposoby budowania kontrfaktycznego porównania.1
Kiedy ma sens
- liczba uprawnionych jest większa niż pojemność;
- przydział jest rzeczywiście niepewny;
- istnieje dopuszczalna alternatywa;
- interwencja jest stabilna;
- wynik jest mierzalny;
- próba wystarczy;
- spillover można ograniczyć lub mierzyć.
Co losować
- osobę;
- prowadzącego;
- placówkę;
- region;
- czas rozpoczęcia;
- dodatkowy moduł;
- wariant.
Jednostka losowania i jednostka analizy muszą być uwzględnione w mocy.
Indywidualna randomizacja
Zalety:
- największa liczba jednostek;
- dobra równowaga średnia.
Ryzyka:
- osoby w jednej placówce wymieniają treści;
- praktyk miesza modele;
- poczucie nierówności;
- organizacyjne błędy.
Randomizacja klastrowa
Losuje się placówki, zespoły lub regiony.
Zalety:
- mniej spillover;
- łatwiejsze wdrożenie modelu.
Wady:
- potrzeba większej próby;
- mała liczba klastrów;
- różnice organizacyjne;
- analiza musi uwzględniać korelację.
Lista oczekujących
Jedna grupa zaczyna później.
Może być uczciwa przy ograniczonej pojemności i braku pilnej potrzeby. Nie jest właściwa, gdy opóźnienie stwarza nieakceptowalne zagrożenie albo zwykła praktyka i tak zaczęłaby się natychmiast.
Stepped wedge
Wszystkie klastry otrzymują program, ale w losowej kolejności.
Zalety:
- polityczna akceptacja;
- wdrożenie etapowe.
Wady:
- czas jest splątany z interwencją;
- złożona analiza;
- wymaga wielu pomiarów;
- założenie stabilnego efektu może być nierealne;
- klastrów bywa za mało.
Randomizacja zachęty
Losuje się dodatkową zachętę do skorzystania, nie sam program. Może oceniać efekt oferty lub, przy silnych założeniach, efekt uczestnictwa w określonej grupie.
A/B modułu
Obie grupy dostają podstawową usługę, a porównuje się:
- mentor standardowy vs specjalistyczny;
- sesję osobistą vs hybrydową;
- różną dawkę;
- dodatkową superwizję.
Etycznie i poznawczo może być lepsze niż program vs nic.
Etyka randomizacji
Równowaga wiedzy
Musi istnieć uczciwa niepewność, który wariant jest lepszy. Jeżeli jeden jest niezbędnym standardem, nie należy go odbierać.
Ryzyko
Oddziela się:
- ryzyko niewłączenia;
- ryzyko samej interwencji;
- ryzyko badania;
- ryzyko danych.
Dostęp podstawowy
Grupa porównawcza otrzymuje:
- zwykłą opiekę;
- pomoc kryzysową;
- prawa;
- interwencję bezpieczeństwa.
Badanie nie zawiesza obowiązków ochrony.
Zgoda
Zgoda na badanie i zgoda na usługę są odrębne. Odmowa pomiaru nie powinna pogarszać pomocy, chyba że konkretna procedura i prawo przewidują inaczej.
Władza
W więzieniu lub probacji formalny podpis może nie być swobodny. Potrzebne są:
- niezależna informacja;
- brak wpływu na zwolnienie;
- możliwość pytań;
- minimalizacja nacisku;
- właściwa ocena etyczna.
Analiza randomizacji
Intention-to-treat
Porównuje według przydziału niezależnie od ukończenia. Szacuje efekt oferty programu.
Chroni randomizację, ale może dać mały wynik, gdy wiele osób nie skorzysta.
Per protocol
Porównuje osoby realizujące plan. Jest silnie podatna na selekcję.
Treatment-on-the-treated
Próbuje oszacować efekt faktycznego uczestnictwa z wykorzystaniem przydziału jako instrumentu. Wymaga dodatkowych założeń i interpretuje określoną grupę osób, których udział zmienił przydział.
Równowaga
Sprawdza się cechy bazowe, ale nie testuje ich bez końca. Losowe różnice mogą wystąpić.
Nieprzestrzeganie przydziału
- przejście do innej grupy;
- brak udziału;
- częściowa dawka;
- usługa poza badaniem.
Raportuje się każde.
Spillover
Uczestnicy kontrolni mogą korzystać z:
- tego samego mentora;
- materiałów;
- rodziny;
- zmienionej praktyki placówki.
Efekt porównania może zostać rozmyty. Spillover jest też wynikiem systemowym, który warto zbadać.
Quasi-eksperyment
Quasi-eksperyment testuje hipotezę przyczynową bez losowego przydziału; przydział wynika z samo-selekcji, decyzji administratora lub reguły.2
Jakość zależy od mechanizmu, nie od skomplikowania modelu.
Regresja nieciągłości
Pomysł
Program otrzymują osoby powyżej progu:
wynik oceny ≥ 20.
Porównuje się osoby tuż po obu stronach, zakładając, że są podobne poza szansą udziału.
Warunki
- ciągła zmienna;
- znany próg;
- brak manipulacji;
- dostatecznie dużo przypadków;
- inne reguły nie zmieniają się w tym samym punkcie;
- wynik jest gładki bez interwencji.
Ostra i rozmyta
Ostra: próg całkowicie określa udział.
Rozmyta: próg zwiększa prawdopodobieństwo, lecz są wyjątki.
Ograniczenie
Wynik dotyczy przede wszystkim osób blisko progu. Nie musi mówić o najwyższym ryzyku.
Kontrole
- wykres;
- gęstość wokół progu;
- cechy bazowe;
- inne progi;
- różne szerokości okna;
- wcześniejsze wyniki.
Różnica w różnicach
Pomysł
Porównuje zmianę w grupie objętej programem ze zmianą w grupie nieobjętej.
Nie:
po programie grupa ma lepszy wynik.
Tylko:
czy jej zmiana różni się od zmiany porównania.
Kluczowe założenie
Bez programu trendy byłyby równoległe.
Sprawdzenie
Wiele punktów przed wdrożeniem pomaga ocenić, czy trendy były podobne. Nie dowodzi założenia po wdrożeniu.
Zagrożenia
- grupa dostała program, bo jej trend był gorszy;
- jednocześnie zmieniła inne usługi;
- skład populacji się zmienił;
- efekt pojawia się przed startem;
- wynik ma różną definicję.
Event study
Pokazuje dynamikę przed i po. Przy etapowym wdrożeniu i zróżnicowanych efektach proste estymatory mogą być mylące; potrzebna jest odpowiednia metoda.
Dopasowanie
Pomysł
Tworzy grupę porównawczą podobną pod względem zmierzonych cech.
Cechy
Powinny poprzedzać program:
- wcześniejsze zachowanie;
- wiek;
- status;
- potrzeby;
- typ skierowania;
- region;
- wynik bazowy.
Nie należy dopasowywać na zmienne powstałe wskutek programu.
Propensity score
Szacuje prawdopodobieństwo otrzymania programu na podstawie cech.
Możliwe użycia:
- parowanie;
- ważenie;
- stratyfikacja.
Sam podobny propensity score nie gwarantuje podobieństwa każdej ważnej cechy. Trzeba pokazać balans i wspólny obszar.
Brak wspólnego wsparcia
Jeśli najwyższe ryzyko zawsze dostaje program, nie ma porównania dla tej grupy. Model nie może wyczarować kontrfaktycznego wyniku.
Niezmierzone zakłócenie
Motywacja lub decyzja specjalisty może wpływać zarówno na udział, jak i wynik. Jeśli nie jest mierzona, dopasowanie nie usuwa błędu.
Analiza wrażliwości
Powinna pokazać, jak silna musiałaby być niezmierzona różnica, aby zmienić wniosek.
Zmienne instrumentalne
Pomysł
Instrument wpływa na udział, lecz nie wpływa na wynik inaczej niż przez udział i spełnia inne formalne założenia.
Przykładowy kandydat:
- losowy przydział;
- odległość;
- dostępność prowadzącego.
Pułapka
Odległość może wpływać na pracę i dostęp do usług, więc nie jest automatycznie dobrym instrumentem.
Interpretacja
Wynik zwykle dotyczy osób, których uczestnictwo zmienia instrument, nie całej populacji.
Szereg czasowy przerywany
Pomysł
Wiele pomiarów przed i po zmianie pozwala badać:
- skok poziomu;
- zmianę trendu;
- opóźnienie.
Jednostka
- region;
- placówka;
- system;
- czasem osoba w projekcie pojedynczego przypadku.
Wymagania
- dostatecznie dużo punktów;
- stały sposób pomiaru;
- znany moment;
- model sezonowości i autokorelacji;
- dokumentacja innych zmian.
Kontrolowany szereg
Dodanie podobnego obszaru bez zmiany wzmacnia wniosek.
Rzadkie zdarzenie
Miesięczna liczba zamachów może być zbyt rzadka i niestabilna. Lepsze mogą być:
- zdarzenia w większym obszarze;
- dłuższy okres;
- wynik bliższy mechanizmowi,
ale ten ostatni nie zastępuje wyniku bezpieczeństwa.
Syntetyczna kontrola
Tworzy ważoną kombinację innych jednostek przypominającą obszar przed interwencją.
Może być użyteczna dla polityki w jednym regionie, jeśli:
- istnieje pula nieobjętych jednostek;
- są długie dane przed;
- nie ma szerokiego spillover;
- wynik jest porównywalny.
Nie nadaje się, gdy program wdrożono wszędzie jednocześnie lub jednostki są nieporównywalne.
Kontrolowane badanie przed–po
Co najmniej jedna grupa interwencji i porównawcza z pomiarem przed i po.
Jest słabsze niż projekt z dobrze uzasadnionym mechanizmem przydziału, ale może być użyteczne, jeśli:
- grupy są opisane;
- wartości bazowe znane;
- różnice analizowane;
- wynik interpretowany ostrożnie.
Samo przed–po
Co pozwala powiedzieć
Wynik zmienił się u uczestników między pomiarami.
Czego nie
Program spowodował zmianę.
Zagrożenia
- dojrzewanie;
- historia;
- regresja;
- testowanie;
- zmiana narzędzia;
- utrata;
- selekcja.
Jak wzmocnić
- wiele pomiarów;
- teoria zmiany;
- pomiar mechanizmu;
- dane o kontekście;
- niezależne źródła;
- analiza przypadku;
- porównanie historyczne;
- wynik negatywny;
- transparentny język.
Projekty pojedynczego przypadku
Dla kogo
Przy bardzo małej populacji można prowadzić intensywny powtarzany pomiar.
AB
A — linia bazowa.
B — interwencja.
Zmiana po B jest sugestywna, lecz splątana z czasem.
ABA lub ABAB
Wycofanie i ponowne wdrożenie może wzmacniać wniosek, ale często jest:
- nieetyczne;
- niemożliwe;
- nieodwracalne.
Nie wycofuje się ochrony lub leczenia dla projektu.
Multiple baseline
Interwencję wprowadza się w różnym czasie:
- u osób;
- dla zachowań;
- w miejscach.
Powtarzająca się zmiana po rozpoczęciu wzmacnia hipotezę.
Wyniki
Nadają się do:
- zachowania częstego;
- umiejętności;
- korzystania z planu;
- objawów.
Nie do bezpośredniego testu rzadkiego zamachu.
Analiza
- wykres;
- poziom;
- trend;
- zmienność;
- natychmiastowość;
- nakładanie;
- efekt liczbowy;
- interpretacja kliniczna.
Studium przypadku
Nie anegdota
Wiarygodne studium ma:
- pytanie;
- kryterium doboru;
- granice;
- wiele źródeł;
- oś czasu;
- teorię;
- alternatywy;
- dowody przeciwne;
- łańcuch danych.
Dobór
- typowy przypadek;
- skrajny;
- sukces;
- porażka;
- przypadek krytyczny;
- maksymalna różnorodność.
Dobór wyłącznie najbardziej medialnego sukcesu daje materiał ilustracyjny, nie ocenę.
Process tracing
Sprawdza, czy oczekiwany mechanizm pozostawił ślady:
- działanie poprzedziło zmianę;
- uczestnik rzeczywiście skorzystał z zasobu;
- powstała relacja;
- wykonano krok;
- alternatywa jest słabsza.
Testy
Niektóry dowód jest konieczny, lecz niewystarczający; inny może silnie potwierdzać konkretny mechanizm. Siłę dowodu ocenia się względem hipotez, nie emocjonalności historii.
Negatywny przypadek
Przypadek, który nie pasuje, może ujawnić:
- brakujące założenie;
- inną populację;
- szkodę;
- błąd teorii.
Realist evaluation
Realist evaluation bada, jak uczestnik reaguje na zasoby interwencji w określonym kontekście i jakie wzory wyniku powstają; może korzystać z porównań wewnątrz programu i jest możliwa także w małej skali.3
Konfiguracja
- kontekst;
- mechanizm;
- wynik.
Przykład
Kontekst:
- dobrowolny udział;
- jawna rola mentora.
Mechanizm:
- zaufanie i testowanie nowej tożsamości.
Wynik:
- wykonanie kroków wyjścia.
Dane
- wywiady;
- obserwacja;
- dokumenty;
- skale;
- porównanie przypadków;
- sekwencje.
Wniosek
Nie:
Mentoring działa w 63%.
Lepiej:
Mentoring uruchamiał zaufanie u osób gotowych do odejścia, gdy rola była jawna i kontakt ciągły; w warunkach silnego przymusu prowadził głównie do zgodności językowej.
Ryzyko
Mechanizm bywa mylony z działaniem albo opisem psychologicznym po fakcie. Hipotezy trzeba sformułować i testować.
Analiza wkładu
Pytanie
Czy rozsądnie jest uznać, że program wniósł ważny wkład do obserwowanej zmiany?
Kroki
- teoria zmiany;
- ryzyka;
- istniejące dane;
- historia wkładu;
- alternatywne wyjaśnienia;
- dodatkowe dane;
- rewizja.
BetterEvaluation wskazuje, że analiza wkładu nadaje się do złożonej zmiany z wieloma aktorami, lecz nie służy do precyzyjnego ilościowego przypisania części wyniku.4
Dowody
- każde ogniwo;
- wdrożenie;
- mechanizm;
- sekwencja;
- kontekst;
- alternatywa;
- spójność między przypadkami.
Ograniczenie
Ładna „historia wkładu” bez aktywnego szukania dowodów przeciwnych staje się narracją wykonawcy.
Qualitative Comparative Analysis
QCA bada konfiguracje warunków związanych z wynikiem.
Przykład:
mieszkanie + relacja + dobrowolność
może wystarczać w jednej konfiguracji, a:
kontrola + praca + rodzina
w innej.
Wymagania
- porównywalne przypadki;
- dobrze skalibrowane zbiory;
- teoria;
- dostateczna różnorodność;
- przejrzyste decyzje kodowania.
Ograniczenia
- wrażliwość na kalibrację;
- ograniczona różnorodność;
- sprzeczne konfiguracje;
- trudność małej lub bardzo dużej liczby;
- nie zastępuje wiedzy o procesie.
Outcome harvesting
Zaczyna od zaobserwowanych zmian i pracuje wstecz, ustalając wkład programu.
Może pomóc przy:
- nieprzewidywalnych wynikach;
- pracy społecznościowej;
- zmianie instytucjonalnej.
Ryzyko:
- wybór pozytywnych zmian;
- pamięć;
- brak kontrfaktycznego porównania.
Potrzebna jest weryfikacja zewnętrzna i poszukiwanie szkód.
Metody mieszane
Po co
Ilościowe:
- ile;
- jak duża zmiana;
- jaka różnica;
- jaka niepewność.
Jakościowe:
- jak;
- dlaczego;
- dla kogo;
- co znaczy;
- co pominięto.
Projekty
Równoległy
Zbiera oba rodzaje jednocześnie i integruje.
Sekwencyjny wyjaśniający
Najpierw wynik liczbowy, potem wywiady wyjaśniające.
Sekwencyjny eksploracyjny
Najpierw jakościowo poznaje domeny, potem buduje pomiar.
Zagnieżdżony
Studia przypadków wewnątrz eksperymentu lub quasi-eksperymentu.
Integracja
- wspólne pytania;
- wspólny przypadek lub kohorta;
- tabela joint display;
- analiza zgodności;
- wyjaśnienie różnic;
- jeden wniosek.
Przykład
Ilościowo:
brak średniego efektu mentoringu.
Jakościowo:
relacja powstała tylko przy ciągłości prowadzącego.
Po integracji:
średnia miesza wysoką korzyść przy ciągłości i brak mechanizmu przy rotacji.
To hipoteza wymagająca dalszego testu, nie automatyczne potwierdzenie podgrupy.
Program adaptacyjny
Problem
Program często zmienia moduł, dawkę, kolejność, prowadzącego i intensywność w odpowiedzi na przypadek. Prosta etykieta „otrzymał program” ukrywa dynamiczny reżim decyzji.
Dopasowanie jako składnik
Jeśli teoria mówi, że ocena dobiera właściwy moduł, ewaluacja bada:
- jakość reguły dopasowania;
- efekt dostarczonego modułu.
Dobry moduł przy błędnym dopasowaniu może mieć słaby wynik systemowy.
Confounding by indication
Osoby w gorszym stanie dostają więcej terapii. Proste porównanie może pokazać, że większa dawka wiąże się z gorszym wynikiem, choć decyzja była odpowiedzią na potrzebę.
Potrzebne są:
- dane czasowe;
- zmienne sprzed decyzji;
- model zależnego od czasu zakłócenia;
- projekt sekwencyjny;
- ostrożna interpretacja.
SMART
Sequential Multiple Assignment Randomized Trial może losować kolejny wariant u osób, które nie odpowiedziały. Buduje adaptacyjne sekwencje, ale wymaga:
- większej próby;
- jasnych punktów decyzji;
- bezpiecznych wariantów;
- stabilnego pomiaru;
- złożonej analizy.
W małych programach częściej realistyczne jest prospektywne dokumentowanie reguły i porównanie przypadków.
Micro-randomized trial
Losuje się krótkie interwencje w wielu momentach, na przykład przypomnienie lub kontakt. Może badać bliski wynik, nie długoterminową deradykalizację. Wysoka liczba decyzji nie zastępuje liczby osób dla wszystkich pytań.
Adaptacja a dryf
Adaptacja:
- wynika z teorii;
- ma zapis;
- zachowuje rdzeń;
- ma hipotezę;
- jest oceniana.
Dryf:
- zależy od wygody;
- jest niewidoczny;
- zmienia funkcję;
- utrudnia porównanie.
Ewaluator powinien wersjonować interwencję.
Zewnętrzna przenośność
Populacja badania
Raport pokazuje, kto:
- był uprawniony;
- zgodził się;
- został wyłączony;
- rozpoczął;
- pozostał.
Wynik u dobrowolnych uczestników nie przenosi się automatycznie na nakazanych.
Ośrodek
Wysoki efekt może zależeć od:
- charyzmatycznego założyciela;
- małego obciążenia;
- specjalnego finansowania;
- doświadczonego zespołu;
- silnej sieci;
- wyjątkowego rynku pracy.
To nie „szum”, lecz część pakietu przyczynowego.
Ideologia
Mechanizm regulacji emocji może przenosić się szerzej niż konkretny dialog teologiczny. Należy wskazać, co jest:
- rdzeniem mechanizmu;
- treścią adaptowaną;
- warunkiem kontekstu.
Kraj
Prawo, zaufanie, system pomocy, więzienie i wspólnota zmieniają interwencję. Kopiowanie nazwy nie kopiuje mechanizmu.
Transportability
Można analizować, czy rozkład moderatorów w nowej populacji różni się od badania i ważyć wynik, lecz wymaga to:
- pomiaru istotnych cech;
- wspólnego zakresu;
- prawidłowego modelu;
- założenia o braku niezmierzonych moderatorów.
Replikacja
Najcenniejsza jest w innym ośrodku, z innym zespołem, przy tym samym rdzeniu, jawnej adaptacji i wspólnym głównym wyniku.
Brak identycznego efektu nie musi obalać programu. Może ujawnić warunek.
Uczenie przez wiele ośrodków
Wspólny rdzeń danych
- definicje;
- kohorta;
- punkt bazowy;
- wyniki;
- czas;
- szkody;
- wdrożenie.
Lokalny moduł
Każdy ośrodek może dodać:
- kontekst;
- wywiady;
- szczególny mechanizm;
- własny wynik.
Model wielopoziomowy
Przy dostatecznej liczbie ośrodków rozdziela różnice osób, prowadzących i placówek. Przy kilku klastrach estymacja wariancji jest bardzo niepewna.
Meta-analiza danych indywidualnych
Wspólne dane mogą zwiększać moc i badać heterogeniczność, jeśli:
- definicje są harmonizowane;
- zgody i podstawy pozwalają;
- protokół powstał;
- ośrodki zachowują odpowiedzialność;
- bezpieczeństwo jest wysokie.
Analiza federacyjna
Kod może być wykonywany lokalnie, a agregaty łączone bez centralizacji danych osobowych. Ogranicza część ryzyka, ale nie usuwa błędów definicji, ujawnienia z małych komórek ani potrzeby zarządzania.
Synteza dowodów
Nie liczyć głosów
Trzy badania „dodatnie” i dwa „zerowe” nie wystarczą. Liczy się:
- projekt;
- wielkość;
- niepewność;
- wdrożenie;
- populacja;
- ryzyko błędu.
Meta-analiza
Łączy porównywalne szacunki. Przy dużej heterogeniczności wspólna średnia może być mało użyteczna.
Należy podawać:
- model;
- heterogeniczność;
- przedział predykcyjny;
- wpływ małych badań;
- analizę jakości.
Synteza jakościowa
Może identyfikować:
- mechanizmy;
- bariery;
- warunki;
- szkody;
- doświadczenia.
Wymaga systematycznego wyszukania, doboru i oceny, nie wyboru cytatów.
Evidence and gap map
Pokazuje, gdzie istnieją ewaluacje i przeglądy, a gdzie luki. Nie mówi sama, że interwencja działa.
Bias publikacyjny
Programy z wynikiem dodatnim są częściej publikowane, promowane i opisywane po angielsku. Protokoły, raporty zamawiających i wyniki zerowe są potrzebne do pełniejszej syntezy.
Zarządzanie ewaluacją
Komitet sterujący
Może obejmować:
- zamawiającego;
- praktyka;
- ewaluatora;
- ochronę danych;
- etykę;
- partnera społecznego;
- osobę z doświadczeniem;
- przedstawiciela ofiar.
Nie powinien zmieniać wyniku analizy głosowaniem.
Niezależny przegląd bezpieczeństwa
Przy większym lub ryzykownym badaniu właściwy komitet może przeglądać:
- poważne szkody;
- jakość;
- reguły zatrzymania;
- nierównowagę;
- poufność.
Własność decyzji
Trzeba ustalić, kto:
- zmienia program;
- zatrzymuje rekrutację;
- zgłasza incydent;
- publikuje;
- odpowiada uczestnikom.
Harmonogram
Ewaluator powinien wejść przed wyborem systemu danych, pierwszym uczestnikiem, zmianą progu i umową z wykonawcą. Retrospektywne „dopisanie ewaluacji” ogranicza pytania.
Budżet
Obejmuje:
- projekt;
- narzędzia;
- pomiar bazowy;
- follow-up;
- linkowanie;
- tłumaczenie;
- ochronę;
- analizę;
- publikację;
- archiwizację.
Budżet ograniczony do końcowego raportu nie tworzy danych.
Reguły zatrzymania i adaptacji
Szkoda
Zatrzymanie lub przegląd może uruchomić:
- poważne naruszenie;
- przemoc związaną z procedurą;
- nieautoryzowane ujawnienie;
- wtórną wiktymizację;
- wyraźną nierówność szkody.
Daremność
Jeśli program nie ma szansy osiągnąć wyniku przy dostępnej próbie lub mechanizm nie powstaje, kontynuowanie wyłącznie dla dodatniego raportu może być nieetyczne.
Skuteczność
Wczesne zakończenie dla korzyści wymaga rygorystycznej reguły, bo przypadkowy wysoki wynik na początku zawyża efekt.
Analizy okresowe
Powinny być:
- planowane;
- wykonywane przez właściwy podmiot;
- ograniczone;
- z korektą lub podejściem sekwencyjnym.
Adaptacja bez zatarcia
Jeśli program zmieniono po sygnale:
- wersja 1 i 2 są opisane;
- kohorty rozdzielone;
- pytanie zmienione;
- wynik pierwotny zachowany.
Wykorzystanie wyniku
Mapa decyzji
| Wynik | Wdrożenie | Szkody | Decyzja |
|---|---|---|---|
| korzystny | dobre | małe | kontynuuj i replikuj |
| niepewny | dobre | małe | zwiększ wiedzę, nie reklamuj |
| zerowy | słabe | różne | napraw wdrożenie i testuj |
| zerowy | dobre | małe | zmień teorię lub zakończ |
| korzystny | dobre | duże | przeprojektuj; korzyść nie unieważnia szkody |
| negatywny | dowolne | dowolne | zabezpiecz i rozważ zatrzymanie |
Użytkownicy
- uczestnicy;
- praktycy;
- kierownictwo;
- zamawiający;
- organy nadzoru;
- społeczność;
- nauka.
Każdy potrzebuje innej formy, ale nie innej prawdy.
Plan uczenia
Przed startem ustala:
- jakie decyzje;
- kto;
- kiedy;
- jaki próg dowodu;
- jak wynik zostanie wdrożony.
Raport bez właściciela decyzji jest słabym narzędziem zmiany.
Dobór próby i moc
Moc
Prawdopodobieństwo wykrycia efektu o określonej wielkości przy założeniach.
Potrzebne elementy
- główny wynik;
- oczekiwana wartość;
- minimalny ważny efekt;
- wariancja;
- poziom błędu;
- moc;
- jednostka;
- klasteryzacja;
- powtarzanie;
- utrata;
- zgodność.
Rzadki wynik
Jeśli ponowna przemoc jest rzadka, wykrycie umiarkowanej różnicy wymaga dużej próby i czasu.
Nie rozwiązuje się tego przez zmianę wyniku na łatwy i nazywanie go przemocą.
Mała próba
Możliwe działania:
- wieloośrodkowość;
- dłuższa rekrutacja;
- wspólne definicje;
- powtarzane pomiary;
- ciągły wynik mechanizmu;
- precyzyjne estymowanie;
- podejście bayesowskie z jawnymi priors;
- studia przypadków;
- synteza między programami.
Nie zwiększać sztucznie n
Dziesięć pomiarów jednej osoby nie daje dziesięciu niezależnych osób. Model musi uwzględnić zależność.
Minimalny ważny efekt
Nie wybiera się go dlatego, że da się osiągnąć moc. Powinien odzwierciedlać:
- wagę wyniku;
- koszt;
- ryzyko;
- alternatywę;
- szkodę.
Wielokrotne wyniki
Problem
Przy 30 testach część może wyjść „istotna” przypadkiem.
Rozwiązania
- jeden lub kilka głównych wyników;
- hierarchia;
- korekta;
- przedział;
- wynik eksploracyjny oznaczony;
- replikacja.
Nie wszystko jest równoważne
Wynik bezpieczeństwa, mechanizmu i szkody nie powinny zostać sprowadzone do jednej korekty bez sensu teoretycznego.
Selekcja
Do skierowania
Nie każdy ma tę samą szansę wejścia w lejek.
Do przyjęcia
Praktycy mogą wybierać osoby rokujące.
Do udziału
Dobrowolni różnią się od odmawiających.
Do ukończenia
Pozostają osoby stabilniejsze lub lepiej dopasowane.
Do follow-up
Łatwiej znaleźć osoby z mieszkaniem i pracą.
Dokumentacja
Pełny lejek:
- skierowani;
- ocenieni;
- uprawnieni;
- przyjęci;
- rozpoczęli;
- otrzymali dawkę;
- ukończyli;
- obserwowani.
Przyczyny każdej straty.
Attrition — utrata obserwacji
Dlaczego groźna
Jeśli odpadają osoby z gorszym wynikiem, średnia pozostałych zawyża sukces.
Analiza
- porównanie bazowe;
- przyczyny;
- wzór czasowy;
- metody uzupełniania przy założeniach;
- ważenie;
- analiza wrażliwości;
- skrajne scenariusze.
Nie imputować bezmyślnie
Uzupełnienie danych nie odzyskuje informacji. Przenosi założenie do modelu.
Retencja etyczna
- kilka kanałów;
- zgoda na kontakt;
- rozsądne wynagrodzenie;
- brak nacisku;
- bezpieczny termin;
- możliwość krótkiego pomiaru.
Jakość pomiaru
Oślepienie
Oceniający nie zawsze może nie znać grupy, ale niezależne kodowanie ogranicza oczekiwanie.
Równoważność
Narzędzie powinno znaczyć podobnie między grupami i czasem.
Zmiana instrumentu
Nie wolno mieszać wersji bez kalibracji.
Efekt uczenia
Powtarzanie tej samej winiety może uczyć odpowiedzi.
Reaktywność
Sam pomiar może zmieniać zachowanie lub zwiększać podejrzenie.
Dane administracyjne
Trzeba audytować:
- definicję;
- kompletność;
- opóźnienie;
- zakres geograficzny;
- zmiany praktyki.
Prerejestracja i protokół
Co zapisać
- pytania;
- teoria;
- populacja;
- wynik główny;
- wyniki dodatkowe;
- źródła;
- projekt;
- moc;
- wyłączenia;
- braki;
- model;
- podgrupy;
- korekty;
- szkody;
- odstępstwa.
Gdzie
Publiczny rejestr może nie przyjmować wrażliwych szczegółów. Możliwe:
- rejestr z embargiem;
- zaufany depozyt;
- organ nadzoru;
- dokument opatrzony datą;
- jawna wersja bez danych operacyjnych.
Eksploracja
Jest wartościowa. Należy ją oznaczyć:
Hipoteza powstała po zobaczeniu danych i wymaga replikacji.
Odstępstwo
Raport:
- co zmieniono;
- kiedy;
- dlaczego;
- czy przed analizą wyniku;
- jaki wpływ.
Niezależność
OECD wskazuje niezależność, przejrzystość i etykę jako zasady wspierające wiarygodność, a praktycznymi zabezpieczeniami są odrębne linie raportowania, budżet i deklaracje konfliktów.5
Wymiary
Strukturalna
Ewaluator nie podlega kierownikowi programu.
Funkcjonalna
Ma kontrolę nad metodą, analizą i wnioskami.
Behawioralna
Ujawnia konflikty i nie manipuluje.
Umowa
Powinna gwarantować:
- dostęp do danych pozytywnych i negatywnych;
- kontakt z odmawiającymi;
- publikację wyniku;
- jawny komentarz zamawiającego, nie weto;
- czas;
- bezpieczeństwo;
- prawa do kodu i dokumentacji;
- archiwizację.
Wewnętrzna ewaluacja
Może dobrze służyć szybkiemu uczeniu. Zabezpieczenia:
- oddzielny analityk;
- standard;
- peer review;
- audyt;
- publikacja metody;
- zewnętrzny komitet.
Nie należy przedstawiać jej jako niezależnej.
Etyka i prawa uczestnika
Ocena etyczna
Badanie może wymagać komisji etycznej lub innego właściwego nadzoru. Sama ewaluacja usług nie jest automatycznie wolna od wymogów.
Minimalne ryzyko nie jest oczywiste
Pytanie o ideologię może:
- wywołać lęk;
- ujawnić czyn;
- narazić rodzinę;
- wpłynąć na status;
- zostać źle zinterpretowane.
Zgoda
Informacja obejmuje:
- cel;
- dobrowolność;
- dane;
- odbiorców;
- wyjątki;
- publikację;
- wycofanie;
- wpływ na usługę;
- kontakt.
Poufność
Badacz powinien wiedzieć, co zrobi przy:
- bezpośredniej groźbie;
- ujawnieniu przestępstwa;
- przemocy wobec dziecka;
- nakazie prawnym;
- informacji operacyjnej.
Obietnica musi być prawdziwa.
Wynagrodzenie
Powinno rekompensować czas, nie być nieproporcjonalną zachętą w warunkach zależności.
Uczestnicy z ograniczoną zdolnością
Potrzebują:
- wsparcia;
- dostosowania;
- właściwej reprezentacji;
- ochrony;
- uwzględnienia zdania.
Bezpieczeństwo danych
Plan
- cel;
- minimalny zakres;
- podstawa;
- pseudonimizacja;
- klucz;
- dostęp;
- szyfrowanie;
- transfer;
- retencja;
- usunięcie;
- incydent.
Łączenie rejestrów
Zwiększa wartość i ryzyko. Potrzebne są:
- legalność;
- jakość identyfikatora;
- błędy dopasowania;
- zakres;
- kontrola;
- logi.
Małe liczby
Opis:
jedyna kobieta wracająca z regionu X w roku Y
identyfikuje bez nazwiska.
Dane jakościowe
Usunięcie imienia nie wystarczy. Należy maskować:
- miejsce;
- rolę;
- datę;
- unikalne zdarzenie;
- relację.
Nie wolno zmienić znaczenia.
Zespół ewaluacji
Badacz może być narażony na:
- groźby;
- treści;
- wtórną traumę;
- presję prawną;
- cyberatak.
Potrzebny jest plan bezpieczeństwa i superwizji.
Analiza jakości wdrożenia
Bez danych o wdrożeniu wynik jest nieinterpretowalny.
Wymiary
- zasięg;
- dawka;
- wierność;
- jakość;
- responsywność;
- adaptacja;
- kompetencje;
- terminowość;
- kontekst.
Trzy sytuacje
Brak efektu, słabe wdrożenie
Nie testowano uczciwie teorii.
Brak efektu, dobre wdrożenie
Teoria lub dopasowanie mogą być błędne.
Efekt, słabe wdrożenie
Może działać inny składnik, kontekst albo selekcja.
Analiza statystyczna
Efekt i przedział
Raportuje się:
- różnicę;
- jednostkę;
- przedział ufności lub wiarygodności;
- liczebność;
- model;
- założenia.
Nie tylko p
Wartość p nie mówi:
- wielkości;
- praktycznego znaczenia;
- jakości projektu;
- prawdopodobieństwa hipotezy;
- szkód.
Klasteryzacja
Osoby tego samego mentora lub placówki są zależne. Standardowy błąd musi to uwzględnić.
Powtarzane pomiary
Model powinien uwzględniać korelację wewnątrz osoby oraz nierówny czas.
Zdarzenia
Analiza przeżycia może uwzględniać czas do zdarzenia i cenzorowanie. Należy zdefiniować ryzyka konkurujące, na przykład zgon lub ponowne uwięzienie.
Małe próbki
Modele z wieloma parametrami przeuczą dane. Potrzebne są:
- prostota;
- regularizacja;
- ograniczenie hipotez;
- wykresy;
- analiza przypadku;
- jawne przedziały.
Bayesian
Może integrować wcześniejszą wiedzę i pokazywać rozkład niepewności. Nie usuwa małej ilości danych. Prior powinien być jawny, uzasadniony i poddany analizie wrażliwości.
Analiza jakościowa
Dobór
- maksymalna różnorodność;
- typowe przypadki;
- negatywne przypadki;
- rezygnujący;
- partnerzy;
- rodziny.
Nasycenie
Nie powinno być rytualnym uzasadnieniem małej próby. Trzeba opisać:
- cel;
- zakres;
- różnorodność;
- proces decyzji.
Kodowanie
- kodeks;
- definicje;
- przykłady;
- szkolenie;
- spotkania rozbieżności;
- ślad zmian.
Zgodność kodujących nie jest konieczna w każdym paradygmacie, ale podejście musi być jawne.
Refleksyjność
Rola, tożsamość i afiliacja badacza wpływają na dostęp oraz wypowiedzi.
Dowody przeciwne
Raport powinien pokazać:
- głos negatywny;
- wyjątek;
- niepewność;
- alternatywę.
Interpretacja
Poziomy wniosku
Opis
18 z 30 osób ukończyło moduł.
Związek
Wyższa dawka wiązała się z poprawą.
Zmiana
Średni wynik wzrósł od punktu bazowego.
Wkład
Dane wspierają tezę, że relacja mentora przyczyniła się do wykonania planu.
Wpływ
Przydział do modułu zwiększył wynik średnio o...
Nie wolno przeskakiwać poziomów.
Wynik zerowy
Możliwe:
- brak istotnego efektu;
- przedział obejmuje korzyść i szkodę;
- efekt jest precyzyjnie bliski zeru;
- interwencja nie została wdrożona.
Każde zdanie znaczy coś innego.
Wynik negatywny
Program pogorszył wynik lub zwiększył szkodę. Należy:
- zweryfikować dane;
- uruchomić ochronę;
- zbadać mechanizm;
- nie ukrywać;
- rozważyć zatrzymanie.
Wynik mieszany
Może poprawiać pracę, nie zmieniać przemocy i obciążać rodzinę. Nie ma jednego „działa”.
Kiedy powiedzieć „nie wiemy”
Sytuacje
- brak punktu bazowego;
- brak porównania dla pytania wpływu;
- duża selekcja;
- niepełne dane;
- zmiana definicji;
- za mała próba;
- bardzo szeroki przedział;
- brak wdrożenia;
- wynik zastępczy bez walidacji;
- sprzeczne źródła.
Dobre zdanie
Zaobserwowano poprawę funkcjonowania wśród 18 osób z pełnym follow-up, ale utrata 40% kohorty i brak porównania uniemożliwiają wiarygodne przypisanie zmiany programowi.
Nie jest porażką ewaluatora
Wskazuje, jakich danych i projektu potrzeba dalej.
Publikacja
Raport podstawowy
- protokół;
- zmiany;
- lejek;
- interwencja;
- porównanie;
- dane bazowe;
- braki;
- wyniki;
- szkody;
- wdrożenie;
- ograniczenia;
- konflikty;
- finansowanie.
Wynik negatywny
Nie powinien znikać w:
- poufnym aneksie;
- zmianie głównego wyniku;
- podgrupie;
- komunikacie „wyciągnięto lekcje”.
Ochrona
Można:
- łączyć lata;
- tłumić małe komórki;
- uogólniać miejsce;
- opóźniać szczegół;
- publikować dane syntetyczne;
- udostępniać kod bez danych.
Nie należy:
- ukrywać liczebności;
- usuwać wszystkich rezygnujących;
- pomijać definicji;
- zasłaniać ograniczeń bezpieczeństwem bez analizy.
Replikacja
Materiały:
- słownik;
- kod;
- formularze;
- syntetyczne dane;
- historia wersji
zwiększają sprawdzalność bez ujawniania osób.
Plan ewaluacji
Rozdziały
- decyzja i użytkownicy;
- pytania;
- teoria zmiany;
- obiekt;
- projekt;
- populacja;
- wyniki;
- źródła;
- moc;
- analiza;
- proces;
- etyka;
- bezpieczeństwo;
- niezależność;
- publikacja;
- harmonogram;
- budżet.
Macierz
| Pytanie | Wskaźnik | Źródło | Projekt | Analiza | Ograniczenie |
|---|---|---|---|---|---|
| czy relacja powstała | skala i wywiad | uczestnik, mentor | przed–po | trajektoria | pozorowanie |
| czy moduł poprawił wynik | wynik po 12 mies. | rejestr, ankieta | randomizacja | ITT | spillover |
| dla kogo | kontekst i mechanizm | mixed methods | realist w RCT | joint display | małe podgrupy |
Dobór projektu — skrót
Jest uczciwa nadsubskrypcja i próba?
Rozważ randomizację dostępu lub wariantu.
Jest jasny próg?
Rozważ regresję nieciągłości.
Program wchodzi w części miejsc i są trendy?
Rozważ różnicę w różnicach, stepped wedge lub szereg kontrolowany.
Jest dobra pula podobnych nieuczestników?
Rozważ dopasowanie lub ważenie, z analizą niezmierzonych różnic.
Jedna polityka, długi szereg i inne regiony?
Rozważ szereg przerywany lub syntetyczną kontrolę.
Mało przypadków i złożone dopasowanie?
Rozważ multiple baseline, realist evaluation, process tracing, analizę wkładu i replikację przypadków.
Program jest nowy i niestabilny?
Najpierw wykonalność, proces, bezpieczeństwo i teoria.
Checklista jakości
- Czy pytanie jest decyzyjne?
- Czy obiekt jest określony?
- Czy teoria istniała przed wynikiem?
- Czy projekt odpowiada pytaniu?
- Czy kontrfaktyczne założenie jest jawne?
- Czy próba ma moc?
- Czy główny wynik jest właściwy?
- Czy pomiar jest porównywalny?
- Czy lejek jest pełny?
- Czy attrition jest analizowany?
- Czy wdrożenie jest mierzone?
- Czy spillover jest znany?
- Czy alternatywy są testowane?
- Czy podgrupy były planowane?
- Czy szkody są równorzędne?
- Czy protokół ma datę?
- Czy odstępstwa są jawne?
- Czy ewaluator jest niezależny?
- Czy uczestnik jest chroniony?
- Czy dane są minimalne?
- Czy wynik negatywny zostanie opublikowany?
- Czy język odpowiada sile dowodu?
Standard końcowy
Najbardziej rygorystyczna ewaluacja nie zawsze jest najbardziej użyteczna, a najbardziej złożony model nie zawsze jest najbardziej wiarygodny. Wiarygodność powstaje z dopasowania:
- pytania;
- projektu;
- założeń;
- danych;
- analizy;
- etyki;
- języka wniosku.
Randomizacja może dobrze oszacować średni wpływ jasno zdefiniowanego modułu. Realist evaluation może wyjaśnić, dlaczego działa tylko przy ciągłości relacji. Studium przypadku może ujawnić mechanizm szkody. Analiza procesu pokaże, że połowa uczestników nie otrzymała interwencji. Te elementy nie konkurują o tytuł „najlepszej metody”; odpowiadają na inne części problemu.
RAND-owski toolkit ewaluacji CVE łączy teorię programu, pomiar procesu i wyniku oraz dobór projektu, podkreślając potrzebę planowania przed wdrożeniem.6 W obszarze małych populacji i rzadkich zdarzeń ta dyscyplina jest ważniejsza niż pozorna precyzja.
Uczciwy raport może więc zakończyć się trzema różnymi zdaniami:
Randomizowane porównanie wskazuje, że oferta modułu zwiększyła utrzymanie pracy, lecz nie dostarczyło precyzyjnego wyniku dla przemocy.
Analiza przypadków wspiera mechanizm zaufania przy ciągłości mentora, ale nie pozwala oszacować średniego wpływu.
Zaobserwowano poprawę, jednak selekcja, utrata danych i brak porównania sprawiają, że nie wiemy, czy spowodował ją program.
Każde może być wynikiem dobrej ewaluacji. Niewiarygodne jest dopiero twierdzenie większe niż pozwala projekt.