Najważniejsze wnioski

  • Projekt ewaluacji wybiera się do pytania, sposobu przydziału, wielkości populacji, dojrzałości programu i możliwych decyzji. Nie zaczyna się od deklaracji „zrobimy RCT” albo „zrobimy wywiady”.
  • Monitoring odpowiada, co dostarczono i co się zmienia. Ewaluacja procesu bada, jak program wdrożono. Ewaluacja wyniku opisuje zmianę. Ewaluacja wpływu próbuje ustalić, jaki wynik powstał dzięki programowi.
  • Zmiana przed–po nie jest sama w sobie wpływem. Uczestnicy mogliby zmienić się wskutek dojrzewania, selekcji, innych usług, odstraszania, regresji do średniej albo zmiany kontekstu.
  • Kontrfaktyczne pytanie brzmi: co stałoby się z tymi samymi osobami w tym samym czasie bez badanego programu? Ponieważ tego nie obserwujemy, projekt tworzy przybliżenie.
  • Randomizacja dobrze ogranicza zakłócenie przyczynowe, jeśli jest wykonalna, etyczna, ma wystarczającą próbę i jest prawidłowo wdrożona. Nie naprawia słabego pomiaru, dużej utraty danych, spillover ani niejasnej interwencji.
  • Grupa kontrolna nie musi pozostawać bez pomocy. Można porównywać standardową usługę, dwa warianty, kolejność wdrożenia lub dodatkowy moduł.
  • Quasi-eksperyment może być bardzo wiarygodny, gdy wykorzystuje jasny mechanizm przydziału i sprawdzalne założenia. Samo nazwanie historycznej grupy „kontrolną” nim nie jest.
  • Dopasowanie równoważy tylko cechy zmierzone. Nie usuwa różnic w motywacji, ukrywaniu, relacji ani jakości skierowania, jeśli ich nie zmierzono.
  • Regresja nieciągłości jest mocna wokół progu, lecz odpowiada głównie o osobach blisko granicy. Różnica w różnicach wymaga wiarygodnego założenia równoległych trendów.
  • Szereg przerywany potrzebuje wielu punktów przed i po oraz kontroli równoczesnych zmian. Dwa pomiary nie tworzą szeregu.
  • Przy małej próbie priorytetem jest bogata teoria zmiany, powtarzane pomiary, analiza przypadku, proces tracing, replikacja między przypadkami i jawna niepewność — nie mnożenie testów.
  • Studium przypadku może wspierać wnioskowanie przyczynowe, jeśli szuka sekwencji, mechanizmu, dowodów przeciwnych i alternatyw. Historia sukcesu wybrana przez wykonawcę nie jest takim studium.
  • Realist evaluation bada konfiguracje kontekst–mechanizm–wynik. Analiza wkładu ocenia, czy program wiarygodnie przyczynił się do zmiany w pakiecie przyczyn. Nie dostarczają prostego procentu wpływu.
  • Metody mieszane są wartościowe tylko wtedy, gdy dane ilościowe i jakościowe odpowiadają na powiązane pytania i są wspólnie integrowane. Dwie osobne części raportu nie wystarczą.
  • Obliczenie mocy wykonuje się przed zbiorem danych dla głównego wyniku, realistycznego efektu, jednostki przydziału, korelacji, utraty i rzadkości zdarzenia.
  • Brak istotności statystycznej nie dowodzi braku efektu. Może oznaczać małą próbę, duży szum albo efekt zbyt mały, by go odróżnić.
  • Istotność statystyczna nie dowodzi znaczenia praktycznego, braku szkód ani poprawności projektu.
  • Selekcja do programu, odmowa, wykluczenie, przerwanie i brak follow-up są wynikami procesu i możliwymi źródłami błędu. Trzeba raportować cały lejek.
  • Protokół, główne pytania, wyniki, reguły wyłączeń i plan analizy powinny powstać przed obejrzeniem wyników. Odstępstwa są dopuszczalne, ale jawne.
  • Prerejestracja nie gwarantuje jakości. Ogranicza swobodę dopasowywania hipotez i pokazuje, co było potwierdzające, a co eksploracyjne.
  • Ewaluator potrzebuje niezależności organizacyjnej, dostępu do danych i prawa publikacji wniosków. Zapłata przez zamawiającego nie musi niszczyć niezależności, jeśli struktura chroni metodę i raport.
  • Program wysokiej stawki wymaga oceny etycznej, minimalizacji danych, świadomej zgody tam, gdzie jest właściwa, ochrony przed odwetem i planu reakcji na ujawnione zagrożenie.
  • Dane operacyjne i badawcze mają różne cele. Ich połączenie wymaga jawnej podstawy i granic; uczestnik nie powinien wierzyć, że poufny wywiad badawczy wpłynie na zwolnienie, jeśli nie wpływa.
  • Wynik negatywny, zerowy albo niejednoznaczny powinien być publikowany. Ukrywanie go zniekształca bazę wiedzy i skazuje kolejne programy na powtarzanie błędu.
  • Bezpieczna publikacja może usuwać szczegóły identyfikujące bez ukrywania metod, liczebności, braków, konfliktów i ograniczeń.
  • Najuczciwszy wniosek czasem brzmi: program został wdrożony, obserwowano poprawę, lecz projekt nie pozwala ustalić, czy ją spowodował.

Najpierw pytanie decyzyjne

Pytanie opisowe

Kto trafia do programu i jakie ma potrzeby?

Metody:

  • rejestry;
  • ankieta;
  • audyt;
  • wywiady;
  • analiza skierowań.

Pytanie o wdrożenie

Czy mentoring został dostarczony zgodnie z modelem?

Metody:

  • dokumentacja;
  • obserwacja;
  • nagrania, gdy zgodne z prawem;
  • superwizja;
  • wywiady;
  • dane o dawce.

Pytanie o zmianę

Czy u uczestników zmieniła się akceptacja przemocy i funkcjonowanie?

Metody:

  • pomiar bazowy i kolejne;
  • wiele źródeł;
  • analiza trajektorii.

Pytanie o wpływ

Czy moduł mentoringu spowodował zmianę wobec tego, co nastąpiłoby bez niego?

Potrzebne jest wiarygodne porównanie albo inne jawne podejście do przyczynowości.

Pytanie o mechanizm

Czy moduł działał przez relację zaufania i nową sieć?

Metody:

  • teoria zmiany;
  • pomiar mechanizmu;
  • czasowa sekwencja;
  • wywiady;
  • analiza mediacji przy odpowiedniej próbie;
  • proces tracing.

Pytanie o heterogeniczność

Dla kogo i w jakich warunkach?

Metody:

  • planowane podgrupy;
  • interakcje;
  • porównanie przypadków;
  • realist evaluation;
  • QCA przy odpowiedniej liczbie przypadków.

Pytanie ekonomiczne

Jaki jest koszt dodatkowego bezpiecznego wyniku wobec alternatywy?

Wymaga danych kosztowych i wiarygodnego efektu.

Obiekt ewaluacji

Moduł

Na przykład:

  • mentor;
  • rozmowa teologiczna;
  • wsparcie pracy;
  • terapia.

Najłatwiej zdefiniować interwencję i porównanie.

Pełny program

Pakiet wielu modułów dopasowywanych do osoby. Trudniej oddzielić składniki.

System

Skierowanie, ocena, wymiana danych, usługi i nadzór. Wyniki mogą powstawać na kilku poziomach.

Polityka

Zmiana prawa lub obowiązku obejmująca całą populację. Randomizacja jednostek może być niemożliwa.

Pilotaż

Ma sprawdzić:

  • wykonalność;
  • akceptację;
  • jakość danych;
  • mechanizm;
  • bezpieczeństwo.

Mały pilotaż rzadko daje wiarygodny szacunek wpływu na rzadką przemoc.

Ewaluowalność

Przed projektem warto przeprowadzić ocenę ewaluowalności.

Pytania

  • Czy cel jest określony?
  • Czy grupa jest zdefiniowana?
  • Czy istnieje teoria zmiany?
  • Czy interwencja jest względnie stabilna?
  • Czy można opisać dawkę?
  • Czy wyniki da się mierzyć?
  • Czy jest punkt bazowy?
  • Czy istnieje porównanie?
  • Czy dane można legalnie połączyć?
  • Czy próba wystarczy?
  • Czy wynik będzie użyty?
  • Czy szkody są monitorowane?

Wyniki oceny

Program może być:

  • gotowy do ewaluacji wpływu;
  • gotowy do ewaluacji procesu i wyniku;
  • wymagający przebudowy danych;
  • zbyt niestabilny;
  • niewłaściwy do obiecanego pytania.

Odmowa wykonania pozornie precyzyjnej ewaluacji może być oznaką jakości.

Cztery rodzaje trafności

Trafność konstruktu

Czy interwencja i wynik odpowiadają pojęciom?

Przykładowe błędy:

  • frekwencja nazwana zaangażowaniem;
  • brak skazania nazwany brakiem przemocy;
  • zmiana odpowiedzi nazwana zmianą ideologii;
  • zatrudnienie nazwane reintegracją;
  • mentoring rozumiany inaczej w każdym miejscu.

Zabezpieczenia:

  • definicja;
  • teoria zmiany;
  • kilka miar;
  • pilotaż;
  • obserwacja jakości;
  • wywiad poznawczy;
  • sprawdzenie, czy interwencja faktycznie zmieniła zakładany mechanizm.

Trafność wewnętrzna

Czy obserwowaną różnicę można wiarygodnie przypisać interwencji?

Zagrożenia:

  • selekcja;
  • historia;
  • dojrzewanie;
  • regresja;
  • utrata;
  • zmiana pomiaru;
  • spillover;
  • inne usługi.

Projekt kontrfaktyczny przede wszystkim wzmacnia ten rodzaj trafności.

Trafność zewnętrzna

Czy wynik dotyczy innych:

  • uczestników;
  • ośrodków;
  • ideologii;
  • krajów;
  • okresów;
  • wykonawców?

RCT z jednego dobrego ośrodka może mieć wysoką trafność wewnętrzną i ograniczoną zewnętrzną.

Trafność wnioskowania statystycznego

Czy analiza właściwie ocenia wielkość i niepewność?

Zagrożenia:

  • mała moc;
  • błędny model;
  • zależne obserwacje;
  • wielokrotne testy;
  • odstające przypadki;
  • wybiórcza analiza;
  • naruszenie założeń.

Nie wymieniać jednej za drugą

Duża próba nie naprawia złej definicji. Randomizacja nie gwarantuje przenośności. Głęboki wywiad nie izoluje średniego efektu. Dobra ewaluacja mówi, który rodzaj trafności wzmacnia i gdzie pozostaje słaba.

Przyczynowość i kontrfaktyczny wynik

Dla każdej osoby istnieją dwa potencjalne wyniki:

  • z programem;
  • bez programu.

Obserwujemy tylko jeden. Grupa porównawcza ma przybliżyć drugi.

Wymiana

Wiarygodne porównanie wymaga, by grupy różniły się zasadniczo interwencją, a nie:

  • motywacją;
  • ryzykiem;
  • regionem;
  • czasem;
  • dostępem;
  • prowadzącym;
  • nadzorem.

Założenia

Każdy projekt przyczynowy ma założenia. Różni się tym, czy są:

  • projektowo wymuszone;
  • empirycznie sprawdzalne częściowo;
  • wiarygodne teoretycznie;
  • ukryte.

Randomizacja wzmacnia wymianę średnio. Dopasowanie zakłada brak ważnych niezmierzonych różnic. Szereg zakłada brak równoczesnego przełomu.

Randomizowane badanie

World Bank przedstawia randomizację, zmienne instrumentalne, regresję nieciągłości, różnicę w różnicach i dopasowanie jako odrębne sposoby budowania kontrfaktycznego porównania.1

Kiedy ma sens

  • liczba uprawnionych jest większa niż pojemność;
  • przydział jest rzeczywiście niepewny;
  • istnieje dopuszczalna alternatywa;
  • interwencja jest stabilna;
  • wynik jest mierzalny;
  • próba wystarczy;
  • spillover można ograniczyć lub mierzyć.

Co losować

  • osobę;
  • prowadzącego;
  • placówkę;
  • region;
  • czas rozpoczęcia;
  • dodatkowy moduł;
  • wariant.

Jednostka losowania i jednostka analizy muszą być uwzględnione w mocy.

Indywidualna randomizacja

Zalety:

  • największa liczba jednostek;
  • dobra równowaga średnia.

Ryzyka:

  • osoby w jednej placówce wymieniają treści;
  • praktyk miesza modele;
  • poczucie nierówności;
  • organizacyjne błędy.

Randomizacja klastrowa

Losuje się placówki, zespoły lub regiony.

Zalety:

  • mniej spillover;
  • łatwiejsze wdrożenie modelu.

Wady:

  • potrzeba większej próby;
  • mała liczba klastrów;
  • różnice organizacyjne;
  • analiza musi uwzględniać korelację.

Lista oczekujących

Jedna grupa zaczyna później.

Może być uczciwa przy ograniczonej pojemności i braku pilnej potrzeby. Nie jest właściwa, gdy opóźnienie stwarza nieakceptowalne zagrożenie albo zwykła praktyka i tak zaczęłaby się natychmiast.

Stepped wedge

Wszystkie klastry otrzymują program, ale w losowej kolejności.

Zalety:

  • polityczna akceptacja;
  • wdrożenie etapowe.

Wady:

  • czas jest splątany z interwencją;
  • złożona analiza;
  • wymaga wielu pomiarów;
  • założenie stabilnego efektu może być nierealne;
  • klastrów bywa za mało.

Randomizacja zachęty

Losuje się dodatkową zachętę do skorzystania, nie sam program. Może oceniać efekt oferty lub, przy silnych założeniach, efekt uczestnictwa w określonej grupie.

A/B modułu

Obie grupy dostają podstawową usługę, a porównuje się:

  • mentor standardowy vs specjalistyczny;
  • sesję osobistą vs hybrydową;
  • różną dawkę;
  • dodatkową superwizję.

Etycznie i poznawczo może być lepsze niż program vs nic.

Etyka randomizacji

Równowaga wiedzy

Musi istnieć uczciwa niepewność, który wariant jest lepszy. Jeżeli jeden jest niezbędnym standardem, nie należy go odbierać.

Ryzyko

Oddziela się:

  • ryzyko niewłączenia;
  • ryzyko samej interwencji;
  • ryzyko badania;
  • ryzyko danych.

Dostęp podstawowy

Grupa porównawcza otrzymuje:

  • zwykłą opiekę;
  • pomoc kryzysową;
  • prawa;
  • interwencję bezpieczeństwa.

Badanie nie zawiesza obowiązków ochrony.

Zgoda

Zgoda na badanie i zgoda na usługę są odrębne. Odmowa pomiaru nie powinna pogarszać pomocy, chyba że konkretna procedura i prawo przewidują inaczej.

Władza

W więzieniu lub probacji formalny podpis może nie być swobodny. Potrzebne są:

  • niezależna informacja;
  • brak wpływu na zwolnienie;
  • możliwość pytań;
  • minimalizacja nacisku;
  • właściwa ocena etyczna.

Analiza randomizacji

Intention-to-treat

Porównuje według przydziału niezależnie od ukończenia. Szacuje efekt oferty programu.

Chroni randomizację, ale może dać mały wynik, gdy wiele osób nie skorzysta.

Per protocol

Porównuje osoby realizujące plan. Jest silnie podatna na selekcję.

Treatment-on-the-treated

Próbuje oszacować efekt faktycznego uczestnictwa z wykorzystaniem przydziału jako instrumentu. Wymaga dodatkowych założeń i interpretuje określoną grupę osób, których udział zmienił przydział.

Równowaga

Sprawdza się cechy bazowe, ale nie testuje ich bez końca. Losowe różnice mogą wystąpić.

Nieprzestrzeganie przydziału

  • przejście do innej grupy;
  • brak udziału;
  • częściowa dawka;
  • usługa poza badaniem.

Raportuje się każde.

Spillover

Uczestnicy kontrolni mogą korzystać z:

  • tego samego mentora;
  • materiałów;
  • rodziny;
  • zmienionej praktyki placówki.

Efekt porównania może zostać rozmyty. Spillover jest też wynikiem systemowym, który warto zbadać.

Quasi-eksperyment

Quasi-eksperyment testuje hipotezę przyczynową bez losowego przydziału; przydział wynika z samo-selekcji, decyzji administratora lub reguły.2

Jakość zależy od mechanizmu, nie od skomplikowania modelu.

Regresja nieciągłości

Pomysł

Program otrzymują osoby powyżej progu:

wynik oceny ≥ 20.

Porównuje się osoby tuż po obu stronach, zakładając, że są podobne poza szansą udziału.

Warunki

  • ciągła zmienna;
  • znany próg;
  • brak manipulacji;
  • dostatecznie dużo przypadków;
  • inne reguły nie zmieniają się w tym samym punkcie;
  • wynik jest gładki bez interwencji.

Ostra i rozmyta

Ostra: próg całkowicie określa udział.

Rozmyta: próg zwiększa prawdopodobieństwo, lecz są wyjątki.

Ograniczenie

Wynik dotyczy przede wszystkim osób blisko progu. Nie musi mówić o najwyższym ryzyku.

Kontrole

  • wykres;
  • gęstość wokół progu;
  • cechy bazowe;
  • inne progi;
  • różne szerokości okna;
  • wcześniejsze wyniki.

Różnica w różnicach

Pomysł

Porównuje zmianę w grupie objętej programem ze zmianą w grupie nieobjętej.

Nie:

po programie grupa ma lepszy wynik.

Tylko:

czy jej zmiana różni się od zmiany porównania.

Kluczowe założenie

Bez programu trendy byłyby równoległe.

Sprawdzenie

Wiele punktów przed wdrożeniem pomaga ocenić, czy trendy były podobne. Nie dowodzi założenia po wdrożeniu.

Zagrożenia

  • grupa dostała program, bo jej trend był gorszy;
  • jednocześnie zmieniła inne usługi;
  • skład populacji się zmienił;
  • efekt pojawia się przed startem;
  • wynik ma różną definicję.

Event study

Pokazuje dynamikę przed i po. Przy etapowym wdrożeniu i zróżnicowanych efektach proste estymatory mogą być mylące; potrzebna jest odpowiednia metoda.

Dopasowanie

Pomysł

Tworzy grupę porównawczą podobną pod względem zmierzonych cech.

Cechy

Powinny poprzedzać program:

  • wcześniejsze zachowanie;
  • wiek;
  • status;
  • potrzeby;
  • typ skierowania;
  • region;
  • wynik bazowy.

Nie należy dopasowywać na zmienne powstałe wskutek programu.

Propensity score

Szacuje prawdopodobieństwo otrzymania programu na podstawie cech.

Możliwe użycia:

  • parowanie;
  • ważenie;
  • stratyfikacja.

Sam podobny propensity score nie gwarantuje podobieństwa każdej ważnej cechy. Trzeba pokazać balans i wspólny obszar.

Brak wspólnego wsparcia

Jeśli najwyższe ryzyko zawsze dostaje program, nie ma porównania dla tej grupy. Model nie może wyczarować kontrfaktycznego wyniku.

Niezmierzone zakłócenie

Motywacja lub decyzja specjalisty może wpływać zarówno na udział, jak i wynik. Jeśli nie jest mierzona, dopasowanie nie usuwa błędu.

Analiza wrażliwości

Powinna pokazać, jak silna musiałaby być niezmierzona różnica, aby zmienić wniosek.

Zmienne instrumentalne

Pomysł

Instrument wpływa na udział, lecz nie wpływa na wynik inaczej niż przez udział i spełnia inne formalne założenia.

Przykładowy kandydat:

  • losowy przydział;
  • odległość;
  • dostępność prowadzącego.

Pułapka

Odległość może wpływać na pracę i dostęp do usług, więc nie jest automatycznie dobrym instrumentem.

Interpretacja

Wynik zwykle dotyczy osób, których uczestnictwo zmienia instrument, nie całej populacji.

Szereg czasowy przerywany

Pomysł

Wiele pomiarów przed i po zmianie pozwala badać:

  • skok poziomu;
  • zmianę trendu;
  • opóźnienie.

Jednostka

  • region;
  • placówka;
  • system;
  • czasem osoba w projekcie pojedynczego przypadku.

Wymagania

  • dostatecznie dużo punktów;
  • stały sposób pomiaru;
  • znany moment;
  • model sezonowości i autokorelacji;
  • dokumentacja innych zmian.

Kontrolowany szereg

Dodanie podobnego obszaru bez zmiany wzmacnia wniosek.

Rzadkie zdarzenie

Miesięczna liczba zamachów może być zbyt rzadka i niestabilna. Lepsze mogą być:

  • zdarzenia w większym obszarze;
  • dłuższy okres;
  • wynik bliższy mechanizmowi,

ale ten ostatni nie zastępuje wyniku bezpieczeństwa.

Syntetyczna kontrola

Tworzy ważoną kombinację innych jednostek przypominającą obszar przed interwencją.

Może być użyteczna dla polityki w jednym regionie, jeśli:

  • istnieje pula nieobjętych jednostek;
  • są długie dane przed;
  • nie ma szerokiego spillover;
  • wynik jest porównywalny.

Nie nadaje się, gdy program wdrożono wszędzie jednocześnie lub jednostki są nieporównywalne.

Kontrolowane badanie przed–po

Co najmniej jedna grupa interwencji i porównawcza z pomiarem przed i po.

Jest słabsze niż projekt z dobrze uzasadnionym mechanizmem przydziału, ale może być użyteczne, jeśli:

  • grupy są opisane;
  • wartości bazowe znane;
  • różnice analizowane;
  • wynik interpretowany ostrożnie.

Samo przed–po

Co pozwala powiedzieć

Wynik zmienił się u uczestników między pomiarami.

Czego nie

Program spowodował zmianę.

Zagrożenia

  • dojrzewanie;
  • historia;
  • regresja;
  • testowanie;
  • zmiana narzędzia;
  • utrata;
  • selekcja.

Jak wzmocnić

  • wiele pomiarów;
  • teoria zmiany;
  • pomiar mechanizmu;
  • dane o kontekście;
  • niezależne źródła;
  • analiza przypadku;
  • porównanie historyczne;
  • wynik negatywny;
  • transparentny język.

Projekty pojedynczego przypadku

Dla kogo

Przy bardzo małej populacji można prowadzić intensywny powtarzany pomiar.

AB

A — linia bazowa.

B — interwencja.

Zmiana po B jest sugestywna, lecz splątana z czasem.

ABA lub ABAB

Wycofanie i ponowne wdrożenie może wzmacniać wniosek, ale często jest:

  • nieetyczne;
  • niemożliwe;
  • nieodwracalne.

Nie wycofuje się ochrony lub leczenia dla projektu.

Multiple baseline

Interwencję wprowadza się w różnym czasie:

  • u osób;
  • dla zachowań;
  • w miejscach.

Powtarzająca się zmiana po rozpoczęciu wzmacnia hipotezę.

Wyniki

Nadają się do:

  • zachowania częstego;
  • umiejętności;
  • korzystania z planu;
  • objawów.

Nie do bezpośredniego testu rzadkiego zamachu.

Analiza

  • wykres;
  • poziom;
  • trend;
  • zmienność;
  • natychmiastowość;
  • nakładanie;
  • efekt liczbowy;
  • interpretacja kliniczna.

Studium przypadku

Nie anegdota

Wiarygodne studium ma:

  • pytanie;
  • kryterium doboru;
  • granice;
  • wiele źródeł;
  • oś czasu;
  • teorię;
  • alternatywy;
  • dowody przeciwne;
  • łańcuch danych.

Dobór

  • typowy przypadek;
  • skrajny;
  • sukces;
  • porażka;
  • przypadek krytyczny;
  • maksymalna różnorodność.

Dobór wyłącznie najbardziej medialnego sukcesu daje materiał ilustracyjny, nie ocenę.

Process tracing

Sprawdza, czy oczekiwany mechanizm pozostawił ślady:

  • działanie poprzedziło zmianę;
  • uczestnik rzeczywiście skorzystał z zasobu;
  • powstała relacja;
  • wykonano krok;
  • alternatywa jest słabsza.

Testy

Niektóry dowód jest konieczny, lecz niewystarczający; inny może silnie potwierdzać konkretny mechanizm. Siłę dowodu ocenia się względem hipotez, nie emocjonalności historii.

Negatywny przypadek

Przypadek, który nie pasuje, może ujawnić:

  • brakujące założenie;
  • inną populację;
  • szkodę;
  • błąd teorii.

Realist evaluation

Realist evaluation bada, jak uczestnik reaguje na zasoby interwencji w określonym kontekście i jakie wzory wyniku powstają; może korzystać z porównań wewnątrz programu i jest możliwa także w małej skali.3

Konfiguracja

  • kontekst;
  • mechanizm;
  • wynik.

Przykład

Kontekst:

  • dobrowolny udział;
  • jawna rola mentora.

Mechanizm:

  • zaufanie i testowanie nowej tożsamości.

Wynik:

  • wykonanie kroków wyjścia.

Dane

  • wywiady;
  • obserwacja;
  • dokumenty;
  • skale;
  • porównanie przypadków;
  • sekwencje.

Wniosek

Nie:

Mentoring działa w 63%.

Lepiej:

Mentoring uruchamiał zaufanie u osób gotowych do odejścia, gdy rola była jawna i kontakt ciągły; w warunkach silnego przymusu prowadził głównie do zgodności językowej.

Ryzyko

Mechanizm bywa mylony z działaniem albo opisem psychologicznym po fakcie. Hipotezy trzeba sformułować i testować.

Analiza wkładu

Pytanie

Czy rozsądnie jest uznać, że program wniósł ważny wkład do obserwowanej zmiany?

Kroki

  1. teoria zmiany;
  2. ryzyka;
  3. istniejące dane;
  4. historia wkładu;
  5. alternatywne wyjaśnienia;
  6. dodatkowe dane;
  7. rewizja.

BetterEvaluation wskazuje, że analiza wkładu nadaje się do złożonej zmiany z wieloma aktorami, lecz nie służy do precyzyjnego ilościowego przypisania części wyniku.4

Dowody

  • każde ogniwo;
  • wdrożenie;
  • mechanizm;
  • sekwencja;
  • kontekst;
  • alternatywa;
  • spójność między przypadkami.

Ograniczenie

Ładna „historia wkładu” bez aktywnego szukania dowodów przeciwnych staje się narracją wykonawcy.

Qualitative Comparative Analysis

QCA bada konfiguracje warunków związanych z wynikiem.

Przykład:

mieszkanie + relacja + dobrowolność

może wystarczać w jednej konfiguracji, a:

kontrola + praca + rodzina

w innej.

Wymagania

  • porównywalne przypadki;
  • dobrze skalibrowane zbiory;
  • teoria;
  • dostateczna różnorodność;
  • przejrzyste decyzje kodowania.

Ograniczenia

  • wrażliwość na kalibrację;
  • ograniczona różnorodność;
  • sprzeczne konfiguracje;
  • trudność małej lub bardzo dużej liczby;
  • nie zastępuje wiedzy o procesie.

Outcome harvesting

Zaczyna od zaobserwowanych zmian i pracuje wstecz, ustalając wkład programu.

Może pomóc przy:

  • nieprzewidywalnych wynikach;
  • pracy społecznościowej;
  • zmianie instytucjonalnej.

Ryzyko:

  • wybór pozytywnych zmian;
  • pamięć;
  • brak kontrfaktycznego porównania.

Potrzebna jest weryfikacja zewnętrzna i poszukiwanie szkód.

Metody mieszane

Po co

Ilościowe:

  • ile;
  • jak duża zmiana;
  • jaka różnica;
  • jaka niepewność.

Jakościowe:

  • jak;
  • dlaczego;
  • dla kogo;
  • co znaczy;
  • co pominięto.

Projekty

Równoległy

Zbiera oba rodzaje jednocześnie i integruje.

Sekwencyjny wyjaśniający

Najpierw wynik liczbowy, potem wywiady wyjaśniające.

Sekwencyjny eksploracyjny

Najpierw jakościowo poznaje domeny, potem buduje pomiar.

Zagnieżdżony

Studia przypadków wewnątrz eksperymentu lub quasi-eksperymentu.

Integracja

  • wspólne pytania;
  • wspólny przypadek lub kohorta;
  • tabela joint display;
  • analiza zgodności;
  • wyjaśnienie różnic;
  • jeden wniosek.

Przykład

Ilościowo:

brak średniego efektu mentoringu.

Jakościowo:

relacja powstała tylko przy ciągłości prowadzącego.

Po integracji:

średnia miesza wysoką korzyść przy ciągłości i brak mechanizmu przy rotacji.

To hipoteza wymagająca dalszego testu, nie automatyczne potwierdzenie podgrupy.

Program adaptacyjny

Problem

Program często zmienia moduł, dawkę, kolejność, prowadzącego i intensywność w odpowiedzi na przypadek. Prosta etykieta „otrzymał program” ukrywa dynamiczny reżim decyzji.

Dopasowanie jako składnik

Jeśli teoria mówi, że ocena dobiera właściwy moduł, ewaluacja bada:

  1. jakość reguły dopasowania;
  2. efekt dostarczonego modułu.

Dobry moduł przy błędnym dopasowaniu może mieć słaby wynik systemowy.

Confounding by indication

Osoby w gorszym stanie dostają więcej terapii. Proste porównanie może pokazać, że większa dawka wiąże się z gorszym wynikiem, choć decyzja była odpowiedzią na potrzebę.

Potrzebne są:

  • dane czasowe;
  • zmienne sprzed decyzji;
  • model zależnego od czasu zakłócenia;
  • projekt sekwencyjny;
  • ostrożna interpretacja.

SMART

Sequential Multiple Assignment Randomized Trial może losować kolejny wariant u osób, które nie odpowiedziały. Buduje adaptacyjne sekwencje, ale wymaga:

  • większej próby;
  • jasnych punktów decyzji;
  • bezpiecznych wariantów;
  • stabilnego pomiaru;
  • złożonej analizy.

W małych programach częściej realistyczne jest prospektywne dokumentowanie reguły i porównanie przypadków.

Micro-randomized trial

Losuje się krótkie interwencje w wielu momentach, na przykład przypomnienie lub kontakt. Może badać bliski wynik, nie długoterminową deradykalizację. Wysoka liczba decyzji nie zastępuje liczby osób dla wszystkich pytań.

Adaptacja a dryf

Adaptacja:

  • wynika z teorii;
  • ma zapis;
  • zachowuje rdzeń;
  • ma hipotezę;
  • jest oceniana.

Dryf:

  • zależy od wygody;
  • jest niewidoczny;
  • zmienia funkcję;
  • utrudnia porównanie.

Ewaluator powinien wersjonować interwencję.

Zewnętrzna przenośność

Populacja badania

Raport pokazuje, kto:

  • był uprawniony;
  • zgodził się;
  • został wyłączony;
  • rozpoczął;
  • pozostał.

Wynik u dobrowolnych uczestników nie przenosi się automatycznie na nakazanych.

Ośrodek

Wysoki efekt może zależeć od:

  • charyzmatycznego założyciela;
  • małego obciążenia;
  • specjalnego finansowania;
  • doświadczonego zespołu;
  • silnej sieci;
  • wyjątkowego rynku pracy.

To nie „szum”, lecz część pakietu przyczynowego.

Ideologia

Mechanizm regulacji emocji może przenosić się szerzej niż konkretny dialog teologiczny. Należy wskazać, co jest:

  • rdzeniem mechanizmu;
  • treścią adaptowaną;
  • warunkiem kontekstu.

Kraj

Prawo, zaufanie, system pomocy, więzienie i wspólnota zmieniają interwencję. Kopiowanie nazwy nie kopiuje mechanizmu.

Transportability

Można analizować, czy rozkład moderatorów w nowej populacji różni się od badania i ważyć wynik, lecz wymaga to:

  • pomiaru istotnych cech;
  • wspólnego zakresu;
  • prawidłowego modelu;
  • założenia o braku niezmierzonych moderatorów.

Replikacja

Najcenniejsza jest w innym ośrodku, z innym zespołem, przy tym samym rdzeniu, jawnej adaptacji i wspólnym głównym wyniku.

Brak identycznego efektu nie musi obalać programu. Może ujawnić warunek.

Uczenie przez wiele ośrodków

Wspólny rdzeń danych

  • definicje;
  • kohorta;
  • punkt bazowy;
  • wyniki;
  • czas;
  • szkody;
  • wdrożenie.

Lokalny moduł

Każdy ośrodek może dodać:

  • kontekst;
  • wywiady;
  • szczególny mechanizm;
  • własny wynik.

Model wielopoziomowy

Przy dostatecznej liczbie ośrodków rozdziela różnice osób, prowadzących i placówek. Przy kilku klastrach estymacja wariancji jest bardzo niepewna.

Meta-analiza danych indywidualnych

Wspólne dane mogą zwiększać moc i badać heterogeniczność, jeśli:

  • definicje są harmonizowane;
  • zgody i podstawy pozwalają;
  • protokół powstał;
  • ośrodki zachowują odpowiedzialność;
  • bezpieczeństwo jest wysokie.

Analiza federacyjna

Kod może być wykonywany lokalnie, a agregaty łączone bez centralizacji danych osobowych. Ogranicza część ryzyka, ale nie usuwa błędów definicji, ujawnienia z małych komórek ani potrzeby zarządzania.

Synteza dowodów

Nie liczyć głosów

Trzy badania „dodatnie” i dwa „zerowe” nie wystarczą. Liczy się:

  • projekt;
  • wielkość;
  • niepewność;
  • wdrożenie;
  • populacja;
  • ryzyko błędu.

Meta-analiza

Łączy porównywalne szacunki. Przy dużej heterogeniczności wspólna średnia może być mało użyteczna.

Należy podawać:

  • model;
  • heterogeniczność;
  • przedział predykcyjny;
  • wpływ małych badań;
  • analizę jakości.

Synteza jakościowa

Może identyfikować:

  • mechanizmy;
  • bariery;
  • warunki;
  • szkody;
  • doświadczenia.

Wymaga systematycznego wyszukania, doboru i oceny, nie wyboru cytatów.

Evidence and gap map

Pokazuje, gdzie istnieją ewaluacje i przeglądy, a gdzie luki. Nie mówi sama, że interwencja działa.

Bias publikacyjny

Programy z wynikiem dodatnim są częściej publikowane, promowane i opisywane po angielsku. Protokoły, raporty zamawiających i wyniki zerowe są potrzebne do pełniejszej syntezy.

Zarządzanie ewaluacją

Komitet sterujący

Może obejmować:

  • zamawiającego;
  • praktyka;
  • ewaluatora;
  • ochronę danych;
  • etykę;
  • partnera społecznego;
  • osobę z doświadczeniem;
  • przedstawiciela ofiar.

Nie powinien zmieniać wyniku analizy głosowaniem.

Niezależny przegląd bezpieczeństwa

Przy większym lub ryzykownym badaniu właściwy komitet może przeglądać:

  • poważne szkody;
  • jakość;
  • reguły zatrzymania;
  • nierównowagę;
  • poufność.

Własność decyzji

Trzeba ustalić, kto:

  • zmienia program;
  • zatrzymuje rekrutację;
  • zgłasza incydent;
  • publikuje;
  • odpowiada uczestnikom.

Harmonogram

Ewaluator powinien wejść przed wyborem systemu danych, pierwszym uczestnikiem, zmianą progu i umową z wykonawcą. Retrospektywne „dopisanie ewaluacji” ogranicza pytania.

Budżet

Obejmuje:

  • projekt;
  • narzędzia;
  • pomiar bazowy;
  • follow-up;
  • linkowanie;
  • tłumaczenie;
  • ochronę;
  • analizę;
  • publikację;
  • archiwizację.

Budżet ograniczony do końcowego raportu nie tworzy danych.

Reguły zatrzymania i adaptacji

Szkoda

Zatrzymanie lub przegląd może uruchomić:

  • poważne naruszenie;
  • przemoc związaną z procedurą;
  • nieautoryzowane ujawnienie;
  • wtórną wiktymizację;
  • wyraźną nierówność szkody.

Daremność

Jeśli program nie ma szansy osiągnąć wyniku przy dostępnej próbie lub mechanizm nie powstaje, kontynuowanie wyłącznie dla dodatniego raportu może być nieetyczne.

Skuteczność

Wczesne zakończenie dla korzyści wymaga rygorystycznej reguły, bo przypadkowy wysoki wynik na początku zawyża efekt.

Analizy okresowe

Powinny być:

  • planowane;
  • wykonywane przez właściwy podmiot;
  • ograniczone;
  • z korektą lub podejściem sekwencyjnym.

Adaptacja bez zatarcia

Jeśli program zmieniono po sygnale:

  • wersja 1 i 2 są opisane;
  • kohorty rozdzielone;
  • pytanie zmienione;
  • wynik pierwotny zachowany.

Wykorzystanie wyniku

Mapa decyzji

Wynik Wdrożenie Szkody Decyzja
korzystny dobre małe kontynuuj i replikuj
niepewny dobre małe zwiększ wiedzę, nie reklamuj
zerowy słabe różne napraw wdrożenie i testuj
zerowy dobre małe zmień teorię lub zakończ
korzystny dobre duże przeprojektuj; korzyść nie unieważnia szkody
negatywny dowolne dowolne zabezpiecz i rozważ zatrzymanie

Użytkownicy

  • uczestnicy;
  • praktycy;
  • kierownictwo;
  • zamawiający;
  • organy nadzoru;
  • społeczność;
  • nauka.

Każdy potrzebuje innej formy, ale nie innej prawdy.

Plan uczenia

Przed startem ustala:

  • jakie decyzje;
  • kto;
  • kiedy;
  • jaki próg dowodu;
  • jak wynik zostanie wdrożony.

Raport bez właściciela decyzji jest słabym narzędziem zmiany.

Dobór próby i moc

Moc

Prawdopodobieństwo wykrycia efektu o określonej wielkości przy założeniach.

Potrzebne elementy

  • główny wynik;
  • oczekiwana wartość;
  • minimalny ważny efekt;
  • wariancja;
  • poziom błędu;
  • moc;
  • jednostka;
  • klasteryzacja;
  • powtarzanie;
  • utrata;
  • zgodność.

Rzadki wynik

Jeśli ponowna przemoc jest rzadka, wykrycie umiarkowanej różnicy wymaga dużej próby i czasu.

Nie rozwiązuje się tego przez zmianę wyniku na łatwy i nazywanie go przemocą.

Mała próba

Możliwe działania:

  • wieloośrodkowość;
  • dłuższa rekrutacja;
  • wspólne definicje;
  • powtarzane pomiary;
  • ciągły wynik mechanizmu;
  • precyzyjne estymowanie;
  • podejście bayesowskie z jawnymi priors;
  • studia przypadków;
  • synteza między programami.

Nie zwiększać sztucznie n

Dziesięć pomiarów jednej osoby nie daje dziesięciu niezależnych osób. Model musi uwzględnić zależność.

Minimalny ważny efekt

Nie wybiera się go dlatego, że da się osiągnąć moc. Powinien odzwierciedlać:

  • wagę wyniku;
  • koszt;
  • ryzyko;
  • alternatywę;
  • szkodę.

Wielokrotne wyniki

Problem

Przy 30 testach część może wyjść „istotna” przypadkiem.

Rozwiązania

  • jeden lub kilka głównych wyników;
  • hierarchia;
  • korekta;
  • przedział;
  • wynik eksploracyjny oznaczony;
  • replikacja.

Nie wszystko jest równoważne

Wynik bezpieczeństwa, mechanizmu i szkody nie powinny zostać sprowadzone do jednej korekty bez sensu teoretycznego.

Selekcja

Do skierowania

Nie każdy ma tę samą szansę wejścia w lejek.

Do przyjęcia

Praktycy mogą wybierać osoby rokujące.

Do udziału

Dobrowolni różnią się od odmawiających.

Do ukończenia

Pozostają osoby stabilniejsze lub lepiej dopasowane.

Do follow-up

Łatwiej znaleźć osoby z mieszkaniem i pracą.

Dokumentacja

Pełny lejek:

  • skierowani;
  • ocenieni;
  • uprawnieni;
  • przyjęci;
  • rozpoczęli;
  • otrzymali dawkę;
  • ukończyli;
  • obserwowani.

Przyczyny każdej straty.

Attrition — utrata obserwacji

Dlaczego groźna

Jeśli odpadają osoby z gorszym wynikiem, średnia pozostałych zawyża sukces.

Analiza

  • porównanie bazowe;
  • przyczyny;
  • wzór czasowy;
  • metody uzupełniania przy założeniach;
  • ważenie;
  • analiza wrażliwości;
  • skrajne scenariusze.

Nie imputować bezmyślnie

Uzupełnienie danych nie odzyskuje informacji. Przenosi założenie do modelu.

Retencja etyczna

  • kilka kanałów;
  • zgoda na kontakt;
  • rozsądne wynagrodzenie;
  • brak nacisku;
  • bezpieczny termin;
  • możliwość krótkiego pomiaru.

Jakość pomiaru

Oślepienie

Oceniający nie zawsze może nie znać grupy, ale niezależne kodowanie ogranicza oczekiwanie.

Równoważność

Narzędzie powinno znaczyć podobnie między grupami i czasem.

Zmiana instrumentu

Nie wolno mieszać wersji bez kalibracji.

Efekt uczenia

Powtarzanie tej samej winiety może uczyć odpowiedzi.

Reaktywność

Sam pomiar może zmieniać zachowanie lub zwiększać podejrzenie.

Dane administracyjne

Trzeba audytować:

  • definicję;
  • kompletność;
  • opóźnienie;
  • zakres geograficzny;
  • zmiany praktyki.

Prerejestracja i protokół

Co zapisać

  • pytania;
  • teoria;
  • populacja;
  • wynik główny;
  • wyniki dodatkowe;
  • źródła;
  • projekt;
  • moc;
  • wyłączenia;
  • braki;
  • model;
  • podgrupy;
  • korekty;
  • szkody;
  • odstępstwa.

Gdzie

Publiczny rejestr może nie przyjmować wrażliwych szczegółów. Możliwe:

  • rejestr z embargiem;
  • zaufany depozyt;
  • organ nadzoru;
  • dokument opatrzony datą;
  • jawna wersja bez danych operacyjnych.

Eksploracja

Jest wartościowa. Należy ją oznaczyć:

Hipoteza powstała po zobaczeniu danych i wymaga replikacji.

Odstępstwo

Raport:

  • co zmieniono;
  • kiedy;
  • dlaczego;
  • czy przed analizą wyniku;
  • jaki wpływ.

Niezależność

OECD wskazuje niezależność, przejrzystość i etykę jako zasady wspierające wiarygodność, a praktycznymi zabezpieczeniami są odrębne linie raportowania, budżet i deklaracje konfliktów.5

Wymiary

Strukturalna

Ewaluator nie podlega kierownikowi programu.

Funkcjonalna

Ma kontrolę nad metodą, analizą i wnioskami.

Behawioralna

Ujawnia konflikty i nie manipuluje.

Umowa

Powinna gwarantować:

  • dostęp do danych pozytywnych i negatywnych;
  • kontakt z odmawiającymi;
  • publikację wyniku;
  • jawny komentarz zamawiającego, nie weto;
  • czas;
  • bezpieczeństwo;
  • prawa do kodu i dokumentacji;
  • archiwizację.

Wewnętrzna ewaluacja

Może dobrze służyć szybkiemu uczeniu. Zabezpieczenia:

  • oddzielny analityk;
  • standard;
  • peer review;
  • audyt;
  • publikacja metody;
  • zewnętrzny komitet.

Nie należy przedstawiać jej jako niezależnej.

Etyka i prawa uczestnika

Ocena etyczna

Badanie może wymagać komisji etycznej lub innego właściwego nadzoru. Sama ewaluacja usług nie jest automatycznie wolna od wymogów.

Minimalne ryzyko nie jest oczywiste

Pytanie o ideologię może:

  • wywołać lęk;
  • ujawnić czyn;
  • narazić rodzinę;
  • wpłynąć na status;
  • zostać źle zinterpretowane.

Zgoda

Informacja obejmuje:

  • cel;
  • dobrowolność;
  • dane;
  • odbiorców;
  • wyjątki;
  • publikację;
  • wycofanie;
  • wpływ na usługę;
  • kontakt.

Poufność

Badacz powinien wiedzieć, co zrobi przy:

  • bezpośredniej groźbie;
  • ujawnieniu przestępstwa;
  • przemocy wobec dziecka;
  • nakazie prawnym;
  • informacji operacyjnej.

Obietnica musi być prawdziwa.

Wynagrodzenie

Powinno rekompensować czas, nie być nieproporcjonalną zachętą w warunkach zależności.

Uczestnicy z ograniczoną zdolnością

Potrzebują:

  • wsparcia;
  • dostosowania;
  • właściwej reprezentacji;
  • ochrony;
  • uwzględnienia zdania.

Bezpieczeństwo danych

Plan

  • cel;
  • minimalny zakres;
  • podstawa;
  • pseudonimizacja;
  • klucz;
  • dostęp;
  • szyfrowanie;
  • transfer;
  • retencja;
  • usunięcie;
  • incydent.

Łączenie rejestrów

Zwiększa wartość i ryzyko. Potrzebne są:

  • legalność;
  • jakość identyfikatora;
  • błędy dopasowania;
  • zakres;
  • kontrola;
  • logi.

Małe liczby

Opis:

jedyna kobieta wracająca z regionu X w roku Y

identyfikuje bez nazwiska.

Dane jakościowe

Usunięcie imienia nie wystarczy. Należy maskować:

  • miejsce;
  • rolę;
  • datę;
  • unikalne zdarzenie;
  • relację.

Nie wolno zmienić znaczenia.

Zespół ewaluacji

Badacz może być narażony na:

  • groźby;
  • treści;
  • wtórną traumę;
  • presję prawną;
  • cyberatak.

Potrzebny jest plan bezpieczeństwa i superwizji.

Analiza jakości wdrożenia

Bez danych o wdrożeniu wynik jest nieinterpretowalny.

Wymiary

  • zasięg;
  • dawka;
  • wierność;
  • jakość;
  • responsywność;
  • adaptacja;
  • kompetencje;
  • terminowość;
  • kontekst.

Trzy sytuacje

Brak efektu, słabe wdrożenie

Nie testowano uczciwie teorii.

Brak efektu, dobre wdrożenie

Teoria lub dopasowanie mogą być błędne.

Efekt, słabe wdrożenie

Może działać inny składnik, kontekst albo selekcja.

Analiza statystyczna

Efekt i przedział

Raportuje się:

  • różnicę;
  • jednostkę;
  • przedział ufności lub wiarygodności;
  • liczebność;
  • model;
  • założenia.

Nie tylko p

Wartość p nie mówi:

  • wielkości;
  • praktycznego znaczenia;
  • jakości projektu;
  • prawdopodobieństwa hipotezy;
  • szkód.

Klasteryzacja

Osoby tego samego mentora lub placówki są zależne. Standardowy błąd musi to uwzględnić.

Powtarzane pomiary

Model powinien uwzględniać korelację wewnątrz osoby oraz nierówny czas.

Zdarzenia

Analiza przeżycia może uwzględniać czas do zdarzenia i cenzorowanie. Należy zdefiniować ryzyka konkurujące, na przykład zgon lub ponowne uwięzienie.

Małe próbki

Modele z wieloma parametrami przeuczą dane. Potrzebne są:

  • prostota;
  • regularizacja;
  • ograniczenie hipotez;
  • wykresy;
  • analiza przypadku;
  • jawne przedziały.

Bayesian

Może integrować wcześniejszą wiedzę i pokazywać rozkład niepewności. Nie usuwa małej ilości danych. Prior powinien być jawny, uzasadniony i poddany analizie wrażliwości.

Analiza jakościowa

Dobór

  • maksymalna różnorodność;
  • typowe przypadki;
  • negatywne przypadki;
  • rezygnujący;
  • partnerzy;
  • rodziny.

Nasycenie

Nie powinno być rytualnym uzasadnieniem małej próby. Trzeba opisać:

  • cel;
  • zakres;
  • różnorodność;
  • proces decyzji.

Kodowanie

  • kodeks;
  • definicje;
  • przykłady;
  • szkolenie;
  • spotkania rozbieżności;
  • ślad zmian.

Zgodność kodujących nie jest konieczna w każdym paradygmacie, ale podejście musi być jawne.

Refleksyjność

Rola, tożsamość i afiliacja badacza wpływają na dostęp oraz wypowiedzi.

Dowody przeciwne

Raport powinien pokazać:

  • głos negatywny;
  • wyjątek;
  • niepewność;
  • alternatywę.

Interpretacja

Poziomy wniosku

Opis

18 z 30 osób ukończyło moduł.

Związek

Wyższa dawka wiązała się z poprawą.

Zmiana

Średni wynik wzrósł od punktu bazowego.

Wkład

Dane wspierają tezę, że relacja mentora przyczyniła się do wykonania planu.

Wpływ

Przydział do modułu zwiększył wynik średnio o...

Nie wolno przeskakiwać poziomów.

Wynik zerowy

Możliwe:

  • brak istotnego efektu;
  • przedział obejmuje korzyść i szkodę;
  • efekt jest precyzyjnie bliski zeru;
  • interwencja nie została wdrożona.

Każde zdanie znaczy coś innego.

Wynik negatywny

Program pogorszył wynik lub zwiększył szkodę. Należy:

  • zweryfikować dane;
  • uruchomić ochronę;
  • zbadać mechanizm;
  • nie ukrywać;
  • rozważyć zatrzymanie.

Wynik mieszany

Może poprawiać pracę, nie zmieniać przemocy i obciążać rodzinę. Nie ma jednego „działa”.

Kiedy powiedzieć „nie wiemy”

Sytuacje

  • brak punktu bazowego;
  • brak porównania dla pytania wpływu;
  • duża selekcja;
  • niepełne dane;
  • zmiana definicji;
  • za mała próba;
  • bardzo szeroki przedział;
  • brak wdrożenia;
  • wynik zastępczy bez walidacji;
  • sprzeczne źródła.

Dobre zdanie

Zaobserwowano poprawę funkcjonowania wśród 18 osób z pełnym follow-up, ale utrata 40% kohorty i brak porównania uniemożliwiają wiarygodne przypisanie zmiany programowi.

Nie jest porażką ewaluatora

Wskazuje, jakich danych i projektu potrzeba dalej.

Publikacja

Raport podstawowy

  • protokół;
  • zmiany;
  • lejek;
  • interwencja;
  • porównanie;
  • dane bazowe;
  • braki;
  • wyniki;
  • szkody;
  • wdrożenie;
  • ograniczenia;
  • konflikty;
  • finansowanie.

Wynik negatywny

Nie powinien znikać w:

  • poufnym aneksie;
  • zmianie głównego wyniku;
  • podgrupie;
  • komunikacie „wyciągnięto lekcje”.

Ochrona

Można:

  • łączyć lata;
  • tłumić małe komórki;
  • uogólniać miejsce;
  • opóźniać szczegół;
  • publikować dane syntetyczne;
  • udostępniać kod bez danych.

Nie należy:

  • ukrywać liczebności;
  • usuwać wszystkich rezygnujących;
  • pomijać definicji;
  • zasłaniać ograniczeń bezpieczeństwem bez analizy.

Replikacja

Materiały:

  • słownik;
  • kod;
  • formularze;
  • syntetyczne dane;
  • historia wersji

zwiększają sprawdzalność bez ujawniania osób.

Plan ewaluacji

Rozdziały

  1. decyzja i użytkownicy;
  2. pytania;
  3. teoria zmiany;
  4. obiekt;
  5. projekt;
  6. populacja;
  7. wyniki;
  8. źródła;
  9. moc;
  10. analiza;
  11. proces;
  12. etyka;
  13. bezpieczeństwo;
  14. niezależność;
  15. publikacja;
  16. harmonogram;
  17. budżet.

Macierz

Pytanie Wskaźnik Źródło Projekt Analiza Ograniczenie
czy relacja powstała skala i wywiad uczestnik, mentor przed–po trajektoria pozorowanie
czy moduł poprawił wynik wynik po 12 mies. rejestr, ankieta randomizacja ITT spillover
dla kogo kontekst i mechanizm mixed methods realist w RCT joint display małe podgrupy

Dobór projektu — skrót

Jest uczciwa nadsubskrypcja i próba?

Rozważ randomizację dostępu lub wariantu.

Jest jasny próg?

Rozważ regresję nieciągłości.

Program wchodzi w części miejsc i są trendy?

Rozważ różnicę w różnicach, stepped wedge lub szereg kontrolowany.

Jest dobra pula podobnych nieuczestników?

Rozważ dopasowanie lub ważenie, z analizą niezmierzonych różnic.

Jedna polityka, długi szereg i inne regiony?

Rozważ szereg przerywany lub syntetyczną kontrolę.

Mało przypadków i złożone dopasowanie?

Rozważ multiple baseline, realist evaluation, process tracing, analizę wkładu i replikację przypadków.

Program jest nowy i niestabilny?

Najpierw wykonalność, proces, bezpieczeństwo i teoria.

Checklista jakości

  • Czy pytanie jest decyzyjne?
  • Czy obiekt jest określony?
  • Czy teoria istniała przed wynikiem?
  • Czy projekt odpowiada pytaniu?
  • Czy kontrfaktyczne założenie jest jawne?
  • Czy próba ma moc?
  • Czy główny wynik jest właściwy?
  • Czy pomiar jest porównywalny?
  • Czy lejek jest pełny?
  • Czy attrition jest analizowany?
  • Czy wdrożenie jest mierzone?
  • Czy spillover jest znany?
  • Czy alternatywy są testowane?
  • Czy podgrupy były planowane?
  • Czy szkody są równorzędne?
  • Czy protokół ma datę?
  • Czy odstępstwa są jawne?
  • Czy ewaluator jest niezależny?
  • Czy uczestnik jest chroniony?
  • Czy dane są minimalne?
  • Czy wynik negatywny zostanie opublikowany?
  • Czy język odpowiada sile dowodu?

Standard końcowy

Najbardziej rygorystyczna ewaluacja nie zawsze jest najbardziej użyteczna, a najbardziej złożony model nie zawsze jest najbardziej wiarygodny. Wiarygodność powstaje z dopasowania:

  • pytania;
  • projektu;
  • założeń;
  • danych;
  • analizy;
  • etyki;
  • języka wniosku.

Randomizacja może dobrze oszacować średni wpływ jasno zdefiniowanego modułu. Realist evaluation może wyjaśnić, dlaczego działa tylko przy ciągłości relacji. Studium przypadku może ujawnić mechanizm szkody. Analiza procesu pokaże, że połowa uczestników nie otrzymała interwencji. Te elementy nie konkurują o tytuł „najlepszej metody”; odpowiadają na inne części problemu.

RAND-owski toolkit ewaluacji CVE łączy teorię programu, pomiar procesu i wyniku oraz dobór projektu, podkreślając potrzebę planowania przed wdrożeniem.6 W obszarze małych populacji i rzadkich zdarzeń ta dyscyplina jest ważniejsza niż pozorna precyzja.

Uczciwy raport może więc zakończyć się trzema różnymi zdaniami:

Randomizowane porównanie wskazuje, że oferta modułu zwiększyła utrzymanie pracy, lecz nie dostarczyło precyzyjnego wyniku dla przemocy.

Analiza przypadków wspiera mechanizm zaufania przy ciągłości mentora, ale nie pozwala oszacować średniego wpływu.

Zaobserwowano poprawę, jednak selekcja, utrata danych i brak porównania sprawiają, że nie wiemy, czy spowodował ją program.

Każde może być wynikiem dobrej ewaluacji. Niewiarygodne jest dopiero twierdzenie większe niż pozwala projekt.

Źródła