Inti buku dalam 12 gagasan, jadwal baca 21 hari, dan kuis dengan pembahasan. Soal kuis diacak setiap kali halaman dibuka.
Tiga kalimat yang merangkum buku
Setiap angka ringkasan hanya memberi informasi sebagian. Odds Ratio, persen benar, dan p-value masing-masing menyembunyikan sesuatu. Tanyakan informasi apa yang belum ada.
Signifikansi adalah ukuran efek dikalikan ukuran sampel. t = d × √(n/2). Baca d dan n, jangan hanya p.
Eksperimen berdaya sedang tidak boleh selalu berhasil. Rangkaian hasil yang selalu signifikan patut dicurigai.
Dua belas gagasan di bawah ini kira-kira seperlima isi buku, dan sisanya bertumpu padanya. Nomor mengikuti urutan buku karena tiap gagasan memakai gagasan sebelumnya. Nomor halaman adalah angka yang tercetak di halaman buku.
Bagian I · Bab 1–4
Dasar statistik
01
Satu peluang tidak cukup
Tes dengan sensitivitas 0,9999 dan spesifisitas 0,9999 terdengar hampir sempurna. Bila angka kejadian penyakitnya 1 per 10.000, peluang terinfeksi setelah hasil positif hanya 0,5. Dari 10.000 orang ada satu yang terinfeksi dan kira-kira satu positif palsu.
Tiga angka diperlukan sekaligus: sensitivitas, spesifisitas, dan angka kejadian. Tes kedua pada orang yang positif menaikkan peluang itu menjadi 0,9999.
P(A|B) = P(B|A) × P(A) / P(B)
Bab 1 · hal. 4–9
02
Odds Ratio buta terhadap angka kejadian
Tujuh serangan jantung pada 107 perokok dan satu pada 101 bukan perokok memberi OR = 7. Bila jumlah orang tanpa serangan jantung dikalikan 100 pada kedua kelompok, OR tetap 7, padahal risikonya turun sekitar 100 kali.
OR tinggi baru penting bila efek utamanya juga besar. Efek utama yang besar baru penting bila OR-nya juga tinggi.
OR = (a/c) / (b/d) = (a × d) / (b × c)
Bab 1 · hal. 9–11
03
Daya beda dan kriteria adalah dua hal
Signal Detection Theory memakai dua distribusi: noise saja dan sinyal + noise. Daya beda d′ mengukur seberapa jauh keduanya terpisah. Kriteria adalah titik potong yang kita pilih sendiri.
Persen benar mencampur keduanya. Kriteria yang buruk bisa menurunkan persen benar sampai 50% walau d′ tetap. Hal yang sama berlaku untuk sensitivitas dan spesifisitas tes medis.
Batasnya: d′ bebas kriteria tetapi tidak bebas model. Ia mengandaikan distribusi Gaussian, varians sama, dan kriteria yang tidak berubah selama pengukuran.
Bab 2 · hal. 13–22
04
Undersampling dan standard error
Kita tidak bisa mengukur semua pohon, jadi rata-rata sampel hampir pasti meleset dari rata-rata populasi. Besar melesetnya diukur oleh standard error.
Makin besar n, makin sempit distribusi sampling. Makin besar σ, makin banyak sampel yang diperlukan. Bila σ = 0, satu pohon sudah cukup.
sx̄ = s / √n
Bab 3 · hal. 26–30
05
Nilai t adalah d′ untuk rata-rata
Membandingkan dua rata-rata sampel adalah soal SDT. Apakah selisih yang teramati berasal dari distribusi noise saja (H0) atau dari sinyal + noise (H1)? Nilai t adalah selisih rata-rata dibagi standard error-nya.
Bila diuraikan, t adalah Cohen's d dikalikan fungsi ukuran sampel. Nilai t yang besar bisa muncul karena efeknya besar, sampelnya besar, atau keduanya.
t = (x̄₁ − x̄₂) / (s × √(2/n)) = d × √(n/2)
Coba sendiri. Geser ukuran efek dan ukuran sampel, lalu lihat t, p, dan power berubah.
t = d × √(n/2)2,00
p (dua ekor)0,050
Power, bila d efek populasi≈ 0,50
H0: tidak ada beda (noise saja)H1: ada beda sebesar d (sinyal + noise)Garis putus-putus: kriteria untuk α = 0,05
Daerah biru adalah power (Hit rate). Daerah merah adalah Type I error. Kurva digambar dengan pendekatan normal, jadi power adalah nilai perkiraan.
Bab 3 · hal. 30–32, 38–39
06
p-value adalah kriteria untuk Type I error
p-value adalah luas ekor distribusi H0 di luar nilai t yang teramati. Artinya: peluang memperoleh t sebesar itu atau lebih ekstrem bila H0 benar. Bila p di bawah 0,05, hasilnya disebut signifikan.
p ditentukan sepenuhnya oleh t, jadi p mencampur ukuran efek dan ukuran sampel. p bukan ukuran besar efek dan bukan peluang hipotesis benar. Type II error dan power tidak bisa dihitung tanpa menetapkan satu ukuran efek tertentu, karena hipotesis alternatif tak terhingga banyaknya.
Istilah SDT
Istilah statistik
Arti
False Alarm
Type I error
H0 benar, kita menyimpulkan ada beda
Miss
Type II error
H0 salah, bukti kita tidak cukup
Hit rate
Power
Peluang signifikan bila efeknya ada
d′
Cohen's δ, effect size
Rasio sinyal terhadap noise
Bab 3 · hal. 25, 33–39
07
Enam kesalahan baca yang paling sering
Signifikan tidak berarti besar. Setiap d yang bukan nol menjadi signifikan bila n cukup besar.
p dari dua studi tidak bisa dibandingkan bila n berbeda. p yang lebih kecil tidak berarti efek yang lebih besar.
Tidak signifikan bukan bukti tidak ada efek. Mungkin efeknya terlalu kecil untuk n itu.
“Signifikan di A, tidak di B” bukan bukti A berbeda dari B. Uji selisihnya langsung, seperti pada contoh krim Aloe Vera.
Hasil berlaku untuk rata-rata. Bila variabilitas antar-individu tidak nol, kesimpulan tidak otomatis berlaku untuk tiap orang.
Studi kohort dengan efek kecil dan sampel besar hampir tidak bisa ditafsirkan. Contohnya selisih 2 mmHg pada data Framingham.
xij = μ + vi + εij (v: beda antar-individu, ε: noise pengukuran)
Bab 3 · hal. 41–49
Bagian II · Bab 5–8
Multiple testing dan desain
08
Banyak uji, banyak False Alarm
Dengan 12 uji independen pada α = 0,05, peluang muncul minimal satu False Alarm adalah 0,46. Koreksi Bonferroni (p < 0,05/m) menahan Type I error tetapi menurunkan power.
ANOVA menguji satu hipotesis gabungan. F membandingkan keragaman antar rata-rata kelompok dengan keragaman dalam kelompok, dan mendekati 1 bila H0 benar. ANOVA yang signifikan hanya mengatakan minimal satu rata-rata berbeda; post hoc test mencari yang mana.
Pada desain dua faktor, bila interaksi signifikan, efek utama jangan ditafsirkan sendiri. ANOVA 2 × 2 pada data tanpa efek tetap punya peluang 14% memunculkan minimal satu p < 0,05.
Cara termurah mengatasi multiple testing adalah menghindarinya. Ringkas data tiap subjek menjadi satu angka yang menjawab pertanyaan, misalnya slope kurva belajar, lalu lakukan satu uji. Tetapkan analisis sebelum data diambil.
Hitung power sebelum eksperimen. Untuk d = 0,55, sampel 40 per kelompok memberi power 0,68; power 0,90 butuh 71 per kelompok.
Contoh buku: satu studi pernapasan dan memori butuh enam hasil uji yang semuanya cocok. Tiap uji punya peluang 0,60–0,82, tetapi keenamnya bersama hanya 0,216.
Bab 7 · hal. 83–94
10
Korelasi memakai skala rasio, tetapi bukan sebab-akibat
Bila variabel bebas berskala interval atau rasio, korelasi memakai informasi itu dan lebih kuat daripada ANOVA atau median split. r² adalah proporsi variabilitas yang dijelaskan.
Korelasi signifikan punya empat kemungkinan penjelasan: x menyebabkan y, y menyebabkan x, variabel ketiga menyebabkan keduanya, atau kebetulan. r hanya menangkap hubungan linear dan peka terhadap outlier. Empat set data Anscombe sangat berbeda tetapi semuanya r = 0,816, jadi selalu lihat grafiknya.
r = cov(x, y) / (sx × sy) −1 ≤ r ≤ +1
Bab 8 · hal. 95–102
Bagian III · Bab 9–12
Meta-analisis dan krisis sains
11
Terlalu sering berhasil adalah tanda masalah
Ukuran efek dari beberapa studi bisa digabung dalam meta-analisis, dibobot dengan kebalikan variansnya. Dari ukuran efek gabungan kita bisa menghitung power tiap eksperimen. Jumlah power adalah jumlah keberhasilan yang wajar.
Precognition: jumlah power sepuluh eksperimen 6,27, tetapi 9 dilaporkan signifikan. Peluangnya 0,058. Bystander effect: jumlah power sembilan belas eksperimen 10,77 dan 10 signifikan. Ini wajar.
Jadi replikasi yang sukses tidak cukup dan tidak perlu untuk mempercayai suatu efek. Yang dinilai adalah kecocokan tingkat keberhasilan dengan power.
d = t × √(2/n) g* = Σ wi gi / Σ wi, w = 1 / vg
Bab 9–10 · hal. 105–116
12
Dari mana keberhasilan berlebih datang, dan jalan keluarnya
Publication bias. Hanya studi signifikan yang terbit. Dalam simulasi dengan δ = 0,3, lima studi yang terbit memberi estimasi 0,607.
Optional stopping. Data ditambah sampai p < 0,05. Tanpa efek sama sekali, Type I error naik di atas 20%.
HARKing dan analisis yang fleksibel. Hipotesis atau cara analisis dipilih setelah melihat hasil.
Dari 18 artikel multi-eksperimen di jurnal Science yang diperiksa, 15 punya peluang sukses di bawah 0,1. Preregistrasi membantu secara praktis tetapi tidak menyentuh akar masalah. Menurut penulis, tujuan jangka panjang sains adalah memahami mekanisme, sehingga variabilitas berkurang dan statistik makin tidak diperlukan.
Bab 10–12 · hal. 116–142
Empat catatan koreksi atas buku
Tabel 4.2 (hal. 58) memasangkan uji t dua sampel dengan Wilcoxon rank sum dan uji t berpasangan dengan Mann-Whitney U. Kedua nama itu merujuk pada uji yang sama untuk dua sampel independen. Padanan non-parametrik untuk uji t berpasangan adalah Wilcoxon signed-rank.
Keterangan Gambar 3.5 (hal. 35) menulis “one-sample t-test”. Yang dimaksud adalah uji satu ekor (one-tailed).
Tabel 6.2 (hal. 77) memberi patokan η² 0,01 / 0,09 / 0,25. Banyak sumber lain memakai 0,01 / 0,06 / 0,14. Sebutkan patokan yang dipakai saat melaporkan.
Bagian 6.3 (hal. 71) menyatakan post hoc test tidak menaikkan Type I error karena hanya dijalankan setelah ANOVA signifikan. Ini penyederhanaan; uji seperti Tukey dan Scheffé membawa koreksinya sendiri.
Catatan ini berasal dari penyusun ringkasan, bukan dari penulis buku.
Jadwal baca 21 hari
Sediakan 45–60 menit per hari: baca 20–25 menit, kerjakan latihan 20 menit, lalu tutup dengan kuis bab itu. Bab 3 mendapat lima hari karena seluruh buku bertumpu padanya. Latihan memakai R.
Nomor halaman adalah angka yang tercetak di halaman buku, bukan urutan halaman PDF. Untuk versi 14 hari, gabungkan Hari 1–2, 3–4, 5–6, 10–11, 13–14, 18–19, dan 20–21.
Tugas penutup setelah Hari 21
Ambil satu naskah Anda sendiri dan periksa dengan sepuluh pertanyaan ini.
Apakah tiap klaim disertai ukuran efek dan n, bukan hanya p?
Adakah kesimpulan “tidak ada efek” yang ditarik dari hasil tidak signifikan?
Adakah perbandingan “signifikan di A, tidak di B” tanpa menguji selisihnya?
Berapa banyak uji yang dijalankan pada satu set data, dan adakah koreksinya?
Apakah ukuran sampel ditetapkan sebelum data diambil, dengan analisis power?
Apakah satuan analisisnya independen, atau ada pengukuran berulang yang dihitung sebagai n?
Apakah cara analisis dipilih sebelum melihat data?
Apakah korelasi ditafsirkan sebagai sebab-akibat, dan apakah grafiknya ditampilkan?
Apakah klaim utama bergantung pada banyak uji yang semuanya harus cocok?
Adakah mekanisme yang menjelaskan mengapa efek itu muncul?