Belajar Statistik Herzog

Herzog, Francis & Clarke · Springer 2019

Understanding Statistics and Experimental Design

Materi lengkap 12 bab dalam bahasa sederhana, tugas dengan pembahasan, jadwal belajar 21 hari, dan kuis yang soalnya diacak setiap kali halaman dibuka.

Tiga kalimat yang merangkum buku

  1. Setiap angka ringkasan hanya memberi informasi sebagian. Odds Ratio, persen benar, dan nilai p masing-masing menyembunyikan sesuatu. Selalu tanyakan: informasi apa yang belum saya punya?
  2. Hasil “signifikan” adalah gabungan besar efek dan banyaknya sampel. Rumusnya t = d × √(n/2). Jadi baca besar efek (d) dan ukuran sampel (n), jangan hanya nilai p.
  3. Eksperimen yang peluang berhasilnya sedang tidak boleh selalu berhasil. Kalau semua eksperimen dalam satu artikel signifikan, hasil itu terlalu bagus untuk benar.

Halaman ini punya empat bagian. Inti adalah daftar pendek di bawah ini: dua belas gagasan yang paling menentukan. Materi menjelaskan kedua belas bab buku secara lengkap, disertai tugas dan pembahasannya. Jadwal membagi semuanya menjadi 21 hari. Kuis menguji pemahaman dengan soal acak.

Mulailah dari daftar ini untuk mendapat gambaran, lalu pelajari tiap bab di tab Materi.

Bagian I buku · Bab 1–4

Dasar statistik

01

Satu angka peluang tidak cukup

Sebuah tes yang benar 9.999 kali dari 10.000 terdengar hampir sempurna. Tetapi bila penyakitnya hanya diderita 1 dari 10.000 orang, separuh dari hasil positif adalah keliru. Untuk menyimpulkan, kita perlu tiga angka sekaligus: seberapa jeli tesnya pada orang sakit, seberapa jeli pada orang sehat, dan seberapa sering penyakitnya terjadi.

02

Odds Ratio tidak tahu seberapa sering penyakit terjadi

Odds Ratio 7 berarti peluang relatif perokok terkena serangan jantung tujuh kali bukan perokok. Angka itu tetap 7 baik ketika 7 dari 107 perokok terkena maupun ketika 7 dari 10.007 terkena. Jadi Odds Ratio tinggi belum tentu berarti risikonya besar.

03

Kemampuan membedakan dan ambang keputusan adalah dua hal

Seberapa baik kita bisa membedakan “ada sinyal” dari “tidak ada sinyal” disebut daya beda (d′). Di titik mana kita memutuskan “ada” disebut ambang keputusan. Persen jawaban benar mencampur keduanya, sehingga orang yang kemampuannya sama bisa mendapat persen benar yang berbeda.

04

Sampel yang sedikit membuat rata-rata meleset

Kita tidak bisa mengukur semua pohon, jadi rata-rata dari sampel hampir pasti berbeda dari rata-rata sebenarnya. Besar melesetnya diukur oleh galat baku (standard error), yaitu s/√n. Makin banyak sampel, makin kecil melesetnya.

05

Nilai t adalah besar efek dikali akar ukuran sampel

Uji t bertanya: apakah selisih dua rata-rata sampel cukup besar dibandingkan melesetnya? Bila diuraikan, t = d × √(n/2). Nilai t yang besar bisa datang dari efek yang besar, dari sampel yang besar, atau keduanya.

06

Nilai p hanya menjaga alarm palsu

Nilai p menjawab satu pertanyaan: kalau sebenarnya tidak ada beda, seberapa sering kebetulan saja menghasilkan nilai t sebesar ini? Nilai p tidak mengukur besar efek dan tidak mengukur peluang hipotesis kita benar.

07

Enam salah baca yang paling sering

Signifikan tidak berarti efeknya besar. Tidak signifikan tidak berarti tidak ada efek. Nilai p dua studi tidak bisa dibandingkan bila ukuran sampelnya beda. “Signifikan di A, tidak di B” tidak berarti A beda dari B. Hasil rata-rata belum tentu berlaku untuk tiap orang. Studi kohort dengan efek kecil dan sampel besar hampir tidak bisa ditafsirkan.

Bagian II buku · Bab 5–8

Banyak uji dan rancangan penelitian

08

Makin banyak uji, makin banyak alarm palsu

Satu uji punya peluang alarm palsu 5%. Dua belas uji punya peluang 46% untuk memunculkan minimal satu alarm palsu. ANOVA mengatasinya dengan satu uji gabungan untuk banyak kelompok, tetapi hanya memberi tahu bahwa “ada yang berbeda”, belum yang mana.

09

Rancangan sederhana lebih kuat

Ringkas data tiap peserta menjadi satu angka yang menjawab pertanyaan, lalu lakukan satu uji. Sebelum mengambil data, hitung daya uji (power): peluang eksperimen berhasil bila efeknya memang ada. Klaim yang bergantung pada banyak uji sekaligus jarang terpenuhi semuanya.

10

Korelasi bukan sebab-akibat

Korelasi mengukur seberapa rapat dua variabel mengikuti garis lurus. Korelasi yang signifikan bisa berarti x menyebabkan y, y menyebabkan x, ada variabel ketiga, atau kebetulan saja. Empat set data yang bentuknya sangat berbeda bisa punya korelasi yang sama, jadi selalu lihat grafiknya.

Bagian III buku · Bab 9–12

Meta-analisis dan krisis sains

11

Terlalu sering berhasil adalah tanda masalah

Bila daya uji tiap eksperimen sekitar 0,6, dari sepuluh eksperimen wajarnya enam yang signifikan. Kalau sembilan yang dilaporkan signifikan, ada yang tidak beres. Buku menyebut pemeriksaan ini Test for Excess Success.

12

Dari mana masalahnya, dan apa jalan keluarnya

Hanya menerbitkan hasil yang signifikan, menambah data sampai signifikan, dan menyusun hipotesis setelah melihat hasil, semuanya membuat temuan tampak lebih kuat daripada kenyataannya. Menurut penulis, jalan keluar jangka panjang adalah memahami mekanisme di balik suatu gejala, sehingga kita makin tidak bergantung pada statistik.