Materi lengkap 12 bab dalam bahasa sederhana, tugas dengan pembahasan, jadwal belajar 21 hari, dan kuis yang soalnya diacak setiap kali halaman dibuka.
Tiga kalimat yang merangkum buku
Setiap angka ringkasan hanya memberi informasi sebagian. Odds Ratio, persen benar, dan nilai p masing-masing menyembunyikan sesuatu. Selalu tanyakan: informasi apa yang belum saya punya?
Hasil “signifikan” adalah gabungan besar efek dan banyaknya sampel. Rumusnya t = d × √(n/2). Jadi baca besar efek (d) dan ukuran sampel (n), jangan hanya nilai p.
Eksperimen yang peluang berhasilnya sedang tidak boleh selalu berhasil. Kalau semua eksperimen dalam satu artikel signifikan, hasil itu terlalu bagus untuk benar.
Halaman ini punya empat bagian. Inti adalah daftar pendek di bawah ini: dua belas gagasan yang paling menentukan. Materi menjelaskan kedua belas bab buku secara lengkap, disertai tugas dan pembahasannya. Jadwal membagi semuanya menjadi 21 hari. Kuis menguji pemahaman dengan soal acak.
Mulailah dari daftar ini untuk mendapat gambaran, lalu pelajari tiap bab di tab Materi.
Bagian I buku · Bab 1–4
Dasar statistik
01
Satu angka peluang tidak cukup
Sebuah tes yang benar 9.999 kali dari 10.000 terdengar hampir sempurna. Tetapi bila penyakitnya hanya diderita 1 dari 10.000 orang, separuh dari hasil positif adalah keliru. Untuk menyimpulkan, kita perlu tiga angka sekaligus: seberapa jeli tesnya pada orang sakit, seberapa jeli pada orang sehat, dan seberapa sering penyakitnya terjadi.
02
Odds Ratio tidak tahu seberapa sering penyakit terjadi
Odds Ratio 7 berarti peluang relatif perokok terkena serangan jantung tujuh kali bukan perokok. Angka itu tetap 7 baik ketika 7 dari 107 perokok terkena maupun ketika 7 dari 10.007 terkena. Jadi Odds Ratio tinggi belum tentu berarti risikonya besar.
03
Kemampuan membedakan dan ambang keputusan adalah dua hal
Seberapa baik kita bisa membedakan “ada sinyal” dari “tidak ada sinyal” disebut daya beda (d′). Di titik mana kita memutuskan “ada” disebut ambang keputusan. Persen jawaban benar mencampur keduanya, sehingga orang yang kemampuannya sama bisa mendapat persen benar yang berbeda.
04
Sampel yang sedikit membuat rata-rata meleset
Kita tidak bisa mengukur semua pohon, jadi rata-rata dari sampel hampir pasti berbeda dari rata-rata sebenarnya. Besar melesetnya diukur oleh galat baku (standard error), yaitu s/√n. Makin banyak sampel, makin kecil melesetnya.
05
Nilai t adalah besar efek dikali akar ukuran sampel
Uji t bertanya: apakah selisih dua rata-rata sampel cukup besar dibandingkan melesetnya? Bila diuraikan, t = d × √(n/2). Nilai t yang besar bisa datang dari efek yang besar, dari sampel yang besar, atau keduanya.
06
Nilai p hanya menjaga alarm palsu
Nilai p menjawab satu pertanyaan: kalau sebenarnya tidak ada beda, seberapa sering kebetulan saja menghasilkan nilai t sebesar ini? Nilai p tidak mengukur besar efek dan tidak mengukur peluang hipotesis kita benar.
07
Enam salah baca yang paling sering
Signifikan tidak berarti efeknya besar. Tidak signifikan tidak berarti tidak ada efek. Nilai p dua studi tidak bisa dibandingkan bila ukuran sampelnya beda. “Signifikan di A, tidak di B” tidak berarti A beda dari B. Hasil rata-rata belum tentu berlaku untuk tiap orang. Studi kohort dengan efek kecil dan sampel besar hampir tidak bisa ditafsirkan.
Bagian II buku · Bab 5–8
Banyak uji dan rancangan penelitian
08
Makin banyak uji, makin banyak alarm palsu
Satu uji punya peluang alarm palsu 5%. Dua belas uji punya peluang 46% untuk memunculkan minimal satu alarm palsu. ANOVA mengatasinya dengan satu uji gabungan untuk banyak kelompok, tetapi hanya memberi tahu bahwa “ada yang berbeda”, belum yang mana.
09
Rancangan sederhana lebih kuat
Ringkas data tiap peserta menjadi satu angka yang menjawab pertanyaan, lalu lakukan satu uji. Sebelum mengambil data, hitung daya uji (power): peluang eksperimen berhasil bila efeknya memang ada. Klaim yang bergantung pada banyak uji sekaligus jarang terpenuhi semuanya.
10
Korelasi bukan sebab-akibat
Korelasi mengukur seberapa rapat dua variabel mengikuti garis lurus. Korelasi yang signifikan bisa berarti x menyebabkan y, y menyebabkan x, ada variabel ketiga, atau kebetulan saja. Empat set data yang bentuknya sangat berbeda bisa punya korelasi yang sama, jadi selalu lihat grafiknya.
Bagian III buku · Bab 9–12
Meta-analisis dan krisis sains
11
Terlalu sering berhasil adalah tanda masalah
Bila daya uji tiap eksperimen sekitar 0,6, dari sepuluh eksperimen wajarnya enam yang signifikan. Kalau sembilan yang dilaporkan signifikan, ada yang tidak beres. Buku menyebut pemeriksaan ini Test for Excess Success.
12
Dari mana masalahnya, dan apa jalan keluarnya
Hanya menerbitkan hasil yang signifikan, menambah data sampai signifikan, dan menyusun hipotesis setelah melihat hasil, semuanya membuat temuan tampak lebih kuat daripada kenyataannya. Menurut penulis, jalan keluar jangka panjang adalah memahami mekanisme di balik suatu gejala, sehingga kita makin tidak bergantung pada statistik.
Materi per bab
Urutan mengikuti buku. Istilah bahasa Inggris dari buku ditulis dalam kurung agar mudah dicocokkan saat membaca. Nomor halaman adalah angka yang tercetak di halaman buku.
Bab 1 · hal. 3–11 · Basic Probability Theory
Dasar peluang
Pertanyaan bab ini: kapan sebuah angka peluang cukup untuk mengambil kesimpulan? Jawabannya: hampir tidak pernah bila angka itu berdiri sendiri.
Empat pengertian dasar
Peluang adalah angka antara 0 dan 1 untuk suatu kejadian. Contoh: peluang dadu menunjukkan angka 4 adalah 1/6.
Distribusi peluang adalah daftar peluang untuk semua hasil yang mungkin. Pada dadu ada enam hasil, masing-masing berpeluang 1/6.
Peluang bersyarat, ditulis P(A|B), adalah peluang A bila kita sudah tahu B terjadi. Garis tegak dibaca “bila diketahui”. Contoh kartu: peluang kartu pertama sekop adalah 13/52. Bila kartu pertama memang sekop, peluang kartu kedua sekop tinggal 12/51. Bila kartu pertama hati, peluangnya 13/51.
Kejadian saling bebas berarti mengetahui B tidak mengubah peluang A, yaitu P(A|B) = P(A). Contoh: bila kartu pertama dikembalikan ke tumpukan, peluang sekop pada tarikan kedua tetap 13/52.
Empat istilah pada tes medis
Seseorang bisa sakit atau tidak, dan tes bisa positif atau negatif. Jadi ada empat kemungkinan.
Istilah
Artinya
Sensitivitas (Sensitivity)
Peluang tes positif bila orangnya memang sakit
Spesifisitas (Specificity)
Peluang tes negatif bila orangnya memang tidak sakit
Tingkat positif palsu (False Positive Rate)
Peluang tes positif padahal orangnya tidak sakit
Tingkat luput (Miss Rate)
Peluang tes negatif padahal orangnya sakit
Contoh utama: tes HIV
Misalkan sebuah tes HIV punya sensitivitas 0,9999 dan spesifisitas 0,9999. Angka kejadian infeksi di masyarakat adalah 0,0001, yaitu 1 dari 10.000 orang. Seseorang dipilih acak, dites, dan hasilnya positif. Berapa peluang ia benar-benar terinfeksi?
Banyak orang menjawab 0,9999. Jawaban yang benar adalah 0,5.
Cara mudah: bayangkan 10.000 orang
Dari 10.000 orang, 1 orang terinfeksi. Tesnya sangat jeli, jadi orang ini hampir pasti positif.
Sisanya 9.999 orang tidak terinfeksi. Tes keliru 1 kali dari 10.000, jadi kira-kira ada 1 orang sehat yang hasilnya positif.
Total ada 2 hasil positif. Hanya 1 yang benar-benar terinfeksi. Peluangnya 1/2 = 0,5.
Hasilnya bergantung pada angka kejadian. Bila angka kejadian 1 dari 100.000, peluangnya turun menjadi sekitar 0,1. Bila angka kejadian 0,5, peluangnya 0,9999. Jadi kita butuh tiga angka: sensitivitas, spesifisitas, dan angka kejadian. Bila salah satu tidak ada, kesimpulannya tidak sah.
Dari sini muncul pesan yang diulang di seluruh buku: waspadai informasi sebagian (partial information).
Dua catatan dari buku
Salah paham ini berakibat nyata. Pada 1987, 22 penerima transfusi darah diberi tahu hasil tes HIV mereka positif, dan tujuh orang bunuh diri. Dalam satu studi, 16 dari 20 dokter di Jerman mengatakan kepada pasien bahwa positif palsu hampir tidak ada.
Di rumah sakit keadaannya berbeda. Orang yang datang untuk tes biasanya punya alasan khawatir, jadi angka kejadian di antara mereka lebih tinggi daripada di masyarakat umum. Akibatnya peluang terinfeksi setelah hasil positif bisa lebih besar dari 0,5.
Tes kedua
Apa yang terjadi bila dua orang yang positif tadi dites sekali lagi? Sekarang hanya dua orang yang diuji: satu terinfeksi dan satu tidak. Tes yang sangat baik hampir pasti positif untuk yang terinfeksi dan negatif untuk yang tidak. Orang yang dua kali positif punya peluang terinfeksi 0,9999.
Dalam praktik angkanya lebih rendah, karena sebagian orang selalu positif walau tidak terinfeksi. Ada molekul dalam tubuh mereka yang mirip antibodi yang dicari tes.
Buku juga menyebut kasus pengadilan Amanda Knox. Hakim menolak analisis genetik kedua karena menganggap peluang hasil yang jelas terlalu kecil. Padahal, seperti contoh di atas, pengujian kedua bisa membuat perbedaan besar.
Contoh vaksin: bandingkan dengan pasangannya
Vaksin flu babi bisa menimbulkan sindrom Guillain-Barré pada 1 dari 1.000.000 orang. Apakah kita perlu takut divaksin? Angka itu saja belum cukup. Kita juga perlu tahu peluang terkena sindrom itu tanpa vaksin.
Dalam contoh buku, flu babi sendiri menimbulkan sindrom itu pada 1 dari 3.000 penderita, dan peluang orang yang tidak divaksin terkena flu babi adalah 1 dari 300.
P(sindrom | tanpa vaksin) = 1/3000 × 1/300 = 1/900.000
Jadi tanpa vaksin peluangnya sedikit lebih tinggi daripada dengan vaksin, dan vaksin masih memberi perlindungan dari flu. Pelajarannya: satu peluang harus selalu dibandingkan dengan peluang pasangannya.
Odds Ratio
“Banyak perokok meninggal karena serangan jantung.” Ini juga informasi sebagian. Pertanyaan baliknya: berapa banyak bukan perokok yang meninggal karena serangan jantung?
Odds Ratio (OR) membandingkan dua kelompok. Contoh A di buku: dari 107 perokok, 7 terkena serangan jantung dan 100 tidak. Dari 101 bukan perokok, 1 terkena dan 100 tidak.
Dengan faktor risiko
Tanpa faktor risiko
Sakit
a = 7
b = 1
Tidak sakit
c = 100
d = 100
OR = (a/c) / (b/d) = (a × d) / (b × c) = (7 × 100) / (1 × 100) = 7
OR = 7 berarti odds perokok terkena serangan jantung tujuh kali odds bukan perokok. OR = 1 berarti tidak ada beda.
Sekarang contoh B: jumlah orang yang tidak sakit di kedua kelompok dinaikkan menjadi 10.000. OR tetap (7/10.000)/(1/10.000) = 7. Padahal pada contoh A ada 8 dari 208 orang yang terkena, sedangkan pada contoh B hanya 8 dari 20.008. Risikonya turun kira-kira 100 kali, tetapi OR tidak berubah.
Cara membaca OR menurut buku
OR tinggi baru perlu dikhawatirkan bila efek utamanya juga besar, yaitu bila penyakitnya memang sering terjadi pada kelompok berisiko.
Efek utama yang besar baru perlu dikhawatirkan bila OR juga tinggi. Contoh ekstrem: 100% orang bermata biru akan meninggal, tetapi 100% orang bermata cokelat juga. OR = 1. Kita boleh takut mati, tetapi tidak perlu takut pada warna mata.
Dunia penyakit yang lebih rumit
Merokok tidak hanya berkaitan dengan serangan jantung. Ia bisa memengaruhi penyakit lain, ke arah buruk atau baik. Untuk menjawab “haruskah saya berhenti merokok” secara lengkap, kita perlu memperhitungkan semua penyakit beserta beratnya masing-masing, termasuk penyakit yang belum ditemukan.
Morbiditas(faktor) = jumlah dari [ P(penyakit | faktor) × biaya penyakit ] untuk semua penyakit
Informasi selengkap itu tidak pernah tersedia. Itu tidak berarti statistik tidak berguna. Artinya kita harus sadar bahwa keputusan kita didasarkan pada informasi sebagian, dan berusaha mencari informasi sebanyak yang praktis.
Pesan utama bab ini
Waspadai informasi sebagian. Pastikan informasinya lengkap sebelum menyimpulkan. Odds Ratio, misalnya, biasanya memberi terlalu sedikit informasi.
Angka kejadian penyakit biasanya rendah, kecuali untuk penyakit seperti gigi berlubang.
Tugas Bab 1
Tugas 1.1 · Tes HIV pada tiga angka kejadian
Sebuah tes punya sensitivitas 0,9999 dan spesifisitas 0,9999. Hitung peluang seseorang terinfeksi setelah hasil positif untuk angka kejadian (a) 1 dari 10.000, (b) 1 dari 100.000, dan (c) 0,5. Untuk (a) dan (b), pakai cara “bayangkan sekian orang”.
Sumber: Bab 1.1.1, hal. 5–6
Lihat pembahasan
(a) Bayangkan 10.000 orang. Satu terinfeksi dan hampir pasti positif. Dari 9.999 yang sehat, kira-kira satu positif palsu. Jadi 2 positif, 1 benar: peluang = 1/2 = 0,5.
(b) Bayangkan 100.000 orang. Satu terinfeksi dan positif. Tes keliru 1 kali per 10.000 orang sehat, jadi ada sekitar 10 positif palsu. Total 11 positif, 1 benar: peluang = 1/11 ≈ 0,09, atau kira-kira 0,1.
Kesimpulan. Tes yang sama memberi jawaban 0,1; 0,5; atau 0,9999, tergantung angka kejadian. Makin jarang penyakitnya, makin banyak hasil positif yang palsu.
Tugas 1.2 · Tes kedua
Pada kasus (a) di atas, dua orang yang positif dites sekali lagi dengan tes yang sama. Anggap kedua tes saling bebas. Berapa peluang terinfeksi bagi orang yang positif dua kali? Jelaskan dengan kata-kata, lalu dengan rumus.
Sumber: Bab 1.1.2, hal. 7
Lihat pembahasan
Dengan kata-kata. Yang dites ulang hanya dua orang: satu terinfeksi, satu tidak. Tes hampir selalu positif untuk yang terinfeksi dan hampir selalu negatif untuk yang tidak. Jadi orang yang positif lagi hampir pasti yang terinfeksi.
Dengan rumus. Peluang positif dua kali bila terinfeksi adalah 0,9999². Peluang positif dua kali bila sehat adalah 0,0001².
Catatan. Buku mengingatkan bahwa di dunia nyata angkanya lebih rendah, karena sebagian orang selalu positif walau tidak terinfeksi. Kedua tes pada orang itu tidak benar-benar saling bebas.
Tugas 1.3 · Vaksin dan sindrom Guillain-Barré
Vaksin menimbulkan sindrom pada 1 dari 1.000.000 orang. Flu babi menimbulkan sindrom yang sama pada 1 dari 3.000 penderita. Peluang orang yang tidak divaksin terkena flu babi adalah 1 dari 300. Mana yang lebih berisiko terkena sindrom: divaksin atau tidak?
Sumber: Bab 1.1.3, hal. 8–9
Lihat pembahasan
Orang yang tidak divaksin baru bisa terkena sindrom bila ia lebih dulu terkena flu babi. Jadi dua peluang dikalikan:
1/3000 × 1/300 = 1/900.000
1/900.000 sedikit lebih besar daripada 1/1.000.000. Jadi tidak divaksin sedikit lebih berisiko, dan orang yang divaksin juga terlindung dari flu babi.
Jebakan. Membandingkan 1/3000 langsung dengan 1/1.000.000 keliru, karena tidak semua orang terkena flu. Membaca 1/1.000.000 saja tanpa pembanding juga keliru.
Tugas 1.4 · Odds Ratio pada dua tabel
Tabel A: 7 dari 107 perokok dan 1 dari 101 bukan perokok terkena serangan jantung. Tabel B: 7 dari 10.007 perokok dan 1 dari 10.001 bukan perokok. Hitung OR untuk kedua tabel. Lalu hitung berapa persen dari seluruh orang yang terkena serangan jantung pada tiap tabel. Tabel mana yang lebih mengkhawatirkan?
Sumber: Bab 1.2.1, Tabel 1.1, hal. 9–10
Lihat pembahasan
OR tabel A = (7/100) / (1/100) = 7.
OR tabel B = (7/10.000) / (1/10.000) = 7.
Seberapa sering serangan jantung terjadi. Tabel A: 8 dari 208 orang, sekitar 3,8%. Tabel B: 8 dari 20.008 orang, sekitar 0,04%.
Kesimpulan. OR sama, tetapi pada tabel A serangan jantung jauh lebih sering. Tabel A yang layak dikhawatirkan. OR tidak bergantung pada angka kejadian, jadi OR saja tidak cukup untuk menilai seberapa besar risikonya.
Bab 2 · hal. 13–22 · Experimental Design and the Basics of Statistics: Signal Detection Theory (SDT)
Teori deteksi sinyal
Pertanyaan bab ini: apa ukuran kinerja yang baik? Ukuran yang paling sering dipakai adalah persen jawaban benar. Bab ini menunjukkan bahwa persen benar mencampur dua hal yang berbeda.
Cerita kapal selam
Sebuah kapal selam memakai sonar agar tidak menabrak batu karang. Bila ada batu, angka pada alat sonar lebih besar daripada bila tidak ada batu. Masalahnya, angka itu tidak pernah tetap. Ikan, ganggang, dan alatnya sendiri membuat angka naik turun walau keadaannya sama. Naik turun yang acak ini disebut derau (noise).
Karena itu tiap keadaan digambarkan dengan satu kurva berbentuk lonceng (kurva Gaussian). Dalam contoh buku:
Tidak ada batu (derau saja): angka sonar rata-rata 45.
Ada batu (sinyal + derau): angka sonar rata-rata 70.
Lebar kedua kurva sama, yaitu simpangan baku σ = 10. Makin besar σ, makin besar deraunya.
Kurva lonceng ditentukan sepenuhnya oleh dua angka: rata-rata (μ) yang menentukan letaknya, dan simpangan baku (σ) yang menentukan lebarnya.
Daya beda d′
Seberapa mudah kedua keadaan dibedakan? Itu bergantung pada seberapa banyak kedua kurva bertumpang tindih. Bila keduanya berimpit, sonar tidak berguna. Bila hampir tidak bertumpang tindih, membedakannya mudah.
d′ = (μ₁ − μ₂) / σ = (70 − 45) / 10 = 2,5
d′ adalah perbandingan sinyal terhadap derau. d′ naik bila jarak antar rata-rata membesar, atau bila deraunya mengecil.
Ambang keputusan
Kapan mesin harus dimatikan? Kita perlu satu angka batas, yang disebut ambang keputusan (criterion). Bila angka sonar di atas ambang, kita memutuskan “ada batu”. Bila di bawah, kita lanjut berlayar.
Letak ambang adalah pilihan kita. Bila batu dan tidak ada batu sama sering terjadi, ambang terbaik adalah titik potong kedua kurva, yaitu 57,5 pada contoh ini. Di titik itu jumlah keputusan benar paling banyak.
Setiap keputusan punya empat kemungkinan hasil:
Sinyal ada
Sinyal tidak ada
Kita jawab “ada”
Tepat (Hit)
Alarm palsu (False Alarm)
Kita jawab “tidak ada”
Luput (Miss)
Penolakan benar (Correct Rejection)
Coba sendiri. Geser ambang keputusan. Perhatikan bahwa persen benar berubah, sedangkan d′ tetap 2,5.
Tepat (Hit)0,89
Alarm palsu0,11
Persen benar89%
Daya beda d′2,5
Tidak ada batu (derau saja), rata-rata 45Ada batu (sinyal + derau), rata-rata 70
Daerah biru di kanan ambang adalah Tepat (Hit). Daerah merah di kanan ambang adalah alarm palsu.
Mengapa persen benar berbahaya
Dalam percobaan deteksi, peserta melihat layar. Kadang ada bercak cahaya redup, kadang tidak. Bila bercak muncul di separuh percobaan, persen benar dihitung dari dua hal:
Persen benar = (Hit + Correct Rejection) / 2
Sekarang bayangkan peserta menggeser ambangnya jauh ke kanan, sehingga hampir selalu menjawab “tidak ada”. Hit menjadi 0 dan Correct Rejection menjadi 1. Persen benar = (0 + 1)/2 = 50%, sama seperti menebak. Padahal matanya tidak berubah; d′ tetap sama. Yang berubah hanya cara ia memutuskan.
Jadi persen benar 75% bisa berarti dua hal: daya beda tinggi dengan ambang yang buruk, atau daya beda lebih rendah dengan ambang yang pas. Dari persen benar saja kita tidak bisa tahu. Persen benar adalah informasi sebagian.
Ambang juga bisa sengaja digeser. Bila “tidak ada” lebih sering terjadi, wajar menggeser ambang agar lebih sering menjawab “tidak ada”. Bila salah satu jawaban diberi imbalan lebih besar, ambang juga akan bergeser.
Menghitung d′ dari data
Pada kapal selam kita tahu kurvanya. Pada manusia kita tidak tahu. Kita hanya punya jawaban mereka. Ternyata daya beda dan ambang tetap bisa dipisahkan:
d′ = z(Hit) − z(False Alarm)
b = −[ z(Hit) + z(False Alarm) ] / 2
z adalah fungsi yang mengubah peluang menjadi jarak pada kurva lonceng baku. Anggap saja sebagai fungsi di komputer: qnorm() di R atau NORM.S.INV() di Excel. Angka b mengukur seberapa jauh ambang yang dipakai dari ambang terbaik. b = 0 berarti ambangnya tepat di titik potong.
d′ tidak berubah bila ambang berubah. Tetapi d′ punya tiga syarat:
Kedua distribusi berbentuk lonceng (Gaussian). Syarat ini sering terpenuhi.
Kedua distribusi punya lebar yang sama. Biasanya terpenuhi karena dua rangsangan yang dibandingkan mirip.
Ambang tidak berubah selama pengukuran. Syarat ini penting dan sulit diperiksa.
Buku merangkumnya begini: d′ bebas dari ambang, tetapi tidak bebas dari model. Tidak ada yang gratis.
Awas: kata “sensitivity” punya dua arti
Di kedokteran, sensitivity berarti Hit rate. Di SDT, sensitivity berarti daya beda d′. Buku memakai “sensitivity” untuk Hit rate dan “discriminability” untuk d′.
Enam contoh penerapan
Dokter melawan sistem AI. Keduanya 80% benar dalam mendiagnosis. Dokter: Hit 0,80 dan alarm palsu 0,20, sehingga d′ = 1,68. AI: Hit 0,98 dan alarm palsu 0,38, sehingga d′ = 2,36. AI sangat condong menjawab “ya”. Daya bedanya lebih baik, tetapi ambangnya jauh dari tepat. Menggeser ambang itu mudah, jadi kinerja AI masih bisa naik banyak.
Percobaan belajar. Persen benar naik setelah latihan. Apakah persepsi membaik? Belum tentu. Kenaikan bisa datang dari daya beda yang naik, atau dari ambang yang makin tepat. Untuk percobaan belajar, selalu gambarkan d′ dan bias.
Sensitivitas dan spesifisitas tes medis. Keduanya juga bergantung pada ambang, misalnya kadar antibodi berapa yang disebut “positif”. Sensitivitas bisa dinaikkan dengan mengorbankan spesifisitas, dan sebaliknya. (Sensitivitas + spesifisitas)/2 adalah persen benar.
Tukar-menukar kecepatan dan ketepatan (speed-accuracy trade-off). Peserta yang lambat, misalnya orang tua, sering punya d′ lebih tinggi daripada peserta yang cepat. Percobaan seperti ini sulit ditafsirkan karena waktu reaksi harus ditimbang bersama d′ dan bias.
Efek lantai dan efek atap (floor and ceiling effects). Bila tugasnya terlalu mudah, semua orang 100% benar dan perbedaan antar orang tidak terlihat. Bila terlalu sulit, semua orang di sekitar 50%. Dalam kedua keadaan, kesimpulan tidak bisa ditarik.
Efek terstandar. Karena dibagi σ, d′ tidak bergantung pada satuan. Hasilnya sama baik data diukur dalam meter maupun inci.
Pesan utama bab ini
Waspadai informasi sebagian. Persen benar mencampur daya beda d′ dan ambang keputusan.
Hal yang sama berlaku untuk banyak ukuran lain, seperti sensitivitas dan spesifisitas tes medis.
Daya beda dan ambang bisa dipisahkan dengan d′ empiris.
d′ empiris bebas ambang tetapi tidak bebas model. Tidak ada yang gratis.
Tugas Bab 2
Tugas 2.1 · Kapal selam dengan dua ambang
Angka sonar tanpa batu rata-rata 45, dengan batu rata-rata 70, dan σ = 10 untuk keduanya. (a) Hitung d′. (b) Pada ambang 40, Hit = 0,9987 dan alarm palsu = 0,6915. Pada ambang 57,5, Hit = 0,8944 dan alarm palsu = 0,1056. Hitung persen benar untuk kedua ambang, dengan anggapan batu ada di separuh kejadian. (c) Apa yang berubah dan apa yang tetap?
Sumber: Bab 2.1 dan 2.2, Gambar 2.1 dan 2.2, hal. 13–19
Lihat pembahasan
(a) d′ = (70 − 45)/10 = 2,5.
(b) Correct Rejection = 1 − alarm palsu.
Ambang 40: (0,9987 + 0,3085)/2 = 0,654, atau sekitar 65% benar.
Ambang 57,5: (0,8944 + 0,8944)/2 = 0,894, atau sekitar 89% benar.
(c) Persen benar turun dari 89% menjadi 65% hanya karena ambangnya digeser. Sonarnya sama dan d′ tetap 2,5. Ambang 40 hampir tidak pernah meluputkan batu, tetapi mesin dimatikan sia-sia pada 69% keadaan tanpa batu.
Dari 100 pasien sakit dan 100 pasien sehat, dokter menjawab “sakit” untuk 80 pasien sakit dan 20 pasien sehat. Sistem AI menjawab “sakit” untuk 98 pasien sakit dan 38 pasien sehat. Diketahui z(0,80) = 0,842; z(0,20) = −0,842; z(0,98) = 2,054; z(0,38) = −0,305. Hitung persen benar, d′, dan bias b untuk keduanya. Siapa yang lebih baik?
Sumber: Bab 2.3, Contoh 1 dan Gambar 2.3, hal. 20
Lihat pembahasan
Dokter
Sistem AI
Hit
0,80
0,98
Alarm palsu
0,20
0,38
Persen benar = (Hit + 1 − alarm palsu)/2
0,80
0,80
d′ = z(Hit) − z(alarm palsu)
0,842 + 0,842 = 1,68
2,054 + 0,305 = 2,36
b = −[z(Hit) + z(alarm palsu)]/2
0,00
−0,87
Tafsiran. Persen benar sama, tetapi daya beda AI lebih tinggi. Bias AI jauh dari nol: ia terlalu mudah menjawab “sakit”, sehingga hampir tidak ada yang luput tetapi alarm palsunya banyak. Daya beda sulit diubah, sedangkan ambang mudah digeser. Bila ambang AI dibetulkan, persen benarnya akan naik jauh di atas dokter.
Tugas 2.3 · Percobaan belajar
Peserta berlatih membedakan garis miring ke kiri dan ke kanan selama 10 blok, tiap blok 80 percobaan. Persen benar naik dari blok ke blok. Peneliti menyimpulkan: “persepsi peserta membaik”. Apa yang kurang dari kesimpulan itu, dan apa yang seharusnya dilaporkan?
Sumber: Bab 2.3, Contoh 2, hal. 21
Lihat pembahasan
Persen benar bisa naik karena dua sebab yang berbeda:
Daya beda naik. Misalnya derau (σ) mengecil sehingga peserta melihat kemiringan lebih jelas, atau kedua rata-rata makin berjauhan. Inilah yang biasanya dimaksud dengan “persepsi membaik”.
Ambang makin tepat. Pada blok pertama ambang peserta mungkin belum pas, lalu selama latihan mereka belajar menyesuaikannya. Persepsi tidak berubah.
Dari persen benar saja kedua sebab itu tidak bisa dipisahkan. Yang seharusnya dilaporkan untuk tiap blok adalah d′ dan bias. Bila d′ naik, barulah kesimpulan tentang persepsi punya dasar.
Tugas 2.4 · Lima jari
Peneliti mengangkat satu tangan dengan lima jari terlihat jelas. Semua peserta menjawab “lima”. Bolehkah disimpulkan bahwa penglihatan semua peserta sama baiknya? Apakah menghitung d′ menolong?
Sumber: Bab 2.3, Contoh 5, hal. 21–22
Lihat pembahasan
Tidak boleh. Tugasnya terlalu mudah, sehingga semua orang mencapai 100%. Ini efek atap (ceiling effect). Perbedaan penglihatan antar peserta mungkin ada, tetapi tugas ini tidak bisa menampakkannya.
Menghitung d′ tidak menolong. Alarm palsu = 0, dan z(0) tak terhingga, sehingga d′ tak terhingga.
Hal yang sama terjadi di ujung lain. Bila tugas terlalu sulit, semua orang berada di sekitar 50% (efek lantai). Rangsangan harus dipilih di rentang yang membuat perbedaan antar peserta bisa terlihat.
Bab 3 · hal. 23–50 · The Core Concept of Statistics
Inti statistik: uji t
Pertanyaan bab ini: selisih yang saya lihat pada sampel itu nyata, atau hanya kebetulan karena sampelnya sedikit? Ini bab terpenting. Menurut penulis, minimal Bagian 3.3 (Summary) harus dipahami agar sisa buku bisa diikuti.
Dari d′ ke Cohen's d
Di Bab 2, d′ adalah jarak dua rata-rata dibagi simpangan baku. Dalam statistik, d′ untuk populasi diberi nama lain: Cohen's δ (delta) atau ukuran efek (effect size).
δ = (μsinyal − μderau) / σ
Biasanya kita tidak tahu angka populasi. Kita hanya punya sampel. Dari sampel kita menaksir δ dengan Cohen's d:
d = (x̄₁ − x̄₂) / s
Patokan di psikologi: d sekitar 0,2 disebut kecil, 0,5 sedang, 0,8 besar. Bahkan pada efek “besar”, kedua distribusi masih banyak bertumpang tindih. Artinya, dari satu pengukuran saja kita sulit menebak asalnya. Yang masih bisa dibedakan adalah rata-rata dari banyak pengukuran. Itulah yang dikerjakan uji t.
Rumus dasar dan padanan istilah
Misalkan kita punya n skor dari satu sampel.
Nama
Rumus
Arti sederhana
Rata-rata sampel
x̄ = (jumlah semua skor) / n
Titik tengah data
Varians sampel
s² = jumlah (skor − x̄)² / (n − 1)
Seberapa tersebar data
Simpangan baku
s = √s²
Sebaran dalam satuan aslinya
Galat baku (standard error)
sx̄ = s / √n
Seberapa jauh rata-rata sampel biasanya meleset
Karena konsep yang sama dikembangkan di banyak bidang, satu hal punya banyak nama. Hafalkan padanan ini; seluruh buku memakainya.
Di SDT (Bab 2)
Di statistik
Hit rate
Daya uji (Power)
Alarm palsu (False Alarm, False Positive)
Galat Tipe I (Type I error)
Luput (Miss)
Galat Tipe II (Type II error)
d′
Cohen's δ, ukuran efek, ukuran efek terstandar
Distribusi Gaussian
Distribusi normal, kurva lonceng
Masalahnya: sampel terlalu sedikit
Kita ingin tahu apakah rata-rata tinggi pohon ek di lereng Utara pegunungan Alpen berbeda dari lereng Selatan. Cara paling lurus adalah mengukur semua pohon di kedua lereng, lalu membandingkan. Kalau berbeda, ya berbeda.
Pohonnya terlalu banyak. Kita hanya sanggup mengukur n pohon dari tiap lereng, dipilih secara acak. Kumpulan pohon yang diukur disebut sampel, tinggi tiap pohon disebut skor, dan n disebut ukuran sampel.
Rata-rata sampel hampir pasti tidak sama dengan rata-rata semua pohon. Mungkin kebetulan kita memilih lebih banyak pohon tinggi. Selisih ini disebut galat sampling. Sebabnya adalah kita mengukur lebih sedikit dari semua pohon. Buku menyebut keadaan ini undersampling.
Akibatnya, dua rata-rata sampel bisa berbeda walau kedua populasi sebenarnya sama. Bila kita lalu menyimpulkan “ada beda”, kita membuat alarm palsu. Dalam statistik ini disebut galat Tipe I.
Seberapa jauh rata-rata sampel bisa meleset
Bayangkan kita pergi ke hutan berkali-kali, dan tiap kali mengukur 2 pohon Utara. Rata-rata sebenarnya 20 m. Suatu kali kita mendapat pohon 18,5 m dan 19,5 m, rata-ratanya 19 m. Meleset 1 m. Kali berikutnya melesetnya lain lagi.
Bila semua rata-rata sampel itu dikumpulkan, bentuknya kurva lonceng yang berpusat di 20 m. Kurva ini disebut distribusi sampling. Untuk sampel 2 pohon kurvanya lebar: meleset 2 m tidak aneh. Untuk sampel 9 pohon kurvanya jauh lebih sempit: meleset 2 m sudah jarang terjadi.
Lebar distribusi sampling adalah galat baku:
galat baku = σ / √n (bila σ tidak diketahui, pakai s / √n)
Makin besar n, makin kecil galat baku. Bila semua pohon diukur, galatnya nol.
Makin besar σ, makin banyak pohon yang harus diukur. Bila σ = 0, semua pohon sama tinggi dan satu pohon sudah cukup.
Membandingkan dua rata-rata: nilai t
Sekarang kita punya satu sampel Utara dan satu sampel Selatan, masing-masing n pohon. Kita hitung selisih rata-ratanya. Selisih itu juga punya distribusi sampling, dengan galat baku:
galat baku selisih = s × √(2/n)
Pertanyaannya persis seperti di kapal selam. Ada dua kemungkinan:
Derau saja. Kedua populasi sama. Selisih yang terlihat hanya akibat sampel yang sedikit. Distribusinya berpusat di 0.
Sinyal + derau. Kedua populasi memang berbeda. Distribusinya berpusat di selisih yang sebenarnya.
Daya beda untuk dua kemungkinan ini disebut nilai t:
t = (x̄Utara − x̄Selatan) / (s × √(2/n)) = d × √(n/2)
Jadi nilai t tidak lain adalah d′ untuk rata-rata. Bedanya, pembaginya adalah galat baku, bukan simpangan baku. Rumus di kanan menunjukkan hal terpenting bab ini: t adalah ukuran efek d dikalikan akar dari setengah ukuran sampel. Nilai t yang besar bisa muncul karena d besar, karena n besar, atau keduanya.
Coba sendiri. Geser ukuran efek dan ukuran sampel. Lihat bagaimana t, nilai p, dan daya uji berubah.
t = d × √(n/2)2,00
Nilai p (dua ekor)0,050
Daya uji, bila d efek populasi≈ 0,50
H0: tidak ada beda (derau saja)H1: ada beda sebesar d (sinyal + derau)Garis putus-putus: ambang untuk galat Tipe I 5%
Daerah biru adalah daya uji (Hit rate). Daerah merah adalah galat Tipe I. Kurva digambar dengan pendekatan normal, jadi daya uji adalah nilai perkiraan.
Dua jenis kesalahan
Anggapan bahwa kedua populasi sama disebut hipotesis nol (H0). Anggapan bahwa keduanya berbeda disebut hipotesis alternatif (H1).
H0 salah (memang ada beda)
H0 benar (tidak ada beda)
Kita simpulkan ada beda
Tepat (Hit)
Alarm palsu = galat Tipe I
Kita tidak menyimpulkan ada beda
Luput = galat Tipe II
Penolakan benar
Cara memutuskan: hitung t, lalu bandingkan dengan sebuah ambang. Bila t lebih besar dari ambang, kita simpulkan ada beda. Bila lebih kecil, kita tidak menyimpulkan apa-apa. Mungkin ada beda, mungkin tidak.
Tiap bidang memakai ambang berbeda. Fisika sering memakai “aturan 5σ” (t harus di atas 5), karena fisikawan bisa menekan derau dan punya sampel sangat banyak. Kedokteran, psikologi, dan biologi memakai kira-kira “aturan 2σ”, karena gejalanya memang berderau, bedanya kecil, dan sampelnya mahal. Ambang yang lebih ketat mengurangi alarm palsu, tetapi juga mengurangi Hit.
Mengapa alarm palsu yang dijaga? Karena alarm palsu membuat orang percaya ada efek padahal tidak ada. Misalnya obat disimpulkan menolong padahal tidak, sehingga obat lain tidak dipakai. Sikap dasar ilmuwan adalah ragu: anggap tidak ada efek sampai data menunjukkan sebaliknya.
Nilai p
Bayangkan distribusi sampling bila H0 benar. Pusatnya di 0. Misalkan ambang kita t = 2,0. Peluang kebetulan mendapat t di atas 2,0 padahal H0 benar adalah luas daerah di bawah kurva di sebelah kanan 2,0. Untuk sampel besar luasnya 0,0228. Ini uji satu ekor.
Bila kita tidak tahu arah bedanya, kita pakai dua ambang: +2,0 dan −2,0. Luas kedua ekor adalah 0,0456. Ini uji dua ekor.
Dalam praktik urutannya dibalik. Kita tetapkan dulu galat Tipe I yang bisa diterima, biasanya 5%. Untuk uji dua ekor dan sampel besar, ambangnya menjadi ±1,96. Dari sinilah “aturan 2σ” berasal.
Lalu, alih-alih membandingkan t dengan ambang, orang menghitung luas ekor di luar nilai t yang diperoleh dari data. Luas itu disebut nilai p.
Arti nilai p
Bila H0 benar, nilai p adalah peluang memperoleh t sebesar yang kita peroleh, atau lebih besar lagi. Bila p lebih kecil dari 0,05, hasilnya disebut signifikan.
Contoh di buku: t = 1,8 memberi p = 0,0359 untuk uji satu ekor dan p = 0,0718 untuk uji dua ekor.
Nilai t bisa dihitung dengan tangan. Nilai p dihitung oleh program statistik. Untuk sampel kecil ambangnya lebih besar dari 1,96, dan program sudah menyesuaikannya.
Catatan penyusun atas buku
Keterangan Gambar 3.5 (hal. 35) menulis “one-sample t-test”. Yang dimaksud adalah uji satu ekor (one-tailed), sesuai teks di halaman yang sama.
Galat Tipe II dan daya uji
Dengan menetapkan ambang, kita juga menentukan Hit, luput, dan penolakan benar. Galat Tipe I 5% otomatis berarti penolakan benar 95%.
Galat Tipe II tidak semudah itu dihitung. Sebabnya: H0 hanya satu, yaitu “selisih = 0”. Hipotesis alternatif tak terhingga banyaknya, karena selisih bisa bernilai berapa saja. Untuk menghitung galat Tipe II kita harus memilih satu ukuran efek tertentu. Misalnya: “kami hanya peduli bila pohon Utara lebih tinggi minimal 1,2 m”. Dengan itu baru kita bisa bertanya berapa n yang dibutuhkan agar hasilnya signifikan pada 80% percobaan.
Daya uji (power) adalah peluang memperoleh hasil signifikan bila efeknya memang ada. Daya uji = Hit rate = 1 − galat Tipe II. Bab 7 membahasnya lebih jauh.
Contoh hitung lengkap: lima pohon Utara, lima pohon Selatan
Galat baku selisih: √(3,996 × (1/5 + 1/5)) = 1,264.
Nilai t: (18,00 − 15,00) / 1,264 = 2,373.
Derajat bebas (df): 4 + 4 = 8.
Program statistik memberi p = 0,045. Karena di bawah 0,05, beda tinggi pohon Utara dan Selatan signifikan.
Ukuran efek: d = 3,00 / √3,996 = 1,5, tergolong besar.
Derajat bebas diperlukan karena pada sampel kecil bentuk distribusi sampling sedikit berbeda dari kurva lonceng. Untuk df = 8, ambang dua ekornya ±2,306, lebih besar dari 1,96.
Yang terpenting: nilai p ditentukan sepenuhnya oleh t, dan t = d × √(n/2). Jadi nilai p mencampur ukuran efek dan ukuran sampel. Nilai p adalah informasi sebagian. Sekarang nilai p sering disangka ukuran besar efek. Itu keliru. Laporkan dan baca d dan n.
Implikasi 1: ukuran sampel
1a. Selama d bukan nol, selalu ada n yang membuat uji t signifikan. Jadi efek yang sangat kecil pun bisa signifikan bila sampelnya cukup besar.
1b. Hasil bisa tidak signifikan pada sampel kecil dan signifikan pada sampel lebih besar. Itu tidak berarti “tidak ada efek pada sampel kecil”. Artinya hanya: bukti pada sampel kecil belum cukup.
1c. Pertanyaan menggelitik dari buku: bukankah dua keadaan hampir selalu berbeda, walau sangat sedikit? Mustahil rata-rata pohon Utara dan Selatan sama-sama tepat 20,2567891119 m. Kalau begitu, dengan n yang cukup besar semua eksperimen akan signifikan. Lalu untuk apa bereksperimen? Pertanyaan ini dijawab di Bagian III.
Implikasi 2: ukuran efek
2a. Efek kecil bisa signifikan. Menurut satu studi, minyak ikan memperpanjang hidup secara signifikan. Tetapi bisa saja hanya 2 menit. Apakah itu penting bagi Anda?
2b. Nilai p tidak memberi tahu besar efek. Bila n naik, p turun walau d sama.
2c. Dua eksperimen bisa punya p yang persis sama, padahal yang satu efeknya besar dengan sampel kecil dan yang lain sebaliknya. Jangan bandingkan nilai p dua eksperimen bila n-nya berbeda.
2d. Pada nilai p yang sama, studi dengan sampel lebih kecil punya taksiran ukuran efek lebih besar.
2e. H0 hanya satu titik, yaitu selisih = 0. Semua nilai lain termasuk H1. Saat menjaga galat Tipe I, kita menjaga satu titik di antara tak terhingga titik.
Implikasi 3: hasil yang tidak signifikan
3a. Tidak ada bukti bukan berarti bukti tidak ada. Hasil tidak signifikan bisa berarti memang tidak ada beda, atau ada beda yang terlalu kecil untuk tertangkap pada n itu. Kita tidak boleh menyimpulkan “tidak ada efek”.
3b. Beda signifikansi bukan beda yang signifikan. Contoh krim Aloe Vera: setelah 4 minggu eksim berkurang secara signifikan pada kelompok krim, tetapi tidak signifikan pada kelompok plasebo. Menggoda untuk menyimpulkan Aloe Vera menyembuhkan eksim. Padahal kelompok plasebo juga membaik, hanya lebih sedikit, mungkin karena sembuh sendiri. Uji yang benar adalah membandingkan langsung besar perbaikan di kedua kelompok. Dalam contoh buku, hasilnya tidak signifikan.
Kalimat “ada efek pada kondisi A tetapi tidak pada kondisi B” sangat sering muncul di artikel ilmiah. Perlakukan dengan hati-hati.
Implikasi 4: derau atau perbedaan antar orang?
Mengapa kita menghitung statistik? Sering dianggap statistik “membersihkan” derau. Pada kapal selam, tiap pengukuran adalah sinyal sebenarnya ditambah derau acak:
xj = μ + εj
Merata-ratakan banyak pengukuran membuang derau itu. Model ini cocok untuk fisika. Di biologi dan kedokteran keadaannya lain. Obat sakit kepala menolong rata-rata orang, tetapi ada orang yang sangat tertolong, ada yang tidak tertolong, dan ada yang malah makin sakit. Perbedaan antar orang ini tetap, bukan acak:
xij = μ + vi + εij
μ: efek rata-rata pada seluruh populasi.
vi: seberapa berbeda orang ke-i dari rata-rata. Ini perbedaan yang menetap pada orang itu.
εij: derau pengukuran, yang berubah dari hari ke hari pada orang yang sama.
Dalam banyak eksperimen v dan ε tidak bisa dipisahkan. Keduanya masuk ke dalam s. Secara hitungan tidak ada bedanya, tetapi untuk tafsiran bedanya besar:
4a. Bila obat sangat menolong separuh populasi dan sedikit merugikan separuh lainnya, rata-ratanya positif dan bisa signifikan. Namun bagi separuh orang obat itu merugikan. Hasil signifikan tidak mengizinkan kesimpulan untuk tiap orang. Studi bisa menunjukkan wortel baik untuk mata secara rata-rata; apakah baik untuk mata Anda, tidak jelas.
4b. Pernyataan seperti “X benar” hanya pasti berlaku untuk semua bila perbedaan antar individu nol.
4c. Sampel yang tidak seragam bisa menyesatkan. Dari data kunjungan dokter, mahasiswa yang lebih pendek tampak lebih sering sakit. Sebabnya bukan tinggi badan. Mahasiswi rata-rata lebih pendek dan lebih sering ke dokter kandungan untuk pemeriksaan pencegahan.
4d. Saat merancang, kita harus memilih siapa yang diikutkan. Sampel dari seluruh populasi lebih mewakili tetapi sangat beragam. Makin banyak kelompok yang dikeluarkan, makin seragam sampelnya tetapi makin tidak mewakili.
4e. Efek sering bergantung pada dosis, dan tiap orang bisa menanggapi dosis secara berbeda. Efek yang bergantung pada dosis lebih cocok dianalisis dengan korelasi (Bab 8).
Implikasi 5: paradoks statistik dan bahaya studi kohort
Untuk efek yang sangat besar, statistik tidak diperlukan. Gajah lebih besar dari semut tanpa perlu uji. Statistik dikembangkan untuk efek sedang dengan sampel sedang. Dulu data sulit didapat, sehingga hanya efek besar yang bisa signifikan. Sekarang data murah dan sampel bisa jutaan, sehingga statistik dipakai juga untuk efek yang sangat kecil. Ini berbahaya.
Contoh Framingham. Sejak 1948 tekanan darah 5.209 warga kota Framingham diukur. Orang yang lebih lama bersekolah punya tekanan darah sedikit lebih rendah, dan bedanya signifikan. Apakah sekolah menurunkan tekanan darah? Kemungkinan besar tidak. Mungkin mereka lebih sedikit merokok, makan berbeda, lebih sering berolahraga, bekerja di lingkungan lain, atau berbeda secara genetik. Terlalu banyak faktor yang berperan dan tidak bisa dikendalikan.
Bedanya pun hanya sekitar 2 mmHg. Ukur tekanan darah Anda, lalu ulangi 5 menit kemudian. Perubahannya lebih besar dari itu.
Studi seperti ini disebut studi kohort: kelompok dibandingkan menurut label yang sudah ada (pasien dan bukan pasien, vegetarian dan pemakan daging), bukan dibagi secara acak.
5b. Efek kecil tidak selalu tidak penting. Mengurangi efek samping obat yang diminum jutaan orang sebesar 1% tetap berguna. Banyak penemuan penting berawal dari efek kecil yang kemudian diperbesar dengan metode yang lebih baik.
5c. Sampel kecil bermasalah karena galat sampling. Sampel sangat besar juga bermasalah bila efeknya kecil, karena selisih sekecil apa pun menjadi signifikan, termasuk yang datang dari faktor lain yang tidak berkaitan. Studi kohort dengan efek kecil dan sampel besar sering tidak berguna.
Cara membaca hasil statistik
Lihat dulu apakah n cukup besar. Makin besar n, makin stabil taksiran efeknya.
Lalu lihat ukuran efeknya. Apakah cukup besar untuk pertanyaan yang diajukan? Efek yang sangat kecil hanya kadang penting, dan bisa berasal dari faktor pengganggu yang tidak dikenali.
Pesan utama bab ini
Efek yang kecil pun menjadi signifikan bila sampelnya cukup besar.
Jangan bandingkan nilai p dua eksperimen bila n tidak sama. p yang lebih kecil tidak berarti “lebih signifikan”.
Signifikan secara statistik tidak sama dengan penting dalam praktik.
Tidak ada bukti bukan berarti bukti tidak ada. Jangan menarik kesimpulan dari hasil yang tidak signifikan.
Jangan mengadu eksperimen yang signifikan dengan eksperimen kontrol yang tidak signifikan.
Studi kohort dengan efek kecil biasanya tidak berguna.
Pernyataan “X benar” hanya pasti benar bila perbedaan antar subjek nol.
Tugas Bab 3
Tugas 3.1 · Galat baku dan ukuran sampel
Pada contoh pohon Utara, s² = 3,995 sehingga s ≈ 2,0 m. (a) Hitung galat baku rata-rata untuk n = 5, n = 20, dan n = 80. (b) Berapa kali n harus diperbesar agar galat baku menjadi setengahnya?
Sumber: Bab 3.2.1, Persamaan 3.6, hal. 28–30
Lihat pembahasan
(a) Galat baku = s/√n.
n = 5: 2,0/√5 = 0,89 m.
n = 20: 2,0/√20 = 0,45 m.
n = 80: 2,0/√80 = 0,22 m.
(b) Empat kali. Karena n berada di bawah tanda akar, sampel yang 4 kali lebih besar hanya membuat galat baku 2 kali lebih kecil. Menambah ketelitian itu mahal.
Tugas 3.2 · Uji t dengan tangan
Tinggi lima pohon Utara: 20,80; 17,81; 17,92; 18,30; 15,17 m. Tinggi lima pohon Selatan: 16,91; 15,28; 13,70; 16,81; 12,30 m. Hitung rata-rata, varians, varians gabungan, galat baku selisih, nilai t, derajat bebas, dan Cohen's d. Ambang dua ekor untuk df = 8 adalah ±2,306. Apakah bedanya signifikan?
Nilai t. (18,00 − 15,00)/1,264 = 2,373, dengan df = 5 + 5 − 2 = 8.
Keputusan. 2,373 lebih besar dari 2,306, jadi signifikan. Program statistik memberi p = 0,045.
Ukuran efek. d = 3,00/√3,996 = 1,5, efek besar. Cek: d × √(n/2) = 1,5 × √2,5 = 2,37. Cocok.
Bila memakai R: t.test(utara, selatan, var.equal = TRUE).
Tugas 3.3 · Bermain dengan t = d × √(n/2)
(a) Efek sedang d = 0,5. Hitung t untuk n = 8, 32, dan 128 per kelompok. (b) Efek kecil d = 0,2. Berapa n per kelompok agar t mencapai 1,96? (c) Catatan kaki di hal. 42 menyatakan: bila d lebih besar dari 4,31, n = 2 pun sudah signifikan. Jelaskan dari rumus.
Sumber: Bab 3.3 Persamaan 3.12 dan Bab 3.5 Implikasi 1, hal. 39, 42
Lihat pembahasan
(a) t = 0,5 × √(8/2) = 1,0. t = 0,5 × √(32/2) = 2,0. t = 0,5 × √(128/2) = 4,0. Efeknya sama, tetapi hanya dua yang terakhir signifikan. Tiap kali n dikali 4, t menjadi 2 kali.
(b) Dari t = d × √(n/2) diperoleh n = 2 × (t/d)² = 2 × (1,96/0,2)² = 192. Jadi dibutuhkan sekitar 193 pohon per kelompok. Untuk d = 0,02 dibutuhkan sekitar 19.200. Inilah Implikasi 1a: efek sekecil apa pun bisa signifikan asal n cukup besar.
(c) Bila n = 2, maka √(n/2) = 1, sehingga t = d. Derajat bebasnya 2 + 2 − 2 = 2. Ambang dua ekor untuk df = 2 adalah sekitar 4,3. Jadi t baru signifikan bila d di atas kira-kira 4,3. Efek sebesar itu terlihat tanpa statistik.
Tugas 3.4 · Satu ekor atau dua ekor
Sebuah eksperimen dengan sampel besar menghasilkan t = 1,8. Nilai p satu ekor adalah 0,0359 dan dua ekor 0,0718. (a) Apakah hasilnya signifikan pada α = 0,05? (b) Peneliti awalnya merencanakan uji dua ekor. Setelah melihat hasil, ia ingin beralih ke uji satu ekor. Bolehkah?
Sumber: Bab 3.2.4, Gambar 3.6, hal. 36–37; Bab 4.3.3, hal. 55
Lihat pembahasan
(a) Tergantung uji yang direncanakan. Dengan uji satu ekor, 0,0359 < 0,05, signifikan. Dengan uji dua ekor, 0,0718 > 0,05, tidak signifikan.
(b) Tidak boleh. Pilihan satu atau dua ekor harus didasarkan pada alasan teoretis dan ditetapkan sebelum data dilihat. Bila peneliti selalu beralih ke satu ekor ketika uji dua ekor gagal, peluang alarm palsunya menjadi lebih besar dari 5%. Buku menyebut ini salah satu bentuk keluwesan analisis (Bab 11.3.5).
Tugas 3.5 · Periksa empat kesimpulan
Untuk tiap kesimpulan berikut, tulis apa yang salah dan implikasi mana yang dilanggar.
“Nilai p = 0,001, jadi efeknya besar.”
“Nilai p = 0,30, jadi perlakuan ini tidak punya efek.”
“Eksim berkurang signifikan pada kelompok krim tetapi tidak pada kelompok plasebo, jadi krim itu bekerja.”
“Obat ini menurunkan sakit kepala secara signifikan, jadi obat ini baik untuk Anda.”
Sumber: Bab 3.5, Implikasi 2, 3, dan 4, hal. 42–46
Lihat pembahasan
Salah. p ditentukan oleh t = d × √(n/2). p yang sangat kecil bisa datang dari d yang sangat kecil dengan n yang sangat besar. Lihat d dan n. (Implikasi 2a dan 2b)
Salah. Hasil tidak signifikan bisa berarti tidak ada efek, atau efeknya terlalu kecil untuk n itu. Tidak ada kesimpulan yang bisa ditarik. (Implikasi 3a)
Salah. Kelompok plasebo mungkin juga membaik, hanya lebih sedikit. Yang harus diuji adalah selisih perbaikan antara kedua kelompok. (Implikasi 3b)
Belum tentu. Hasil itu berlaku untuk rata-rata. Bila tanggapan orang terhadap obat berbeda-beda, sebagian orang bisa tidak tertolong atau malah dirugikan. (Implikasi 4a)
Tugas 3.6 · Studi Framingham
Tekanan darah kelompok dengan pendidikan lebih lama lebih rendah sekitar 2 mmHg, dan bedanya signifikan. (a) Sebutkan minimal empat penjelasan selain “pendidikan menurunkan tekanan darah”. (b) Mengapa 2 mmHg dinilai kecil? (c) Mengapa studi kohort seperti ini sulit diperbaiki dengan menambah sampel?
Sumber: Bab 3.5, Implikasi 5a, Gambar 3.11, hal. 47–48
Lihat pembahasan
(a) Buku menyebut: lebih sedikit yang merokok, lebih sedikit rokok per hari, mulai merokok lebih lambat atau berhenti lebih cepat, gizi, olahraga, lingkungan kerja, genetik, atau satu subkelompok kecil yang bekerja dalam kondisi sangat tidak sehat. Gabungan beberapa faktor juga mungkin, misalnya gizi hanya berpengaruh pada orang yang tidak berolahraga.
(b) Tekanan darah satu orang berubah lebih dari 2 mmHg dalam 5 menit, dan perbedaan antar orang jauh lebih besar lagi. Sedikit olahraga mungkin menurunkannya lebih banyak dan lebih murah daripada bertahun-tahun sekolah.
(c) Karena kelompok tidak dibagi secara acak, semua faktor tadi ikut berbeda antar kelompok. Untuk mengendalikan semua faktor dan gabungannya, sampel yang dibutuhkan bisa melebihi jumlah manusia di bumi. Menambah sampel hanya membuat selisih yang kecil itu makin signifikan, tanpa menjelaskan sebabnya.
Bab 4 · hal. 51–59 · Variations on the t-Test
Ragam uji t dan syaratnya
Pertanyaan bab ini: uji t mana yang dipakai untuk rancangan yang mana, dan apa saja syarat agar hasilnya bisa dipercaya?
Beberapa istilah
Jenis studi.
Studi eksperimental: peserta dibagi secara acak ke dalam kelompok. Misalnya pasien diundi untuk mendapat obat atau plasebo.
Studi kohort: kelompok ditentukan oleh label yang sudah ada, misalnya pasien dan bukan pasien, atau vegetarian dan pemakan daging. Studi ini umum dan berguna, tetapi punya masalah berat seperti dibahas di Bab 3, Implikasi 5a.
Jenis variabel. Pada grafik, sumbu x biasanya variabel bebas dan sumbu y variabel terikat. Ada empat skala ukur:
Skala
Ciri
Contoh di buku
Nominal
Hanya nama, tidak ada urutan
Negara asal; terapi A atau B
Ordinal
Ada urutan, tetapi jarak tidak bermakna
Pangkat militer: jenderal di atas letnan, tetapi bukan “dua kali lebih tinggi”
Interval
Bisa dijumlah dan dikurang, tetapi tidak bisa dibandingkan dengan kelipatan
Suhu Celsius: 30 °C lebih panas 15 derajat dari 15 °C, tetapi bukan dua kali lebih panas
Rasio
Punya nol sejati, semua hitungan bermakna
Berat dalam kilogram; suhu dalam Kelvin
Jenis uji. Uji parametrik mengandaikan bentuk distribusi data tertentu, misalnya kurva lonceng. Uji non-parametrik tidak mengandaikan bentuk distribusi apa pun.
Lima langkah uji hipotesis nol
Nyatakan hipotesis alternatif (H1). Contoh: terapi A berbeda dari terapi B.
Anggap hipotesis nol (H0) benar: tidak ada beda antara A dan B.
Dari data, hitung galat baku selisih: s × √(2/n).
Hitung nilai t, yaitu selisih rata-rata dibagi galat baku, lalu nilai p-nya.
Putuskan. Bila p ≤ 0,05, tolak H0 dan sebut efeknya signifikan. Bila p > 0,05, kita tidak bisa menyatakan apa-apa. Jangan menyimpulkan H0 benar.
Cara ini membatasi alarm palsu. Bila H0 benar dan eksperimen diulang berkali-kali, p di bawah 0,05 hanya akan muncul pada 5% ulangan. Kita bisa lebih ketat, misalnya p < 0,01. Harganya: makin ketat, makin banyak efek nyata yang luput.
Tiga macam uji t
Uji
Dipakai bila
Rumus t
df
Dua sampel (Bab 3)
Dua kelompok berbeda dibandingkan
(x̄A − x̄B) / (s × √(2/n))
n₁ + n₂ − 2
Satu sampel
Satu rata-rata dibandingkan dengan angka tetap μ₀. Contoh: apakah terapi menaikkan IQ di atas 100?
(x̄ − μ₀) / (s / √n)
n − 1
Sampel berpasangan
Tiap skor di satu sampel punya pasangan di sampel lain. Contoh: kadar sel darah merah sebelum dan sesudah terapi pada orang yang sama.
Hitung selisih tiap pasangan, lalu lakukan uji satu sampel pada selisih itu
n − 1 (n = jumlah pasangan)
Uji berpasangan juga disebut repeated measures t-test, paired t-test, atau within-subjects t-test.
Satu ekor atau dua ekor
Uji dua ekor bertanya “apakah A berbeda dari B”, tanpa menyebut arah. Uji satu ekor bertanya “apakah A lebih baik dari B”. Pada uji satu ekor hanya ada satu ambang, sehingga ambangnya lebih rendah dan daya ujinya lebih tinggi.
Tetapi uji satu ekor diperdebatkan. Aturannya:
Pilihan harus didasarkan pada alasan teoretis, bukan pada data atau hasilnya.
Tidak boleh beralih ke uji satu ekor setelah uji dua ekor gagal.
Tidak boleh memilih uji satu ekor hanya karena terlihat satu rata-rata lebih besar.
Lima syarat uji t
Tujuan utama uji t adalah menjaga galat Tipe I. Bila syarat di bawah ini dilanggar, galat Tipe I hampir selalu berubah, kadang sedikit, kadang banyak.
Data saling bebas dan berasal dari distribusi yang sama (independent and identically distributed, IID). Tiap orang hanya ikut satu kali. Contoh pelanggaran: mengukur ketajaman mata di 8 titik pada 3 pasien memberi 24 angka, tetapi angka dari pasien yang sama tidak saling bebas. Rata-ratakan per pasien; ukuran sampelnya 3, bukan 24. Contoh lain: tinggi pohon ek dan bunga edelweiss tidak boleh dicampur dalam satu sampel.
Populasi berdistribusi lonceng, atau sampelnya besar (n = 30 sering sudah cukup). Uji t cukup tahan terhadap pelanggaran ini. Selama distribusinya berpuncak satu, kemencengan yang besar pun hanya sedikit mengubah galat Tipe I.
Variabel terikat berskala rasio. Rata-rata tidak bermakna untuk data nominal, dan simpangan baku tidak bermakna untuk data nominal maupun ordinal. Untuk skala interval pendapat terbelah; dalam banyak kasus uji t masih berperilaku wajar.
Varians kedua populasi sama. Lihat tabel di bawah.
Ukuran sampel ditetapkan sebelum eksperimen dan tidak diubah di tengah jalan. Syarat ini lebih sulit dipenuhi daripada kelihatannya (lihat Bab 10 tentang optional stopping).
Tabel 4.1 di buku menunjukkan galat Tipe I dari 10.000 uji t simulasi ketika H0 benar. Yang seharusnya 0,05:
Keadaan
Galat Tipe I
Sampel sama besar (5 dan 5), simpangan baku sama
0,050
Sampel sama besar (5 dan 5), simpangan baku 1 dan 5
0,074
Sampel 5 dan 25, simpangan baku sama
0,052
Sampel kecil (5) dari populasi yang kurang beragam (σ = 1), sampel besar (25) dari σ = 5
0,000
Sampel kecil (5) dari populasi yang lebih beragam (σ = 5), sampel besar (25) dari σ = 1
0,383
Baris terakhir adalah yang berbahaya: alarm palsu hampir 40%, delapan kali dari yang diinginkan. Sebabnya, uji t biasa menggabungkan simpangan baku kedua sampel menjadi satu taksiran. Di baris terakhir taksiran itu terlalu kecil. Jalan keluarnya adalah uji Welch. Harganya: bila varians sebenarnya sama, daya uji Welch lebih rendah daripada uji t biasa.
Uji non-parametrik
Bila data tidak berdistribusi lonceng, uji non-parametrik bisa dipertimbangkan. Uji ini tidak bisa memanfaatkan model distribusi, sehingga daya ujinya lebih rendah dan biasanya butuh sampel lebih besar. Hitungannya tampak lain, tetapi prinsipnya sama dengan SDT.
Catatan penyusun atas buku
Tabel 4.2 (hal. 58) memasangkan uji t dua sampel dengan Wilcoxon rank sum, dan uji t berpasangan dengan Mann-Whitney U. Kedua nama itu sebenarnya merujuk pada uji yang sama, untuk dua sampel yang saling bebas. Padanan yang lazim: uji t satu sampel dengan sign test, uji t dua sampel dengan Wilcoxon rank sum (Mann-Whitney U), dan uji t berpasangan dengan Wilcoxon signed-rank.
Pola yang sama pada semua uji
Pada uji t urutannya begini: ada pertanyaan (beda rata-rata), lalu model statistik (tinggi pohon berdistribusi lonceng), lalu dari model itu diturunkan statistik uji (nilai t), lalu nilai p untuk menjaga galat Tipe I.
Pola ini berlaku untuk pertanyaan lain: apakah dua varians berbeda, apakah bentuk dua distribusi berbeda (uji χ²), dan seterusnya. Yang berbeda hanya modelnya. Cara menghitung tiap statistik uji tidak terlalu penting karena dikerjakan komputer. Yang penting diingat: pada semua uji parametrik, nilai p mencampur ukuran efek dan ukuran sampel.
Rancangan sebaiknya dibuat sesederhana mungkin agar cukup dengan uji t. Bila ada lebih dari dua kelompok, muncul masalah uji berulang, yang dibahas di Bagian II. Pembaca yang tidak memerlukan uji-uji khusus di Bagian II boleh langsung ke Bagian III.
Pesan utama bab ini
Untuk uji t, pastikan data saling bebas dan berasal dari distribusi yang sama, dan variabel terikat berskala rasio.
Data sebaiknya berdistribusi lonceng, atau n besar.
Tugas Bab 4
Tugas 4.1 · Mengenali skala ukur
Tentukan skala ukur untuk: (a) negara asal, (b) pangkat militer, (c) suhu dalam Celsius, (d) suhu dalam Kelvin, (e) berat dalam kilogram, (f) jenis terapi A atau B. Variabel mana yang memenuhi syarat sebagai variabel terikat pada uji t?
Sumber: Bab 4.1 dan 4.4.3, hal. 52, 56
Lihat pembahasan
(a) Nominal. Negara bisa diurutkan sesuka hati.
(b) Ordinal. Ada urutan, tetapi jarak antar pangkat tidak bermakna.
(c) Interval. Selisih bermakna, tetapi 0 °C bukan “tidak ada panas”.
(d) Rasio. 0 K adalah nol sejati.
(e) Rasio.
(f) Nominal.
Untuk uji t. Secara teknis hanya skala rasio, yaitu (d) dan (e). Skala interval (c) masih diperdebatkan dan sering dipakai. Data nominal dan ordinal tidak boleh dianalisis dengan uji t, karena uji t memakai rata-rata dan simpangan baku.
Tugas 4.2 · Memilih uji t dan derajat bebasnya
Pilih uji t yang sesuai dan tentukan df-nya. (a) Peneliti ingin menunjukkan sebuah terapi menaikkan IQ, yang rata-ratanya 100. Ia mengukur IQ 25 peserta setelah terapi. (b) Kadar sel darah merah 12 pasien diukur sebelum dan sesudah terapi. (c) 40 pasien diundi: 20 mendapat terapi A dan 20 mendapat terapi B.
Sumber: Bab 4.2 dan 4.3, hal. 53–55
Lihat pembahasan
(a) Uji t satu sampel. Satu rata-rata dibandingkan dengan angka tetap μ₀ = 100. t = (x̄ − 100)/(s/√25). df = 25 − 1 = 24.
(b) Uji t sampel berpasangan. Tiap skor “sesudah” punya pasangan “sebelum” dari orang yang sama. Hitung selisih tiap pasien, lalu lakukan uji satu sampel pada 12 selisih itu. df = 12 − 1 = 11.
(c) Uji t dua sampel. Dua kelompok orang yang berbeda. df = 20 + 20 − 2 = 38.
Tugas 4.3 · Apakah datanya saling bebas?
Jelaskan masalah pada tiap rancangan. (a) Ketajaman mata diukur di 8 titik lapang pandang pada 3 pasien, lalu 24 angka itu dimasukkan ke uji t. (b) Peneliti menguji obat sakit kepala pada dirinya sendiri selama 10 hari, lalu menyimpulkan untuk masyarakat umum. (c) Tinggi tumbuhan di lereng Utara dan Selatan dibandingkan, dengan sampel berisi campuran pohon ek dan bunga edelweiss.
Sumber: Bab 4.4.1, hal. 55–56
Lihat pembahasan
(a) Delapan angka dari satu pasien tidak saling bebas. Rata-ratakan delapan angka tiap pasien. Ukuran sampelnya 3, bukan 24.
(b) Sepuluh pengukuran pada satu orang tidak saling bebas dan tidak mewakili populasi. Mungkin peneliti itu satu-satunya orang yang cocok dengan obat tersebut. Tiap orang hanya boleh ikut satu kali.
(c) Data tidak berasal dari distribusi yang sama. Varians tinggi ek dan edelweiss sangat berbeda. Selisih bisa muncul hanya karena sampel Utara kebetulan berisi lebih banyak ek.
Tugas 4.4 · Membaca Tabel 4.1
Anda membandingkan dua kelompok: 5 orang dari populasi yang sangat beragam dan 25 orang dari populasi yang seragam. H0 benar. (a) Berapa kira-kira peluang uji t biasa memberi hasil signifikan? (b) Mengapa bisa begitu? (c) Uji apa yang seharusnya dipakai, dan apa kekurangannya?
Sumber: Bab 4.4.4, Tabel 4.1, hal. 57
Lihat pembahasan
(a) Sekitar 0,38, yaitu hampir 40%, padahal yang diinginkan 5%.
(b) Uji t biasa menggabungkan simpangan baku kedua sampel, dengan bobot menurut ukuran sampel. Sampel besar yang seragam mendominasi, sehingga taksiran gabungannya terlalu kecil. Galat baku ikut terlalu kecil, nilai t terlalu besar, dan H0 terlalu sering ditolak.
(c) Uji Welch. Kekurangannya: bila varians kedua populasi ternyata sama, daya uji Welch lebih rendah daripada uji t biasa.
Keadaan sebaliknya. Bila sampel kecil berasal dari populasi yang seragam, taksiran gabungan terlalu besar dan uji hampir tidak pernah menolak H0 (0,000 pada simulasi).
Bab 5 · hal. 63–66 · The Multiple Testing Problem
Masalah uji berulang
Pertanyaan bab ini: apa yang terjadi bila kita melakukan banyak uji sekaligus? Uji t bagus untuk membandingkan dua rata-rata. Begitu ada lebih dari dua, alarm palsu bertambah.
Uji yang saling bebas
Satu uji t punya peluang alarm palsu 0,05 bila H0 benar. Dengan kata lain, peluang tidak membuat alarm palsu adalah 0,95.
Dua uji: peluang tidak ada alarm palsu sama sekali = 0,95 × 0,95 = 0,90. Jadi peluang minimal satu alarm palsu = 0,10.
Dua belas uji: 0,95¹² = 0,54. Peluang minimal satu alarm palsu = 0,46.
Peluang minimal satu alarm palsu dari m uji = 1 − (1 − α)m
Makin banyak perbandingan, makin besar peluang ada alarm palsu. Inilah masalah uji berulang (multiple testing problem).
Koreksi Bonferroni
Cara klasik mengatasinya adalah memperketat ambang tiap uji. Agar peluang alarm palsu untuk seluruh m uji tetap 0,05, tiap uji harus memenuhi:
p < 0,05 / m
Harganya adalah daya uji. Seperti di SDT, ambang yang lebih ketat selalu mengurangi alarm palsu dan Hit. Dengan koreksi Bonferroni, daya uji turun banyak. Karena itu buku menyebutnya cara yang kurang ideal.
Kapan koreksi diperlukan? Para ahli statistik tidak sepakat. Yang jelas, m bukan jumlah semua uji sepanjang karier. Bila uji-uji itu menyangkut topik yang sangat berbeda, tiap topik wajar punya galat Tipe I sendiri dan koreksi tidak perlu.
Variasi yang sering terjadi. Anda menguji satu hipotesis dan hasilnya tidak signifikan, misalnya tidak ada beda daya ingat antara pria dan wanita. Lalu Anda menguji hal lain pada data yang sama: wanita muda lawan wanita tua, pria muda lawan pria tua. Tiap uji tambahan membawa risiko alarm palsu dan perlu dikoreksi. Mengajukan terlalu banyak pertanyaan pada satu sampel itu bermasalah.
Uji yang tidak saling bebas
Rumus di atas berlaku bila semua uji saling bebas. Bila satu set data dipakai untuk menjawab banyak pertanyaan, uji-ujinya tidak saling bebas karena datanya dipakai berulang. Koreksi Bonferroni masih bisa menahan galat Tipe I, tetapi mungkin terlalu ketat.
Contoh ikan mas
Kita mengambil sampel ikan mas dari kolam untuk melihat apakah ekor yang lebih besar berarti jantung yang lebih besar. Kebetulan sampel kita menunjukkan hubungan itu, padahal di populasi tidak ada. Ini alarm palsu.
Lalu dari sampel yang sama kita uji apakah ekor yang lebih besar berarti paru yang lebih besar. Andaikan ukuran jantung dan paru berkaitan sempurna. Uji kedua pasti menghasilkan alarm palsu juga.
Bila kita mengajukan 10 pertanyaan pada sampel yang kebetulan menyesatkan, kita bisa mendapat 10 jawaban salah.
Apakah data saling berkaitan atau tidak biasanya tidak diketahui. Ini satu alasan lagi untuk tidak mengajukan lebih dari satu pertanyaan pada satu sampel.
Berapa banyak hasil ilmiah yang salah?
Galat Tipe I biasanya 5%. Apakah berarti 5% dari semua hasil ilmiah salah? Tidak.
Itu hanya benar bila semua eksperimen menguji efek yang sebenarnya nol. Padahal ilmuwan biasanya mengejar efek yang nyata. Bila semua eksperimen menguji efek yang memang ada, tidak ada galat Tipe I sama sekali, karena H0 salah di semua eksperimen.
Jadi jumlah hasil yang salah bergantung pada seberapa sering “tidak ada efek” itu terjadi. Ini sama dengan angka kejadian di Bab 1. Angka itu tidak diketahui, sehingga kita tidak tahu berapa banyak hasil yang merupakan alarm palsu atau luput.
Pesan utama bab ini
Untuk satu set data, Anda hanya boleh mengajukan satu pertanyaan. Bila lebih, perhitungkan perbandingan berulang.
Buat rancangan sesederhana mungkin.
Bila rancangan tidak bisa sederhana dan ada lebih dari satu perbandingan kelompok, baca bab berikutnya.
Tugas Bab 5
Tugas 5.1 · Alarm palsu pada banyak uji
Semua H0 benar dan α = 0,05. (a) Hitung peluang minimal satu alarm palsu untuk 2 uji dan 12 uji yang saling bebas. (b) Berapa ambang p menurut Bonferroni untuk 12 uji? (c) Apa harga yang dibayar?
(b) 0,05/12 ≈ 0,0042. Tiap uji baru disebut signifikan bila p di bawah angka itu.
(c) Daya uji turun banyak. Ambang yang lebih ketat mengurangi alarm palsu, tetapi efek yang nyata juga lebih sering luput.
Tugas 5.2 · Pertanyaan tambahan pada data yang sama
Peneliti tidak menemukan beda daya ingat antara pria dan wanita. Ia lalu menguji wanita muda lawan wanita tua, dan pria muda lawan pria tua, pada data yang sama. Salah satu uji tambahan memberi p = 0,03. (a) Berapa uji yang sudah dilakukan? (b) Apakah p = 0,03 signifikan setelah koreksi Bonferroni? (c) Apa nasihat buku?
Sumber: Bab 5.1 dan 5.2, hal. 65
Lihat pembahasan
(a) Tiga uji: pria lawan wanita, wanita muda lawan tua, pria muda lawan tua.
(b) Ambang Bonferroni untuk tiga uji adalah 0,05/3 ≈ 0,017. Karena 0,03 lebih besar dari 0,017, hasilnya tidak signifikan setelah koreksi.
(c) Mengajukan terlalu banyak pertanyaan pada satu sampel itu bermasalah. Ketiga uji ini memakai data yang sama, jadi tidak saling bebas. Koreksi Bonferroni tetap bisa menahan galat Tipe I, walau mungkin terlalu ketat. Lebih baik satu pertanyaan untuk satu set data.
Tugas 5.3 · “Lima persen hasil ilmiah salah”
Jelaskan mengapa pernyataan itu keliru dengan membandingkan dua dunia: (a) dunia tempat semua eksperimen menguji efek yang sebenarnya nol, dan (b) dunia tempat semua eksperimen menguji efek yang nyata. Apa hubungannya dengan contoh tes HIV di Bab 1?
Sumber: Bab 5.3, hal. 65–66
Lihat pembahasan
(a) H0 benar di semua eksperimen. Dari 1.000 eksperimen, kira-kira 50 akan signifikan, dan semuanya alarm palsu. Semua hasil “signifikan” di dunia ini salah.
(b) H0 salah di semua eksperimen. Galat Tipe I tidak mungkin terjadi. Tidak ada hasil signifikan yang salah.
Hubungan dengan Bab 1. Pada tes HIV, arti hasil positif bergantung pada angka kejadian penyakit. Di sini, arti hasil signifikan bergantung pada “angka kejadian” H0 yang benar. Angka itu tidak diketahui, sehingga kita tidak tahu berapa persen hasil ilmiah yang salah.
Bab 6 · hal. 67–82 · ANOVA
ANOVA
Pertanyaan bab ini: bagaimana membandingkan rata-rata lebih dari dua kelompok tanpa terkena masalah uji berulang?
Mengapa perlu ANOVA
Kita ingin tahu pengaruh lokasi terhadap tinggi pohon. Sampel diambil dari tiga wilayah: dekat khatulistiwa, lintang 49, dan lintang 60. Uji t hanya bisa untuk dua kelompok. Kita bisa melakukan tiga uji t untuk semua pasangan, tetapi itu memunculkan masalah uji berulang dari Bab 5.
Analisis varians (ANOVA) memakai satu akal untuk menghindarinya: semua hipotesis alternatif digabung menjadi satu.
H0: ketiga rata-rata sama.
H1: minimal satu rata-rata berbeda dari yang lain.
Istilah yang sama artinya
“Way” sama dengan “factor” (faktor). “Group” sama dengan “treatment” sama dengan “level” (kelompok, perlakuan, taraf). ANOVA satu arah berarti satu faktor, misalnya lokasi, dengan beberapa kelompok.
Logika ANOVA
ANOVA mengandaikan semua kelompok punya varians yang sama. Varians itu ditaksir dengan dua cara:
Dari dalam kelompok. Seberapa tersebar data di sekitar rata-rata kelompoknya masing-masing. Taksiran ini selalu dekat dengan nilai sebenarnya. Ini deraunya.
Dari antar kelompok. Seberapa tersebar rata-rata kelompok di sekitar rata-rata keseluruhan (grand mean). Bila H0 benar, taksiran ini juga dekat dengan nilai sebenarnya. Bila rata-rata kelompok memang berbeda, taksiran ini menjadi terlalu besar.
F = (taksiran varians dari antar kelompok) / (taksiran varians dari dalam kelompok)
Bila H0 benar, kedua taksiran mirip dan F mendekati 1.
Bila kelompok memang berbeda, F besar.
Seperti pada uji t, ada ambang untuk F agar galat Tipe I tetap 5%. Bila F melewati ambang, kita simpulkan ada beda yang signifikan.
Derajat bebasnya ada dua: df₁ = k − 1 dan df₂ = n − k, dengan k jumlah kelompok dan n jumlah seluruh skor. Untuk dua kelompok, ANOVA sama dengan uji t dua ekor: F = t² dan nilai p-nya sama. Jadi ANOVA adalah perluasan uji t.
Yang dikatakan dan tidak dikatakan ANOVA
ANOVA yang signifikan hanya berkata: “minimal satu rata-rata berbeda”. Ia tidak berkata yang mana. Itulah harga dari menggabungkan semua hipotesis alternatif.
Untuk mencari yang mana, dipakai uji lanjutan (post-hoc test), yang pada dasarnya membandingkan pasangan-pasangan rata-rata. Uji lanjutan hanya dilakukan bila ANOVA menemukan efek. Yang sering dipakai: Scheffé, Tukey, dan REGW-Q.
Catatan penyusun atas buku
Buku menyatakan (hal. 71) bahwa uji lanjutan tidak menaikkan galat Tipe I karena hanya dijalankan setelah ANOVA signifikan. Ini penyederhanaan. Uji seperti Tukey dan Scheffé punya koreksinya sendiri untuk perbandingan berulang.
Syarat ANOVA
Sampel saling bebas.
Populasi berdistribusi lonceng.
Variabel bebas berupa kategori; variabel terikat berupa angka kontinu.
Semua kelompok punya varians yang sama.
Ukuran sampel ditetapkan sebelum eksperimen.
Contoh hitung: turnamen tiga jenis pedang
Lima belas petarung dibagi ke tiga jenis pedang, lima orang tiap jenis. Yang dicatat adalah jumlah kemenangan.
Nilai F. 35/3,83 = 9,14. Program statistik memberi p = 0,0039.
SS berarti jumlah kuadrat (sum of squares) dan MS berarti kuadrat rata-rata (mean square), yaitu SS dibagi derajat bebasnya. F = 9,14 berarti sebaran rata-rata kelompok 9 kali lebih besar daripada sebaran data di dalam kelompok. Hasil ini ditulis: F(2, 12) = 9,14, p = 0,0039. Kesimpulannya: minimal satu jenis pedang memberi jumlah kemenangan yang berbeda.
Uji lanjutan Scheffé. Tiap pasangan dibandingkan dengan ANOVA kecil, tetapi tetap memakai MSwithin = 3,83 dan df dari ANOVA utama.
Perbandingan
F(2, 12)
p
Signifikan?
Light saber lawan katana
0,33
0,728
Tidak
Light saber lawan belati elf
5,22
0,023
Ya
Katana lawan belati elf
8,16
0,006
Ya
Jadi belati elf berbeda dari dua pedang lainnya, sedangkan light saber dan katana tidak terbukti berbeda.
Ukuran efek η²
Seperti pada uji t, nilai p ANOVA mencampur ukuran efek dan ukuran sampel. Ukuran efek ANOVA adalah η² (eta kuadrat): bagian dari seluruh keragaman data yang dijelaskan oleh perbedaan kelompok.
η² = SSbetween / SStotal = 70 / (70 + 46) = 0,60
Artinya 60% keragaman jumlah kemenangan dijelaskan oleh jenis pedang. Menurut patokan di buku (Tabel 6.2), 0,01 kecil, 0,09 sedang, dan 0,25 besar. Jadi ini efek besar.
Catatan penyusun atas buku
Banyak sumber lain memakai patokan η² 0,01 / 0,06 / 0,14. Saat melaporkan, sebutkan patokan mana yang dipakai.
ANOVA dua arah dan interaksi
Sekarang ada dua faktor. Contoh buku: sekelompok pahlawan super ingin tahu bahan kostum mana yang terbaik untuk menangkap penjahat (spandex, katun, atau kulit), dan apakah itu bergantung pada waktu (siang atau malam). Tiap kombinasi diisi lima orang yang berbeda. Yang dihitung adalah jumlah penjahat yang tertangkap.
Ada tiga hipotesis yang diuji, masing-masing dengan F sendiri:
Efek utama waktu. Apakah siang berbeda dari malam, bila semua bahan dirata-ratakan?
Efek utama bahan. Apakah ada bahan yang berbeda, bila siang dan malam dirata-ratakan?
Interaksi. Apakah pengaruh waktu bergantung pada bahan?
Rata-rata penjahat tertangkap
Spandex
Katun
Kulit
Rata-rata waktu
Siang
14
10
5
9,7
Malam
5
10
15
10
Rata-rata bahan
9,5
10
10
Lihat baris dan kolom rata-rata. Rata-rata tiga bahan hampir sama (9,5; 10; 10). Rata-rata siang dan malam juga hampir sama (9,7 dan 10). Seolah-olah bahan dan waktu tidak berpengaruh.
Sekarang lihat isi tabelnya. Spandex unggul pada siang hari (14 lawan 5). Kulit unggul pada malam hari (15 lawan 5). Katun selalu di tengah. Pengaruh bahan bergantung pada waktu. Itulah interaksi.
Sumber
SS
df
MS
F
p
η²
Bahan kostum
1,67
2
0,83
0,083
0,920
0,0069
Waktu
0,83
1
0,83
0,083
0,775
0,0035
Bahan × waktu
451,67
2
225,83
22,58
0,000003
0,6530
Galat (error)
240,00
24
10,00
Tabel keluaran program (Tabel 6.3 di buku) menunjukkan hal yang sama: kedua efek utama tidak signifikan, interaksinya sangat signifikan.
Pelajaran dari contoh ini:
Bila hanya dilakukan dua ANOVA satu arah yang terpisah, kita tidak akan menemukan apa-apa. Rancangan dua faktor menampakkan pola yang sebenarnya.
Faktor kedua bisa menjelaskan sebagian keragaman yang tadinya dianggap derau, sehingga daya uji naik.
Tetapi menambah faktor terus-menerus tidak selalu baik. Tiap rata-rata dihitung dari lebih sedikit skor, sehingga daya uji turun. Makin banyak faktor, makin besar sampel yang dibutuhkan.
Bila interaksi signifikan, jangan menyimpulkan efek utama. Efek satu faktor berubah menurut taraf faktor lain.
ANOVA dua arah juga membawa kembali masalah uji berulang. ANOVA 2 × 2 menghasilkan tiga nilai p. Pada data yang sama sekali tanpa efek, peluang minimal satu p di bawah 0,05 adalah 14%. Bila ANOVA dipakai untuk “mencari-cari” hasil signifikan, galat Tipe I lebih tinggi dari yang disangka.
ANOVA pengukuran berulang
ANOVA yang dibahas sejauh ini adalah perluasan uji t dua sampel. Ada juga perluasan uji t berpasangan, yaitu repeated measures ANOVA. Dipakai bila orang yang sama diukur beberapa kali, misalnya kesehatan pasien sebelum, selama, dan sesudah terapi.
Daya ujinya lebih tinggi daripada ANOVA biasa. Sebabnya, perbedaan dibandingkan dulu di dalam tiap pasien, sehingga perbedaan menetap antar pasien dikeluarkan dari galat.
Pesan utama bab ini
Dengan ANOVA, masalah uji berulang bisa dihindari, sampai batas tertentu.
Menambah faktor bisa menaikkan atau menurunkan daya uji.
Tugas Bab 6
Tugas 6.1 · ANOVA satu arah dengan tangan
Jumlah kemenangan lima petarung per jenis pedang. Light saber: 6, 8, 5, 4, 2. Katana: 6, 5, 9, 4, 6. Belati elf: 0, 4, 0, 1, 0. Hitung rata-rata tiap kelompok, SS dalam kelompok, rata-rata keseluruhan, SS antar kelompok, kedua MS, F, dan η².
Sumber: Bab 6.5.1 dan 6.6, Gambar 6.3, hal. 72–77
Lihat pembahasan
Rata-rata kelompok. 25/5 = 5; 30/5 = 6; 5/5 = 1.
SS dalam tiap kelompok (kuadrat selisih tiap skor dari rata-rata kelompoknya).
F = 35/3,83 = 9,14. Program statistik memberi 9,13 karena buku membulatkan MSwithin. p = 0,0039, jadi signifikan.
η² = 70/(70 + 46) = 0,60. Efek besar.
Bila memakai R: summary(aov(menang ~ pedang)).
Tugas 6.2 · Uji lanjutan Scheffé
Pakai hasil Tugas 6.1 (MSwithin = 3,83; df antar kelompok = 2). Hitung F Scheffé untuk light saber lawan belati elf. Langkahnya: hitung rata-rata gabungan kedua kelompok, hitung SS antar kedua kelompok terhadap rata-rata itu, bagi dengan 2, lalu bagi dengan 3,83.
Sumber: Bab 6.5.2, Gambar 6.4 dan Tabel 6.1, hal. 74–76
MS antar kelompok. 40/2 = 20. Pembaginya tetap 2, yaitu df antar kelompok dari ANOVA utama.
F. 20/3,83 = 5,22. Dengan df (2, 12), p = 0,023. Signifikan.
Dua perbandingan lain. Light saber lawan katana: rata-rata gabungan 5,5; SS = 5 × 0,5² + 5 × 0,5² = 2,5; F = 1,25/3,83 = 0,33; p = 0,728. Katana lawan belati elf: rata-rata gabungan 3,5; SS = 5 × 2,5² + 5 × 2,5² = 62,5; F = 31,25/3,83 = 8,16; p = 0,006.
Kesimpulan. Belati elf berbeda dari kedua pedang lain. Light saber dan katana tidak terbukti berbeda. Ingat Bab 3: “tidak terbukti berbeda” bukan berarti “sama”.
Tugas 6.3 · Membaca interaksi
Rata-rata penjahat tertangkap. Siang: spandex 14, katun 10, kulit 5. Malam: spandex 5, katun 10, kulit 15. (a) Hitung rata-rata tiap bahan dan tiap waktu. (b) Apakah ada efek utama bahan? Efek utama waktu? (c) Apakah ada interaksi? (d) Bahan mana yang Anda sarankan?
Sumber: Bab 6.7, Gambar 6.6, Gambar 6.7, dan Tabel 6.3, hal. 77–81
(b) Rata-rata bahan hampir sama, jadi tidak ada efek utama bahan (F = 0,083; p = 0,920). Rata-rata waktu hampir sama, jadi tidak ada efek utama waktu (F = 0,083; p = 0,775).
(c) Ada, dan sangat kuat (F = 22,58; p = 0,000003; η² = 0,65). Bila digambar, garis siang turun dari spandex ke kulit dan garis malam naik. Kedua garis bersilangan.
(d) Tidak ada satu bahan terbaik. Spandex untuk siang, kulit untuk malam. Inilah sebabnya efek utama tidak boleh disimpulkan sendiri bila ada interaksi: kalimat “bahan tidak berpengaruh” sangat menyesatkan di sini.
Tugas 6.4 · Alarm palsu pada ANOVA 2 × 2
ANOVA 2 × 2 dijalankan pada data yang benar-benar tanpa efek. (a) Berapa nilai p yang dihasilkan? (b) Berapa peluang minimal satu di antaranya di bawah 0,05? (c) Bagaimana menghindari jebakan ini?
Sumber: Bab 6.7, hal. 80; Bab 11.3.5, hal. 129
Lihat pembahasan
(a) Tiga: dua efek utama dan satu interaksi.
(b) 1 − 0,95³ = 0,14, atau 14%. Hampir tiga kali dari 5%.
(c) Tentukan sebelum melihat data uji mana yang memang relevan untuk pertanyaan penelitian, dan abaikan hasil uji lain yang ikut dikeluarkan program.
Bab 7 · hal. 83–94 · Experimental Design: Model Fits, Power, and Complex Designs
Rancangan penelitian dan daya uji
Pertanyaan bab ini: bagaimana merancang eksperimen supaya uji berulang tidak diperlukan, dan bagaimana mengetahui peluang eksperimen itu berhasil?
Tidak semua data harus diuji
ANOVA adalah satu cara menghadapi uji berulang. Cara yang lebih sederhana adalah menghindarinya lewat rancangan yang cerdik.
Contoh: percobaan belajar. Peserta berlatih tugas visual selama 10 blok, tiap blok 80 percobaan. Untuk tiap blok dihitung persen benar. H0: tidak ada pembelajaran, kinerja sama di semua blok.
Yang pertama terpikir adalah ANOVA pengukuran berulang dengan 10 taraf. Menurut buku ini bukan pilihan yang baik, karena tiga alasan:
ANOVA memperlakukan blok sebagai kategori tanpa urutan. Padahal urutan blok adalah inti dari “belajar”.
Bila kinerja naik selama lima blok lalu turun lagi, ANOVA tetap bisa signifikan. Itu bukan belajar.
Daya ujinya turun.
Pilihan yang lebih baik:
Blok pertama lawan blok terakhir, dengan uji t berpasangan. Blok di tengah tetap perlu untuk proses belajar, tetapi tidak ikut diuji. Kekurangannya: data belajar berderau, sehingga daya ujinya rendah.
Rata-rata dua blok pertama lawan rata-rata dua blok terakhir. Deraunya lebih kecil.
Mencocokkan model (model fit). Untuk tiap peserta, cocokkan garis lurus y = m·x + b pada kesepuluh bloknya. Kemiringan m menyatakan seberapa cepat ia belajar. H0: m = 0. Bila ada 12 peserta, kita punya 12 nilai m, lalu dilakukan satu uji t satu sampel terhadap nol. Semua data terpakai dan hanya ada satu uji.
Cara ini luwes. Bila belajar mengikuti kurva eksponensial, cocokkan kurva eksponensial. Untuk gejala yang berulang, seperti suhu dalam sehari atau jumlah serangga dalam setahun, cocokkan fungsi sinus.
Syaratnya satu: cara analisis dipilih sebelum eksperimen dijalankan. Tidak boleh mencoba berbagai cara setelah melihat data sampai ada yang signifikan.
Pedoman umumnya: pikirkan apa pertanyaan utama eksperimen, lalu pilih variabel yang paling tepat menjawabnya. Makin sederhana rancangan dan makin sedikit variabel, makin baik.
Memperbesar peluang berhasil
Eksperimen memakan banyak tenaga. Sebelum mulai, layak diperkirakan apakah ia punya peluang berhasil, yaitu menghasilkan t yang besar. Ingat t = d × √(n/2). Ada dua jalan.
Pertama, perbesar ukuran efek δ = (μ₁ − μ₂)/σ.
Perbesar selisih rata-rata. Pilih rangsangan atau tes yang paling tajam membedakan.
Perkecil σ. Kalibrasi alat tiap hari. Seragamkan keadaan: uji pasien pada jam yang sama, samakan asupan kopi, pakai penguji yang sama. Batasi umur agar pengaruh penyakit tidak tercampur pengaruh usia. Tetapi ingat: makin seragam sampel, makin sempit keberlakuan hasilnya (Bab 3, Implikasi 4).
Kedua, perbesar ukuran sampel n. Dengan n yang cukup besar, efek kecil pun terdeteksi. Ini hanya masuk akal bila efek sekecil itu memang penting. Tidak ada gunanya sampel raksasa untuk efek yang remeh.
Menghitung daya uji
Walau efeknya nyata, eksperimen tidak selalu signifikan, karena sampel yang sedikit. Daya uji (power) adalah peluang eksperimen menghasilkan hasil signifikan bila efeknya memang ada. Daya uji sama dengan Hit rate.
Untuk menghitungnya kita butuh satu angka ukuran efek populasi. Dari mana? Dari studi sebelumnya tentang gejala yang sama, dari model yang meramalkan hasilnya, atau dari besar efek yang dianggap penting dalam praktik.
Setelah itu perhitungan diserahkan ke program. Buku memakai program gratis G*Power.
Contoh di buku
Ukuran efek 0,55; uji t dua sampel dua ekor; α = 0,05; 40 orang per kelompok. Hasilnya daya uji 0,68. Artinya ada peluang 68% hasilnya signifikan, dan 32% tidak signifikan walau efeknya ada.
Bila kita menginginkan daya uji 0,90, program menghitung balik: dibutuhkan 71 orang per kelompok.
Kedua angka ini bisa Anda lihat sendiri di penggeser pada Bab 3.
Menghitung ukuran sampel seperti ini adalah bagian penting dari rancangan. Sayangnya banyak ilmuwan menjalankan eksperimen tanpa analisis daya uji, karena tidak punya gambaran ukuran efek. Eksperimen seperti itu bisa saja berguna, tetapi berhasil atau tidaknya soal untung-untungan.
Buku membedakan dua jenis kerja. Kerja eksploratif mencari-cari tanpa perkiraan ukuran efek. Kerja konfirmatif hampir selalu dibangun di atas pengetahuan tentang ukuran efek, yang dipakai untuk merancang eksperimen berdaya uji tinggi. Banyak ilmuwan mengira sedang melakukan kerja konfirmatif padahal eksploratif.
Daya uji pada rancangan yang rumit
Daya uji yang dihitung sebelum data diambil disebut a priori. Daya uji juga bisa dihitung sesudahnya dari ukuran efek yang diperoleh; ini disebut post hoc. Untuk satu uji t, daya uji post hoc tidak memberi informasi baru: bila p = 0,05 daya ujinya kira-kira 0,5; bila p di atas 0,05 daya ujinya di bawah 0,5; bila p di bawah 0,05 daya ujinya di atas 0,5.
Daya uji post hoc baru berguna bila sebuah klaim bertumpu pada banyak uji sekaligus. Caranya dengan simulasi: buat ribuan set data tiruan sesuai rancangan dan ukuran sampel, analisis semuanya dengan cara yang sama, lalu hitung seberapa sering semua hasil yang dibutuhkan muncul bersama. Buku menyebutnya peluang sukses.
Contoh di buku: bernapas lewat hidung dan daya ingat
Sebuah studi tahun 2017 menyimpulkan bahwa gambar lebih diingat bila disajikan saat peserta menarik napas lewat hidung, dan tidak bila bernapas lewat mulut. Tiap kelompok berisi 11 orang. Kesimpulan itu bertumpu pada enam uji: empat harus signifikan dan dua harus tidak signifikan.
Uji
Hasil yang dibutuhkan
Peluang
Hidung: efek utama fase napas
Signifikan
0,690
Hidung, saat mengingat: efek fase napas
Signifikan
0,655
Mulut, saat mengingat: efek fase napas
Tidak signifikan
0,809
Hidung lawan mulut secara keseluruhan
Tidak signifikan
0,820
Saat menyimpan: interaksi fase × jalur napas
Signifikan
0,604
Saat mengingat: interaksi fase × jalur napas
Signifikan
0,708
Keenamnya sekaligus
0,216
Tiap uji punya peluang 0,60 sampai 0,82. Tetapi peluang keenamnya cocok sekaligus hanya 0,216. Jadi walau efeknya nyata dan sebesar yang dilaporkan, pengulangan dengan ukuran sampel serupa kemungkinan besar gagal memberi pola yang sama.
Bisakah diperbaiki dengan menambah sampel? Hanya sebagian. Untuk empat uji yang harus signifikan, peluangnya naik bersama n. Untuk dua uji yang harus tidak signifikan, peluangnya justru turun, karena dengan sampel besar efek kecil pun menjadi signifikan. Peluang sukses keseluruhan paling tinggi hanya 0,37, pada sekitar 20 orang per kelompok.
Buku juga mencatat dua kesalahan tafsir dalam studi itu. Uji kedua dan ketiga dipakai untuk menunjukkan beda antara kelompok hidung dan mulut; itu “beda signifikansi”, bukan beda yang signifikan (Bab 3, Implikasi 3b). Uji keempat yang tidak signifikan ditafsirkan sebagai “tidak ada beda” (Implikasi 3a).
Kesimpulannya: makin banyak syarat yang harus dipenuhi satu set data, makin kecil peluang semuanya terpenuhi. Rancangan sederhana lebih baik.
Pesan utama bab ini
Buat rancangan sederhana. Pertimbangkan meringkas data mentah menjadi variabel antara, lalu uji variabel itu.
Lakukan analisis daya uji sebelum eksperimen, untuk memeriksa apakah ada peluang nyata menemukan efek yang ada.
Buat rancangan sederhana. Bila sebuah teori menuntut hasil signifikan dan hasil tidak signifikan sekaligus, daya ujinya bisa turun banyak.
Tugas Bab 7
Tugas 7.1 · Menganalisis percobaan belajar
Dua belas peserta berlatih selama 10 blok. Anda ingin menguji apakah terjadi pembelajaran. (a) Sebutkan tiga alasan buku menolak ANOVA pengukuran berulang dengan 10 taraf. (b) Jelaskan langkah analisis dengan mencocokkan garis. Apa H0-nya, uji apa yang dipakai, dan berapa df-nya? (c) Kapan cara analisis harus diputuskan?
Sumber: Bab 7.1, Gambar 7.1, hal. 83–86
Lihat pembahasan
(a) ANOVA memperlakukan blok sebagai kategori tanpa urutan. ANOVA bisa signifikan untuk pola naik lalu turun, yang bukan belajar. Daya ujinya turun.
(b) Untuk tiap peserta, cocokkan garis y = m·x + b pada sepuluh nilai persen benarnya. Ambil kemiringan m dan abaikan b. Hasilnya 12 nilai m. H0: rata-rata m = 0. Lakukan uji t satu sampel terhadap nol, dengan df = 12 − 1 = 11.
(c) Sebelum eksperimen dijalankan. Mencoba beberapa cara setelah melihat data lalu memilih yang signifikan menaikkan galat Tipe I.
Tugas 7.2 · Membaca analisis daya uji
Buka penggeser “Coba sendiri” di Bab 3 dan tekan contoh d = 0,55; n = 40. (a) Berapa daya ujinya dan apa artinya dalam kalimat biasa? (b) Geser n sampai daya uji mencapai 0,90. Berapa n-nya? (c) Seorang rekan berkata: “Saya tidak tahu ukuran efeknya, jadi saya ambil 20 orang saja dan lihat hasilnya.” Apa tanggapan buku?
Sumber: Bab 7.2.2, Gambar 7.2 dan 7.3, hal. 87–90
Lihat pembahasan
(a) Daya uji 0,68. Bila efeknya benar sebesar 0,55 dan eksperimen ini diulang berkali-kali, 68% ulangan akan signifikan dan 32% tidak. Satu dari tiga eksperimen akan “gagal” walau efeknya nyata.
(b) Sekitar 71 orang per kelompok. G*Power memberi angka 71.
(c) Tanpa ukuran efek yang beralasan, analisis daya uji tidak bisa dilakukan, dan yang tersisa hanya berharap. Bila hasilnya tidak signifikan, ia tidak punya dasar untuk kecewa, karena tidak pernah ada alasan untuk mengira 20 orang cukup. Itu kerja eksploratif, bukan konfirmatif.
Tugas 7.3 · Studi pernapasan dan daya ingat
Peluang enam uji dalam studi itu adalah 0,690; 0,655; 0,809; 0,820; 0,604; 0,708. (a) Bila keenam uji saling bebas, berapa peluang semuanya cocok? (b) Simulasi di buku memberi 0,216. Mengapa berbeda? (c) Mengapa menambah sampel tidak bisa menaikkan peluang sukses di atas kira-kira 0,37? (d) Sebutkan dua kesalahan tafsir dalam studi itu.
Sumber: Bab 7.3, Tabel 7.1 dan Gambar 7.4, hal. 90–93
(b) Keenam uji memakai data yang sama, jadi tidak saling bebas. Hasil satu uji berkaitan dengan hasil uji lain. Karena itu peluang bersama harus dihitung dengan simulasi, dan hasilnya 0,216. Kedua angka sama-sama jauh di bawah peluang tiap uji.
(c) Dua dari enam uji harus tidak signifikan. Dengan sampel besar, selisih kecil pun menjadi signifikan, sehingga peluang kedua uji itu “berhasil” turun. Peluang empat uji lainnya naik. Gabungannya mencapai puncak 0,37 di sekitar 20 orang per kelompok.
(d) Pertama, membandingkan “signifikan pada kelompok hidung” dengan “tidak signifikan pada kelompok mulut”: beda signifikansi bukan beda yang signifikan. Kedua, menafsirkan hasil tidak signifikan antara kedua kelompok sebagai “tidak ada beda”: tidak ada bukti bukan bukti tidak ada.
Bab 8 · hal. 95–102 · Correlation
Korelasi
Pertanyaan bab ini: bagaimana menguji hubungan antara dua variabel yang sama-sama berupa angka, misalnya lintang dan tinggi pohon?
Mengapa korelasi
Di Bab 3 tinggi pohon dibandingkan di 2 lokasi, dan di Bab 6 di 3 lokasi. Cara yang lebih baik adalah mengukur pohon di banyak lintang. ANOVA tidak cocok untuk itu, karena ANOVA memperlakukan lokasi sebagai kategori tanpa urutan. Padahal lintang adalah angka berskala rasio. Korelasi memakai informasi itu dan merangkum hubungan menjadi satu angka, r.
Kovarians dan korelasi
Bayangkan grafik dengan lintang di sumbu x dan tinggi pohon di sumbu y. Tiap titik adalah satu pohon.
Bila semua titik jatuh pada garis lurus yang menurun, korelasinya negatif sempurna (r = −1).
Bila titik-titik membentuk awan tanpa arah, tidak ada korelasi (r = 0).
Bila semua titik jatuh pada garis lurus yang menaik, korelasinya positif sempurna (r = +1).
Kovarians punya kelemahan: nilainya bergantung pada satuan. Tinggi pohon dalam sentimeter memberi kovarians lebih besar daripada dalam meter. Karena itu kovarians dibagi dengan simpangan baku x dan y. Hasilnya adalah korelasi Pearson:
r = cov(x, y) / (sx × sy), nilainya antara −1 dan +1
Menguji korelasi
H0: korelasi di populasi nol (ρ = 0). Bila H0 benar, galat baku korelasi sampel adalah:
sr = √( (1 − r²) / (n − 2) )
t = r / sr, dengan df = n − 2
Contoh buku: 50 pohon dari berbagai lintang memberi r = −0,312. Keluaran programnya: t = −2,28; df = 48; p = 0,027. Karena p di bawah 0,05, korelasinya signifikan. Tanda negatif berarti pohon yang lebih tinggi ada di lintang yang lebih rendah.
Menafsirkan korelasi
Korelasi yang signifikan tidak berarti x menyebabkan y. Rumus kovarians tetap sama bila x dan y ditukar. Ada empat kemungkinan penjelasan:
x menyebabkan y.
y menyebabkan x.
Ada variabel ketiga z yang menyebabkan x dan y. Contoh: bukan lintang yang menentukan tinggi pohon, melainkan hal yang berkaitan dengan lintang, seperti ketersediaan air.
Korelasinya semu, muncul kebetulan. Contoh: selama 2000–2009, konsumsi keju per orang di Amerika Serikat berkorelasi r = 0,947 dengan jumlah orang yang meninggal terlilit seprai. Korelasi semu pasti ditemukan bila kita menelusuri data yang cukup banyak.
Tiga hal lain yang perlu diingat:
Korelasi hanya mengukur hubungan garis lurus. Korelasi yang tidak signifikan tidak berarti tidak ada hubungan. Suhu udara naik dan turun mengikuti jam, tetapi korelasi antara jam dan suhu bisa mendekati nol.
Selalu lihat grafiknya. Empat set data Anscombe (Anscombe's quartet) tampak sangat berbeda bila digambar, tetapi semuanya punya r = 0,816. Nilai r saja adalah informasi sebagian.
Korelasi peka terhadap pencilan (outlier). Pada contoh buku, satu titik tambahan mengubah r dari 0,71 menjadi 0,44.
Ukuran efek
Korelasi sendiri sering dipakai sebagai ukuran efek. Kuadratnya, r², menyatakan bagian keragaman satu variabel yang dijelaskan oleh variabel lain. Ini sejenis dengan η² di Bab 6. Patokan Cohen untuk besar r tanpa memandang tanda: 0,1 kecil, 0,3 sedang, 0,5 besar.
Dibandingkan dengan cara lain
Mencocokkan garis (Bab 7). Menguji apakah kemiringan garis bukan nol memberi hasil yang sama dengan menguji apakah korelasi bukan nol.
ANOVA. ANOVA memperlakukan variabel bebas sebagai kategori. Korelasi memakai sifat skala rasio, sehingga daya ujinya lebih tinggi.
Uji t setelah data dibelah dua. Kita bisa membagi 50 pohon tadi menjadi separuh lintang rendah dan separuh lintang tinggi, lalu melakukan uji t. Hasilnya t(48) = 1,68; p = 0,0996. Tidak signifikan, padahal korelasinya signifikan. Membelah data membuang informasi.
Dalam arti tertentu, korelasi adalah perluasan dari ANOVA dan uji t.
Syarat dan peringatan
Data saling bebas dan berasal dari distribusi yang sama.
Untuk tiap nilai x, nilai-nilai y berdistribusi lonceng.
Kedua variabel berskala interval atau rasio.
Ukuran sampel ditetapkan sebelum eksperimen.
Untuk data ordinal, pakai korelasi Spearman ρ, yang menghitung dari peringkat. Spearman adalah padanan non-parametrik dari Pearson.
Regresi secara singkat
Korelasi memberi tahu seberapa rapat titik-titik mengelilingi garis terbaik. Regresi memberi tahu persamaan garis itu: y = m·x + b.
kemiringan m = r × sy / sx titik potong b = ȳ − m × x̄
Program statistik juga memberi nilai t dan p untuk kemiringan dan titik potong. Keduanya menguji H0 bahwa nilainya nol. Bila kemiringan signifikan, biasanya korelasinya juga signifikan. Bagian ini boleh dilewati; regresi tidak dipakai di bab-bab berikutnya.
Catatan penyusun atas buku
Tabel 8.3 (hal. 102) menulis titik potong 12,146 dan kemiringan −0,147. Angka itu tidak cocok dengan Gambar 8.2, yang garisnya mulai di sekitar 5,5 m dan hanya turun kira-kira 0,3 m sepanjang 67 derajat lintang. Nilai t dan p untuk kemiringan (−2,275 dan 0,027) cocok dengan uji korelasinya.
Pesan utama bab ini
Korelasi adalah pilihan yang dianjurkan bila sumbu x dan sumbu y sama-sama berskala rasio atau interval.
Jangan pernah mencampuradukkan sebab-akibat dengan korelasi.
Set data yang sangat berbeda bisa menghasilkan r yang sama.
Tugas Bab 8
Tugas 8.1 · Menguji korelasi dengan tangan
Dari 50 pohon diperoleh r = −0,312. (a) Hitung galat baku sr, nilai t, dan df. (b) Ambang dua ekor untuk df = 48 kira-kira ±2,01. Apakah korelasinya signifikan? (c) Hitung r² dan tafsirkan. (d) Menurut patokan Cohen, efek ini kecil, sedang, atau besar?
Sumber: Bab 8.2 dan 8.4, Persamaan 8.3–8.4, Tabel 8.1 dan 8.2, hal. 96–100
(b) Ya. Besar t (2,28) melebihi 2,01. Program memberi p = 0,027.
(c) r² ≈ 0,10. Sekitar 10% keragaman tinggi pohon dijelaskan oleh lintang. Sisanya 90% berasal dari hal lain.
(d) Sedang, karena besar r sedikit di atas 0,3.
Catatan. Signifikan tidak berarti lintang menyebabkan pohon lebih pendek. Yang berpengaruh langsung mungkin hal yang berkaitan dengan lintang, seperti ketersediaan air.
Tugas 8.2 · Empat penjelasan untuk satu korelasi
Untuk tiap temuan, tentukan penjelasan yang paling mungkin menurut buku. (a) Konsumsi keju berkorelasi 0,947 dengan kematian akibat terlilit seprai. (b) Lintang berkorelasi negatif dengan tinggi pohon. (c) Korelasi antara jam dan suhu udara mendekati nol; peneliti menyimpulkan suhu tidak bergantung pada jam.
Sumber: Bab 8.3, hal. 98
Lihat pembahasan
(a) Korelasi semu. Tidak ada kaitan apa pun; dengan data yang cukup banyak, korelasi tinggi seperti ini pasti muncul kebetulan.
(b) Variabel ketiga. Lintang sendiri tidak menentukan tinggi pohon. Hal-hal yang berubah bersama lintang, misalnya ketersediaan air, yang berpengaruh langsung.
(c) Kesimpulannya salah. Korelasi hanya mengukur hubungan garis lurus. Suhu naik dan turun dalam satu siklus siang-malam. Hubungannya kuat dan teratur, tetapi tidak lurus, sehingga r bisa mendekati nol.
Tugas 8.3 · Korelasi lawan belah dua
Data 50 pohon dianalisis dengan dua cara. Cara pertama: korelasi, hasilnya r = −0,312; p = 0,027. Cara kedua: data dibelah dua di median lintang lalu diuji dengan uji t, hasilnya t(48) = 1,68; p = 0,0996. (a) Mengapa hasilnya berbeda? (b) Cara mana yang dianjurkan buku? (c) Mengapa Anda tetap harus menggambar datanya?
Sumber: Bab 8.5 dan 8.3, Gambar 8.3–8.5, hal. 98–101
Lihat pembahasan
(a) Saat data dibelah dua, pohon di lintang 5 dan pohon di lintang 30 diperlakukan sama, yaitu “kelompok lintang rendah”. Informasi tentang seberapa jauh lintangnya dibuang. Korelasi memakai informasi itu, sehingga daya ujinya lebih tinggi.
(b) Korelasi. Bila variabel bebas berskala rasio, analisis korelasi lebih baik daripada uji t atau ANOVA.
(c) Karena r hanya satu angka. Empat set data Anscombe punya r = 0,816 tetapi bentuknya sangat berbeda, dan satu pencilan bisa mengubah r dari 0,71 menjadi 0,44. Tanpa grafik, kita tidak tahu apakah r mewakili pola datanya.
Bab 9 · hal. 105–110 · Meta-analysis
Meta-analisis
Pertanyaan bab ini: bagaimana menggabungkan hasil beberapa eksperimen menjadi satu taksiran efek yang lebih baik?
Pembuka Bagian III
Bagian III buku menunjukkan bahwa melihat beberapa eksperimen sekaligus memberi wawasan baru. Tiap eksperimen mungkin tampak wajar bila dilihat sendiri. Tetapi gabungannya bisa menunjukkan masalah. Seberapa mungkin empat eksperimen dengan efek kecil dan sampel kecil semuanya signifikan? Sering kali sangat tidak mungkin. Data seperti itu terlalu bagus untuk benar.
Untuk sampai ke sana, kita perlu dua alat: ukuran efek terstandar (bab ini) dan daya uji (Bab 7).
Ukuran efek terstandar
Untuk uji t dua sampel, perbandingan sinyal terhadap derau adalah Cohen's d = (x̄₁ − x̄₂)/s. Selisih yang lebih besar lebih mudah dideteksi; simpangan baku yang lebih besar membuatnya lebih sulit.
Dari Bab 3 kita tahu t = d × √(n/2). Banyak artikel hanya melaporkan t dan p. Dari t dan n kita bisa menghitung balik:
d = t × √(2/n)
Besar d tidak bergantung pada ukuran sampel, karena d menaksir satu angka tetap di populasi. Angka n dalam rumus hanya mengimbangi t yang membesar bersama n.
Pada sampel kecil, d cenderung menaksir terlalu tinggi. Koreksinya disebut Hedges' g:
g = ( 1 − 3 / (4 × (2n − 2) − 1) ) × d
Untuk hampir semua keperluan praktis, g bisa dianggap sama dengan d. Buku memperkenalkannya karena g dipakai dalam meta-analisis.
Meta-analisis
Bila eksperimen yang sama atau sangat mirip dilakukan beberapa kali, hasilnya bisa digabung untuk kesimpulan yang lebih kuat dan daya uji yang lebih tinggi. Penggabungan ini disebut meta-analisis.
Contoh buku: lima studi yang menyimpulkan bahwa memegang uang mengurangi rasa tertekan akibat dikucilkan. Semuanya memakai uji t dua sampel.
n per kelompok
t
g
varians vg
bobot w
w × g
36
3,01
0,702
0,058
17,3
12,15
36
2,08
0,485
0,056
17,9
8,66
36
2,54
0,592
0,057
17,6
10,43
46
3,08
0,637
0,045
22,2
14,17
46
3,49
0,722
0,046
21,9
15,83
Studi dengan sampel lebih besar harus dihitung lebih berat. Caranya: tiap g diberi bobot w = 1/vg, yaitu kebalikan variansnya. Makin besar sampel, makin kecil varians, makin besar bobot.
g* = jumlah (w × g) / jumlah w = 0,632
g* = 0,632 adalah taksiran terbaik ukuran efek dari kelima eksperimen.
Kapan boleh digabung? Bila secara teori kelima eksperimen mengukur efek yang pada dasarnya sama. Menggabungkan eksperimen yang mengukur hal yang sangat berbeda tidak bermakna.
Dari lampiran bab
Ukuran sampel tidak sama. d = t × √((n₁ + n₂)/(n₁ × n₂)).
Uji t satu sampel. d = (x̄ − a)/s, dengan a angka pembanding dari H0.
Uji t berpasangan. Bila ingin ukuran efek yang setara dengan uji dua sampel, korelasi r antara dua pengukuran harus diperhitungkan: d = (t/√n) × √(2 × (1 − r)). Sayangnya kebanyakan artikel tidak melaporkan r.
Hati-hati dengan rumus di internet. Banyak yang diam-diam mengandaikan ukuran sampel sama, atau r = 0,5 untuk uji berpasangan.
Menurut buku, gagasan ukuran efek terstandar lebih penting daripada rincian rumusnya.
Pesan utama bab ini
Menggabungkan ukuran efek dari beberapa eksperimen menghasilkan taksiran yang lebih baik.
Menggabungkan data dari beberapa eksperimen menaikkan daya uji.
Tugas Bab 9
Tugas 9.1 · Dari t ke d ke g
Dua studi masing-masing memakai 36 orang per kelompok. Studi pertama melaporkan t = 3,01 dan studi kedua t = 2,08. Hitung Cohen's d dan Hedges' g untuk keduanya.
Hasilnya cocok dengan Tabel 9.1. Koreksinya hanya sekitar 1%, jadi d dan g hampir sama.
Tugas 9.2 · Ukuran efek gabungan
Lima studi punya g = 0,702; 0,485; 0,592; 0,637; 0,722 dengan bobot w = 17,3; 17,9; 17,6; 22,2; 21,9. (a) Hitung g*. (b) Mengapa dua studi terakhir bobotnya lebih besar? (c) Kapan penggabungan seperti ini tidak boleh dilakukan?
Sumber: Bab 9.2 dan Tabel 9.2, hal. 107–110
Lihat pembahasan
(a) Hitung w × g tiap studi: 12,15; 8,66; 10,43; 14,17; 15,83. Jumlahnya 61,24. Jumlah bobot: 96,9.
g* = 61,24 / 96,9 = 0,632
(b) Dua studi terakhir punya 46 orang per kelompok, bukan 36. Sampel lebih besar memberi varians lebih kecil, dan bobot adalah kebalikan varians.
(c) Bila eksperimen-eksperimen itu mengukur efek yang berbeda. Keputusan ini soal teori, bukan soal hitungan.
Tugas 9.3 · Asumsi yang tersembunyi
Sebuah artikel dengan rancangan sebelum-sesudah hanya melaporkan t dan n. Anda ingin memasukkannya ke meta-analisis bersama studi dua kelompok. Apa yang kurang, dan apa bahayanya memakai kalkulator daring?
Sumber: Bab 9, Appendix, hal. 108–109
Lihat pembahasan
Agar setara dengan ukuran efek dua kelompok, rumusnya d = (t/√n) × √(2 × (1 − r)). Yang kurang adalah r, yaitu korelasi antara pengukuran sebelum dan sesudah. Kebanyakan artikel tidak melaporkannya.
Banyak kalkulator daring diam-diam mengisi r = 0,5, atau mengandaikan ukuran sampel sama. Bila anggapan itu tidak cocok dengan studinya, d yang keluar keliru tanpa ada peringatan.
Bab 10 · hal. 111–121 · Understanding Replication
Memahami replikasi
Pertanyaan bab ini: bila sebuah temuan berhasil diulang berkali-kali, apakah itu selalu kabar baik? Jawabannya mengejutkan: tidak selalu.
Krisis replikasi
Di semua ilmu, keberhasilan mengulang (replikasi) dianggap ukuran tertinggi kebenaran sebuah temuan. Sayangnya banyak bidang tidak lulus ukuran ini.
Sekelompok psikolog bernama Open Science Collaboration mengulang 97 studi dari tiga jurnal papan atas. Hanya 36% ulangan yang hasilnya sejalan dengan studi asli. Hampir tidak ada hubungan antara nilai p studi asli dan nilai p ulangannya, walau banyak ulangan memakai sampel lebih besar.
Pada 2012, perusahaan bioteknologi Amgen melaporkan tidak bisa mengulang temuan dari 47 di antara 53 makalah penting riset kanker.
Penulis mengusulkan cara pandang lain. Daripada heran mengapa ulangan gagal, lebih mudah melihat hasil asli yang diterbitkan dan menunjukkan bahwa hasil itu memang tidak masuk akal sejak awal.
Dua gejala, mana yang lebih meyakinkan?
Gejala A: 9 dari 10 eksperimen signifikan. Tingkat keberhasilan 0,9.
Gejala B: 10 dari 19 eksperimen signifikan. Tingkat keberhasilan 0,53.
Bila replikasi adalah ukurannya, A jauh lebih meyakinkan. Tetapi A adalah precognition: kemampuan mendapat informasi dari masa depan. Hampir tidak ada ilmuwan yang mempercayainya. B adalah bystander effect: orang cenderung tidak menolong bila ada orang lain di sekitar. Hampir semua orang mempercayainya, walau eksperimennya sulit dan sampelnya kecil.
Jadi tingkat replikasi yang tinggi tidak cukup untuk membuat orang percaya, dan tidak perlu untuk membuat orang percaya.
Test for Excess Success (TES)
Jalan keluarnya: eksperimen tidak seharusnya selalu berhasil, terutama bila efek dan sampelnya kecil. Serangkaian eksperimen seharusnya berhasil kira-kira sesering daya ujinya. Kita justru perlu curiga bila eksperimen terlalu sering berhasil. Pemeriksaan ini disebut Test for Excess Success, atau uji keberhasilan berlebih.
Langkahnya, dengan contoh sepuluh eksperimen precognition:
Gabungkan ukuran efek semua eksperimen dengan meta-analisis (Bab 9). Hasilnya g* = 0,1855.
Dengan g* itu, hitung daya uji tiap eksperimen (Bab 7).
Jumlahkan semua daya uji. Jumlah ini adalah banyaknya eksperimen yang wajarnya signifikan.
Hitung peluang memperoleh keberhasilan sebanyak yang dilaporkan, atau lebih.
Eksperimen
n
g
Daya uji
1
100
0,249
0,578
2
150
0,194
0,731
3
97
0,248
0,567
4
99
0,202
0,575
5
100
0,221
0,578
6a
150
0,146
0,731
6b
150
0,144
0,731
7
200
0,092
0,834
8
100
0,191
0,578
9
50
0,412
0,363
Jumlah daya ujinya 6,27. Jadi wajarnya sekitar 6 dari 10 eksperimen yang signifikan. Yang dilaporkan: 9. Peluang memperoleh 9 atau 10 keberhasilan adalah 0,058.
Artinya, bila efeknya nyata dan sebesar yang dilaporkan, ilmuwan yang mengulang persis kesepuluh eksperimen itu hanya punya peluang sekitar 6% untuk berhasil sebanyak laporan aslinya. Sesuatu telah terjadi pada rangkaian eksperimen itu. Kita mungkin tidak pernah tahu persisnya apa, tetapi beban pembuktian ada pada peneliti yang menyajikan hasilnya.
Bystander effect. Dengan cara yang sama, ukuran efek gabungannya −0,47. Daya uji tiap eksperimen berkisar dari 0,2 sampai hampir 1, karena ada yang hanya 24 peserta dan ada yang 2.500. Jumlah daya ujinya 10,77, dan yang signifikan 10. Peluang memperoleh 10 atau lebih adalah 0,76. Rangkaian ini bisa dipercaya, karena tingkat keberhasilannya cocok dengan besar efek dan ukuran sampelnya.
Tidak ada batas yang disepakati, tetapi banyak orang mulai curiga bila peluang suksesnya di bawah 0,1.
Sumber pertama: bias publikasi
Bias publikasi (publication bias) berarti hanya hasil signifikan yang diterbitkan, sedangkan hasil tidak signifikan disimpan.
Buku mensimulasikan 20 eksperimen dengan ukuran efek sebenarnya δ = 0,3 dan sampel acak antara 15 dan 50 per kelompok.
Bila semua 20 dilaporkan. Lima signifikan. Ukuran efek gabungan g* = 0,303, hampir tepat. Jumlah daya uji 4,2. Peluang memperoleh lima atau lebih keberhasilan adalah 0,42. Wajar.
Bila hanya lima yang signifikan diterbitkan. Ukuran efek gabungan menjadi g* = 0,607, dua kali nilai sebenarnya. Sebabnya: eksperimen yang signifikan pasti punya t besar, jadi taksiran efeknya juga besar. Dengan efek yang ditaksir terlalu tinggi ini, jumlah daya uji kelima studi hanya 3,13, padahal kelimanya signifikan. Peluang kelimanya signifikan adalah 0,081. Di bawah 0,1, jadi mencurigakan.
Jadi bias publikasi punya dua akibat: besar efek di literatur terlalu tinggi, dan keberhasilan tampak terlalu sering.
Sumber kedua: berhenti saat hasil sudah bagus
Syarat uji t: ukuran sampel ditetapkan sebelum eksperimen (Bab 4). Dalam praktik sering tidak demikian.
Bayangkan: dengan 10 orang per kelompok, peneliti mendapat p = 0,08. Hampir signifikan. Ia menambah 10 orang lagi per kelompok dan mendapat p = 0,04. Terdengar baik: data lebih banyak, jawaban lebih jelas. Sebenarnya cara ini menaikkan galat Tipe I, karena dua hal:
Ada lebih dari satu uji. Tiap uji membawa peluang alarm palsu (Bab 5).
Lebih berat lagi: pengambilan data dihentikan begitu hasil yang diinginkan muncul. Saat data ditambah, kesimpulan bisa berubah dari tidak signifikan ke signifikan dan sebaliknya. Bila kita selalu berhenti tepat saat signifikan, prosesnya condong ke hasil signifikan.
Cara ini disebut optional stopping. Seorang peneliti yang mulai dengan 10 orang per kelompok dan menambah satu orang demi satu sampai p < 0,05 atau sampai 50 orang akan punya galat Tipe I di atas 20%.
Yang salah bukan menambah data, melainkan aturan berhentinya. Galat Tipe I berlaku untuk seluruh prosedur. Jadi optional stopping tetap bermasalah walau data pertama kebetulan langsung signifikan, selama peneliti akan menambah data seandainya tidak signifikan. Tanpa rencana pengambilan data yang pasti, galat Tipe I tidak bisa dihitung.
Dalam simulasi buku (20 eksperimen, tidak ada efek sama sekali, mulai dari 15 dan ditambah satu-satu sampai 100), empat eksperimen menjadi signifikan, padahal wajarnya satu. Ukuran efek gabungan dari semua 20 eksperimen adalah 0,052, hampir nol. Jadi, berbeda dari bias publikasi, optional stopping tidak membuat taksiran efek meleset. Yang naik adalah jumlah hasil signifikan. Bila hanya empat yang signifikan itu diterbitkan, ukuran efek gabungannya menjadi 0,4, padahal sebenarnya nol.
Keberhasilan berlebih dan klaim teori
“Berhasil” selalu diukur terhadap sebuah klaim teori.
Seorang peneliti menjalankan sepuluh eksperimen tentang topik yang tidak berkaitan. Empat signifikan dan hanya itu yang diterbitkan. TES akan menunjukkan ada bias publikasi, tetapi itu tidak berarti banyak. Keempat eksperimen itu tidak saling berkaitan dan tidak dipakai untuk satu klaim.
Bila empat eksperimen yang sama dipakai untuk mendukung satu teori, bias publikasi meruntuhkan klaim teori itu.
Sering kali peneliti tanpa sengaja membuat teorinya tampak terlalu bagus, karena teorinya ditentukan oleh uji mana yang signifikan dan mana yang tidak. Teori seperti itu hanya ringkasan kasar dari data, ikut mengikuti derau, dan hampir pasti tidak akan didukung penuh oleh eksperimen baru.
Satu hal lagi: TES tidak membuktikan efeknya tidak ada. TES hanya menunjukkan bahwa rangkaian eksperimen itu bukan bukti ilmiah yang meyakinkan.
Pesan utama bab ini
Bila banyak eksperimen serupa dengan efek kecil dan sampel kecil semuanya signifikan, datanya terlalu bagus untuk benar.
Eksperimen seharusnya signifikan sebanding dengan daya ujinya.
Bias publikasi dan optional stopping bisa sangat menaikkan galat Tipe I.
Tugas Bab 10
Tugas 10.1 · TES untuk studi precognition
Daya uji sepuluh eksperimen: 0,578; 0,731; 0,567; 0,575; 0,578; 0,731; 0,731; 0,834; 0,578; 0,363. (a) Berapa eksperimen yang wajarnya signifikan? (b) Hitung peluang kesepuluhnya signifikan. (c) Buku memberi peluang 9 atau lebih signifikan sebesar 0,058. Jelaskan cara menghitungnya. (d) Apa kesimpulannya?
Sumber: Bab 10.2, Tabel 10.1, hal. 114–115
Lihat pembahasan
(a) Jumlah daya uji = 6,27. Wajarnya sekitar 6 dari 10.
(b) Kalikan kesepuluh daya uji: hasilnya sekitar 0,007.
(c) Ada 11 kemungkinan susunan: satu susunan dengan kesepuluhnya signifikan, dan sepuluh susunan dengan tepat satu eksperimen gagal. Untuk tiap susunan, kalikan daya uji eksperimen yang berhasil dengan (1 − daya uji) eksperimen yang gagal. Jumlahkan kesebelas hasilnya: sekitar 0,007 + 0,050 = 0,058.
(d) Bila efeknya sebesar yang dilaporkan, hanya ada peluang sekitar 6% untuk mendapat 9 keberhasilan. Hasil yang dilaporkan terlalu bagus untuk benar. Ini tidak membuktikan precognition tidak ada. Ini menunjukkan bahwa sepuluh studi itu bukan bukti yang baik untuknya.
Tugas 10.2 · Tidak cukup dan tidak perlu
Precognition: 9 dari 10 signifikan, jumlah daya uji 6,27, peluang sukses 0,058. Bystander effect: 10 dari 19 signifikan, jumlah daya uji 10,77, peluang sukses 0,76. Jelaskan dengan dua contoh ini mengapa replikasi yang sering berhasil “tidak cukup dan tidak perlu” untuk mempercayai suatu efek. Lalu apa ukuran yang benar?
Sumber: Bab 10.1 dan 10.2, hal. 113–116
Lihat pembahasan
Tidak cukup. Precognition berhasil 90%, tetapi hampir tidak ada ilmuwan yang percaya, dan TES menunjukkan tingkat keberhasilan itu jauh di atas yang wajar (6 dari 10).
Tidak perlu. Bystander effect hanya berhasil 53%, tetapi dipercaya luas, dan TES menunjukkan angka itu persis yang diharapkan (sekitar 11 dari 19).
Ukuran yang benar. Bukan seberapa sering eksperimen berhasil, melainkan apakah seringnya berhasil cocok dengan daya ujinya. Eksperimen dengan sampel kecil dan efek kecil memang seharusnya sering gagal.
Tugas 10.3 · Akibat bias publikasi
Dari 20 eksperimen simulasi dengan δ = 0,3, hanya 5 yang signifikan dan diterbitkan. Ukuran efek gabungan kelimanya 0,607. Dengan efek itu, daya uji kelima eksperimen adalah 0,718; 0,444; 0,424; 0,784; 0,764. (a) Berapa kali lipat ukuran efek ditaksir terlalu tinggi, dan mengapa? (b) Berapa eksperimen yang wajarnya signifikan dari lima itu? (c) Hitung peluang kelimanya signifikan.
Sumber: Bab 10.3, Tabel 10.2, hal. 116–117
Lihat pembahasan
(a) 0,607/0,3 ≈ 2 kali. Eksperimen hanya signifikan bila t-nya besar. Karena d = t × √(2/n), t yang besar berarti taksiran d yang besar. Memilih hanya yang signifikan berarti memilih taksiran yang kebetulan terlalu tinggi.
(b) Jumlah daya uji = 0,718 + 0,444 + 0,424 + 0,784 + 0,764 = 3,13. Wajarnya sekitar 3 dari 5.
(c) Hasil kali kelima daya uji = 0,081. Di bawah 0,1, jadi rangkaian ini mencurigakan, walau daya ujinya sudah dihitung dari efek yang terlalu tinggi.
Tugas 10.4 · Optional stopping
Nilai kasus ini. (a) Peneliti mendapat p = 0,08 dengan 10 orang per kelompok, menambah 10 orang, dan mendapat p = 0,04. Ia melaporkan p = 0,04. (b) Peneliti lain mendapat p = 0,03 pada 20 orang yang direncanakan dan berhenti. Ia mengaku akan menambah peserta seandainya p = 0,08. Apakah galat Tipe I-nya 5%? (c) Bagaimana pengaruh optional stopping terhadap ukuran efek gabungan dibandingkan bias publikasi?
Sumber: Bab 10.4, Tabel 10.3, hal. 117–120; Bab 11.3.3, hal. 128
Lihat pembahasan
(a) Bermasalah. Ada dua uji, dan pengambilan data dihentikan karena hasilnya sudah signifikan. Galat Tipe I untuk prosedur ini lebih besar dari 5%. Bila data ditambah satu-satu dari 10 sampai 50, galatnya di atas 20%.
(b) Tidak. Galat Tipe I berlaku untuk seluruh prosedur, termasuk apa yang akan dilakukan seandainya hasilnya lain. Yang ia lakukan memang tidak berbeda dari rencana, tetapi aturan berhentinya bergantung pada hasil. Bila kita tidak tahu apa yang akan kita lakukan di semua kemungkinan, galat Tipe I tidak bisa diketahui.
(c) Bila semua eksperimen dilaporkan, optional stopping hampir tidak menggeser ukuran efek gabungan (0,052 pada simulasi, dekat dengan nol yang sebenarnya). Bias publikasi menggandakannya. Keduanya sama-sama membuat hasil signifikan lebih banyak dari yang wajar.
Bab 11 · hal. 123–131 · Magnitude of Excess Success
Seberapa luas masalahnya
Pertanyaan bab ini: apakah keberhasilan berlebih hanya terjadi pada segelintir studi, atau sudah menjadi hal umum? Dan dari mana asalnya?
Anda mungkin sulit mengenali bias
Inti TES sederhana: kegagalan itu perlu. Walau efeknya nyata, sesekali sampel acak tidak akan menampakkannya. Hanya melaporkan keberhasilan membuat efek tampak terlalu besar, dan bisa membuat efek yang tidak ada tampak ada.
Buku memberi satu latihan. Tiga set berisi lima eksperimen simulasi. Satu set sah: efek sebenarnya 0,8 dan kelima eksperimen dilaporkan apa adanya. Satu set dibuat dengan optional stopping tanpa efek sama sekali, lalu hanya lima yang signifikan dari dua puluh yang dilaporkan. Satu set dibuat dengan efek sangat kecil (0,1), lalu hanya lima yang signifikan dari seratus yang dilaporkan. Set mana yang sah? (Kerjakan di Tugas 11.1 sebelum membaca lanjutannya.)
Ilmuwan berpengalaman pun sulit menjawabnya. Artinya, dengan bias publikasi dan optional stopping, kita tidak bisa membedakan “tidak ada efek sama sekali” dari “efek sangat besar”.
Dua tanda cepat untuk mengenali rangkaian yang bermasalah:
Hubungan ukuran sampel dengan ukuran efek. Pada rangkaian yang sah keduanya tidak berkaitan. Pada rangkaian bermasalah, makin besar sampel makin kecil efeknya (korelasi negatif kuat). Pada optional stopping ini mudah dipahami: sampel baru menjadi besar bila efek yang teramati kecil. Pada studi precognition korelasinya −0,89.
Nilai p yang menumpuk sedikit di bawah 0,05. Eksperimen yang sah dengan efek nyata dan sampel memadai biasanya memberi p yang sangat kecil. Banyak p antara 0,02 dan 0,05 adalah tanda bahaya.
Seberapa luas?
Penulis memeriksa jurnal Science, salah satu jurnal paling bergengsi, yang hanya menerima sekitar 7% naskah. Dari 133 artikel psikologi dan pendidikan tahun 2005–2012, ada 18 yang memuat empat eksperimen atau lebih dan cukup informasinya untuk dihitung.
Hasilnya: 15 dari 18 artikel (83%) punya peluang sukses di bawah 0,1. Hasil mereka terlalu bagus untuk benar. Beberapa temuan itu pernah diberitakan luas dan menjadi dasar kebijakan pendidikan, amal, dan diet.
Salah satu artikel ditulis Diederik Stapel, psikolog sosial Belanda yang terbukti memalsukan data. Datanya dibuat di lembar kerja, bukan dari eksperimen. Data palsu itu pun terlalu bagus untuk benar. Tampaknya ia meniru rupa data yang terbit, dan data yang terbit itu sendiri sering terlalu bagus untuk benar.
Jurnal Psychological Science menunjukkan angka serupa: 36 dari 44 artikel (82%).
Masalah yang sama terlihat pada sebagian makalah epigenetika dan ilmu saraf.
Kesimpulan penulis: ilmuwan, editor, dan penelaah papan atas belum mengenali rupa data yang baik bila sebuah penelitian memuat banyak eksperimen dan uji.
Apa yang sebenarnya terjadi: tujuh sumber
Kebanyakan ilmuwan peduli pada bidangnya dan yakin temuannya benar. Jadi persoalannya tampaknya bukan niat buruk, melainkan salah paham tentang cara kerja statistik. Bagian ini, kata penulis, bersifat dugaan.
Salah paham tentang replikasi. Rangkaian eksperimen yang benar berhasil sesering daya ujinya. Karena terlalu menekankan keberhasilan, orang tidak sadar bahwa eksperimen berdaya uji rendah yang selalu berhasil itu janggal.
Bias publikasi. Sering sulit tahu apakah eksperimen “gagal” karena metodenya cacat atau karena memang tidak ada efek. Eksperimen yang tidak menunjukkan hasil yang diharapkan mudah dianggap cacat metode, atau diberi label “studi pendahuluan”, padahal seharusnya dihitung sebagai jawaban negatif.
Optional stopping. Bisa terjadi juga antar eksperimen. Peneliti mendapat p = 0,07 di Eksperimen 1, lalu menjalankan Eksperimen 2 untuk memastikan. Seandainya Eksperimen 1 memberi p = 0,03, apakah Eksperimen 2 tetap dijalankan? Bila tidak, itu optional stopping.
HARKing (Hypothesizing After the Results are Known): menyusun hipotesis setelah hasil diketahui. Peneliti mengumpulkan banyak data, lalu merangkai cerita yang mengikat semuanya. Cerita seperti itu terlalu dekat dengan data dan ikut mengikuti derau. Temuan yang tidak cocok dianggap tidak relevan dan dibuang. Hal yang sama terjadi bila dari beberapa ukuran dipilih satu yang “berhasil”.
Keluwesan analisis. Tidak signifikan? Coba logaritma. Masih tidak? Buang pencilan di atas 3 simpangan baku, atau 2,5. Gabungkan beberapa ukuran dengan cara lain. Menjelajah data sah untuk studi eksploratif, tetapi menaikkan galat Tipe I pada eksperimen yang sebenarnya. Bila analisis yang signifikan ditemukan dengan cara ini, eksperimen harus diulang dengan analisis itu pada sampel baru.
Salah paham tentang prediksi. Banyak artikel menulis “sesuai prediksi teori, terdapat perbedaan signifikan”. Kalimat ini janggal. Walau efeknya nyata, uji tidak akan signifikan setiap kali. Teori paling jauh hanya bisa meramalkan peluang hasil signifikan, dan untuk itu teori harus menyebut ukuran efek. Tidak satu pun dari artikel yang diperiksa membahas ukuran efek yang diramalkan atau daya uji.
Kecerobohan dan pemeriksaan pilih-pilih. Program STATCHECK menemukan kira-kira separuh artikel psikologi memuat minimal satu angka yang tidak cocok, dan hampir 10% memuat kesalahan yang mengubah status signifikan. Lebih buruk lagi, peneliti cenderung memeriksa ulang hanya hasil yang mengecewakan. Kesalahan yang merugikan ditemukan dan diperbaiki; kesalahan yang menguntungkan lolos.
Pesan utama bab ini
Terlalu banyak replikasi yang berhasil di banyak bidang, termasuk kedokteran, biologi, psikologi, dan kemungkinan banyak lagi.
Tampaknya banyak ilmuwan memakai cara yang sebaiknya dihindari: optional stopping, bias publikasi, HARKing, keluwesan analisis, dan lain-lain.
Tugas Bab 11
Tugas 11.1 · Set mana yang sah?
Tiap set berisi lima eksperimen dengan uji t dua sampel. Satu set sah. Dua set lainnya dibuat dengan optional stopping atau bias publikasi. Tentukan set yang sah dan sebutkan alasannya.
Set A
n
t
p
g
10
2,48
0,03
1,06
28
2,10
0,04
0,55
10
3,12
0,01
1,34
15
2,25
0,04
0,80
12
2,34
0,03
0,92
Set B
n
t
p
g
21
2,67
0,01
0,81
27
4,72
< 0,01
1,26
22
3,66
< 0,01
1,08
26
2,74
0,01
0,75
24
2,06
0,05
0,58
Set C
n
t
p
g
16
2,10
0,04
0,72
19
2,19
0,04
0,70
25
2,22
0,03
0,62
14
2,24
0,04
0,82
23
2,49
0,02
0,72
Sumber: Bab 11.1, Tabel 11.1, hal. 124–125
Lihat pembahasan
Set B yang sah. Ada tiga cara melihatnya.
1. Nilai p. Pada Set B hampir semua p sangat kecil (0,01 atau lebih kecil). Pada Set A dan C, hampir semua p berada di antara 0,02 dan 0,04, menumpuk sedikit di bawah 0,05.
2. Hubungan n dengan g. Pada Set A, sampel terbesar (28) punya efek terkecil (0,55), dan sampel terkecil (10) punya efek terbesar (1,06 dan 1,34). Korelasi n dengan g adalah −0,86. Pada Set C korelasinya −0,83. Pada Set B hanya 0,25: n dan g tidak berkaitan, seperti seharusnya.
3. TES. Peluang kelima eksperimen signifikan, dihitung dari ukuran efek gabungan tiap set: Set A 0,042; Set B 0,45; Set C 0,052. Hanya Set B yang wajar.
Catatan. Ukuran efek gabungannya mirip (0,82; 0,89; 0,70), jadi meta-analisis saja tidak menolong. Padahal efek sebenarnya di balik dua set yang tidak sah adalah 0 dan 0,1.
Tugas 11.2 · Mengenali tujuh sumber masalah
Beri nama pada tiap praktik berikut.
Tiga eksperimen yang tidak mendukung hipotesis disebut “studi pendahuluan” dan tidak dilaporkan.
Setelah melihat hasil, peneliti menulis pendahuluan seolah-olah pola itu sudah diramalkan sejak awal.
Hasil tidak signifikan. Peneliti mencoba transformasi logaritma, lalu membuang pencilan, sampai p < 0,05.
Eksperimen 1 memberi p = 0,07, lalu dijalankan Eksperimen 2 “untuk memastikan”. Seandainya p = 0,03, Eksperimen 2 tidak akan dijalankan.
Analisis yang memberi p = 0,08 diperiksa ulang dan ditemukan salah ketik. Analisis yang memberi p = 0,02 tidak pernah diperiksa ulang.
Sumber: Bab 11.3, hal. 127–130
Lihat pembahasan
Bias publikasi. Eksperimen itu seharusnya dihitung sebagai jawaban negatif.
HARKing. Hipotesis disusun setelah hasil diketahui.
Keluwesan analisis. Hasil seperti ini harus diulang dengan analisis yang sama pada sampel baru yang saling bebas.
Optional stopping antar eksperimen. Keputusan menambah data bergantung pada hasil, sehingga galat Tipe I tidak diketahui.
Pemeriksaan pilih-pilih. Hanya hasil yang mengecewakan yang diperiksa, sehingga kesalahan yang menguntungkan lolos.
Tugas 11.3 · Memeriksa angka yang dilaporkan
(a) Sebuah artikel menulis t(29) = 2,2; p = 0,01. Nilai p yang benar untuk t = 2,2 dan df = 29 adalah 0,036. Apa kesimpulan Anda? (b) Banyak artikel menulis “sesuai prediksi teori, terdapat perbedaan signifikan”. Mengapa buku menilai kalimat ini kosong?
Sumber: Bab 11.3.6 dan 11.3.7, hal. 129–130
Lihat pembahasan
(a) Ada kesalahan pelaporan. Nilai p ditentukan sepenuhnya oleh t dan df, jadi ketiganya harus cocok. Di sini status signifikan tidak berubah, tetapi kesalahan seperti ini menandakan kurang teliti. STATCHECK menemukan kira-kira separuh artikel psikologi punya minimal satu kesalahan seperti ini.
(b) Dua alasan. Pertama, walau efeknya nyata, tidak setiap sampel menunjukkannya, jadi teori tidak bisa meramalkan “akan signifikan”. Teori hanya bisa meramalkan peluang signifikan, yaitu daya uji. Kedua, untuk meramalkan daya uji, teori harus menyebut ukuran efek untuk rancangan dan ukuran sampel tertentu. Artikel-artikel itu tidak pernah membahasnya. Jadi sebenarnya tidak ada prediksi.
Bab 12 · hal. 133–142 · Suggested Improvements and Challenges
Usulan perbaikan dan tantangannya
Pertanyaan bab ini: apa yang bisa dilakukan? Penulis menimbang beberapa usulan yang populer. Menurut mereka, tiap usulan ada baiknya, tetapi tidak ada yang menyentuh akar masalah.
Haruskah semua eksperimen diterbitkan?
Usulnya: terbitkan semua hasil, signifikan atau tidak. Dengan begitu pembaca bisa menarik kesimpulan yang benar dan besar efek tidak ditaksir terlalu tinggi.
Kesulitannya:
Bisakah peneliti membedakan eksperimen yang gagal karena cacat metode (misalnya alat rusak) dari yang gagal karena sampling acak? Bila tidak, literatur akan dipenuhi hasil yang cacat karena berbagai sebab.
Bagaimana menafsirkan temuan yang hanya menambah sedikit data pada topik yang sudah ada? Dan temuan mana yang dimasukkan ke meta-analisis?
Kapan sebuah bidang memutuskan data sudah cukup? Bila meta-analisis memberi p = 0,08, lalu eksperimen ditambah sampai p < 0,05, itu optional stopping pada tingkat eksperimen.
Preregistrasi
Preregistrasi berarti sebelum eksperimen dijalankan, peneliti mencatat seluruh rencananya di tempat yang tidak bisa diubah lagi: rangsangan, tugas, metode, jumlah sampel dan cara mengambilnya, pertanyaan, dan rencana analisis. Setelah itu, setiap penyimpangan dari rencana akan terlihat.
Manfaat praktisnya. Mencegah HARKing. Membuat optional stopping dan perubahan cara analisis terlihat. Bila catatannya terbuka, bias publikasi juga bisa berkurang.
Keraguan penulis. Bila peneliti setia pada rencananya dan hasilnya sesuai, apakah itu menambah keyakinan pada teorinya? Dua kasus ekstrem menunjukkan tidak.
Dua kasus ekstrem
Hipotesis dari lemparan koin. Peneliti melempar koin untuk memutuskan apakah obat “menaikkan” atau “menurunkan” daya ingat, lalu mendaftarkan hipotesis itu. Eksperimen ternyata cocok. Jelas hasil itu tidak membenarkan cara hipotesisnya dibuat. Preregistrasi tidak bisa memberi pembenaran yang tidak ada.
Hipotesis dari teori kuantitatif yang sudah terbit. Peneliti menurunkan ukuran efek dari teori itu, mendaftarkannya, dan eksperimen cocok. Ini dukungan kuat untuk teorinya. Tetapi preregistrasi tidak berperan, karena siapa pun bisa menurunkan prediksi yang sama dari teori yang sudah terbit.
Kebanyakan penelitian berada di antara dua ekstrem itu: campuran gagasan samar, firasat, hasil lama, dan teori. Untuk bagian yang samar, mutu rancangan tidak bisa dinilai, dan preregistrasi tidak mengubahnya. Peneliti yang merancang berdasarkan gagasan samar sebenarnya melakukan kerja eksploratif; memaksa mereka membuat prediksi tidak bermakna.
Kesimpulan penulis: menuliskan alasan di balik rancangan itu baik, untuk memeriksa diri sendiri dan agar tidak lupa. Sering kali saat menuliskannya peneliti sadar bahwa sebagian kerjanya eksploratif. Tetapi alasan itu memang seharusnya menjadi bagian dari laporan penelitian biasa. Menerbitkannya lebih dulu sebagai preregistrasi tidak memberi keuntungan tambahan.
Analisis statistik lain
Uji hipotesis sudah lama dikritik, dan sering diusulkan penggantinya. Ada yang berkata nilai p tidak bermakna. Menurut penulis itu tidak mungkin benar secara umum, karena nilai p dihitung dari informasi yang sama dengan statistik lain, yaitu perbandingan sinyal terhadap derau. Untuk uji t dua sampel dengan n yang diketahui, nilai t bisa diubah menjadi banyak statistik lain.
Yang membedakan adalah pertanyaan yang dijawab. Contoh buku: n = 250 per kelompok dan d = 0,183.
Statistik
Nilai
Pertanyaan yang dijawab
Nilai p
0,04
Apakah keputusan saya menjaga galat Tipe I? Hasil: signifikan.
Selang kepercayaan 95% untuk d
0,007 sampai 0,359
Seberapa tidak pasti taksiran ukuran efeknya?
Selisih AIC
2,19
Model mana yang lebih baik meramalkan data baru? Hasil: model “rata-rata berbeda”.
Selisih BIC
−2,03
Model mana yang didukung data? Hasil: model nol.
Bayes Factor (JZS)
0,755
Sama dengan BIC. Hasil: dukungan lemah untuk model nol.
Data yang sama memberi hasil “signifikan” sekaligus “sedikit mendukung model nol”. Ini tampak bertentangan, tetapi tidak: pertanyaannya berbeda. Pilih statistik yang menjawab pertanyaan Anda.
Perhatikan juga bahwa AIC, BIC, dan Bayes Factor bisa menerima hipotesis nol. Uji hipotesis nol biasa tidak pernah bisa, karena tidak ada bukti bukan berarti bukti tidak ada.
Peran replikasi
Banyak ilmuwan menganggap replikasi sebagai hakim terakhir. Bab 9 sampai 11 menunjukkan pandangan itu terlalu sederhana bila statistik terlibat. Karena sampling acak, studi yang baik tentang efek yang nyata pun tidak selalu bisa diulang.
Anggapan tentang replikasi berasal dari ilmu fisika. Bulu dan palu jatuh sama cepat, tetapi hanya di ruang hampa. Di fisika:
Hasil eksperimen hampir pasti (deterministik). Sumber derau dicari dan ditekan dengan cermat.
Berhasil atau gagalnya replikasi selalu dinilai terhadap sebuah teori. Kegagalan menjadi menarik, karena menunjukkan ada yang salah pada alat atau pada teorinya.
Di psikologi, kedokteran, dan biologi keadaannya lain. Sebagian derau bisa dikurangi, tetapi sering kali keragaman adalah bagian dari gejalanya sendiri: sebagian orang menunjukkan efek, sebagian tidak (Bab 3, Implikasi 4). Bidang-bidang ini terpaksa memakai statistik, dan hasilnya kadang tidak konsisten hanya karena sampling.
Agar replikasi bisa dipakai seperti di fisika, studi harus berhasil hampir setiap kali (daya uji sangat tinggi), atau harus ada teori yang membedakan keragaman antar orang dari derau pengukuran.
Memusatkan perhatian pada mekanisme
Menurut penulis, masalah statistik begitu menyita perhatian sehingga ilmuwan mungkin kehilangan fokus pada hal yang paling mendasar: memahami mekanisme yang menghasilkan suatu gejala. Tanpa itu, kita tidak bisa meramalkan hasil baru atau yakin sebuah temuan akan muncul lagi di keadaan baru.
Mesin MRI. Bagaimana insinyur tahu mesin MRI di Lausanne dan di West Lafayette bekerja sama, padahal lingkungannya berbeda? Bukan karena mesin-mesin lain terbukti bekerja. Mereka yakin karena memahami cara kerjanya, termasuk teori superkonduktivitas. Teori itu menyebut syarat apa yang perlu dan cukup.
Wabah pes. Pada 1898 Paul-Louis Simond menunjukkan bahwa pes ditularkan kutu dari tikus. Mekanisme ini langsung memberi tahu apa yang harus dilakukan: kurangi tikus. Ia juga memberi tahu apa yang tidak berguna, seperti mengurung rumah yang terjangkit. Mekanisme ini tidak perlu meramalkan angka pastinya untuk bisa berguna.
Anestesi. Obat bius isofluran bekerja sangat andal, tetapi mekanismenya tidak diketahui. Sesekali pasien terbangun di tengah operasi. Tanpa teori, kita tidak tahu apakah kegagalan itu derau atau petunjuk adanya mekanisme tersembunyi.
Menemukan mekanisme itu sulit, tetapi seharusnya menjadi tujuan jangka panjang tiap ilmuwan. Dengan memahami mekanisme, kita menemukan faktor yang tepat dan keragaman berkurang. Misalnya, bila kita tahu cara vitamin memengaruhi organ tubuh, kita bisa menjelaskan mengapa vitamin menyehatkan sebagian orang dan merugikan sebagian lain.
Kalimat penutup buku: untuk menyegarkan kembali praktik ilmiah, tujuannya adalah tidak lagi memerlukan statistik, bukan mereformasinya.
Pesan utama bab ini
Banyak usulan untuk memperbaiki praktik statistik, seperti preregistrasi, tidak menyentuh masalah yang mendasar.
Ilmu yang baik lebih dari sekadar statistik.
Tugas Bab 12
Tugas 12.1 · Dua kasus ekstrem preregistrasi
Jelaskan dengan kata-kata sendiri mengapa preregistrasi (a) tidak menolong pada hipotesis yang dibuat dengan lemparan koin, dan (b) tidak diperlukan pada hipotesis yang diturunkan dari teori kuantitatif yang sudah terbit. (c) Apa yang menurut penulis tetap berguna dari preregistrasi?
Sumber: Bab 12.2, hal. 134–136
Lihat pembahasan
(a) Agar eksperimen membenarkan sebuah prediksi, harus ada alasan di balik proses yang menghasilkan prediksi itu. Lemparan koin tidak punya alasan. Mendaftarkannya lebih dulu tidak menambah alasan apa pun.
(b) Teorinya sudah terbit, jadi peneliti lain bisa menurunkan prediksi dan ukuran efek yang sama, lalu menilai sendiri apakah rancangannya tepat. Pembenaran datang dari teori, bukan dari pendaftaran.
(c) Preregistrasi mencegah HARKing, optional stopping, dan membuang kondisi yang gagal. Menuliskan alasan rancangan juga membantu peneliti memeriksa diri dan menyadari bagian mana dari kerjanya yang eksploratif. Tetapi semua itu, kata penulis, sudah tercapai bila alasan rancangan ditulis dengan baik dalam laporan penelitian.
Tugas 12.2 · Satu data, lima statistik
Dengan n = 250 per kelompok dan d = 0,183 diperoleh p = 0,04, selisih BIC = −2,03, dan Bayes Factor = 0,755. (a) Cek dengan rumus Bab 3 bahwa t kira-kira 2,05. (b) Mengapa p menyatakan “signifikan” sedangkan BIC dan Bayes Factor condong ke model nol? (c) Statistik mana yang bisa menerima hipotesis nol?
Sumber: Bab 12.3, hal. 136–137
Lihat pembahasan
(a) t = d × √(n/2) = 0,183 × √125 = 0,183 × 11,18 = 2,05. Sedikit di atas ambang 1,96, cocok dengan p = 0,04.
(b) Semua statistik itu dihitung dari informasi yang sama, tetapi menjawab pertanyaan yang berbeda. Nilai p bertanya apakah keputusan menjaga galat Tipe I. BIC dan Bayes Factor bertanya model mana yang lebih didukung data. Efek sekecil 0,183 dengan sampel 500 orang cukup untuk lolos ambang p, tetapi belum cukup untuk membuat model “ada beda” lebih didukung daripada model nol.
(c) AIC, BIC, dan Bayes Factor. Uji hipotesis nol biasa tidak pernah bisa menerima H0.
Tugas 12.3 · Tiga contoh mekanisme
Apa yang ditunjukkan masing-masing contoh berikut tentang peran mekanisme: (a) mesin MRI di dua kota, (b) wabah pes dan tikus, (c) obat bius isofluran?
Sumber: Bab 12.5, hal. 139–141
Lihat pembahasan
(a) MRI. Keyakinan bahwa sesuatu akan bekerja di keadaan baru datang dari memahami cara kerjanya, bukan dari banyaknya keberhasilan sebelumnya. Tidak mungkin menguji semua lingkungan.
(b) Pes. Mekanisme yang belum lengkap pun sudah berguna. Ia memberi tahu tindakan mana yang menolong (mengurangi kontak dengan tikus) dan mana yang tidak (mengurung rumah yang terjangkit), tanpa perlu angka yang pasti. Tanpa mekanisme, orang London tahun 1665 memusnahkan anjing dan kucing, yang kemungkinan malah menambah tikus.
(c) Isofluran. Efek yang sangat andal pun, bila mekanismenya tidak diketahui, menyisakan kegagalan yang tidak bisa dijelaskan. Tanpa teori, kita tidak tahu apakah kegagalan itu derau atau petunjuk penting.
Jadwal belajar 21 hari
Sediakan 45–60 menit per hari. Urutannya sama tiap hari: baca halaman buku yang disebut, baca penjelasannya di tab Materi, kerjakan tugas lalu cocokkan dengan pembahasan, dan tutup dengan kuis bab itu. Bab 3 mendapat lima hari karena seluruh buku bertumpu padanya.
Nomor halaman adalah angka yang tercetak di halaman buku, bukan urutan halaman PDF. Untuk versi 14 hari, gabungkan Hari 1–2, 3–4, 5–6, 10–11, 13–14, 18–19, dan 20–21.
Tugas penutup setelah Hari 21
Ambil satu naskah Anda sendiri, atau satu artikel yang sedang Anda baca, lalu periksa dengan sepuluh pertanyaan ini. Di bawah tiap pertanyaan ada alasan dan bab rujukannya.
Tugas penutup · Sepuluh pertanyaan untuk satu naskah
Apakah tiap klaim disertai ukuran efek dan n, bukan hanya nilai p?
Adakah kesimpulan “tidak ada efek” yang ditarik dari hasil tidak signifikan?
Adakah kalimat “signifikan di A, tidak di B” tanpa menguji selisihnya?
Berapa banyak uji yang dijalankan pada satu set data, dan adakah koreksinya?
Apakah ukuran sampel ditetapkan sebelum data diambil, dengan analisis daya uji?
Apakah satuan analisisnya saling bebas, atau ada pengukuran berulang yang dihitung sebagai n?
Apakah cara analisis dipilih sebelum melihat data?
Apakah korelasi ditafsirkan sebagai sebab-akibat, dan apakah grafiknya ditampilkan?
Apakah klaim utama bergantung pada banyak uji yang semuanya harus cocok?
Adakah mekanisme yang menjelaskan mengapa efek itu muncul?
Lihat pembahasan: mengapa tiap pertanyaan penting
Nilai p mencampur ukuran efek dan ukuran sampel, karena t = d × √(n/2). Tanpa d dan n, pembaca tidak tahu apakah hasil signifikan didorong efek besar atau sampel besar. (Bab 3)
Tidak ada bukti bukan berarti bukti tidak ada. Uji hipotesis nol tidak pernah bisa menerima H0. (Bab 3, Implikasi 3a)
Beda signifikansi bukan beda yang signifikan. Yang harus diuji adalah selisih antara A dan B. (Bab 3, Implikasi 3b; contoh nyata di Bab 7.3)
Peluang minimal satu alarm palsu dari m uji adalah 1 − 0,95m. Dua belas uji memberi 46%. ANOVA 2 × 2 saja sudah 14%. (Bab 5 dan 6)
Tanpa analisis daya uji, berhasil atau tidaknya eksperimen adalah untung-untungan. Menambah data sampai signifikan menaikkan galat Tipe I di atas 20%. (Bab 7 dan 10)
Delapan pengukuran pada tiga pasien memberi n = 3, bukan 24. Data yang tidak saling bebas membuat galat baku tampak terlalu kecil. (Bab 4)
Mencoba beberapa analisis lalu memilih yang signifikan menaikkan galat Tipe I. Hasilnya harus diulang pada sampel baru. (Bab 7.1 dan 11.3.5)
Korelasi signifikan punya empat penjelasan: x menyebabkan y, y menyebabkan x, variabel ketiga, atau kebetulan. Nilai r yang sama bisa datang dari pola data yang sangat berbeda. (Bab 8)
Makin banyak hasil yang harus cocok, makin kecil peluang semuanya terjadi. Enam uji dengan peluang 0,60–0,82 hanya memberi peluang bersama 0,216. (Bab 7.3 dan 10)
Tanpa mekanisme, kita tidak bisa yakin temuan itu akan muncul lagi di tempat atau keadaan lain. (Bab 12.5)