Desain pra-pasca (satu kelompok, diukur sebelum dan sesudah intervensi) adalah desain paling umum di skripsi keperawatan, dan uji statistiknya sering salah pilih karena dua uji ini terlihat mirip fungsinya tapi punya syarat berbeda. Halaman ini membahas kasus data berpasangan (satu kelompok, dua waktu pengukuran) — berbeda dari kasus dua kelompok independen yang dibahas di halaman terpisah. Ringkasan cepatnya:
| Aspek | Uji T Berpasangan | Wilcoxon Signed-Rank |
|---|---|---|
| Syarat distribusi | Selisih pra-pasca harus normal | Tidak mensyaratkan normalitas |
| Skala data | Interval/rasio | Ordinal, atau interval/rasio yang tidak normal |
| Sensitivitas | Lebih sensitif bila asumsi terpenuhi | Sedikit kurang sensitif, tapi lebih aman bila asumsi tidak terpenuhi |
| Ukuran efek | Cohen’s d | r (dari Z/√N) |
| Contoh kasus | Tekanan darah sistolik sebelum-sesudah edukasi, data mendekati normal | Skor nyeri ordinal atau data menceng (skewed) sebelum-sesudah intervensi |
Rekomendasi: selalu uji normalitas selisih pra-pasca terlebih dahulu dengan Shapiro-Wilk (sampel di bawah 50) sebelum memutuskan — jangan menentukan uji dari skala data saja tanpa mengecek distribusinya.
Kapan Uji T Berpasangan Sah Dipakai
Uji T berpasangan (paired sample t-test) sah dipakai bila memenuhi tiga syarat: (1) data berskala interval atau rasio (mis. tekanan darah dalam mmHg, skor nyeri numerik 0–10 yang diperlakukan sebagai data kontinu), (2) subjek yang sama diukur dua kali (pra dan pasca), dan (3) selisih antara nilai pasca dan pra berdistribusi normal. Syarat ketiga ini yang paling sering diabaikan mahasiswa — normalitas yang diuji adalah normalitas selisihnya, bukan normalitas data pra dan pasca masing-masing secara terpisah.
Kapan Wilcoxon yang Tepat
Wilcoxon signed-rank test adalah padanan nonparametrik dari uji T berpasangan, dipakai saat: (1) data berskala ordinal (mis. skor Likert, tingkat nyeri kategorikal ringan-sedang-berat), atau (2) data berskala interval/rasio tetapi selisih pra-pasca tidak berdistribusi normal. Wilcoxon bekerja dengan mengurutkan (rank) besarnya selisih, bukan nilai selisih itu sendiri, sehingga lebih tahan terhadap data yang menceng (skewed) atau memiliki outlier ekstrem. Pasangan data dengan selisih nol (nilai pra dan pasca identik) umumnya dikeluarkan dari perhitungan sebelum proses ranking, karena tidak memberi informasi arah perubahan — bila proporsi nilai nol terlalu besar, itu juga sinyal instrumen pengukuran mungkin kurang sensitif menangkap perubahan kecil.

Beda dengan Uji T Independen (Dua Kelompok Berbeda)
Uji T berpasangan dan Wilcoxon signed-rank dipakai untuk data berpasangan — satu kelompok subjek yang sama, diukur dua kali. Ini berbeda dari uji T independen dan Mann-Whitney U, yang dipakai untuk membandingkan dua kelompok subjek yang berbeda (mis. kelompok intervensi vs kelompok kontrol yang terdiri dari orang yang berlainan). Kesalahan yang cukup sering terjadi: penelitian dengan desain kelompok intervensi dan kelompok kontrol (subjek berbeda) tetap memakai uji T berpasangan/Wilcoxon, padahal seharusnya uji T independen/Mann-Whitney U, karena datanya bukan data berpasangan dari subjek yang sama.
Cara Menentukan yang Mana: Uji Normalitas Dulu
Langkah yang benar, bukan menebak dari jenis data saja:
- Hitung selisih setiap subjek: nilai pasca dikurangi nilai pra.
- Uji normalitas selisih tersebut dengan Shapiro-Wilk (untuk n < 50, standar di kebanyakan skripsi keperawatan) atau Kolmogorov-Smirnov (untuk n ≥ 50).
- Bila p-value uji normalitas > 0,05, selisih dianggap berdistribusi normal → pakai uji T berpasangan.
- Bila p-value ≤ 0,05, atau data memang berskala ordinal sejak awal → pakai Wilcoxon.
Penjelasan lengkap tentang opsi lain saat data tidak normal — termasuk transformasi data dan bootstrap sebagai alternatif di luar uji nonparametrik — ada di data skripsi tidak normal, apa yang harus dilakukan?.
Jumlah Sampel untuk Desain Pra-Pasca
Jumlah sampel yang cukup untuk mendeteksi perbedaan pra-pasca dihitung dengan power analysis untuk uji berpasangan, bukan rumus Slovin atau Lemeshow biasa yang dipakai untuk survei deskriptif. Tiga input utama: effect size yang ingin dideteksi (semakin kecil effect size yang dianggap bermakna secara klinis, semakin besar sampel yang dibutuhkan), tingkat signifikansi (umumnya α = 0,05), dan power statistik (umumnya 80% atau 90%). Perangkat lunak seperti G*Power bisa menghitung ini secara langsung untuk kedua jenis uji (parametrik dan nonparametrik), dengan catatan Wilcoxon umumnya membutuhkan sampel sedikit lebih besar dari uji T berpasangan untuk mendeteksi effect size yang sama, karena sifatnya yang kurang sensitif.
Contoh Kasus Ilustratif (Data Fiktif)
Contoh untuk penelitian pra-eksperimental “Pengaruh Edukasi Manajemen Nyeri terhadap Skor Nyeri Pasien Pasca Operasi” (data ilustratif, bukan hasil penelitian nyata):
“Skor nyeri diukur menggunakan Numeric Rating Scale (0–10) sebelum dan 24 jam setelah edukasi manajemen nyeri diberikan. Uji normalitas Shapiro-Wilk terhadap selisih skor pra-pasca menghasilkan p = 0,032 (p < 0,05), sehingga selisih data dinyatakan tidak berdistribusi normal. Analisis dilanjutkan dengan uji Wilcoxon signed-rank, menghasilkan Z = −3,21, p < 0,001, menunjukkan penurunan skor nyeri yang signifikan setelah edukasi. Ukuran efek dihitung r = Z/√N = 3,21/√40 ≈ 0,51, tergolong efek besar.” Perhatikan bahwa keputusan memakai Wilcoxon di sini didasarkan pada hasil uji normalitas yang dilaporkan eksplisit, bukan diasumsikan dari awal.

Cara Melaporkan Hasil di Bab IV
Laporan hasil kedua uji punya format yang berbeda dan harus disertai ukuran efek, bukan hanya nilai p:
- Uji T berpasangan — laporkan mean dan SD pra, mean dan SD pasca, nilai t, derajat bebas (df), p-value, dan Cohen’s d sebagai ukuran efek (pedoman kasar: 0,2 kecil, 0,5 sedang, 0,8 besar).
- Wilcoxon — laporkan median (bukan mean, karena data tidak normal atau ordinal) pra dan pasca, nilai Z, p-value, dan r sebagai ukuran efek (0,1 kecil, 0,3 sedang, 0,5 besar).
Kesalahan umum: melaporkan mean dan SD untuk hasil Wilcoxon — karena Wilcoxon bekerja dengan rank, ringkasan deskriptif yang tepat adalah median dan rentang (range) atau interquartile range (IQR), bukan mean dan SD yang mengasumsikan distribusi normal.
Bila Ada Lebih dari Dua Waktu Pengukuran (Pra, Pasca, dan Follow-Up)
Uji T berpasangan dan Wilcoxon signed-rank hanya berlaku untuk membandingkan tepat dua waktu pengukuran. Banyak desain penelitian keperawatan sebenarnya mengukur tiga waktu atau lebih — misalnya sebelum intervensi, segera setelah intervensi, dan pada follow-up beberapa minggu kemudian untuk melihat apakah efeknya bertahan. Membandingkan ketiga waktu ini dengan menjalankan uji T berpasangan/Wilcoxon berkali-kali secara terpisah (pra vs pasca, pasca vs follow-up, pra vs follow-up) tanpa koreksi meningkatkan risiko kesalahan tipe I, sama seperti masalah yang muncul saat membandingkan lebih dari dua kelompok independen.
Uji yang tepat untuk tiga waktu pengukuran atau lebih pada subjek yang sama adalah repeated measures ANOVA (bila data pada tiap waktu berdistribusi normal dan memenuhi asumsi sphericity) atau uji Friedman sebagai padanan nonparametriknya (bila data ordinal atau tidak normal), keduanya diikuti uji lanjut (post-hoc) dengan koreksi Bonferroni atau sejenisnya untuk menentukan pasangan waktu mana yang berbeda signifikan. Kesalahan yang cukup sering ditemukan penguji: mahasiswa dengan desain tiga waktu ukur tetap melaporkan hasil sebagai serangkaian uji T berpasangan/Wilcoxon terpisah, padahal desainnya sudah melampaui cakupan kedua uji yang dibahas di halaman ini.
Kesalahan yang Sering Ditemukan Penguji
- Normalitas diuji pada data pra dan pasca terpisah, bukan pada selisihnya — menghasilkan kesimpulan yang keliru tentang uji mana yang sah dipakai.
- Memakai uji T berpasangan pada data ordinal — skor Likert tunggal atau kategori nyeri diperlakukan seolah data interval tanpa justifikasi.
- Melaporkan mean/SD untuk hasil Wilcoxon — seharusnya median dan IQR, konsisten dengan sifat nonparametrik ujinya.
- Tidak melaporkan ukuran efek — hanya mencantumkan p-value signifikan tanpa r atau Cohen’s d, padahal p-value saja tidak menunjukkan seberapa besar perubahan yang terjadi.
- Software default dipakai tanpa cek asumsi — langsung menjalankan uji T berpasangan di SPSS tanpa mengecek kotak dialog uji normalitas terlebih dahulu.
- Jumlah sampel dihitung dengan rumus survei deskriptif — memakai Slovin atau Lemeshow untuk desain pra-pasca yang sebenarnya butuh power analysis uji berpasangan.
- Uji berpasangan dipakai pada dua kelompok subjek berbeda — desain intervensi vs kontrol dengan subjek berlainan keliru dianalisis dengan uji T berpasangan/Wilcoxon, padahal seharusnya uji T independen/Mann-Whitney U.
Checklist Sebelum Menentukan Uji
- Desain data dipastikan berpasangan (subjek sama, dua waktu) bukan dua kelompok berbeda.
- Selisih pra-pasca (bukan data pra/pasca terpisah) sudah diuji normalitasnya.
- Skala data (interval/rasio vs ordinal) sudah dipastikan sejak Bab III, konsisten dengan instrumen yang dipakai.
- Uji yang dipilih (T berpasangan atau Wilcoxon) sesuai hasil uji normalitas, bukan asumsi.
- Ringkasan deskriptif yang dilaporkan sesuai jenis uji (mean/SD untuk T berpasangan, median/IQR untuk Wilcoxon).
- Ukuran efek (Cohen’s d atau r) dilaporkan bersama p-value, bukan p-value saja.
- Jumlah sampel dihitung dengan power analysis uji berpasangan, bukan rumus survei deskriptif.
Pola pra-pasca ini juga relevan untuk memilih desain penelitian eksperimen atau kuasi-eksperimen keperawatan secara umum, dibahas di apakah skripsi keperawatan boleh eksperimen atau kuasi-eksperimen?, dan pemilihan instrumen baku untuk variabel yang diukur (skor nyeri, kualitas tidur, dan sejenisnya) dibahas di instrumen baku skripsi keperawatan. Struktur lengkap Bab III metode penelitian keperawatan, termasuk desain dan etik penelitian, ada di cara menulis Bab III skripsi keperawatan, dan model utuh skripsi keperawatan dari judul sampai kesimpulan ada di contoh skripsi keperawatan lengkap.
Menentukan uji yang tepat dan melaporkannya dengan format serta ukuran efek yang benar adalah bagian yang paling sering membuat Bab IV harus direvisi berulang. Tesify membantu menyusun alur pemilihan uji statistik dan format pelaporan hasil yang konsisten dengan desain penelitian Anda, sementara Anda tetap menjadi penulis dan penanggung jawab penuh atas isi skripsi.
Pertanyaan yang Sering Diajukan
Apa syarat memakai uji T berpasangan dalam skripsi keperawatan?
Uji T berpasangan sah dipakai bila selisih (pasca dikurangi pra) antara dua pengukuran pada subjek yang sama berdistribusi normal, dan datanya berskala interval atau rasio (mis. tekanan darah, skor nyeri numerik). Normalitas diuji dengan Shapiro-Wilk (untuk sampel kecil, di bawah 50) sebelum memutuskan memakai uji ini.
Kapan Wilcoxon dipakai menggantikan uji T berpasangan?
Wilcoxon signed-rank test dipakai saat selisih pra-pasca tidak berdistribusi normal, atau saat data berskala ordinal (mis. skor Likert, tingkat nyeri kategorikal). Wilcoxon adalah padanan nonparametrik dari uji T berpasangan, dan tetap sah dipakai meski data sebenarnya normal, hanya kurang sensitif menangkap perbedaan kecil dibanding uji T berpasangan.
Bagaimana cara menguji normalitas data pra-pasca sebelum memilih uji?
Uji normalitas dilakukan pada selisih (pasca dikurangi pra), bukan pada data pra dan pasca masing-masing secara terpisah. Shapiro-Wilk dipakai untuk sampel kecil (n di bawah 50), Kolmogorov-Smirnov untuk sampel besar. Bila p-value lebih besar dari 0,05, selisih dianggap berdistribusi normal dan uji T berpasangan sah dipakai.
Apa ukuran efek yang dilaporkan untuk uji Wilcoxon?
Ukuran efek untuk Wilcoxon dilaporkan sebagai r, dihitung dari nilai Z dibagi akar jumlah observasi (r = Z/√N), dengan pedoman kasar 0,1 efek kecil, 0,3 efek sedang, 0,5 efek besar. Ini berbeda dari Cohen’s d yang dipakai untuk melaporkan ukuran efek uji T berpasangan.
Bolehkah memakai uji T berpasangan pada data ordinal seperti skor Likert?
Secara ketat, tidak — skala ordinal seperti skor Likert semestinya diuji dengan Wilcoxon, bukan uji T berpasangan yang mengasumsikan data interval/rasio. Beberapa penelitian memperlakukan skor Likert sebagai data interval bila terdiri dari banyak butir yang dijumlahkan (skor komposit), tapi ini perlu dijustifikasi eksplisit di Bab III, bukan diasumsikan begitu saja.
Berapa jumlah sampel minimum untuk desain pra-pasca keperawatan?
Tidak ada angka baku tunggal; jumlah sampel dihitung dari rumus power analysis untuk uji berpasangan, bergantung pada effect size yang ingin dideteksi, tingkat signifikansi, dan power (umumnya 80%). Semakin kecil effect size yang ingin dideteksi, semakin besar sampel yang dibutuhkan — bukan angka tetap yang sama untuk semua topik.
Apa yang terjadi bila ada banyak nilai selisih nol (tidak berubah) pada data Wilcoxon?
Pasangan data dengan selisih nol (nilai pra dan pasca identik) umumnya dikeluarkan dari perhitungan Wilcoxon sebelum proses ranking, karena tidak memberi informasi arah perubahan. Bila proporsi nilai nol terlalu besar, itu juga sinyal instrumen pengukuran mungkin kurang sensitif menangkap perubahan kecil, dan sebaiknya dicatat sebagai keterbatasan penelitian.
Uji apa yang dipakai bila desain penelitian mengukur lebih dari dua waktu (pra, pasca, follow-up)?
Uji T berpasangan dan Wilcoxon hanya berlaku untuk dua waktu pengukuran. Untuk tiga waktu atau lebih pada subjek yang sama, gunakan repeated measures ANOVA (bila data normal) atau uji Friedman (padanan nonparametriknya), diikuti uji lanjut (post-hoc) dengan koreksi untuk mengetahui pasangan waktu yang berbeda signifikan — bukan mengulang uji T berpasangan/Wilcoxon untuk tiap pasangan waktu tanpa koreksi.
