Bab 12. Evaluasi Mutu Produk: Validasi, Keterbacaan, dan Kepraktisan
Faisal R. Dongoran
Faisal R. Dongoran
Mengapa bab ini penting
Pembuat produk adalah penilai yang paling tidak objektif atas karyanya. Data dari penelaah dan pengguna memberi dasar untuk memutuskan apa yang direvisi dan apa yang dipertahankan.
Empat produk sudah selesai dibuat. Pertanyaan berikutnya bukan "apakah produk ini bagus", melainkan "bagian mana yang perlu diperbaiki, dan atas dasar apa". Evaluasi pada bab ini menjawab pertanyaan kedua.
Evaluasi untuk memperbaiki
Evaluasi pada mata kuliah ini adalah evaluasi formatif, yaitu evaluasi yang bertujuan memperbaiki produk (Plomp & Nieveen, 2013). Evaluasi formatif berbeda dari penilaian akhir. Penilaian akhir memutuskan nilai, sedangkan evaluasi formatif menghasilkan daftar perbaikan.
Dalam kerangka ADDIE pada Bab 2, bab ini berada pada tahap evaluasi. Hasilnya kembali ke tahap pengembangan, karena produk direvisi berdasarkan data.
Empat kriteria mutu
Empat kriteria mutu lazim dipakai dalam penelitian desain pendidikan (Plomp & Nieveen, 2013):
relevansi, yaitu isi produk dibutuhkan dan benar menurut pengetahuan mutakhir;
konsistensi, yaitu produk dirancang secara logis dan bagian-bagiannya selaras;
kepraktisan, yaitu produk dapat dipakai pada situasi sasaran;
efektivitas, yaitu pemakaian produk menghasilkan capaian yang diharapkan.
Contoh pertanyaan untuk tiap kriteria
Contoh berikut adalah rancangan penyusun untuk paket Laundry Bersih.
Relevansi: apakah jurnal penyesuaian sewa pada keempat produk benar?
Konsistensi: apakah tujuan pada design brief, contoh kerja di modul, adegan video, dan soal di spreadsheet melayani tujuan yang sama?
Kepraktisan: apakah siswa dapat membuka e-modul dan mengisi spreadsheet di ponsel tanpa bantuan?
Efektivitas: apakah siswa yang memakai paket lebih sedikit menjurnal seluruh sewa sebagai beban?
Yang diharapkan dan yang aktual
Kepraktisan dan efektivitas dibedakan menjadi yang diharapkan dan yang aktual. Kesimpulan tentang yang aktual baru dapat ditarik setelah pengguna sasaran benar-benar memakai produk.
Batas evaluasi pada mata kuliah ini
Mata kuliah ini menilai tiga kriteria pertama. Efektivitas tidak diukur karena memerlukan pemakaian di kelas sesungguhnya dalam waktu yang lebih panjang.
Akibatnya, laporan T-8 tidak boleh menyimpulkan bahwa paket "efektif meningkatkan hasil belajar". Kesimpulan yang tepat berbunyi, misalnya, "paket dinilai layak oleh penelaah dan praktis oleh pengguna uji coba terbatas". Rumusan ini adalah contoh penyusun.
GAMBAR 12.1 Empat kriteria mutu produk
Empat kartu kriteria mutu produk, tiga berwarna penuh dan satu berwarna pudar. Uraian lengkap ada di bawah gambar.
Kartu relevansi, konsistensi, dan kepraktisan berwarna penuh dan berlabel dinilai pada mata kuliah ini. Kartu efektivitas berwarna pudar dan berlabel memerlukan pemakaian di kelas sesungguhnya.
Satu orang tidak dapat menilai semua hal. Guru akuntansi tepat untuk memeriksa kebenaran jurnal, tetapi belum tentu tepat untuk menilai kontras warna. Siswa tepat untuk menilai kemudahan memakai, tetapi belum dapat menilai kebenaran isi. Karena itu data dikumpulkan dari tiga sumber dengan peran yang berbeda.
Tiga sumber dan perannya
Tiga sumber berikut adalah ketentuan mata kuliah untuk T-8.
Penelaah isi menilai kebenaran dan kesesuaian materi akuntansi. Perannya berkaitan dengan relevansi.
Penelaah media menilai tampilan, navigasi, dan aksesibilitas. Perannya berkaitan dengan konsistensi.
Pengguna uji coba terbatas menilai keterbacaan dan kepraktisan.
Jumlah dan siapa yang dapat dilibatkan
T-8 mensyaratkan minimal dua penelaah dan lima pengguna. Penelaah dapat berupa guru akuntansi atau sejawat dari tim lain. Pengguna dapat berupa siswa atau mahasiswa semester awal.
Memilih penelaah dan pengguna
Saran berikut adalah elaborasi penyusun.
Penelaah isi sebaiknya menguasai akuntansi pada jenjang sasaran, misalnya guru akuntansi SMK atau mahasiswa yang sudah lulus mata kuliah akuntansi keuangan.
Penelaah media sebaiknya sudah mempelajari Bab 2, 3, dan 7, sehingga sejawat dari tim lain di kelas ini dapat berperan.
Pengguna uji coba sebaiknya belum menguasai topik, karena mereka mewakili siswa sasaran. Mahasiswa yang sudah fasih menjurnal penyesuaian kurang tepat menjadi pengguna, karena ia dapat mengisi spreadsheet tanpa membaca petunjuk.
Pembuat produk tidak menjadi penelaah produknya sendiri.
Etika pengumpulan data
Pengguna diberi tahu tujuan uji coba dan boleh menolak ikut. Nama pengguna tidak dicantumkan pada laporan; cukup ditulis sebagai "Pengguna 1" sampai "Pengguna 5". Data pengguna juga tidak dimasukkan ke alat AI, sesuai syarat perlindungan data pada Bab 6. Ketentuan ini adalah rancangan penyusun.
GAMBAR 12.2 Tiga sumber data evaluasi
Diagram tiga sumber data evaluasi yang dihubungkan ke kriteria yang dinilainya. Uraian lengkap ada di bawah gambar.
Penelaah isi terhubung ke relevansi. Penelaah media terhubung ke konsistensi. Pengguna uji coba terbatas terhubung ke keterbacaan dan kepraktisan. Di bawah setiap sumber tertulis jumlah minimalnya, yaitu dua penelaah dan lima pengguna.
Mutu data ditentukan oleh mutu butir instrumen. Butir yang kabur menghasilkan skor yang tidak dapat ditindaklanjuti. Butir yang tajam menunjukkan bagian produk yang perlu diperbaiki.
Bentuk lembar validasi
Lembar validasi (INS-07) memuat butir pernyataan berskala 1 s.d. 4 dan kolom saran. Butir ditulis sebagai pernyataan yang dapat diperiksa.
Lemah: "Materi sudah baik."
Kuat: "Jurnal pada contoh kerja benar."
Lemah: "Tampilan menarik."
Kuat: "Teks isi terbaca pada layar ponsel tanpa diperbesar."
Empat kaidah menulis butir
Kaidah berikut adalah elaborasi penyusun.
Satu butir, satu hal. "Jurnal benar dan tampilannya rapi" memuat dua hal. Bila skornya 2, tim tidak tahu hal mana yang bermasalah.
Sebut objek yang diperiksa. "Takarir menuliskan nama akun dengan benar" lebih tajam daripada "Video mudah diikuti".
Turunkan dari ketentuan yang sudah ada. Butir penelaah media dapat diambil dari lima butir ceklis aksesibilitas pada Bab 3, daftar periksa infografik pada Bab 7, dan daftar periksa video pada Bab 9.
Hindari kata yang menuntun. "Spreadsheet sangat membantu, bukan?" mendorong jawaban setuju.
Contoh butir untuk tiap sumber
Contoh berikut adalah rancangan penyusun.
Penelaah isi:
"Jurnal penyesuaian pada contoh kerja benar."
"Nama akun sama di keempat produk."
"Kunci jawaban pada spreadsheet benar untuk semua soal."
Penelaah media:
"Kontras teks terhadap latar memenuhi 4,5:1."
"Setiap gambar bermakna memiliki teks alternatif."
"Takarir video sinkron dengan narasi."
Pengguna uji coba:
"Saya dapat menemukan video dari e-modul tanpa bantuan."
"Angka pada video terbaca di ponsel saya."
"Pesan pada spreadsheet membantu saya menemukan kesalahan."
Angket keterbacaan untuk pengguna
Angket keterbacaan untuk pengguna memakai bahasa sederhana dan menanyakan pengalaman memakai produk. Butir pengguna ditulis dengan kata "saya", karena pengguna menilai pengalamannya sendiri, bukan mutu teknis produk.
Kolom saran terbuka sering memberi data yang paling berguna untuk revisi. Pertanyaan saran yang terarah lebih mudah dijawab, misalnya "Bagian mana yang paling membingungkan?" daripada "Ada saran?".
Menyebarkan angket
Angket dapat dibuat dengan Google Forms dan disematkan pada halaman Google Sites, sehingga pengguna mengisinya setelah mencoba paket di halaman yang sama.
GAMBAR 12.3 Butir lemah dan butir kuat
Perbandingan dua pasang butir instrumen, yang lemah dan yang dapat diperiksa. Uraian lengkap ada di bawah gambar.
Pasangan pertama: butir lemah materi sudah baik, butir kuat jurnal pada contoh kerja benar. Pasangan kedua: butir lemah tampilan menarik, butir kuat teks isi terbaca pada layar ponsel tanpa diperbesar.
Skor dari penelaah dan pengguna perlu diringkas agar dapat dibaca. Ringkasan itu berupa persentase, lalu ditafsirkan dengan kategori. Namun angka hanya separuh cerita. Separuh lainnya ada pada saran.
Rumus persentase
Skor diolah menjadi persentase:
persentase = jumlah skor yang diperoleh / skor maksimum × 100
Skor maksimum dihitung dari jumlah penilai × jumlah butir × skor tertinggi skala.
Lima kategori
Sebagai ketentuan mata kuliah, hasilnya ditafsirkan dengan lima kategori:
81 s.d. 100: sangat layak;
61 s.d. 80: layak;
41 s.d. 60: cukup layak;
21 s.d. 40: kurang layak;
0 s.d. 20: tidak layak.
Tiga tingkat pengolahan
Pengolahan berikut adalah rancangan penyusun.
Per sumber, yaitu persentase penelaah isi, penelaah media, dan pengguna dihitung terpisah. Ketiganya tidak dirata-ratakan menjadi satu angka, karena masing-masing menjawab kriteria yang berbeda.
Per butir, yaitu persentase setiap butir dihitung untuk menemukan bagian yang paling lemah. Rata-rata yang tinggi dapat menyembunyikan satu butir yang rendah.
Per saran, yaitu saran dikelompokkan menurut produk dan isinya, lalu dihitung berapa orang yang menulis hal yang sama.
Membaca saran
Persentase tinggi tidak menghapus kewajiban membaca saran. Satu saran tentang jurnal yang keliru lebih penting daripada rata-rata yang baik.
Contoh berjalan: data Laundry Bersih
Angka berikut rekaan untuk ilustrasi.
Penelaah isi. Dua penelaah isi menilai 10 butir berskala 4, sehingga skor maksimum tiap penelaah 40. Skor yang diperoleh 33 dan 35.
persentase = (33 + 35) / 80 × 100 = 85, kategori sangat layak.
Pengguna uji coba. Lima pengguna menilai 6 butir berskala 4, sehingga skor maksimum tiap pengguna 24 dan skor maksimum seluruhnya 120. Skor yang diperoleh 20, 21, 19, 22, dan 18, dengan jumlah 100.
persentase = 100 / 120 × 100 = 83,3, kategori sangat layak.
Satu butir pengguna. Butir "Angka pada video terbaca di ponsel saya" mendapat skor 2, 2, 3, 2, dan 4, dengan jumlah 13. Skor maksimum butir ini 5 × 4 = 20.
persentase = 13 / 20 × 100 = 65, kategori layak.
Butir ini paling rendah di antara butir pengguna. Tiga pengguna memberi skor 2, dan ketiganya juga menulis saran yang sama pada kolom saran. Data per butir inilah yang menjadi dasar keputusan revisi pada Subbab 12.5, walaupun persentase keseluruhan pengguna sudah sangat layak.
Mengolah di spreadsheet
Bila skor satu penilai untuk 10 butir ada di B2 sampai K2 dan skala tertingginya 4, persentasenya:
=SUM(B2:K2)/(COUNT(B2:K2)*4)*100
COUNT menghitung jumlah butir yang terisi, sehingga butir yang tidak dijawab tidak ikut menambah skor maksimum. Rumus ini adalah rancangan penyusun.
GAMBAR 12.4 Lima kategori kelayakan
Skala 0 sampai 100 yang terbagi menjadi lima kategori kelayakan. Uraian lengkap ada di bawah gambar.
Skala terbagi lima pita berurutan, yaitu 0 sampai 20 tidak layak, 21 sampai 40 kurang layak, 41 sampai 60 cukup layak, 61 sampai 80 layak, dan 81 sampai 100 sangat layak. Dua penanda menunjukkan contoh hasil, yaitu 65 pada pita layak dan 85 pada pita sangat layak.
Data evaluasi baru bermanfaat bila berubah menjadi keputusan. Tabel keputusan revisi mencatat setiap saran, data yang mendukungnya, keputusan tim, dan tindakan yang dilakukan.
Empat unsur setiap saran
Setiap saran dicatat dengan empat unsur:
saran;
data pendukung;
keputusan, yaitu diterima atau ditolak;
tindakan.
Saran boleh ditolak
Saran boleh ditolak asalkan alasannya ditulis. Keterlacakan inilah yang dinilai paling tinggi pada Rubrik R-9.
Dasar menerima atau menolak
Pertimbangan berikut adalah elaborasi penyusun.
Diterima, bila saran menyangkut kebenaran isi, didukung lebih dari satu sumber, atau sejalan dengan butir yang skornya rendah.
Ditolak dengan alasan, bila saran bertentangan dengan tujuan pembelajaran, bertentangan dengan prinsip yang dipakai, atau tidak dapat dikerjakan dalam waktu yang tersedia.
Diterima sebagian, bila hanya sebagian saran dapat dikerjakan. Bagian yang tidak dikerjakan dicatat beserta alasannya.
Saran tentang kebenaran jurnal selalu diterima, walaupun hanya ditulis satu penelaah, karena kesalahan isi tidak dapat dibiarkan dalam bahan ajar.
Menulis di Google Sites
Naskah ini tidak memakai tabel. Tabel keputusan revisi dapat disusun di Google Sheets dengan empat kolom, lalu disematkan pada halaman laporan. Bila ditulis langsung di kotak teks, setiap saran ditulis sebagai satu kelompok berisi empat butir, seperti contoh berikut.
Contoh berjalan: keputusan revisi Laundry Bersih
Contoh berikut memuat satu saran yang diterima, sesuai naskah yang disetujui, dan satu saran yang ditolak. Saran kedua adalah contoh penyusun.
Saran 1
Saran: angka pada video sulit dibaca di ponsel.
Data pendukung: tiga dari lima pengguna menulis hal yang sama.
Keputusan: diterima.
Tindakan: segmen 2 direkam ulang dengan tampilan diperbesar.
Saran 2
Saran: tambahkan musik latar sepanjang video agar tidak membosankan.
Data pendukung: satu dari lima pengguna.
Keputusan: ditolak.
Tindakan: tidak ada perubahan. Alasan: musik selama narasi menambah pemrosesan ekstrinsik dan melanggar prinsip koherensi pada Bab 2.
Saran pertama juga didukung data per butir pada Subbab 12.4, yaitu skor 65 persen pada butir keterbacaan angka. Saran kedua ditolak dengan merujuk prinsip, sehingga keputusannya tetap dapat dilacak.
GAMBAR 12.5 Dua kartu keputusan revisi
Dua kartu keputusan revisi, satu diterima dan satu ditolak. Uraian lengkap ada di bawah gambar.
Kartu pertama mencatat saran angka video sulit dibaca, didukung tiga dari lima pengguna, diterima, dan ditindaklanjuti dengan merekam ulang segmen 2. Kartu kedua mencatat saran menambah musik latar, didukung satu pengguna, ditolak karena melanggar prinsip koherensi.
Aiken, L. R. (1985). Three coefficients for analyzing the reliability and validity of ratings. Educational and Psychological Measurement, 45(1), 131–142. https://doi.org/10.1177/0013164485451012
Nieveen, N., & Folmer, E. (2013). Formative evaluation in educational design research. In T. Plomp & N. Nieveen (Eds.), Educational design research. Part A: An introduction (pp. 152–169). SLO.
Plomp, T., & Nieveen, N. (Eds.). (2013). Educational design research. Part A: An introduction. SLO. https://www.slo.nl/publish/pages/2904/educational-design-research-part-a.pdf
Tessmer, M. (1993). Planning and conducting formative evaluations: Improving the quality of education and training. Kogan Page.