Angkanya Turun, tapi yang Turun Apa? Cara Membaca Tren Tracker Saat Cara Ukurnya Berubah
Beberapa hari lalu saya kebagian jatah sharing di LEFO (learning forum) internal tim Market Research Nutrifood. Judul yang saya bawa kelihatan sederhana, mungkin terlalu sederhana untuk sebuah forum:
Angkanya turun. Yang turun apa?
Itu saja. Satu pertanyaan yang, jujur, hampir tidak pernah kita ajukan sebelum sebuah rapat berubah jadi tegang.
Di meja kerja market research (tapi bukan di Nutrifood ya), ada kebiasaan yang sudah mendarah daging. Begitu angka tracker bergerak naik, kita cepat mengklaim keberhasilan pekerjaan pemasaran. Begitu angkanya turun, kita mencari penjelasan di pasar: konsumen berubah, kompetitor agresif, iklan kita kalah. Padahal, dan ini bagian yang tidak nyaman, sebagian angka tracker yang bergerak bergerak bukan karena pasar yang berubah, bisa jadi berasal dari alat ukur kita sendiri yang berubah.
Selama ini kita rajin mengukur merek. Kita jarang sekali mengukur alat ukurnya sendiri. Tulisan ini adalah rangkuman sesi LEFO itu: bagaimana caranya mulai mengukur alat ukur kita sendiri, tanpa perlu menambah anggaran riset.
Sebelum Diet, Cek Timbangannya Dulu
Mari mulai dari yang paling akrab.
Bayangkan pagi ini Anda menimbang berat badan dan angkanya naik dua kilogram. Padahal kemarin Anda baru mengganti timbangan kamar mandi, dan tadi Anda menimbang sambil masih memakai jaket. Pertanyaannya: kenapa beratnya naik?
Ada tiga kemungkinan yang sama masuk akalnya:
- Anda memang lebih berat. Tidak ada yang salah. Ini perubahan nyata.
- Timbangan barunya beda hitungan. Berat Anda mungkin sama, alatnya yang memberi angka berbeda.
- Gara-gara jaket dan jam menimbang. Kebetulan, gangguan kecil, tapi cukup menggeser angka.
Kalau Anda di posisi ini, apa yang Anda lakukan? Diet? Kebanyakan orang tidak. Kebanyakan orang akan bilang: “cek timbangannya dulu.”
Anehnya, untuk tracker kita, kita jarang sekali melakukan “cek timbangan dulu” ini. Kita langsung panik, langsung bikin presentasi, langsung menyalahkan pasar.
Tracker kita persis seperti timbangan kamar mandi itu.
Analogi ini saya pakai sampai akhir sesi, karena ia melekat dan tidak butuh istilah teknis apa pun untuk dipahami.
Setiap Angka yang Bergerak Punya Tiga Penyebab
Dari analogi timbangan, kita bisa tarik pelajaran pertama sesi ini: setiap angka tracker yang bergerak punya tiga kemungkinan sumber, bukan satu.
| Sumber | Dalam analogi timbangan | Contoh di tracker | Seberapa sering kita laporkan |
|---|---|---|---|
| True change | “Saya memang lebih berat.” | Konsumen berubah kebiasaan; persepsi merek bergeser; kampanye kita berhasil (atau gagal) | Hampir selalu kita laporkan |
| Artefak alat ukur | “Timbangan barunya beda.” | Pertanyaan atau label diubah; cara wawancara atau vendor berganti; cara menghitung angkanya diganti | Hampir tidak pernah kita sebut |
| Noise acak | “Gara-gara jaket.” | Kebetulan siapa yang terpilih jadi responden; beda hari, beda pewawancara; terjadi walau tidak ada yang berubah | Hampir tidak pernah kita ukur besarnya |
Inilah inti persoalannya:
Di laporan, kita hampir selalu bercerita tentang kolom pertama. Kolom kedua jarang disebut, dan kolom ketiga hampir tidak pernah kita hitung besarnya.
Sisa tulisan ini sebenarnya hanya dua hal: cara mengenali kolom kedua dan cara mengukur kolom ketiga. Tidak ada yang menakutkan, dan tidak ada yang butuh rumus rumit.
“Pernah Mengalami Ini?”
Sebelum masuk ke teori, mari kita akui dulu bahwa gejala ini sudah lama kita alami. Coba tebak: dari empat kejadian di bawah, mana yang sebenarnya soal alat ukur, dan mana yang soal konsumen?
| Kejadian | Angka yang terlihat | Kemungkinan besar penyebabnya | Sumber |
|---|---|---|---|
| Kuesioner baru saja dipendekkan dari 25 ke 15 menit, lalu Top-2 box turun | −4 poin | Kuesioner yang lebih pendek mengubah urutan dan suasana menjawab | Alat ukur |
| Angka naik tepat setelah libur sekolah, tim langsung bilang “kampanye berhasil” | +3 poin | Musiman. Perubahan nyata, tapi bukan karena merek kita. Bandingkan dengan libur sekolah tahun lalu | Pasar (tapi bukan karena kita) |
| Awareness melompat persis di bulan kita ganti vendor panel | Melompat | Yang ditanya sudah bukan orang yang “sama”. Respondennya berganti, angkanya ikut berganti | Alat ukur |
| Kesimpulan rapat berbalik karena “top box” dihitung dari skor 4–6, bukan lagi 5–6 | Berbalik | Cara menghitungnya yang berubah. Tidak ada satu pun responden yang berubah pikiran | Alat ukur |
Tiga dari empat ternyata soal alat ukur, bukan soal konsumen. Pola ini yang berulang di banyak tracker, di banyak perusahaan.
Apa Saja yang Bisa Bergeser di Tengah Tren
Pelajaran kedua: alat ukur kita tidak hanya berubah lewat satu pintu. Ada banyak pintu, dan sebagian besar tidak kita sadari ketika kita membukanya. Enam kategori berikut saya susun dari yang paling sering terjadi.
| Kategori | Contoh perubahan yang lazim |
|---|---|
| Populasi, sampel, dan frame | Sumber sampel berubah (panel tetap → panel fresh); definisi target berubah; skema weighting diganti; cakupan geografis ditambah ke tier 2/3 |
| Mode pengumpulan data | Tatap muka → online; telepon → online; mode interviewer-administered cenderung memunculkan efek recency, mode self-administered cenderung memunculkan primacy dan lebih banyak straightlining |
| Instrumen | Skala dari 5 ke 7 poin; label di semua titik vs hanya ujungnya; wording pertanyaan diubah; urutan butir diubah; jumlah butir dikurangi |
| Protokol lapangan | Waktu wawancara bergeser; insentif berubah; aturan penggantian responden berubah; jumlah supervisor dan cakupan area berubah |
| Pengolahan dan penyajian | Aturan cleaning berubah (batas durasi, definisi speeder); imputasi ditambah/dihapus; definisi metrik berubah (top box → top-2 box) |
| Konteks eksternal | Musiman (Ramadan, libur sekolah, akhir tahun, musim hujan); out of stock; peristiwa besar (pemilu, kenaikan harga, wabah) |
Bedanya jelas: lima kategori pertama adalah internal kita. Artinya bisa dikendalikan dan didokumentasikan. Hanya kategori terakhir yang benar-benar “dunia”. Ironisnya, justru yang internal yang paling sering kita lupakan, padahal yang eksternal yang paling sering kita tuduh.
Kalau Penggarisnya Berubah, Apa yang Masih Boleh Dibandingkan
Sampai sini mungkin ada yang bertanya: kalau begitu, semua perbandingan lintas waktu tidak ada gunanya dong?
Tidak juga. Kabar baiknya, kita bisa tahu persis apa yang masih boleh dibandingkan. Di sesi LEFO saya pakai analogi penggaris.
Bayangkan skala jawaban kita sebagai penggaris. Angka 1 sampai 6 adalah “garis-garis di penggaris”. Yang menentukan arti penggaris itu bukan angkanya, tapi kata-kata di bawahnya, urutan butirnya, dan cara kita menghitungnya. Semua itu bisa berubah walaupun penggarisnya tetap bertuliskan 1–6 — persis seperti skala kita yang memang selalu 1–6, tanpa titik tengah, dengan top-2 box = skor 5 dan 6.
Di sesi itu saya demokan: label versi lama hanya diberi kata di ujung 1 dan 6, label versi baru diberi kata di semua titik. Skalanya sama-sama 1–6, tapi yang dibaca responden berbeda. Belum lagi karena skala kita tidak punya titik netral, responden yang ragu “dipaksa” memilih antara 3 atau 4 — jadi kalau komposisi responden bergeser (misal ganti vendor), isi zona ragu pun ikut bergeser.
Aturan sederhananya seperti ini:
| Yang dibandingkan | Status | Penjelasan |
|---|---|---|
| Pola dan struktur | Masih aman | “Merek A tetap paling disukai, dan rasa tetap alasan nomor satu orang membeli.” Urutan merek dan hubungan antar-pertanyaan biasanya tetap bisa dibaca, karena diukur dengan penggaris yang sama di bulan yang sama |
| Angka persisnya | Belum boleh | “Top-2 box kepuasan turun dari 48% ke 41%.” Angka sebelum dan sesudah perubahan diukur dengan penggaris yang berbeda — ibarat membandingkan berat dari dua timbangan yang berbeda |
Istilah teknis untuk ini adalah measurement invariance. Ilmuwan survei punya beberapa tingkatannya (configural, metric, scalar, strict), dan yang perlu kita ingat untuk sekarang cuma satu: perbandingan angka antar-waktu hanya sah kalau penggarisnya sama. Kalau penggarisnya berubah, yang masih boleh dibaca adalah polanya, bukan level angkanya.
Angka Tracker Bisa Goyang Sendiri
Sekarang kita masuk ke kolom ketiga, yang paling sering kita abaikan: noise acak. Ini bagian yang paling banyak membuat orang terkejut di sesi LEFO.
Analogi paling gampang: timbang badan dua kali dalam satu menit. Angkanya bisa beda sedikit, padahal Anda tidak berubah. Tracker juga begitu. Bahkan tanpa ada perubahan apa pun di dunia dan di cara ukur kita, angka tracker bisa bergoyang.
Kita bisa mengukur besar goyangan ini dengan prosedur sederhana, istilahnya split-half:
- Ambil responden dari satu periode riset yang sama (misalkan: bulan yang sama, pasar yang sama) misalnya 800 orang.
- Kocok dan bagi dua, seperti mengocok kartu: 400 + 400.
- Hitung top2boxes tiap kelompok, lalu lihat selisihnya.
Orangnya sama, hanya dikocok. Harusnya angkanya sama, bukan? Kenyataannya tidak. Mereka bisa berbeda 3, 5, bahkan 7 poin. Rentang goyangan ini disebut noise band. Padanan kata bakunya di literatur survei adalah MDD (minimum detectable difference).
![]()
Contoh ilustratifnya begini. Dengan 400 responden per kelompok dan angka top2boxes sekitar 40 persen, batas 95 persen dari selisih dua kelompok itu jatuh di sekitar 6,8 poin. Artinya, dua kelompok yang berasal dari bulan yang sama pun bisa berbeda sampai sekitar tujuh poin hanya karena kebetulan.
Kalau begitu, kesimpulannya menohok:
Kalau dua kelompok dari bulan yang sama saja bisa beda segini, naik-turun tiga poin antar-bulan belum layak jadi berita.
Berapa pun respondennya, kita bisa memperhitungkan ini. Makin banyak responden, makin kecil goyangannya (dengan 400 responden per kelompok, batasnya sekitar 7 poin; dengan 2.000 orang, jatuh ke sekitar 3 poin). Semua angka di sini ilustrasi, bukan hasil tracker kita, dan bisa dihitung ulang memakai data wave yang sudah ada.
Satu hal penting: noise band dari split-half ini baru menangkap noise statistik. Ada juga process noise dari lapangan seperti efek pewawancara, area, waktu lapangan, pengolahan. Caranya: ulangi langkah di atas untuk 8–12 metrik kunci selama 6 bulan, kumpulkan semua selisihnya, lalu ambil persentil ke-95. Biasanya hasilnya lebih besar dari hitungan statistik semata, dan itulah temuan yang sering mengejutkan.
Lampu Lalu Lintas Angka
Setelah punya noise band, kita bisa mengubah angka jadi keputusan. Di sesi LEFO saya pakai “lampu lalu lintas” tiga zona.
| Zona | Syarat | Artinya |
|---|---|---|
| Stabil | Gerakan berada di dalam noise band | Tidak bisa disimpulkan apa-apa. Lampu hijau untuk tenang |
| Tunggu bukti (grey zone) | Gerakan melewati noise band, tapi masih di bawah 2× noise band | Belum berita. Perlu bukti pendukung lain: data perilaku, temuan kualitatif, atau wave berikutnya |
| Berubah | Gerakan jauh melewati noise band dan konsisten antar-_wave_ | Baru boleh disebut perubahan |
![]()
Contoh dengan angka ilustrasi. Top2boxes bulan ini dibanding bulan lalu turun 3,0 poin, sedangkan noise band kita 6,8 poin. Arahnya baru satu bulan. Maka lampunya stabil — bukan karena angkanya bohong, tapi karena gerakannya masih di dalam batas goyang.
Sekarang geser angkanya: turun 15 poin, dan arahnya sama dua bulan berturut-turut. Lampunya menyalakan berubah.
Ada satu tombol merah yang wajib dipasang: kalau di bulan itu ada perubahan cara ukur, lampunya jadi merah, apa pun besar angkanya. Artinya, cek alat ukurnya dulu sebelum bicara pasar.
Dan ini kata kunci yang saya minta tim bawa pulang: “tercatat”. Kalimat “Top2boxes tercatat turun 3 poin” melaporkan apa yang terbaca di alat ukur, dan itu lebih jujur daripada “kepuasan konsumen turun”.
Jangan Percaya Satu Saksi
Lalu, bagaimana kalau noise band dilewati jauh dan kita benar-benar curiga ada perubahan nyata? Di sini kita butuh saksi kedua.
Logikanya seperti logika detektif. Survei bukan satu-satunya saksi. Ada behavioral control series: penjualan internal, panel rumah tangga, retail audit, bahkan Google Trends. Kuncinya, cari data yang cara ukurnya tidak ikut berubah di bulan yang sama.
- Kalau survei turun dan penjualan ikut turun → dua saksi dengan cara ukur berbeda bercerita sama. Ceritanya makin bisa dipercaya.
- Kalau survei melompat tapi penjualan tenang → hanya satu saksi yang berubah cerita, dan itu persis di bulan cara ukurnya diganti. Tersangka utamanya: alat ukur.
![]()
Satu catatan jujur yang perlu diingat: data penjualan dan panel juga bisa berubah cara ukurnya, misalnya outlet atau panelnya berganti. Aturan yang sama tetap berlaku untuk mereka. Jangan anggap data perilaku otomatis “angka keras” yang kebal dari masalah ini.
Kalau Cara Ukur Terpaksa Berubah: Tiga Cara Jujur Menyambung Grafik
Realistisnya, kadang perubahan cara ukur tidak bisa dihindari: anggaran memaksa pindah vendor, kuesioner harus dipendekkan, mode harus pindah ke online. Pertanyaannya bukan “bagaimana agar tidak berubah”, tapi “bagaimana menyambung grafiknya dengan jujur”. Ada tiga jalan.
| Jalan | Butuh apa | Kapan dipakai |
|---|---|---|
| Koreksi (equating) | Anggaran | Sebelum pindah, jalankan cara lama dan cara baru bersamaan di bulan yang sama. Karena orangnya dari bulan yang sama, beda hasilnya murni efek cara ukur. Beda itu lalu dipakai untuk mengoreksi seri |
| Pakai jangkar (anchor items) | Tanpa anggaran tambahan | Sediakan 3–5 pertanyaan yang tidak pernah diubah sama sekali. Amati jarak antara angka utama dengan angka jangkar. Kalau jaraknya melebar tepat di bulan perubahan, jarak itu adalah efek pertanyaannya |
| Mulai garis baru (rebaseline) | Keberanian | Kalau bukti tidak cukup, putus grafiknya, tandai “seri v2”, dan cantumkan tanggal mulainya. Paling jujur, walau paling tidak nyaman |
![]()
Ada dua hal penting soal jalan “koreksi”.
Pertama, uji kecil hanya bisa bilang “ada bedanya”, belum bisa mengoreksi dengan tepat. Untuk mengoreksi dengan presisi, butuh responden yang banyak. Ini terkait erat dengan apa yang saya tulis di artikel lain soal metode Denton: di sana masalahnya menyambung dua data beda level dan beda frekuensi, di sini masalahnya menyambung dua seri beda cara ukur. Semangatnya sama: jangan menempel begitu saja dua angka yang diukur dengan standar berbeda! Cari dulu cara menyetarakannya, atau akui bahwa keduanya memang beda.
Kedua, jangkar itu harus dijaga. Kalau pertanyaan jangkarnya sendiri ikut bergeser, seluruh penyambungan jadi runtuh. Jadi pilih jangkar yang benar-benar stabil, dan jangan pernah mengutak-atiknya.
Studi Kasus: Kepuasan Merek A
Sekarang mari gabungkan semuanya dalam satu latihan detektif. Ini contoh yang saya pakai di sesi LEFO (semua angkanya ilustrasi).
Situasinya: Sebuah tracker bulanan merek A, dengan 18 bulan data. Di bulan ke-13 ada tiga perubahan sekaligus: responden panel diganti, kuesioner dipendekkan, dan label skala 1–6 kini ditulis di semua titik.
Yang kita lihat: Dari bulan ke-13 sampai ke-18, top2boxes kepuasan turun dari 42 persen ke 36 persen. Kalau ini laporan Anda, apakah konsumen makin tidak puas?
Jangan terburu-buru menyimpulkan! Kita kumpulkan empat bukti dulu!
| Bukti | Temuan | Cara membacanya |
|---|---|---|
| 1. Apa ada yang diubah di bulan 13? | Ada, tiga sekaligus: responden panel diganti, kuesioner dipendekkan, label skala diubah | Wajib cek alat ukur dulu |
| 2. Turun 6 poin: lebih besar dari noise band? | Tidak. Dengan 800 responden, noise band-nya sekitar ±7 poin | Turun 6 poin masih bisa terjadi karena kebetulan |
| 3. Bagaimana pertanyaan jangkar? | Tenang, bertahan di sekitar 55 persen | Pertanyaan yang tidak diubah sama sekali tidak ikut turun |
| 4. Bagaimana saksi lain: penjualan? | Stabil, di sekitar indeks 100 | Konsumen tetap membeli seperti biasa |
![]()
Empat bukti, dan tidak satu pun mendukung “konsumen makin tidak puas”. Maka kalimat laporan yang jujur kira-kira begini:
“Kepuasan tercatat turun 6 poin, bersamaan dengan pergantian responden dan perubahan label skala. Pertanyaan jangkar dan penjualan stabil, jadi kami belum menyebutnya penurunan kepuasan.”
Perhatikan: kalimat ini tidak menakut-nakuti, tapi juga tidak menyembunyikan. Ia hanya menyampaikan apa yang benar-benar kita ketahui, dan mengakui apa yang belum.
Tiga Kebiasaan Murah, Tanpa Anggaran Baru
Kalau semua ini terasa berat, tenang. Ada tiga kebiasaan yang bisa kita mulai hari ini, tanpa menambah satu rupiah pun anggaran riset.
| Kebiasaan | Bentuknya | Istilah |
|---|---|---|
| Buku harian tracker | Satu halaman: tanggal, apa yang diubah, kenapa, siapa yang memutuskan. Setiap perubahan diberi nomor versi | Change log |
| Batas goyang | Hitung dari data yang sudah ada dengan membagi responden jadi dua kelompok kembar. Tidak perlu fieldwork baru | Noise band |
| Pertanyaan jangkar | 3–5 pertanyaan yang kalimat, label 1–6, dan posisinya tidak boleh diubah, minimal dua tahun | Anchor items |
Ketiganya murah, dan ketiganya menutup tiga lubang yang tadi kita bicarakan: buku harian menutup kolom kedua (artefak alat ukur), batas goyang menutup kolom ketiga (random noise), dan pertanyaan jangkar jadi jaring pengaman kalau perubahan tetap terjadi.
Epilog
Yang ingin saya tunjukkan lewat tulisan ini bukan cara membuat analisis yang rumit, malah sebaliknya. Semua yang kita bahas tadi — cek timbangan, noise band, pertanyaan jangkar — adalah hal-hal sederhana yang cenderung kita lompati karena tergesa-gesa.
Saya tutup dengan kalimat yang saya pakai menutup sesi LEFO:
Yang salah bukan angkanya. Yang salah adalah grafik tanpa catatan.
Sebelum diet, cek timbangannya dulu.
if you find this article helpful, support this blog by clicking the ads.