Confidence threshold adalah skor batas yang menentukan apakah sebuah evaluasi AutoQA sudah cukup andal untuk langsung ditindaklanjuti tanpa dicek ulang oleh manusia. Jika threshold-nya terlalu rendah, Anda akan mengotomatisasi keputusan yang sebenarnya masih diragukan oleh model. Jika terlalu tinggi, terlalu banyak percakapan yang dikembalikan ke review manual, sehingga bottleneck sampling yang seharusnya dihilangkan oleh AutoQA justru muncul kembali. Threshold yang tepat bukan angka tunggal yang diambil dari pengaturan default vendor; angka ini dihitung per metrik QA, divalidasi terhadap skor historis milik perusahaan sendiri, dan ditinjau ulang secara berkala seiring perubahan pada agent, kebijakan, dan bahasa pelanggan [workforceplaybook.ai].
Ringkasan
- Confidence threshold menentukan skor AutoQA mana yang bisa dipercaya secara otomatis dan mana yang perlu diteruskan ke reviewer manusia.
- Threshold sebaiknya dihitung per metrik menggunakan precision, recall, dan skor F1, bukan disamaratakan sebagai satu persentase tetap untuk semua kriteria QA [workforceplaybook.ai].
- Kalibrasi berarti membandingkan confidence model dengan akurasi aktual pada kumpulan percakapan yang sudah diskor sebelumnya, lalu menyesuaikan hingga keduanya selaras [llamaindex.ai].
- Bahkan skor yang lolos threshold pun tetap perlu diperiksa lewat sampling, karena otomatisasi tanpa audit trail justru menciptakan blind spot baru [rills.ai].
- Evaluator berbasis LLM terkemuka sudah mencapai tingkat kesepakatan lebih dari 80% dengan penilai manusia, setara dengan tingkat kesepakatan antara dua penilai manusia yang menilai ticket yang sama [research finding].
Tentang Penulis: Artikel ini ditulis berdasarkan pengalaman Revelir AI membangun RevelirQA, mesin AutoQA yang menskor 100% percakapan customer service untuk klien enterprise termasuk Xendit dan Tiket.com, memproses ribuan ticket per minggu dalam bahasa Inggris, Indonesia, Thailand, dan Tagalog.
Apa Sebenarnya Confidence Threshold dalam AutoQA?
Confidence threshold adalah skor minimum yang harus diberikan model pada outputnya sendiri sebelum output tersebut dianggap final, bukan sekadar provisional. Dalam auto QA, setiap percakapan yang diskor membawa dua angka: skor QA itu sendiri (apakah agent mengikuti kebijakan refund, apakah nada bicaranya sesuai, apakah masalah terselesaikan) dan nilai confidence yang menyertai skor tersebut. Nilai confidence memperkirakan seberapa yakin model terhadap kebenaran alasan penilaiannya, berdasarkan seberapa jelas percakapan tersebut cocok dengan bahasa kebijakan yang diambil model [workforceplaybook.ai] [getclaro.ai]. Kebijakan threshold kemudian menentukan langkah berikutnya: auto-approve, ditandai untuk direview, atau ditolak dan dijalankan ulang [getclaro.ai]. Perbedaan ini penting karena skor confidence dan kebijakan threshold menjawab dua pertanyaan berbeda. Skor menjawab "seberapa besar kemungkinan ini benar?" Kebijakan menjawab "apa yang boleh dilakukan sistem terhadap kemungkinan itu?" [getclaro.ai]
Mengapa Tidak Bisa Memakai Satu Threshold untuk Semua Metrik QA?
Karena setiap kriteria QA membawa konsekuensi berbeda ketika salah, dan satu threshold tetap mengabaikan hal itu. Sapaan yang terlewat atau waktu respons yang sedikit terlambat termasuk risiko rendah jika AI salah menilai: manusia pada akhirnya akan menangkapnya dan tidak ada konsekuensi regulasi yang menyusul. Sebaliknya, persyaratan disclosure yang terlewat pada produk pinjaman, atau pernyataan yang keliru soal aturan kelayakan refund, termasuk risiko tinggi: kesalahan semacam ini yang terjadi dalam skala besar berarti kesalahan yang sama berulang di ribuan percakapan sebelum ada yang menyadarinya. Inilah persoalan yang selalu dihadapi sampling QA manual, yang hanya mengulas 1 sampai 5% percakapan, dengan 2% sebagai benchmark industri yang paling sering dikutip, artinya kesalahan kebijakan yang sistemik pada 98% percakapan yang tidak direview tidak akan pernah terlihat. Solusinya bukan satu confidence threshold, melainkan threshold per metrik, dibobot berdasarkan seberapa mahal biaya false positive pada kriteria spesifik tersebut:
| Jenis Metrik QA | Biaya Auto-Approval yang Salah | Posisi Threshold yang Direkomendasikan |
|---|---|---|
| Bahasa compliance / disclosure | Tinggi - eksposur regulasi atau finansial | Threshold tinggi, sampling rendah pada skor yang lolos tetap direkomendasikan |
| Kepatuhan kebijakan (refund, aturan escalation) | Sedang - kepercayaan dan konsistensi pelanggan | Threshold moderat, rekalibrasi berkala |
| Nada bicara, empati, format | Rendah - sinyal coaching, bukan risiko compliance | Threshold lebih rendah dapat diterima, tingkat otomatisasi lebih tinggi |
Bagaimana Cara Menghitung Threshold yang Tepat?
Berdasarkan logika per metrik di atas, pertanyaan yang lebih sulit adalah dari mana angka aktualnya berasal. Angka ini tidak ditebak, melainkan diturunkan dari dataset berlabel, sama seperti cara memvalidasi sistem klasifikasi mana pun. Ambil sekumpulan percakapan yang sudah diskor manual oleh tim, jalankan percakapan yang sama melalui mesin AutoQA, lalu bandingkan kedua set skor tersebut kriteria demi kriteria [voxjar.com]. Dari situ, berlaku metodologi standar: hitung precision (dari skor yang ditandai model sebagai high-confidence, berapa yang benar-benar tepat), recall (dari semua skor yang seharusnya benar, berapa yang berhasil ditangkap model pada threshold tersebut), dan skor F1, yang menyeimbangkan keduanya. Evaluator juga memetakan kurva precision-recall di setiap kemungkinan nilai threshold dan menghitung mean average precision, yang menunjukkan keseluruhan kurva tradeoff, bukan sekadar satu titik estimasi. Menaikkan threshold hampir selalu meningkatkan precision dan menurunkan recall: lebih sedikit skor yang di-auto-approve, tetapi yang lolos lebih dapat diandalkan. Tugasnya bukan memaksimalkan precision atau recall secara terpisah, melainkan menemukan titik pada kurva itu di mana biaya kesalahan yang terlewat dan biaya review manual yang tidak perlu berada dalam keseimbangan untuk metrik spesifik tersebut.
Apa Itu Kalibrasi, dan Mengapa Lebih Penting daripada Angka Threshold Itu Sendiri?
Pertanyaan lain yang terkait namun berbeda adalah apakah angka confidence yang dilaporkan model benar-benar mencerminkan apa yang diklaimnya. Inilah kalibrasi: menjalankan confidence yang dinyatakan model terhadap sekumpulan percakapan yang disisihkan, lalu memeriksa apakah skor "confidence 90%" memang benar 90% dari waktu [llamaindex.ai]. Jika model melaporkan confidence 90% tetapi hanya benar 70% dari waktu pada rentang tersebut, threshold yang ditetapkan menjadi tidak bermakna, karena sinyal dasarnya sudah tidak terkalibrasi. Ini adalah langkah yang paling sering dilewatkan tim. Mereka menetapkan threshold di 85%, menganggapnya berjalan baik, dan tidak pernah memeriksa apakah rentang 85% pada model benar-benar berkorelasi dengan akurasi dunia nyata sebesar 85% [llamaindex.ai]. Kalibrasi juga bukan sesuatu yang dilakukan sekali saja. Script agent berubah, produk baru diluncurkan, pelanggan mulai bertanya soal struktur biaya baru, dan distribusi confidence model bisa bergeser tanpa disadari siapa pun sampai akurasinya diam-diam menurun.
Apakah Skor yang Lolos Threshold Tetap Perlu Di-sampling?
Ya, dan di sinilah banyak implementasi AutoQA justru mengurangi nilainya sendiri. Bahkan untuk skor yang lolos confidence threshold, sampling rate pada kumpulan yang di-auto-approve tetap menangkap drift sebelum menumpuk. Jika sampling ditetapkan pada rate tertentu, satu dari sekian skor yang di-auto-approve tetap mendapat pengecekan manusia, murni sebagai pemeriksaan atas pemeriksaan itu sendiri [rills.ai]. Bayangkan seperti lini quality control di pabrik yang memiliki mesin pemeriksa otomatis: mesin itu menangkap hampir semua cacat, tetapi supervisor tetap mengambil beberapa komponen "lolos" dari lini produksi setiap shift, karena sensor yang mulai bergeser dari kalibrasinya menghasilkan hasil yang salah dengan penuh keyakinan, bukan yang jelas-jelas salah. Logika yang sama berlaku untuk AutoQA. Model yang tidak terkalibrasi tidak tahu bahwa dirinya salah; model akan memberikan skor confidence tinggi pada evaluasi yang keliru semudah pada evaluasi yang benar. Men-sampling tumpukan "lolos" adalah satu-satunya cara menangkap mode kegagalan ini sebelum muncul dalam audit compliance.
Bagaimana Kaitannya dengan Regulasi, Terutama untuk Keputusan yang Diskor AI?
Di luar detail teknis, ada persoalan lain: confidence threshold bukan sekadar masalah akurasi, melainkan juga bersinggungan dengan kewajiban regulasi. Berdasarkan GDPR Pasal 22, organisasi yang menggunakan pengambilan keputusan otomatis wajib memberikan transparansi tentang bagaimana keputusan tersebut dicapai, memungkinkan pihak yang terdampak untuk keberatan, dan menyediakan jalur intervensi manusia. EU AI Act menambahkan persyaratan lain: perusahaan wajib secara jelas mengungkapkan ketika pelanggan berinteraksi dengan sistem AI. Untuk AutoQA secara spesifik, ini berarti confidence threshold dan alasan di balik setiap skor tidak boleh hanya tersimpan di dalam bobot internal model. Jika skor QA memengaruhi penilaian kinerja agent atau hasil kasus pelanggan, dibutuhkan catatan yang dapat diaudit, menunjukkan kebijakan apa yang diambil, alasan apa yang menghasilkan skor tersebut, dan mengapa skor itu dipercaya atau ditandai. Inilah reasoning trace yang disertakan RevelirQA pada setiap evaluasi: model yang digunakan, dokumen yang diambil dari SOP milik pelanggan sendiri, dan rantai penalaran di balik skor tersebut, yang mengubah "AI yang bilang begitu" menjadi sesuatu yang benar-benar bisa ditinjau oleh tim compliance.
Bagaimana Pendekatan RevelirQA terhadap Confidence dan Kepercayaan Berbeda?
RevelirQA dibangun di atas prinsip yang sama dengan semua poin sebelumnya: kepercayaan terhadap skor otomatis harus diperoleh per percakapan, bukan diasumsikan berlaku untuk seluruh sistem. Alih-alih menskor terhadap benchmark generik, RevelirQA mengambil kebijakan dan SOP milik pelanggan sendiri melalui RAG sebelum mengevaluasi setiap percakapan, sehingga confidence model didasarkan pada aturan aktual yang sedang diperiksa, bukan perkiraan kasarnya. Setiap skor, baik yang melewati ambang high-confidence maupun yang ditandai, membawa reasoning trace lengkap: model yang digunakan, dokumen yang diambil, dan logika yang diterapkan. Inilah yang memungkinkan Xendit dan Tiket.com menjalankan RevelirQA di ribuan ticket per minggu dan tetap punya jawaban siap ketika pimpinan compliance atau CX bertanya mengapa skor tertentu jatuh seperti itu. Karena RevelirQA menskor 100% percakapan, bukan hanya 1 sampai 5% seperti sampling manual, keputusan threshold tidak hanya melindungi skor individual, tetapi menentukan berapa banyak dari total volume ticket yang bisa dipercaya tim tanpa disentuh manusia, yang justru menjadi inti dari peralihan dari sampling QA manual ke auto QA sejak awal.
FAQ
Apakah AutoQA dimaksudkan untuk sepenuhnya menggantikan reviewer QA manusia?
Tidak. AutoQA menggantikan sampling manual, bukan penilaian manusia. Tujuannya adalah menskor setiap percakapan secara otomatis dan meneruskan yang berada di bawah confidence threshold, atau sebagian sampel dari yang di atasnya, ke reviewer manusia.
Confidence threshold berapa yang sebaiknya digunakan sebagai titik awal jika belum ada data historis?
Mulailah dengan angka yang konservatif dan tinggi, lalu jalankan proses kalibrasi terhadap batch yang sudah diskor manual begitu tersedia. Tanpa dataset berlabel untuk memvalidasi, angka awal mana pun hanyalah tebakan [voxjar.com].
Seberapa sering threshold perlu direkalibrasi?
Secara berkala, bukan sekali setup saja, karena bahasa agent, kebijakan produk, dan pertanyaan pelanggan berubah seiring waktu dan bisa secara diam-diam menggeser distribusi confidence model [llamaindex.ai].
Bisakah tool QA bawaan helpdesk menangani otomatisasi berbasis threshold sendirian?
QA otomatis bawaan Zendesk dapat menskor semua percakapan, tetapi lapisan pelaporannya terpisah dari lapisan ticketing-nya, sehingga membatasi cross-referencing dengan sinyal CRM yang lebih luas. Salesforce Service Cloud menawarkan unifikasi CRM yang lebih mendalam tetapi membutuhkan konfigurasi signifikan untuk disiapkan sebagai QA.
Apakah skor confidence yang tinggi berarti penalaran AI-nya benar?
Belum tentu. Confidence mencerminkan seberapa yakin model, bukan apakah model itu benar. Karena itulah kalibrasi, yaitu memeriksa confidence yang dinyatakan terhadap akurasi aktual, sama pentingnya dengan angka threshold itu sendiri [llamaindex.ai].
Apakah evaluasi QA yang diskor AI perlu bisa dijelaskan demi alasan compliance?
Semakin ke sini, jawabannya ya. GDPR Pasal 22 mewajibkan transparansi dan jalur intervensi manusia untuk keputusan otomatis, dan EU AI Act mewajibkan disclosure ketika pelanggan berinteraksi dengan sistem AI.
Seberapa akurat skor QA AI dibandingkan reviewer QA manusia?
Sistem evaluasi berbasis LLM terkemuka, dengan pendekatan LLM-as-a-judge, terbukti mencapai tingkat kesepakatan lebih dari 80% dengan evaluator manusia, setara dengan tingkat kesepakatan yang biasa terlihat antara dua penilai manusia.
Tentang Revelir AI
Revelir AI membangun RevelirQA, mesin AutoQA yang menskor 100% percakapan customer service terhadap kebijakan dan scorecard QA milik perusahaan sendiri, menggantikan sampling manual 1 sampai 5% yang masih diandalkan sebagian besar tim support saat ini. Didirikan pada 2025 dan berkantor pusat di Singapura, Revelir AI sudah berjalan di production pada klien enterprise termasuk Xendit dan Tiket.com, menskor ribuan percakapan per minggu dalam bahasa Inggris, Indonesia, Thailand, dan Tagalog. Setiap skor membawa reasoning trace lengkap, yaitu model yang digunakan, dokumen kebijakan yang diambil, dan logika yang diterapkan, memberikan tim CX dan compliance audit trail di balik setiap keputusan otomatis. RevelirQA mengevaluasi chatbot manusia maupun AI pada scorecard QA yang sama, memberikan pemimpin support satu pandangan kualitas yang konsisten di seluruh operasi mereka.
Jika Anda sedang menentukan di mana confidence threshold harus ditetapkan untuk percakapan support Anda sendiri, atau ingin melihat bagaimana reasoning trace tampak pada ticket nyata, kunjungi Revelir AI untuk informasi lebih lanjut.
Referensi
- Auto QA: How AI Call Scoring Actually Works, and When Not to Trust It | Voxjar (voxjar.com)
- Understanding Confidence Threshold in AI Systems (llamaindex.ai)
- Confidence Thresholds Explained (workforceplaybook.ai)
- How to Set Confidence Thresholds for AI Agent Actions · Claro (getclaro.ai)
- AI Confidence Scores: Which Actions Send Without You | Rills Blog (rills.ai)
