Cara Membangun QA Scorecard Multibahasa yang Menerapkan Standar Sama untuk Setiap Agent di Bahasa Inggris, Bahasa Indonesia, Thai, dan Tagalog

Published on:
September 3, 2026

How to Build a Multilingual QA Scorecard | Revelir AI

QA scorecard multibahasa menerapkan satu set kriteria kualitas yang konsisten pada percakapan customer service, apa pun bahasa yang digunakan. Tantangannya bukan soal terjemahan. Yang perlu dipastikan adalah logika scoring, referensi policy, dan threshold pass/fail tetap identik, baik ketika agent menulis dalam Bahasa Inggris, Bahasa Indonesia, Thai, maupun Tagalog. Tim yang berhasil menyelesaikan masalah ini akan menghilangkan ketidakkonsistenan tersembunyi, di mana agent di satu pasar bahasa dinilai dengan standar yang lebih ketat atau lebih longgar dibanding agent di pasar bahasa lain.

Ringkasan
  • QA scorecard multibahasa mengevaluasi percakapan dalam bahasa apa pun dengan kriteria yang sama, bukan versi terjemahan dari kriteria yang berbeda-beda.
  • Kegagalan paling umum adalah scorecard drift: tiap tim melakukan lokalisasi kriteria dengan caranya sendiri, sehingga agent di Jakarta dan Manila akhirnya dinilai dengan tolok ukur yang berbeda.
  • Policy grounding jauh lebih penting daripada sekadar deteksi bahasa. AI scoring engine harus mengambil SOP asli perusahaan sebelum melakukan setiap evaluasi, bukan menerapkan benchmark kualitas generik.
  • Weighted criteria, binary check, dan sentiment arc harus dirancang agar bersifat language-agnostic sejak awal.
  • Coverage 100% dari seluruh percakapan adalah satu-satunya cara untuk menangkap pola kegagalan khas per bahasa yang luput dari sampling manual.
Tentang Penulis Revelir AI mengoperasikan RevelirQA secara production dengan customer enterprise di berbagai negara, termasuk Xendit dan Tiket.com, men-score ribuan percakapan customer service per minggu dalam Bahasa Inggris, Bahasa Indonesia, Thai, dan Tagalog. Artikel ini disusun langsung berdasarkan pengalaman operasional tersebut.

Kenapa QA Scorecard Multibahasa Sering Gagal di Lapangan?

Kegagalan hampir tidak pernah terjadi di level bahasa. Kegagalan terjadi di level standar. Ketika tim QA di Singapura menyusun scorecard dalam Bahasa Inggris lalu meminta team lead di Jakarta untuk "menyesuaikannya ke Bahasa Indonesia", hasil yang didapat justru scorecard yang berbeda, dengan threshold yang sedikit berbeda, contoh frasa yang dianggap layak berbeda, dan interpretasi berbeda soal apa yang disebut "empati". Drift semacam ini terus menumpuk secara diam-diam selama berbulan-bulan.

Hasilnya adalah ketidakadilan struktural: agent di satu pasar bahasa dihukum untuk hal-hal yang bahkan tidak dinilai pada agent di pasar bahasa lain. Karena kebanyakan program QA hanya melakukan sampling 1 sampai 5% dari ticket [2], ketidakkonsistenan ini jarang terungkap sampai ada compliance review atau komplain dari agent yang memaksa seseorang membandingkan lintas pasar.

Ada tiga pola kegagalan spesifik yang paling sering muncul:

  • Lokalisasi kriteria tanpa governance. Tim lokal menulis ulang kriteria dalam bahasa mereka, dan penulisan ulang ini justru mengubah scope-nya.
  • Scoring tool yang tidak language-aware. Reviewer manual yang hanya bisa berbahasa Inggris tidak bisa menilai percakapan Tagalog secara adil, sehingga percakapan tersebut dialihkan ke reviewer lain dengan standar yang berbeda pula.
  • Referensi policy yang hanya ada dalam satu bahasa. Jika SOP refund ditulis dalam Bahasa Inggris dan agent Bahasa Indonesia tidak pernah dinilai berdasarkan SOP tersebut, ini bukan masalah bahasa, melainkan celah policy.

Apa yang Sebenarnya Perlu Diukur oleh QA Scorecard Multibahasa?

Melanjutkan pola kegagalan di atas, pertanyaan yang lebih sulit adalah kriteria mana yang harus language-agnostic sejak dirancang, dan mana yang memang membutuhkan lokalisasi asli. Scorecard yang terstruktur dengan baik memisahkan keduanya secara jelas [1][4].

Jenis Kriteria Language-Agnostic? Contoh
Kepatuhan terhadap policy Ya Apakah agent mengikuti SOP refund?
Penyelesaian masalah Ya Apakah masalah customer benar-benar terselesaikan?
Penanganan escalation Ya Apakah escalation dipicu pada momen yang tepat?
Nada bicara dan empati Sebagian Pengakuan yang hangat; frasa yang sesuai budaya bisa berbeda-beda
Tata bahasa dan kejelasan Tidak Standar kelancaran harus ditetapkan per bahasa
Pengungkapan regulasi Ya Pernyataan wajib harus muncul terlepas dari bahasa yang digunakan

Kriteria pada kolom "ya" adalah tempat scorecard drift menimbulkan dampak paling besar. Kriteria ini bersifat objektif dan berbasis policy, sehingga seharusnya menghasilkan hasil pass atau fail yang sama dalam bahasa apa pun [6]. Baris "sebagian" dan "tidak" adalah tempat lokalisasi yang cermat memang sah dan diperlukan.

Bagaimana Menyusun Kriteria Scoring agar Konsisten di Empat Bahasa?

Kuncinya adalah menulis kriteria di level intent, bukan di level frasa [3]. Definisikan empati sebagai "agent mengakui kondisi emosional customer sebelum berpindah ke penyelesaian masalah." Definisi pertama hanya berlaku dalam Bahasa Inggris. Definisi kedua berlaku dalam bahasa apa pun dan bisa dievaluasi oleh reviewer atau AI engine yang memahami percakapan dalam bahasa aslinya.

Langkah praktis untuk merancang kriteria yang language-agnostic:

  1. Tulis setiap kriteria sebagai outcome perilaku, bukan baris skrip. Outcome bisa diterjemahkan; frasa yang persis sama tidak [7].
  2. Pisahkan binary check dari kriteria yang di-score. Binary check (apakah agent mengumpulkan nomor akun customer? ya atau tidak) lebih mudah dijaga konsistensinya. Kriteria yang di-score (kualitas penjelasan, skala 1-5) memerlukan contoh anchor eksplisit di setiap bahasa [4][6].
  3. Dokumentasikan contoh anchor di setiap bahasa target. Untuk setiap kriteria yang di-score, sediakan minimal satu contoh respons skor 3 dan satu contoh respons skor 5 dalam Bahasa Inggris, Bahasa Indonesia, Thai, dan Tagalog. Ini adalah langkah yang paling sering dilewatkan [7].
  4. Tetapkan bobot di level global, bukan level pasar. Jika kepatuhan policy bernilai 40% di Singapura, bobotnya juga harus 40% di Manila. Drift pada bobot sama merusaknya dengan drift pada kriteria [1][5].
  5. Jalankan sesi kalibrasi lintas pasar bahasa setiap kuartal. Ambil ticket yang sama (diterjemahkan ke setiap bahasa), score secara independen di tiap pasar, lalu bandingkan hasilnya. Perbedaan hasil akan mengungkap scorecard drift sebelum berubah menjadi masalah keadilan.

Bagaimana AI Mengubah Persamaan QA Multibahasa?

Selangkah dari desain scorecard, ada hal lain yang sama pentingnya: apakah scoring engine benar-benar bisa membaca percakapan tersebut. Program QA hanya sekonsisten tool yang menerapkannya.

AI scoring engine mengubah persamaan QA multibahasa dalam dua hal [8]:

  • Coverage bahasa tanpa beban tambahan reviewer. Satu AI engine bisa mengevaluasi chat Tagalog, email Bahasa Indonesia, dan transkrip telepon Bahasa Inggris terhadap kriteria QA scorecard yang identik, tanpa perlu mengalihkan masing-masing ke reviewer manusia yang berbeda.
  • Policy grounding pada saat evaluasi. Ketika AI mengambil SOP asli perusahaan sebelum men-score setiap percakapan, policy refund yang sama berlaku untuk agent di Jakarta maupun agent di Manila. Tidak ada risiko reviewer manusia di satu pasar menghafal versi policy yang berbeda.

Di sinilah pendekatan RevelirQA layak dipahami. Alih-alih menerapkan benchmark kualitas generik, RevelirQA memasukkan SOP dan knowledge base milik perusahaan sendiri ke dalam vector database. Sebelum men-score percakapan apa pun, sistem mengambil dokumen policy yang relevan lalu mengevaluasi agent berdasarkan dokumen tersebut, dalam bahasa apa pun percakapan itu ditulis. QA scorecard yang sama, digroundkan pada policy yang sama, diterapkan pada setiap ticket. Xendit dan Tiket.com menjalankan ini pada ribuan percakapan per minggu, bukan sekadar sebagai pilot.

"Celah QA yang paling berbahaya bukanlah satu percakapan dengan skor rendah. Celah paling berbahaya adalah pola kegagalan yang konsisten di satu pasar bahasa, yang tidak pernah terjangkau oleh sampling manual."

Bagaimana Menangani Sentiment dan Tone di Bahasa yang Berbeda Budaya?

Melanjutkan poin soal policy grounding, evaluasi tone adalah bagian yang paling membutuhkan desain cermat pada scorecard multibahasa. Sikap langsung yang terkesan profesional dalam Bahasa Inggris bisa terasa dingin dalam Bahasa Indonesia. Penggunaan honorifik formal dalam bahasa Thai membawa sinyal kualitas yang tidak punya padanan dalam Bahasa Inggris.

Best practice untuk scoring tone lintas bahasa:

  • Nilai tone berdasarkan sentiment arc (bagaimana perasaan customer di awal dibandingkan di akhir percakapan?), bukan berdasarkan frasa spesifik. Customer yang membuka percakapan dengan frustrasi lalu menutup dengan puas menunjukkan penanganan tone yang efektif, apa pun bahasanya [2].
  • Libatkan QA lead penutur asli untuk mengkalibrasi contoh anchor tone di setiap bahasa. Jangan berasumsi QA scorecard tone berbahasa Inggris bisa langsung diterjemahkan begitu saja.
  • Pisahkan persyaratan tone yang bersifat regulasi (pengungkapan wajib, pengakuan yang harus disampaikan) dari tone yang bersifat gaya bahasa. Yang pertama bersifat binary dan language-agnostic; yang kedua memerlukan kalibrasi lokal.

FAQ

Apakah saya bisa memakai satu QA scorecard untuk keempat bahasa, atau perlu empat scorecard terpisah? Satu scorecard dengan contoh anchor khusus per bahasa adalah struktur yang tepat. Empat scorecard terpisah hampir selalu mengalami drift seiring waktu, sehingga menghasilkan perbandingan lintas pasar yang tidak adil [4].
Bagaimana cara menilai tata bahasa dan kejelasan agent kalau saya tidak menguasai bahasanya? Serahkan penilaian tata bahasa dan kejelasan kepada reviewer penutur asli, atau ke AI engine yang mampu mengevaluasi kelancaran dalam bahasa tersebut. Jangan lewatkan kriteria ini atau menilainya tanpa kapasitas bahasa yang memadai.
Berapa bobot yang seharusnya diberikan pada kepatuhan policy dalam scorecard multibahasa? Praktik industri menempatkan kepatuhan policy sebagai salah satu kriteria dengan bobot tertinggi, terutama untuk industri fintech dan industri yang diregulasi ketat [1][5]. Tetapkan bobotnya secara global dan jangan disesuaikan per pasar.
Seberapa sering scorecard multibahasa perlu dikalibrasi ulang? Jalankan sesi kalibrasi lintas pasar minimal setiap kuartal. Saat ada perubahan policy atau SOP, perlakukan itu sebagai event pembaruan scorecard dan segera perbarui contoh anchor di semua bahasa [7].
Apakah AI scoring bisa membawa bias bahasanya sendiri? Bisa, jika AI menerapkan benchmark generik alih-alih policy milik perusahaan sendiri. AI engine yang mengambil SOP perusahaan sebelum setiap evaluasi akan mendasarkan scoring pada standar perusahaan, bukan pada pola kualitas apa pun yang diserap model selama training [8].
Bagaimana coverage 100% dari seluruh percakapan mengubah QA multibahasa? Sampling manual sebesar 1 sampai 5% hampir tidak pernah representatif untuk semua pasar bahasa sekaligus. Pasar bahasa dengan volume ticket lebih rendah secara sistematis kurang terwakili dalam sampel acak mana pun. Coverage 100% menghilangkan blind spot tersebut.
Bisakah satu AI scoring engine mengevaluasi agent manusia dan chatbot AI dengan scorecard yang sama? Bisa, dan memang seharusnya begitu. Seiring perusahaan menerapkan chatbot berdampingan dengan agent manusia, men-score keduanya dengan QA scorecard yang sama memberi CX leader satu gambaran kualitas yang menyatu, bukan dua program terpisah dengan metrik yang tidak sebanding.

Tentang Revelir AI

Revelir AI membangun RevelirQA, platform AI quality assurance yang mengevaluasi 100% percakapan customer service berdasarkan policy dan QA scorecard milik perusahaan itu sendiri. Revelir AI beroperasi secara production dengan customer enterprise di berbagai negara, termasuk Xendit dan Tiket.com, men-score ribuan percakapan per minggu dalam Bahasa Inggris, Bahasa Indonesia, Thai, dan Tagalog. RevelirQA terintegrasi dengan helpdesk apa pun melalui API, menyediakan audit trail lengkap untuk setiap evaluasi, dan men-score agent manusia maupun chatbot AI dengan QA scorecard yang sama, sehingga tim CX dan QA mendapat satu gambaran kualitas yang konsisten di seluruh operasi support mereka.

Siap menerapkan standar yang sama untuk setiap agent, dalam bahasa apa pun, di setiap ticket?

Pelajari bagaimana RevelirQA bisa mendukung program QA multibahasa Anda di revelir.ai

Referensi

  1. How to Build Call Center QA Scorecards for Better CX (www.calabrio.com)
  2. How to build a QA scorecard: Examples + template (www.zendesk.com)
  3. Call Center Quality Monitoring Scorecard Best Practices | Balto (www.balto.ai)
  4. Customer Service QA Scorecard: Free Template & Guide [2026] (www.gistly.ai)
  5. How to Design & Build an Effective QA Scorecard - Scorebuddy (www.scorebuddyqa.com)
  6. How do you build a QA scorecard for support (with examples and scoring templates)? (www.supportbench.com)
  7. Designing a Call Center Quality Assurance Scorecard ... (www.verequest.com)
  8. Gladia - Automated call scoring: Best practices for AI-powered QA and performance (www.gladia.io)