Sebagian besar scorecard QA ditulis dalam bahasa Inggris, untuk agent customer service berbahasa Inggris, dan diuji terhadap percakapan berbahasa Inggris. Ketika perusahaan menerapkan kriteria yang sama untuk agent yang menangani ticket dalam Bahasa Indonesia, Thailand, atau Tagalog, mereka sebenarnya tidak sedang mengukur kualitas. Yang terukur justru kedekatan linguistik dengan benchmark yang memang tidak pernah dirancang untuk bahasa-bahasa tersebut. Menentukan standar "bagus" di berbagai bahasa Asia Tenggara membutuhkan pemikiran ulang atas kriterianya sendiri, bukan sekadar menerjemahkan kata-katanya.
Ringkasan
- Scorecard QA berbasis bahasa Inggris tidak berfungsi dengan baik dalam Bahasa Indonesia, Thailand, dan Tagalog karena kesopanan, formalitas, dan sinyal resolusi bekerja berbeda di setiap bahasa.
- Menerjemahkan kriteria secara langsung saja tidak cukup. Setiap bahasa butuh definisi tone, empati, dan kelengkapan yang berakar pada budayanya masing-masing.
- Scoring yang konsisten dan selaras dengan kebijakan lintas bahasa bisa dicapai, tapi hanya jika sistem QA memproses SOP asli perusahaan, bukan menerapkan benchmark generik.
- Sampling 1-5% dari ticket multibahasa justru memperbesar blind spot. Coverage penuh atas seluruh percakapan adalah satu-satunya baseline yang bisa diandalkan.
- Scoring engine berbasis AI yang mendukung evaluasi multibahasa bisa menerapkan rubrik yang sama secara konsisten, sambil tetap mengakomodasi kriteria khas tiap bahasa.
Mengapa Framework QA Berbasis Bahasa Inggris Gagal di Bahasa-Bahasa Asia Tenggara?
Standar kualitas untuk customer service secara historis dirumuskan dalam bahasa Inggris, mencerminkan dominasi bahasa Inggris pada riset dan tooling CX di masa awal [1]. Menerapkan standar tersebut di tempat lain menciptakan kesalahan kategori: kriterianya tidak diturunkan dari apa yang dianggap "bagus" dalam bahasa tertentu. Kriteria itu diturunkan dari norma percakapan bahasa Inggris, lalu diasumsikan berlaku universal.
Ada tiga alasan struktural di balik kegagalan ini:
- Kesopanan bekerja secara berbeda. Dalam bahasa Thailand, formalitas ditandai secara gramatikal lewat partikel seperti "khrap" dan "kha". Agent yang tidak menggunakan partikel ini bukan sekadar terkesan santai. Mereka melanggar register sosial yang punya bobot emosional nyata bagi customer. Rubrik berbasis bahasa Inggris yang menilai "tone sopan" tidak punya mekanisme untuk mendeteksi hal ini.
- Sinyal empati bersifat spesifik per bahasa. Frasa yang menunjukkan empati dalam bahasa Inggris ("I completely understand your frustration") sering terdengar hampa atau terlalu formal saat diterjemahkan secara harfiah ke Tagalog atau Bahasa Indonesia. Penutur asli menggunakan konstruksi yang berbeda, dan menilai hasil terjemahan harfiah sebagai "empatik" justru memberi penghargaan pada perilaku yang keliru.
- Konfirmasi resolusi tidak bersifat universal. Dalam bahasa Inggris, penutupan ticket biasanya diakhiri dengan "Is there anything else I can help you with?" yang jelas. Dalam Bahasa Indonesia dan Tagalog, resolusi lebih sering dikonfirmasi lewat frasa yang lebih lembut dan relasional, yang mungkin tidak dikenali sebagai penutupan yang tepat oleh model atau reviewer yang terlatih dalam bahasa Inggris.
"Kualitas yang baik dalam interaksi customer service sangat bergantung pada konteks, dan konteks itu mencakup bahasa serta budaya, bukan hanya isi kebijakan yang diterapkan." [1]
Apa Sebenarnya yang Harus Diukur oleh Scorecard QA Khusus Bahasa?
Berangkat dari kegagalan struktural di atas, pertanyaan yang lebih sulit adalah kriteria apa yang seharusnya menggantikan atau melengkapi standar bawaan bahasa Inggris. Scorecard QA yang dirancang baik untuk tim multibahasa harus memisahkan kriteria universal dari kriteria khas bahasa, bukan meleburnya menjadi satu rubrik hasil terjemahan [3].
| Kategori Kriteria | Universal (berlaku lintas bahasa) | Khas Bahasa (butuh definisi lokal) |
|---|---|---|
| Kepatuhan pada kebijakan | Apakah agent mengikuti SOP refund/escalation yang benar? | Apakah agent menggunakan frasa yang sesuai secara lokal untuk menyampaikan kebijakan tersebut? |
| Tone dan register | Apakah agent bersikap hormat? | Apakah agent menggunakan penanda formalitas gramatikal yang tepat? (partikel Thailand, tingkat tutur Jawa dalam Bahasa Indonesia) |
| Empati | Apakah agent mengakui situasi customer? | Apakah agent menggunakan ekspresi empati yang sesuai secara budaya, bukan terjemahan harfiah? |
| Konfirmasi resolusi | Apakah masalahnya terselesaikan? | Apakah penutupan disampaikan dengan cara yang terasa lengkap bagi penutur asli? |
| Akurasi | Apakah informasi yang diberikan secara faktual benar? | Apakah terminologi teknis dilokalkan dengan tepat (misalnya "dompet digital" vs "e-wallet" dalam bahasa Indonesia)? |
Bagaimana Code-Switching Mempersulit Proses Scoring QA?
Tantangan lain yang terkait namun berbeda adalah code-switching: agent customer service di Asia Tenggara terbiasa mencampurkan istilah bahasa Inggris ke dalam kalimat Bahasa Indonesia atau Tagalog, dan customer pun melakukan hal yang sama. Ini bukan kegagalan kualitas. Ini realitas linguistik di pasar-pasar tersebut.
Contohnya dari interaksi bergaya Tiket.com: seorang agent mungkin menulis "Silakan cek booking ID kamu di email ya, kak", mencampurkan kata pinjaman bahasa Inggris secara alami ke dalam kalimat Bahasa Indonesia. Sistem QA yang menilai "merespons dalam bahasa customer" bisa keliru menandai ini sebagai penyimpangan, kecuali scorecard dikonfigurasi untuk mengenali kata pinjaman bahasa Inggris yang sudah lazim dalam konteks tersebut sebagai hal yang standar.
Karena itu, kriteria QA sebaiknya mencantumkan definisi code-switching yang bisa diterima, bukan memperlakukan semua percampuran bahasa sebagai kesalahan. Ujiannya selalu sama: apakah pilihan kata ini membantu pemahaman customer, atau justru menimbulkan kebingungan?
Apa Peran AI dalam Men-score Percakapan Multibahasa Secara Konsisten?
Di luar desain kriteria, ada persoalan operasional lain yang juga penting: konsistensi. Reviewer QA manusia yang men-sampling 1-5% ticket memunculkan dua bias yang saling memperkuat di lingkungan multibahasa: mereka cenderung memilih ticket yang bisa mereka baca dengan lancar, dan interpretasi mereka terhadap tone berbeda-beda antar reviewer. Akibatnya, agent yang bekerja dalam bahasa Thailand sering dievaluasi lebih jarang dan kurang konsisten dibanding rekan yang berbahasa Inggris.
Scoring engine berbasis AI bisa mengatasi kedua masalah ini, tapi hanya jika memang dirancang untuk itu. Benchmark AI generik kesulitan menilai kualitas bahasa secara nuansa, bahkan dalam bahasa Inggris [4], dan kesenjangan ini melebar untuk bahasa-bahasa dengan sumber daya lebih terbatas. Faktor pembeda utamanya adalah apakah sistem scoring mengevaluasi berdasarkan kebijakan perusahaan sendiri, atau berdasarkan model generik tentang "customer service yang bagus".
RevelirQA mengatasi hal ini dengan memproses SOP dan knowledge base asli perusahaan lewat RAG sebelum mengevaluasi tiap percakapan. Scoring engine mengambil kebijakan yang relevan, menerapkan scorecard QA yang telah dikonfigurasi, lalu menghasilkan reasoning trace yang menunjukkan persis dokumen kebijakan mana yang diambil dan alasan di balik skor yang diberikan. Pendekatan ini membuat standar audit-grade yang sama berlaku baik ticket ditulis dalam bahasa Inggris, Bahasa Indonesia, Thailand, maupun Tagalog, dan mencakup 100% percakapan, bukan sebagian kecil hasil sampling.
Bagaimana Tim Membangun dan Memvalidasi Scorecard QA Multibahasa?
Berdasarkan framework kriteria di atas, penerapannya secara praktis mengikuti urutan berikut:
- Mulai dari kriteria universal. Definisikan kepatuhan pada kebijakan, akurasi, dan konfirmasi resolusi dalam istilah yang netral bahasa, terhubung langsung dengan SOP perusahaan.
- Tambahkan kriteria khas bahasa. Untuk setiap bahasa target, bekerja sama dengan QA lead yang merupakan penutur asli untuk mendefinisikan tone, register, ekspresi empati, dan standar code-switching yang bisa diterima. Dokumentasikan ini sebagai kriteria eksplisit, bukan panduan informal.
- Konfigurasi metrik scoring khusus. Kriteria biner (apakah agent mengonfirmasi resolusi: ya/tidak) cocok untuk item kepatuhan. Scoring bertingkat lebih cocok untuk tone dan empati, di mana nilai parsial mencerminkan variasi yang nyata.
- Jalankan calibration set. Sebelum menerapkan AI scoring, minta reviewer penutur asli men-score 50-100 percakapan per bahasa. Gunakan hasil ini untuk memverifikasi bahwa output AI scoring selaras dengan penilaian manusia pada kriteria khas bahasa.
- Tinjau hasil coaching per bahasa. Agregasikan pelanggaran kebijakan per kelompok bahasa. Pola yang hanya muncul pada satu kelompok bahasa biasanya menunjukkan celah pada kriteria, bukan masalah performa agent.
FAQ
Pendekatan hybrid paling efektif. Kriteria universal (kepatuhan kebijakan, akurasi, resolusi) bisa berbagi framework yang sama. Kriteria tone, register, dan empati sebaiknya didefinisikan terpisah per bahasa, karena apa yang terdengar cukup hormat dalam bahasa Thailand bisa terbaca sangat berbeda dalam Tagalog.
Tidak. Terjemahan mempertahankan kata-katanya, tapi bukan maksudnya. Kriteria seperti "menggunakan bahasa yang empatik" perlu ditulis ulang dari sudut pandang bahasa aslinya, bukan diterjemahkan dari versi bahasa Inggris, agar mencerminkan bagaimana empati benar-benar diekspresikan dalam bahasa tersebut.
Definisikan secara eksplisit dalam scorecard. Code-switching yang membantu pemahaman customer (misalnya kata pinjaman bahasa Inggris yang umum dalam Bahasa Indonesia) sebaiknya ditandai sebagai hal yang bisa diterima. Code-switching yang menimbulkan kebingungan atau mencampur register secara tidak tepat sebaiknya ditandai sebagai masalah. Standarnya tidak boleh "semua percampuran bahasa adalah kesalahan".
Karena reviewer manusia cenderung memilih ticket yang bisa mereka baca dengan lancar, ticket berbahasa Thailand dan Tagalog lebih jarang direview dibanding ticket berbahasa Inggris. Ini berarti agent yang bekerja dalam bahasa-bahasa tersebut menerima lebih sedikit sinyal coaching dan feedback yang kurang konsisten, yang lama-kelamaan menumpuk menjadi celah kualitas yang tidak terlihat oleh manajemen.
Dengan menerapkan rubrik yang sama pada setiap percakapan tanpa memandang bahasanya, dan mengambil dokumen kebijakan yang sama sebelum tiap evaluasi. Konsistensi ini berasal dari arsitektur sistemnya, bukan dari asumsi bahwa AI punya pemahaman multibahasa yang sempurna. Reasoning trace lengkap pada setiap skor memungkinkan QA lead memverifikasi bahwa kebijakan yang tepat sudah diterapkan [2].
Memperlakukan bahasa sebagai variabel format, bukan dimensi kualitas yang substansial. Perusahaan yang sekadar menerjemahkan scorecard berbahasa Inggris lalu menyebutnya "QA multibahasa" sebenarnya sedang mengukur seberapa mirip agent berkomunikasi dengan gaya bahasa Inggris, bukan seberapa baik mereka melayani customer dalam bahasa mereka sendiri.
Ya, dan bisa dibilang di situlah nilainya paling terasa. Review manual berskala besar dalam banyak bahasa sekaligus secara operasional mustahil dilakukan dengan tingkat akurasi tinggi. Scoring engine berbasis AI yang mendukung evaluasi multibahasa bisa mencakup 100% percakapan secara konsisten, memunculkan peluang coaching yang tidak akan pernah tertangkap oleh sampling.
Tentang Revelir AI
Revelir AI membangun RevelirQA, platform quality assurance berbasis AI yang men-score 100% percakapan support terhadap kebijakan dan scorecard QA milik perusahaan sendiri. Didirikan di Singapura pada 2025 oleh alumnus Y Combinator, platform ini sudah digunakan secara production di Xendit dan Tiket.com, men-score ribuan ticket per minggu dalam Bahasa Indonesia dan bahasa-bahasa lainnya. RevelirQA terintegrasi dengan helpdesk apa pun lewat API, menyediakan reasoning trace lengkap pada setiap evaluasi untuk industri yang sangat memperhatikan compliance, dan mengevaluasi agent manusia maupun chatbot AI melalui satu framework scoring yang konsisten, dirancang untuk enterprise global.
Siap melampaui benchmark berbasis bahasa Inggris dan membangun framework QA yang benar-benar berhasil untuk tim multibahasa Anda?
Referensi
- Beyond the Checklist: What Does Good Teaching Look Like? | NEA (www.nea.org)
- Essay Criteria That Are Beyond the Reach of AI? | Educational Technology and Change Journal (etcjournal.com)
- The Complete Guide to Talent Evaluation (2026) (juicebox.ai)
- Beyond the Leaderboard: Rethinking Medical Benchmarks for Large Language Models (arxiv.org)
