AI quality assurance

Kenapa menilai setiap percakapan?

Setiap fungsi lain di perusahaan Anda diukur berdasarkan seluruh outputnya. Support diukur berdasarkan sampel yang dipilih seseorang secara manual. Berikut biaya yang Anda tanggung karenanya, dan apa yang berubah ketika sampelnya adalah semuanya.

Anda hanya mereview 1.2% dari percakapan Anda.

  • Agen di tim Anda30
  • Percakapan direview per agen, per bulan20
  • Total review, kira-kira dua minggu waktu satu orang600
  • Percakapan yang benar-benar ditangani tim Anda50,000
  • Yang dilihat QA lead Anda1.2%

Ambil contoh kesalahan yang terjadi pada satu dari setiap 200 percakapan. Pada 50,000 percakapan, itu terjadi 250 kali sebulan. Pada cakupan 1.2%, Anda diperkirakan hanya melihatnya tiga kali. Tiga kejadian terbaca sebagai kesialan, dan tidak ada apa pun dalam data Anda yang mengatakan sebaliknya.

250 kegagalan sebulan 3 yang diperkirakan akan terlihat

Sampelnya pun tidak acak. Reviewer memilih percakapan yang cepat direview, sehingga condong ke tiket pendek dan menjauh dari tiket panjang dan rumit yang justru sering bermasalah.

Bisakah Anda mempercayai skor yang dihasilkan AI?

Setiap QA lead menanyakan ini, dan itu pertanyaan yang tepat. Jika mereka tidak percaya skornya, tidak ada yang akan menindaklanjuti.

Setiap skor menunjukkan alasannya

Setiap penilaian mengutip bagian dari SOP atau basis pengetahuan Anda yang jadi acuannya. QA lead Anda bisa membukanya dan memeriksa.

Dikalibrasi dengan tim Anda

QA lead Anda menilai sampel secara manual. Kami menyetel sampai AI-nya sejalan dengan mereka, dan Anda menyetujui sebelum ini digunakan secara langsung.

Skor bisa disanggah

Agen yang merasa sebuah skor keliru bisa melihat persis apa dasarnya dan mengajukan sanggahan. Ketidaksepakatan ini menjadi masukan untuk kalibrasi.

Tidak ada yang terjadi otomatis

Kami tidak memicu peringatan, peringkat, atau tindakan disipliner. Hasilnya masuk ke QA lead Anda dan merekalah yang memutuskan langkah selanjutnya.

Sedang mempertimbangkan tools QA lain?

Bagaimana RevelirQA dibandingkan, berdampingan.

Bot Anda butuh QA lebih dari agen manusia Anda.

  • Scorecard yang sama berlaku untuk agen manusia dan agen AI.
  • Saat Anda meluncurkan bot, Anda kehilangan kontrol yang selama ini ada tanpa disadari: seseorang yang melihat ada yang tidak beres dan menandainya.
  • Temukan di mana AI-nya keliru dengan percaya diri, sebelum pelanggan Anda yang menemukannya.
Agen manusia
88%
Tone
Policy
Resolution
Agen AI
91%
Tone
Policy
Resolution

Satu scorecard, berlaku untuk keduanya.

Apa yang berubah dalam minggu kerja QA lead Anda.

Saat ini

  • Dua minggu menarik dan membaca 600 percakapan
  • Skor yang bergeser tergantung siapa yang mereview dan kapan
  • Coaching yang dibangun dari sedikit tiket yang kebetulan mereka buka
  • Tidak ada cara mengetahui apakah perbaikan kuartal lalu benar-benar bertahan

Dengan RevelirQA

  • Penilaian berjalan di setiap percakapan, secara otomatis
  • Daftar berperingkat tentang apa yang perlu diperhatikan
  • Coaching pada percakapan yang tepat, momen yang tepat, kebijakan yang tepat
  • Ukuran yang sama setiap bulan, sehingga Anda bisa melihat apakah perbaikannya bertahan

Uji dengan scorecard Anda sendiri.

Enam minggu, dan QA lead Anda yang memutuskan apakah hasil kami sudah tepat.

  • QA lead Anda menilai sampel secara manual. Revelir menilai percakapan yang sama. Anda membandingkan keduanya, dan kami terus menyesuaikan sampai QA lead Anda menyetujuinya
  • Setelah disetujui, penilaian yang sama berjalan pada 10,000 percakapan Anda, jauh lebih banyak dari yang bisa dibaca tim Anda secara manual
  • Pada akhirnya Anda akan melihat sendiri hasilnya bekerja pada percakapan Anda, dan jika Anda belum yakin, kami berhenti di situ

Apa yang dicakup pilot →