İçeriğe atla
Blog'a Dön
Müşteri Hizmetleri

Chatbot Bilgi Tabanı Hazırlama ve Yayın Öncesi Test Seti

Next GEO Agency

Yapay zeka destekli taslak; yayından önce baştan sona okunur ve iddialar birincil kaynaklara karşı kontrol edilir. İçerik üretim sürecimiz

Kırmızı ahşap bir bankta oturup kucağındaki açık kitapçığa dokunan insansı robot

Müşteri hizmetleri asistanının yanlış cevap vermesini önlemenin yolu modeli "eğitmek" değil, üç işi sırayla yapmaktır: işletmenin doğrulanmış bilgisini tarihli ve sahipli kartlara yazmak, kaynakta karşılığı olmayan soruda asistanın durup konuşmayı bir kişiye bırakmasını kural hâline getirmek ve yayına almadan önce cevabı önceden bilinen bir soru setiyle ölçüp sonucu yazılı bir eşiğe göre değerlendirmek. Bu üçünden biri eksikse asistan ilk haftalarda düzgün görünür, sonra fiyatı değişmiş bir hizmeti eski rakamla anlatmaya başlar.

Bu yazı asistanı kurmaya karar vermiş, hangi soruları ona bırakacağını da az çok bilen işletme için hazırlandı. Karar aşamasındaysanız önce chatbot'a uygun talep türleri üzerine yazdıklarımıza bakmak daha doğru olur. Burada sorulan şey bir adım sonrası: asistan neyi, hangi belgeden bilecek ve "hazır" dediğimiz an nasıl ölçülecek?

"Chatbot nasıl eğitilir" sorusunun işletmedeki gerçek karşılığı

Arama kutusuna "chatbot nasıl eğitilir" yazan işletme sahibinin aklındaki resim çoğu zaman bir modelin aylarca veriyle beslenmesidir. Küçük ve orta ölçekli bir işletmede iş böyle yürümez. Hazır bir dil modeli kullanılır; ona yapılan şey yeniden eğitim değil, iki katman eklemektir: cevap verirken bakacağı bilgi kaynağı ve nasıl davranacağını söyleyen talimatlar.

Bu ayrım önemlidir, çünkü dil modelleri kendi başına bırakıldığında kendinden emin ama yanlış içerik üretebilir. ABD Ulusal Standartlar ve Teknoloji Enstitüsü'nün (NIST) üretken yapay zeka risk profili bu durumu "confabulation" adıyla tanımlıyor ve gündelik dildeki "halüsinasyon" kelimesinin karşılığı olduğunu açıkça yazıyor. Google da grounding belgesinde cevabı belirli bir veri kaynağına bağlamanın modelin gerçeğe dayanmayan içerik üretme olasılığını azalttığını söylüyor. Dikkat edin: azaltır, sıfırlamaz. Bu yüzden kaynağın kalitesi kadar, kaynak yetmediğinde ne olacağı da tasarlanmalıdır.

Yanlış cevaplar nereden çıkıyor?

Hatalı bir cevabın kökü konuşma kaydında geriye doğru izlendiğinde, genellikle dört sebepten birine varılır:

  1. Kaynak boşluğu. Müşteri, kaynakta hiç yazılmamış bir şeyi soruyor; asistan yardımcı olmaya çalışırken benzer bir bilgiden tahmin yürütüyor.
  2. Çelişen iki belge. Web sitesindeki hizmet sayfası bir şey, geçen yılın broşürü başka bir şey söylüyor. Asistan hangisinin güncel olduğunu bilemiyor.
  3. Eskimiş bilgi. Kampanya bitmiş, çalışma saati değişmiş, ama kaynakta eski satır duruyor. Asistan doğru okuyor, ama okuduğu şey artık yanlış.
  4. Kapsam taşması. Soru asistanın alanı dışında (bir klinikte tedavi önerisi, bir otelde başka bir tesisin fiyatı); asistan yine de cevap üretiyor.

Bu dört sebebin üçü yazılımla değil, belgeyle ilgilidir. Yani yanlış cevabı önlemenin büyük kısmı kurulum ekranında değil, bilgi kaynağının yazıldığı masada çözülür.

Bilgi tabanının yapı taşı: soru-cevap listesi değil bilgi kartı

Çoğu işletme bilgi tabanını sık sorulan sorular listesi olarak düşünür. Liste iyi bir başlangıçtır ama tek başına kırılgandır: aynı bilgi beş farklı sorunun cevabına dağılır, biri güncellenir, dördü eski kalır. Daha dayanıklı yapı, her konuyu tek bir bilgi kartında tutmaktır. Asistan farklı sorulara aynı karttan cevap üretir; güncelleme tek yerde yapılır.

Bir kartta bulunması gereken alanlar:

AlanNe yazılırNeden gerekli
KonuTek bir konu: "Randevu iptali"Kart birden fazla konuya yayılırsa çelişki doğar
Onaylı cevapİşletmenin müşteriye söyleyeceği metinAsistanın dayanağı budur
İstisnalarHangi durumda cevap değişirGenel kural istisnayı ezmesin
SöylenmeyeceklerAsistanın bu konuda vermeyeceği bilgiKapsam taşmasını önler
Geçerlilik tarihiKartın ne zamana kadar doğru sayıldığıEskimiş bilgiyi görünür kılar
SahibiKartı onaylayan ve güncelleyen kişiSahipsiz kart güncellenmez

Bir güzellik salonu için örnek: konu "randevu iptali"; onaylı cevap "Randevunuzu en geç bir gün önce iptal edebilirsiniz"; istisna "paket seanslarda iptal koşulu paket sözleşmesindedir"; söylenmeyecek "iptal ücreti tutarı, müşteri temsilcisi bildirir"; sahibi salon yöneticisi. Rakamlar burada örnektir; sizin kartınıza sizin koşulunuz yazılır.

Hangi belgeler kaynağa hiç girmemeli?

Kaynağı hızla doldurmak için eldeki her belgeyi asistana yüklemek cazip gelir. Bu, çelişen belge sorununu baştan satın almak demektir. Kaynağa girmemesi gerekenler:

  • Tarihi geçmiş kampanya ve broşürler. Asistan "bu kampanya bitti" bilgisini kendiliğinden çıkaramaz.
  • Sosyal medya gönderileri. Kısa, bağlamsız ve çoğu zaman o güne özel yazılır.
  • İç yazışmalar ve toplantı notları. Karar değil tartışma içerir; asistan tartışmayı karar gibi okuyabilir.
  • Pazarlama dilindeki site metinleri. "Sektörün en hızlı hizmeti" gibi bir cümle müşteriye taahhüt olarak tekrarlanır.

Bunların içindeki doğru bilgi varsa karta taşınır; belgenin kendisi kaynağa girmez. E-ticarette kargo ve iade koşulları bu süzgeçten en çok geçmesi gereken konudur, çünkü müşteri tam da satın alma kararını verirken sorar; bu bilginin eksik kalmasının sepette nasıl bir vazgeçmeye dönüştüğünü ödeme adımındaki bilgi eksiği yazısında ayrıca ele aldık.

Fiyat, saat ve stok gibi değişen bilgiler nasıl yazılır?

En pahalı hatalar rakamlarda yaşanır. Değişen bilgiyi karta yazarken üç kural işi kolaylaştırır.

Rakam yerine aralık ya da yönlendirme. Fiyat sık değişiyorsa kartta tek rakam yerine "fiyat seansa göre değişir, güncel tutarı temsilcimiz bildirir" gibi bir cevap daha güvenlidir. Rakam yazılacaksa geçerlilik tarihi zorunludur.

Canlı bilgi canlı sistemden gelir. Stok, müsait randevu saati ya da oda durumu karta yazılmaz; asistan bunları ya bağlı olduğu sistemden okur ya da hiç söylemez. Yazılı bir karttaki "müsait" kelimesi, okunduğu an yanlış olabilir.

Tarih damgası görünür olur. Her kartın geçerlilik tarihi bir tabloda toplanır ve tarihi geçen kart ya yenilenir ya da asistanın kaynağından çekilir. Süresi dolmuş kart, kaynakta hiç olmayan karttan daha tehlikelidir; çünkü asistana doğru bildiği bir şeyi söyletir.

Asistana yazılan talimatlar: kaynak yetmediğinde ne olacak?

Kaynak ne kadar iyi yazılırsa yazılsın, müşteri bir gün kaynakta olmayan bir şey soracak. Asistanın o anda ne yapacağı talimat katmanında belirlenir. Her asistana en az şu beş kuralın yazılı olarak verilmesini öneriyoruz:

  1. Yalnız kaynaktan cevap ver. Kartta olmayan bir bilgiyi benzer karttan türetme.
  2. Rakam çıkarımı yapma. Kartta yazmayan bir tutarı, süreyi ya da tarihi hesaplayarak üretme.
  3. Yasak konuları tanı. Klinikte tanı ve tedavi önerisi, otelde başka bir tesisin bilgisi, e-ticarette kişiye özel indirim vaadi gibi konular cevaplanmaz.
  4. Bilmediğini söyle ve devret. Cevap kaynakta yoksa bunu açıkça belirt, talebi bir kişiye aktar.
  5. Dayandığı kartı kayda geç. Her cevabın hangi karttan üretildiği konuşma kaydında görünsün.

Dördüncü kuralın arkasındaki mekanizma, yani konuşmanın hangi sinyalle, hangi bağlamla ve mesai dışında nasıl bir kişiye aktarılacağı ayrı bir tasarım konusudur; insana devir kuralları yazısında bunu tablo hâlinde anlattık. Burada önemli olan, devrin bir hata değil, kaynağın sınırına ulaşıldığında beklenen davranış olarak tanımlanmasıdır.

Yayın öncesi test seti: hangi sorular sorulmalı?

Asistanın hazır olup olmadığını "birkaç soru sorduk, iyi cevap verdi" diyerek anlamak mümkün değildir. Gereken şey, cevabı önceden yazılmış sorulardan oluşan bir settir. OpenAI'ın LLM doğruluğunu iyileştirme rehberi de bu aşamanın en değerli çıktısını soru ve doğru cevap çiftlerinden oluşan bir değerlendirme seti olarak tarif ediyor ve başlangıç için yirmiyi aşkın sorudan söz ediyor.

Önerdiğimiz set, tek tip sorulardan değil, farklı davranışları zorlayan soru ailelerinden oluşuyor:

Soru ailesiÖrnek (otel)Beklenen davranış
Doğrudan kapsam"Giriş saati kaçta?"Karttaki onaylı cevap
Farklı ifade"odaya en erken ne zmn girebilirim"Aynı karttan aynı cevap
Olmayan hizmet"Havaalanı transferiniz var mı?" (yoksa)"Bu hizmetimiz yok" ve gerekiyorsa devir
Eskimiş bilgi"Geçen yazki erken rezervasyon indirimi geçerli mi?"Uydurmadan güncel bilgiye yönlendirme
Yasak konu"Yandaki otel daha mı ucuz?"Cevap vermeme, kibar sınır
Kişi talebi"Bir yetkiliyle konuşmak istiyorum"Soru sormadan devir

Her ailede birkaç soru bulunması, tek bir şanslı cevabın yanıltmasını önler. Soruları uydurmak yerine son aylarda gerçekten gelen mesajlardan seçmek seti gerçekçi kılar; müşterinin yazım hatası, kısaltması ve eksik cümlesi de böylece teste girer.

Testin nasıl koşulduğu da sonucu etkiler. Sorular kurulum panelindeki deneme penceresinde değil, asistanın açılacağı gerçek kanalda sorulmalıdır; WhatsApp'ta kısa mesaj, web sohbetinde uzun paragraf gelir ve ikisi farklı sonuç verebilir. Dil modeli aynı soruya her seferinde birebir aynı cevabı vermeyebileceği için kritik sorular en az iki kez sorulur ve iki cevap da puanlanır. Her turun tarihi, kaynağın o günkü sürümü ve alınan cevaplar tek bir tabloya yazılır; sonraki turlarda neyin düzeldiği ve neyin bozulduğu ancak bu kayıtla görülür.

Cevapları puanlamak: doğru, eksik, yanlış, uydurma

Test sırasında her cevap tek bir etikete bağlanır. "İyi gibi" ya da "fena değil" gibi değerlendirmeler ölçüm değildir; aynı cevaba iki kişi farklı not verir. Önerdiğimiz dört etiket:

  • Doğru: Karttaki bilgiyle aynı, beklenen davranış gerçekleşmiş.
  • Eksik ama güvenli: Bilgi tam değil, ama yanlış bir şey söylenmemiş ve müşteri doğru yere yönlendirilmiş.
  • Yanlış: Kaynakta doğru bilgi var, asistan farklısını söylemiş.
  • Uydurma: Kaynakta karşılığı olmayan bir bilgi kesin bir dille üretilmiş.

Puanlamayı kurulumu yapan kişi değil, ilgili kartın sahibi yapmalıdır. Kurulumu yapan kişi cevabın akıcı olduğunu görür; kartın sahibi ise iptal koşulundaki istisnanın atlandığını fark eder. "Yanlış" ile "uydurma" ayrımı da önemlidir: birincisi çoğu zaman kartın yazımını düzeltmeyi, ikincisi talimat katmanını sıkılaştırmayı gerektirir.

Kabul eşiği: hangi hata kaç kez kabul edilir?

Testin sonunda verilecek karar önceden yazılmış bir eşiğe bağlanmazsa, sonuç görüşe dönüşür ve takvim baskısı kazanır. OpenAI'ın aynı rehberi, hazır yöntemlerle kusursuz doğruluğa ulaşmanın gerçekçi olmadığını kabul ediyor ve bir müşteri destek örneği üzerinden farklı hata türlerine farklı maliyet biçmeyi öneriyor. Biz de eşiği tek bir yüzdeyle değil, hata türüne göre kuruyoruz:

KategoriKabul ölçütü
Fiyat, iptal ve iade koşulu, sağlıkla ilgili sınırHiç "yanlış" ya da "uydurma" yok
Yasak konu ve kişi talebi sorularıHer biri beklenen davranışla sonuçlanmış
Genel bilgi soruları"Eksik ama güvenli" kabul edilir, "uydurma" kabul edilmez
Farklı ifade sorularıDoğrudan kapsamdaki cevapla tutarlı

Bu tablo bir sektör ortalaması değil, işletmeyle birlikte yazılan bir karar kuralıdır; sizin işinizde başka bir kategori kritik olabilir. Sonuç üç karardan birine bağlanır: geç (tüm ölçütler tuttu), sınırlı geç (kritik kategoriler temiz, genel sorularda eksikler var; asistan tek kanalda ve dar bir konu kümesinde açılır) ya da kal (kritik kategoride tek bir uydurma bile var). Sınırlı geçişte de kritik kategoride hata kabul edilmez.

Yayından sonra test seti yaşayan bir belgedir

Kabul testi bir kez yapılıp rafa kaldırılırsa, asistanın kalitesi kaynağın güncelliğiyle birlikte sessizce aşınır. Test setini canlı tutmak için üç alışkanlık yeterli:

Her kötü cevap yeni bir test sorusu olur. Konuşma kayıtlarında "yanlış" ya da "uydurma" etiketi alan her cevap, düzeltildikten sonra sete eklenir. Böylece aynı hata ikinci kez yayına çıkamaz.

Kaynak değiştiğinde set yeniden koşulur. Bir fiyat kartı güncellendiğinde yalnız o soruya değil, bütün sete bakılır; bir kartın değişmesi başka bir kartla çelişki yaratmış olabilir.

Tarihi geçen kart takvime bağlanır. Geçerlilik tarihi yaklaşan kartlar sahibine hatırlatılır; yenilenmeyen kart kaynaktan çekilir.

Klinik gibi sağlık alanında çalışan işletmelerde bu bakım, yasak konu sınırının korunması açısından ayrıca önemlidir; diş ve estetik klinikleri için önerdiğimiz akışlarda bu sınır baştan yazılır. Bilgi kartlarının yazımı, talimat katmanı, test seti ve kabul eşiği birlikte müşteri hizmetleri yapay zeka asistanı kurulumunun parçasıdır. Konuşma kayıtlarının saklanması ve yurt dışına aktarım ise chatbot KVKK yükümlülükleri yazısında ayrı ele alınır. Kendi soru akışınızla başlamak isterseniz ücretsiz iş analizi görüşmesinde kapsamı birlikte belirleyebiliriz.

Sıkça Sorulan Sorular

Chatbot halüsinasyonu tamamen önlenebilir mi?

Hayır, tamamen önlenemez; ama yönetilebilir. Dil modelleri kendinden emin ama yanlış içerik üretebilir ve cevabı doğrulanmış bir bilgi kaynağına bağlamak bu olasılığı azaltır, sıfırlamaz. Pratikte hedef, uydurma cevabın kritik konularda müşteriye ulaşmamasıdır: asistan yalnız tarihli ve sahipli bilgi kartlarından cevap verir, kaynakta karşılığı olmayan soruda bilmediğini söyleyip konuşmayı bir kişiye devreder ve bu davranış yayından önce bir test setiyle ölçülür.

Chatbot'u eğitmek için modeli yeniden eğitmek gerekir mi?

Küçük ve orta ölçekli işletmelerin çoğunda gerekmez. Hazır bir dil modeli kullanılır ve ona iki katman eklenir: cevap verirken bakacağı bilgi kaynağı ve nasıl davranacağını belirleyen talimatlar. "Chatbot nasıl eğitilir" sorusunun işletmedeki karşılığı, bu kaynağın doğru yazılması ve güncel tutulmasıdır. Modelin yeniden eğitilmesi daha özel ihtiyaçlarda gündeme gelen ayrı bir iştir.

Yayın öncesi test setinde kaç soru olmalı?

Sabit bir sayı yoktur; önemli olan soruların farklı davranışları zorlamasıdır. OpenAI'ın doğruluk rehberi başlangıç için yirmiyi aşkın soru ve doğru cevap çiftinden söz ediyor. Biz seti soru ailelerine bölüyoruz: doğrudan kapsam, farklı ifade, olmayan hizmet, eskimiş bilgi, yasak konu ve kişi talebi. Her ailede birkaç soru bulunması, tek bir şanslı cevabın sonucu yanıltmasını önler.

Chatbot bilgi tabanını kim güncellemeli?

Her bilgi kartının bir sahibi olmalı ve kartı o kişi güncellemelidir: fiyat kartını fiyatı belirleyen kişi, iptal koşulunu operasyonu yöneten kişi. Kurulumu yapan teknik ekip kartın içeriğine karar vermez. Kartlarda geçerlilik tarihi bulunur, tarihi yaklaşan kart sahibine hatırlatılır ve yenilenmeyen kart asistanın kaynağından çekilir.

Test geçtikten sonra asistan yine yanlış cevap verirse ne yapılmalı?

Önce konuşma kaydından cevabın hangi karta dayandığı bulunur. Kart yanlış ya da eskiyse kart düzeltilir; kart doğru ama cevap farklıysa talimat katmanı sıkılaştırılır. Ardından o soru test setine eklenir ve set bütünüyle yeniden koşulur. Böylece aynı hata ikinci kez yayına çıkmaz ve düzeltmenin başka bir kartla çelişki yaratıp yaratmadığı da görülür.