Sesli yapay zekâ ajanı nasıl çalışır, gerçek çağrılarda nerede bozulur
Sesli yapay zekâ ajanının içinde neler olduğu, kurmanın üç yolu ve yalnızca gerçek telefon çağrılarında ortaya çıkan bozulmalar.
Sesli yapay zekâ ajanı, bir konuşmayı kendi başına yürüten yazılımdır. Arayanı dinler, ne demek istediğini anlar, ne yapacağına karar verir ve sesli olarak yanıt verir; bunu bir telefon hattında ya da tarayıcıda yapar. Aynı konuşmanın içinde bir bilgiyi sorgulayabilir, randevu oluşturabilir, çağrıyı aktarabilir ya da sonlandırabilir.
Bu kısmı anlatmak kolay. Bu yazı geri kalanıyla ilgili: arayanın sözleriyle ajanın yanıtı arasında neler olduğu, bir ajanın davranışını belirleyen seçimler ve Glytos'u geliştirirken gerçek çağrılarda karşılaştığımız bozulmalar. Hiçbiri sıra dışı değil; ses tarafında ürün çıkarmış herkes çoğunu tanıyacaktır. Yazmaya değer olmalarının sebebi, neredeyse hiçbirinin hata vermemesi. Çağrı bağlanıyor, ajan konuşuyor ve bir şey sessizce yanlış gidiyor.
Sesli yapay zekâ ajanının içinde neler olur
Neyle kurulmuş olursa olsun, bir çağrının her sırası aynı dört işten geçer:
- Duymak. Arayanın sesi küçük ses parçalarından oluşan bir akış olarak gelir.
- Arayanın sözünü bitirdiğine karar vermek. Buna sıra algılama denir. Fazla aceleci olursa ajan insanların sözünü yarıda keser; fazla sabırlı olursa hat sessiz kalır.
- Anlamak ve karar vermek. Bir dil modeli o ana kadarki konuşmayı, talimatlarını ve onun için getirilen bilgileri okur; sonra ya yanıt verir ya da bir araç çağırır.
- Konuşmak. Yanıt sese dönüştürülüp çalınır; ideal olan, yanıtın tamamı yazılmadan konuşmaya başlamaktır.
Bu dört işin etrafında, ajanı bir demodan ayıran parçalar bulunur: araçlar, bilgi kaynakları, çağrı kontrolü (aktarma, sonlandırma, sessizlikte ne yapılacağı) ve olan her şeyin kaydı.
Sesli yapay zekâ ajanı kurmanın üç yolu
Aşamalı: konuşmadan metne, dil modeli, metinden konuşmaya
Art arda çalışan üç servis. Güçlü yanı kontrol. Her adım okunabilen, kaydedilebilen, filtrelenebilen ve test edilebilen bir metin üretir; her bileşeni ayrı seçersiniz ve her birinin maliyeti görünür. Zayıf yanı bir bayrak yarışı olması: her devir teslim zaman alır ve konuşma metne dönüştüğü anda arayanın ses tonu kaybolur.
Konuşmadan konuşmaya
Tek bir model sesi duyar ve sesle yanıt verir. Daha doğal duyulur ve konuşmanın tonunu korur. Karşılığında kontrolden vazgeçersiniz. Model konuşmadan önce incelenebilecek bir metin adımı yoktur ve bazı modellerde belirli bir cümleyi kelimesi kelimesine söyletemezsiniz: ne söylemesi gerektiği anlatılır, o da kendi kelimeleriyle söyler. Söylenmesi zorunlu bir bilgilendirme, bir kapanış cümlesi ya da sabit bir yedek yanıt söz konusu olduğunda bu, göründüğünden daha önemlidir.
Tam çift yönlü
Konuşurken de dinlemeye devam eden bir ses modeli. Araya girmek ya da cevabın ortasında bir ayrıntı eklemek sıradan hale gelir. Aşamalı bir yapının dayandığı bazı varsayımları da bozar. Ajan konuşurken arayanın mikrofonunu susturmak orada yaygın bir korumadır; tam çift yönlü bir modelde aynı susturma onu sağır eder.
Hangisini seçmeli
Çağrı belirli bir sırayla ilerlemesi gereken adımlardan oluşuyorsa ya da kelimesi kelimesine söylenmesi gereken cümleler varsa aşamalı yapıyla başlayın. Konuşma serbest akıyorsa ve doğallık her şeyden önemliyse konuşmadan konuşmaya bir modeli deneyin. Kalıcı bir karar olmak zorunda değil: Glytos'ta ses motoru ajanın bir ayarıdır; değiştirdiğinizde talimatı, araçları, bilgi kaynakları ve telefon numarası olduğu gibi kalır.
Sıra almak, sesli ajanların yapay hissettirdiği yer
"Robot gibi" hissettiren bir sesli ajanla ilgili şikâyetlerin çoğu sesle değil, sıra almayla ilgilidir.
Arayanın sustuğunu anlamak. Düşünmek için verilen bir duraklama ile cümlenin sonu, bir sessizlik algılayıcısına aynı gelir. Bu ayar, insanların sözünü kesmekle boşluk bırakmak arasında bir tercihtir ve doğru nokta, kısa bir onay çağrısıyla serbest bir konuşma arasında farklıdır.
Söz kesme. Arayanın ajanın sözünü kesebilmesi ilk bakışta açıkça doğru görünür. Ama hoparlörü açık bir telefonda ya da kulaklıksız bir dizüstü bilgisayarda ajanın kendi sesi mikrofona geri döner. Söz kesme açıkken ajan kendi sözünü kesebilir ya da kendi cümleleri arayanın yeni bir sözü gibi metne dökülebilir. Glytos'ta bu her ajan için ayrı bir tercihtir ve ajanlar korumalı başlar: söz kesmeyi siz açmadıkça ajan cümlesini bitirir.
Sessizlik. Kimse konuşmadığında ajanın ne yapacağına karar verin: kendi dilinde yeniden sorsun ve belirlediğiniz bir sınırdan sonra hattı süresiz açık tutmak yerine çağrıyı kapatsın.
Sesli yapay zekâ ajanları gerçek çağrılarda nerede bozulur
Bunların her biriyle karşılaştık. Her biri için: nasıl göründüğü, neden olduğu ve nasıl yakalanacağı.
Ajan kimsenin söylemediği sözlere yanıt veriyor
Belirti: arayanın hiç söylemediği şeylere akıcı ve kendinden emin yanıtlar.
Bizdeki sebep: ses biçimi uyuşmazlığı. Konuşmadan konuşmaya çalışan bir model 24 kHz ses bekliyordu. Ona 16 kHz ses, üzerinde 24 kHz etiketiyle değiştirilmeden iletildi; model her arayanı 1,5 kat hızlı ve yaklaşık yedi yarım ses tiz duydu. Şikâyet etmedi. Duyduğunu sandığı şeye yanıt verdi.
Ders: hatalı ses alan bir model hata vermez, tahmin eder. Örnekleme hızını ve kodlamayı her geçiş noktasında kontrol edin; yanıtlar anlamsızlaşmaya başladığında arayanın ne söylediğine değil, modelin ne aldığına kulak verin.
Sessizlik "teşekkürler"e dönüşüyor
Belirti: arayan hiçbir şey söylemiyor ve ajan "teşekkürler" ya da "izlediğiniz için teşekkürler" sözüne yanıt veriyor.
Sebep: Whisper ailesindeki transkripsiyon modelleri büyük ölçüde altyazılı videolarla eğitildi ve sessizlik ya da hat gürültüsü verildiğinde hazır altyazı cümleleri üretmeleriyle bilinir. Ajan da kimsenin söylemediği bir cümleye yanıt verir.
Ders: yalnızca metne bakarak filtrelemek işe yaramaz, çünkü arayan gerçekten de "teşekkürler" diyebilir. İkisini ayıran şey, arayanın gerçekte ne kadar konuştuğudur: böyle bir cümleyi söylemek yaklaşık bir saniye sürer, hayali bir döküm ise saniyenin küçük bir parçası kadar gürültüden çıkar. Filtre transkripsiyon modeline de uygun olmalıdır. Konuşmayı parça parça işleyen bir model için yazılmış bir kural, akış halinde çalışan bir model için yanlıştı; bir kez gereğinden geniş uyguladığımızda gerçek ve kısa bir yanıtı da silip attı.
Arayan konuşuyor, hat sessiz kalıyor
Belirti: arayan bir şey söylüyor, ajan hiçbir şey söylemiyor ve bu böyle sürüyor.
Sebep: transkripsiyon modeli kesin bir döküm üretemedi; çoğunlukla arayan, modelin ayarlanmadığı bir dilde konuştuğu için. Sıra boş kapandı, modele hiçbir şey ulaşmadı ve hiçbir yerde hata görünmedi.
Ders: sesin kendisini ölçün; hem seviyesini hem de gerçekte kaç saniyesinin iletildiğini. Arayanın konuştuğuna dair kanıt olduğu halde hiçbir döküm çıkmadıysa, ajan sınırlı sayıda tekrar etmesini istemeli, sonra döngüye girmek ya da sessiz kalmak yerine çağrıyı nazikçe kapatmalıdır.
Model anladı, döküm anlamadı
Belirti: Türkçe konuşan bir arayan "Bu arada sen kimsin?" diye sordu. Ajan soruyu doğru yanıtladı. Kaydedilen dökümde ise arayanın sözleri Korece görünüyordu.
Sebep: konuşmadan konuşmaya modellerde konuşma ile döküm ayrı işlemlerdir. Model sesi doğrudan duyar ve dilini talimatlarından alır. Döküm ise ayrı bir tanıma adımından gelir; bu adım ayarlanmadığında dili kendisi tahmin eder ve kısa sözlerde yanlış tahmin etmesi kolaydır.
Ders: döküm, arayanın ne söylediğine dair bir kanıttır, ispat değildir. Raporlarınız, analizleriniz ya da topladığınız veriler dökümden üretiliyorsa ajanın dilini yalnızca modele değil, döküm adımına da verin.
Bir değişken hiçliğe dönüşüyor
Belirti: bir giden arama "Merhaba John." yerine "Merhaba." diye başlıyor.
Sebep: talimatta "Merhaba {{ad}}" yazıyordu ve ad, kişi listesinden geliyordu.
Bir değeri bulamadığında onu sessizce boşlukla değiştiren bir şablon "Merhaba." üretir
ve hata vermez. Tam olarak bunu yaşadık: kişinin bilgileri çağrıya ulaşıyor ama
talimata ulaşmıyordu.
Ders: bir kampanya başlamadan önce, listenizden gerçek bir satırla oluşan son talimatı kontrol edin. Sessizce başarısız olan bir şablon, gürültüyle başarısız olandan daha kötüdür.
Daha hızlı düşünme, daha kötü akış
Belirti: ajan, talimatının zorunlu tuttuğu bir adımı atladı.
Sebep: akıl yürüten bir modelin düşünme seviyesini düşürmek daha çabuk yanıt vermesini sağlar. Canlı bir çağrıda, en düşük ayarda çalışan çok adımlı bir talimata sahip ajan, arayan müsait olmadığını söylediğinde talimatının gerektirdiği gibi geri arama önermek yerine çağrıyı sonlandırdı.
Ders: hız, akışa uymanın karşılığında alınmıştı. Karmaşık akışlara daha fazla düşünme payı verin ya da akışı talimattan çıkarıp her adımın yapı tarafından zorunlu tutulduğu ve modelin her adımda yalnızca küçük bir iş yaptığı bir iş akışına taşıyın.
Sesli yapay zekâ ajanı gerçek çağrılardan önce nasıl test edilir
- Önce tarayıcıdan konuşun. Aynı ajan, aynı araçlar; telefon numarası gerekmez.
- Mantığı metinle test edin. Kontrolleri olan senaryolu konuşmalar: doğru adımda bitti mi, doğru bilgileri topladı mı, söylemesi gereken cümleyi söyledi mi ve "ajan iade önerdi" gibi bir değerlendirme ölçütü sağlanıyor mu? Metin testleri hızlı ve tekrarlanabilirdir, mantıktaki gerilemeleri yakalar. Sesi test etmezler; yukarıdaki bozulmalar için yine gerçek çağrılar gerekir.
- Sürümleri karşılaştırın. Bir değişikliği yayınlamadan önce ajanın iki sürümünü aynı mesajlarla yan yana çalıştırın.
- Her gerçek çağrıyı okuyun. Döküm, arayanla ajanın ayrı şeritlerde göründüğü ses kaydı, yönlendirme kararlarının ve araç çağrılarının zaman çizelgesi ve maliyet. Çağrıları canlı izleyin, biri ters gittiğinde araya girin.
Glytos tam olarak böyle çalışıyor ve bunların hiçbiri sese özgü değil: üretime giden her yazılımda olması gerekenler.
Sesli yapay zekâ ajanının maliyeti
Tek bir rakam yok. Bir çağrının maliyeti, her biri kendi biriminden ücretlendirilen bileşenlerin toplamıdır: dil modeli token başına, ses karakter başına, transkripsiyon ses dakikası başına, konuşmadan konuşmaya bir model kendi ses token'ı ya da dakikası başına; buna platform ücreti eklenir.
Bunun pratik sonuçları var. Çok konuşan bir ajan ses tarafında daha pahalıya gelir. Uzun talimatlar her sırada yeniden gönderilir ve girdi token'ı harcar; istem önbelleği bunu hafifletir. Bu yüzden dakika başına bir ortalama, faturanızı asıl neyin belirlediğini gizler. Glytos her çağrının maliyetini bileşenlerine ayrılmış olarak gösterir; kendi sağlayıcı anahtarlarınızla sağlayıcı sizi doğrudan faturalandırır ve yalnızca platform ücreti alınır.
Sesli yapay zekâ ajanı platformu seçmeden önce sorulacak sorular
- Her sırayı görebiliyor musunuz: transkripsiyon modeli ne duydu, model ne aldı, neye karar verdi ve maliyeti ne oldu?
- Ajanı yeniden kurmadan aşamalı yapı ile konuşmadan konuşmaya arasında geçiş yapabiliyor musunuz?
- Söz kesmeyi ve sessizliği her ajan için ayrı ayarlayabiliyor musunuz?
- Bir değişikliği arayanlara ulaşmadan önce test edip sürümleri karşılaştırabiliyor musunuz?
- Kendi telefon numaralarınızı ya da SIP hattınızı ve kendi sağlayıcı anahtarlarınızı kullanabiliyor musunuz?
- Ajanlarınızı dışa aktarıp başka bir yere götürebiliyor musunuz?
Deneyin
Glytos'ta tek bir talimatla ya da görsel bir iş akışıyla sesli yapay zekâ ajanı kurabilir, tarayıcınızdan arayabilir ve her çağrının her sırasını görebilirsiniz. Ücretsiz başlayın ya da önce hızlı başlangıç rehberini okuyun.