OpenAI bugün GPT-Live-1’i yayınladı. 24 saat geçmeden her Glytos sesli ajanı onun üzerinde çalışabilir hale geldi. Bekleme listesi yok, kapalı beta yok: bir ajanı aç, motoru değiştir, ara.
GPT-Live nedir
Sesli ajanlar bugüne kadar çoğunlukla bir röle olarak kuruldu. Ses bir transkripsiyon servisine, metin bir dil modeline, yanıt bir sese gidiyor. Üç servis, üç devir teslim, ve arayan hepsini sırayla bekliyor.
GPT-Live bunu aynı anda dinleyip konuşan tek bir modele indiriyor. Tam çift yönlü olması, "sözünü kesebilirsiniz"den daha güçlü bir iddia: model siz konuşurken de duymaya devam ediyor, dolayısıyla cevabının ortasında bir ayrıntı eklemek, sırasını bitirmesini beklemek yerine sıradan bir davranış haline geliyor.
Düşünmeyi konuşmaktan da ayırıyor. Sohbet canlı modelde kalırken akıl yürütme ve araç çağrıları ayrı bir arka plan modeline devrediliyor, böylece bir şey sorgulanırken hat sessizleşmiyor.
Gerçek bir aramada nasıl
Telefondan aradık. Gidiş geliş, tanıtımların ima ettiği gibi doğal hissettiriyor: araya girebiliyor, o an aklınıza geleni ekleyebiliyor ya da yön değiştirebiliyorsunuz; cümlenin bitmesini beklemek gerekmiyor ve model üzerinize konuşmak yerine konuyu alıyor.
Bu bir ölçüm değil, birkaç aramadan çıkan bir izlenim. Süre tutmadık; almadığımız bir rakamı yayınlamaktansa hiçbir şey söylememeyi tercih ederiz.
Artık doğru olmayan üç şey
Kiminle kurarsanız kurun, üzerine bir şey inşa etmeden önce okunmaya değer kısım burası. Tam çift yönlü bir model, her ses yığınının bugün doğru saydığı birkaç varsayımı sessizce geçersiz kılıyor ve hiçbiri gürültüyle bozulmuyor.
Arayanı susturmak artık bir savunma değil
Klasik yığında, ajan konuşurken arayanın mikrofonunu kapatmak rutindir. Ajanın kendi sesinin hoparlörden geri dönüp yeni bir arayan turu olarak yazıya dökülmesine karşı standart korumadır; yarım kalmış bir cümlenin bir öksürükle kesilmesine karşı da.
Tam çift yönlü bir modelde aynı susturma, araya girmeyi engellemiyor. Modelin kendi sırası boyunca hiçbir şey duymamasına yol açıyor, yani onu seçme sebebinizi ortadan kaldırıyor. O kararın modelde olması gerekiyor: araya girildiğini duyup sırayı bırakıp bırakmayacağına kendisi karar veriyor.
Bunu yanlış yaptığınızda hiçbir yerde hata çıkmıyor. Çağrı kuruluyor, ajan konuşuyor, ve karşıdakinin konuştuğunu hiç fark etmiyor.
Bir sağlayıcı adı artık tek bir davranış demek değil
OpenAI şu anda tek bir isim altında, iki farklı API yüzeyinden erişilen iki konuşma motoru sunuyor ve aralarında önemli farklar var. En belirgini yazılı konuşma: realtime modelleri, modele tam olarak belirli bir cümleyi söyleten yanıt bazlı bir talimat kabul ediyor; GPT-Live etmiyor, çünkü onun talimatları oturuma ait.
Ajanınızın kelimesi kelimesine söylemesi gereken bir kapanış cümlesi varsa, ya da arayanı anlamadığında döndüğü sabit bir ifade varsa, bunu ileten mekanizma ikisinde aynı değil. Davranışı sağlayıcı adına bakarak belirleyen kod, ikisinden birinde yanlış yapacak ve belirtisi hiç söylenmeyen bir cümle olacak.
Bir sesli ajanın maliyeti artık iki parçalı
OpenAI, GPT-Live sesini saniye bazında, arka plan modelini ise ayrıca kendi token’ları üzerinden faturalandırıyor. Her iki rakam da onların ve yayınlanmış durumda; buradaki mesele yalnızca biçim: tek bir şey olarak fiyatlanan bir konuşma artık iki şey olarak fiyatlanıyor ve ikisi birbirinden bağımsız hareket ediyor. Çok konuşan bir arayan ile tek bir zor soru soran arayan, eskisinden farklı ve birbirine zıt yönlerde maliyet çıkarıyor.
Birim ekonomisini yalnızca dakika başı bir rakam üzerinden modellemeden önce bilinmesi gereken bir şey.
Denemek için
Herhangi bir sesli ajanda model ayarlarını açın, konuşma motorunu realtime’a alın ve model olarak GPT-Live’ı seçin. Bir ses seçip arayın. Ajanın sahip olduğu her şey çalışmaya devam ediyor: promptu, bilgi tabanı, araçları, telefon numarası.
Daha çok erken
Burada haftalardır değil, saatlerdir yayında; dolayısıyla bu bir ilk izlenim, bir hüküm değil. Şu ana kadar duyduğumuzu beğendik. Bunu bir iddiaya dönüştürecek ölçümler sonra gelecek ve geldiklerinde kendi yazıları olacak.