OpenAI, ChatGPT Voice için yeni nesil ses modeli GPT-Live’ı tanıttı

Google News Icon Takip Et

Microsoft destekli OpenAI (MSFT), ChatGPT Voice üzerinde gerçek zamanlı ve doğal sohbetler sunmak üzere tasarlanan yeni nesil ses modeli GPT-Live’ı tanıttı.

GPT-Live, geleneksel sistemlerin aksine, kullanıcının konuşmasını bitirmesini beklemeden aynı anda dinleyip yanıt verebiliyor. Bu sayede anlık kesintileri yönetebiliyor, duraklamaları algılayabiliyor ve “evet”, “hı hı” gibi kısa tepkilerle insan benzeri bir sohbet akışı sağlayabiliyor.

Sistem, OpenAI’ın genel ekosistemiyle doğrudan entegre çalışıyor. Standart sesli etkileşimleri kendi içinde işlerken, web aramaları veya ileri düzey mantık yürütme gibi karmaşık talepleri otomatik olarak farklı bir modele yönlendiriyor ve sonuçları sesli arayüz üzerinden kullanıcıya iletiyor.

GPT-Live, başlangıçta daha ağır iş yükleri için GPT-5.5 modelini kullanacak ve yeni modeller kullanıma sunuldukça güncellenecek. Şirket, dahili testlerde önceki Gelişmiş Ses Modu’na kıyasla sohbet akışı, kesinti yönetimi ve kullanıcı tercihi gibi alanlarda iyileşme sağlandığını belirtti.

Güncellemeyle birlikte ChatGPT Voice, yalnızca sesli yanıtların ötesine geçiyor. OpenAI, bu özellikle birlikte hava durumu, hisse senetleri ve spor gibi konularda sesli sohbet sırasında görsel kartlar gösterileceğini, ayrıca arama, hafıza, görsel oluşturma ve dosya yükleme gibi araçlara erişimin devam edeceğini açıkladı.

Yeni modellerde, izinsiz ses taklidine karşı koruma ve hassas sohbetleri yönetmek için ek güvenlik önlemleri bulunuyor. Kullanıcıların gerçek kişilerin doğrudan kopyalarını oluşturmasına izin verilmek yerine, onaylanmış sınırlı bir ses seti kullanılıyor.

Şirket, performansın diller arasında farklılık gösterebileceğini ve bazı dillerde aksan doğruluğu ile akıcılıkta hâlâ eksiklikler yaşanabileceğini kabul etti. “GPT-Live’ı ChatGPT’de en çok kullanılan diller için optimize ettik. Bazı dillerde model, ana dili konuşan bir aksana sahip olmayabilir veya akıcılıkta eksiklikler olabilir. Deneyimi tüm dillerde geliştirmek için aktif olarak çalışıyoruz.” açıklaması yapıldı.

Yapay Zekâ Sesi: Yeni Ana Arayüz

Bu gelişme, yapay zekâ geliştiricileri arasındaki rekabette metin tabanlı sohbet robotlarının ötesine geçilerek daha kalıcı ve sohbet odaklı asistanlara yönelinen bir adım olarak öne çıkıyor.

Google, Gemini tabanlı sesli özelliklerini genişletirken; Amazon, Alexa’yı üretici yapay zekâ ile yeniden inşa ediyor. Apple ise Apple Intelligence platformu üzerinden Siri’ye daha gelişmiş yapay zekâ özellikleri kazandırmak için çalışıyor.

Aynı dönemde ElevenLabs gibi girişimler de yapay zekâ ile üretilen konuşma, sesli asistanlar ve sohbet uygulamalarına daha fazla odaklanıyor. Şirket, şubat ayında en gelişmiş metinden konuşmaya modelini, Eleven v3’ü duyurmuştu.

Bu içerik hazırlanırken faydalanılan kaynaklar: Benzinga