Google (GOOG) (GOOGL), şimdiye kadarki en hassas konuşmadan metne modeli olarak tanımladığı Gemini 3.5 Transcribe’ı tanıttı.
Google, geleneksel konuşma tanıma modellerinin arka plan gürültüsü, karmaşık terimler ve akıcılık sorunlarıyla baş etmekte zorlandığını, ancak Gemini 3.5 Transcribe’ın ham ses kaydını doğrudan doğru, düzenli ve biçimlendirilmiş metne dönüştürdüğünü belirtti.
Model, geliştiricilerin iş akışlarına kolayca entegre edilebiliyor ve sesli asistanlar, gerçek zamanlı altyazı veya görüşme sonrası analiz gibi uygulamalar için kullanılabiliyor. Gerçek zamanlı ses akışı için Live API, önceden kaydedilmiş sesler için ise Interactions API üzerinden erişilebiliyor.
Öne çıkan özellikleri arasında; otomatik olarak metni temizleyen akıllı transkripsiyon, özel kelime dağarcığı tanıma, 85’ten fazla dili destekleme ve üçe kadar konuşmacıyı ayırt edebilme bulunuyor.
Modelin hata oranı, canlı akışta %4, kayıtlı seslerde ise %2,6 olarak açıklandı. Ayrıca, FLEURS benchmark testinde de birçok dilde daha iyi sonuçlar elde etti. Örneğin, Gemini Transcribe 3.5 Live’ın kelime hata oranı %5,5 iken, OpenAI’ın GPT Live Transcribe’ında bu oran %8,9 olarak ölçüldü.
Yeni model, geliştiriciler ve kurumsal kullanıcılar için herkese açık önizleme olarak sunuluyor. Diğer kullanıcılar ise Gemini uygulaması üzerinden macOS’ta İngilizce olarak ve Android’de belirli ülkelerde Rambler ile erişebiliyor. Yakında Chrome’da da kullanıma sunulacak.
Google, bu ayın başında Gemini 3.7 Flash’ı piyasaya sürmüş ve Gemini uygulaması 1 milyar kullanıcıyı aşmıştı. Ancak, haziran ayında çıkması planlanan bir sonraki ileri seviye model Gemini 3.5 Pro henüz yayımlanmadı.
Bu içerik hazırlanırken faydalanılan kaynaklar: Seeking Alpha