Türkiye’nin ikinci astronotu Tuva Cihangir Atasever, uzay kampı Türkiye’de gençlerle buluştu
Türkiye’nin ikinci astronotu Tuva Cihangir Atasever, uzay kampı Türkiye’de gençlerle buluştu
İçeriği Görüntüle

Google, sesli konuşmaları metne dönüştürmek için geliştirdiği Gemini 3.5 Transcribe modelini duyurdu. 85 dili destekleyen yeni yapay zeka modeli, özellikle arka plan gürültüsünün bulunduğu ortamlarda konuşmaları daha doğru algılamaya ve günlük konuşma dilini daha iyi anlamaya odaklanıyor.

Google, Gemini 3.5 Transcribe’ı geliştirdiği en doğru konuşmadan metne dönüştürme modeli olarak tanımlıyor. Şirket, modelin gürültülü ortamlarda ve teknik terimlerin kullanıldığı konuşmalarda önceki modellere kıyasla daha az hata yaptığını belirtiyor.

Konuşma sırasında yapılan hataları düzeltebiliyor

Gemini 3.5 Transcribe, yalnızca duyduğu kelimeleri yazıya aktarmıyor. Model, konuşma sırasında yapılan bazı hataları düzeltebiliyor ve “ııı”, “eee” gibi dolgu ifadelerini kaldırabiliyor.

Yapay zeka ayrıca oluşturduğu metni otomatik olarak düzenleyebiliyor. Doğal konuşma biçimlerini anlayabilen model sayesinde kullanıcıların sesli komut verirken önceden belirlenmiş kalıpları kullanmasına gerek kalmıyor.

Model; kullanıcıların eklediği özel kelimeleri, farklı yazımları ve belirli alanlarda kullanılan terimleri de tanıyabiliyor.

Google hata oranlarını açıkladı

Google'ın paylaştığı verilere göre Gemini 3.5 Transcribe, canlı konuşmaların yazıya aktarılmasında ortalama yüzde 4,0 kelime hata oranına (WER) sahip.

Önceden kaydedilmiş seslerde ise hata oranının yüzde 2,6'ya kadar düştüğü belirtiliyor.

Model, özellikle arka plan gürültüsünün bulunduğu ortamlarda konuşmaları ayırt etmek üzere geliştirildi. Sipariş numaraları ve posta kodları gibi harf ve rakamların bir arada kullanıldığı ifadeleri de daha doğru şekilde metne aktarabiliyor.

Google Yapay Zekada Çıtayı Yükseltti Yanlış Söyleseniz Bile Anlıyor! (1)

85 dil desteği sunuyor

Gemini 3.5 Transcribe toplam 85 dili destekliyor. Model, farklı bölgesel aksanları ve lehçeleri de tanıyabiliyor.

Önceden kaydedilmiş ses dosyalarında üç kişiye kadar konuşmacıyı birbirinden ayırabilen model, konuşmalara zaman damgası da ekleyebiliyor.

Kullanıcılar ayrıca özel kelime listeleri oluşturabiliyor. Bu özellik; şirket isimleri, ürün adları ve belirli mesleklerde kullanılan teknik ifadelerin doğru şekilde yazılması için kullanılabiliyor.

Gemini modelleri arasında görev aktarımı yapabilecek

Gemini 3.5 Transcribe, gerektiğinde dosya analizi veya görsel oluşturma gibi kendi alanının dışındaki görevleri diğer Gemini modellerine aktarabiliyor.

Bu özelliğin, farklı yapay zeka yeteneklerinin aynı iş akışı içerisinde kullanılmasına olanak sağlaması hedefleniyor.

Geliştiricilere Gemini API üzerinden açıldı

Google, Gemini 3.5 Transcribe'ı geliştiriciler için Gemini API üzerinden genel önizlemeye açtı. Geliştiriciler modele Google AI Studio ve Google Antigravity üzerinden erişebiliyor.

Modelin sesli asistanlar, gerçek zamanlı altyazı sistemleri ve görüşme sonrasında konuşmaları analiz eden uygulamalarda kullanılması hedefleniyor.

Android ve macOS'ta kullanılabiliyor

Son kullanıcılar da Gemini 3.5 Transcribe'ı Android ve macOS üzerinde deneyebiliyor.

Google ayrıca desteğin Chrome'a da geleceğini açıkladı. Böylece kullanıcıların internet sitelerindeki metin alanlarına klavye yerine konuşarak yazı girebilmesi mümkün olacak.

Kaynak: Haber Merkezi