xAI, konuşmadan metne dönüştürme modeli Grok Voice Transcribe 2.0’ı 18 Eylül 2026’da yayınladı. Şirket yeni modelin 1.0 sürümüne göre iki kat daha doğru çalıştığını söylerken toplu transkripsiyon fiyatını saat başına 0,10 dolarda sabit tuttu.
Grok Voice Transcribe 2.0, Grok Voice’un arkasındaki ses temel modeli üzerine kuruldu. xAI’ye göre Grok Voice bugün günde on binlerce müşteri destek çağrısını yürütüyor, milyonlarca saat video anlatımını yazıya çeviriyor ve Tesla araçlarındaki Grok asistanı dahil fiziksel ürünlerde sesli ajanları çalıştırıyor. Yeni model, farklı ortamlarda kaydedilen canlı, gürültülü ve çok dilli seslerle eğitildi ve ince ayarla geliştirildi.
Doğruluk ölçümleri
xAI’ye göre Grok Voice Transcribe 2.0, Artificial Analysis’ın halka açık listesindeki 32 akış modeli arasında doğrulukta birinci sırada. Şirket ayrıca üretim trafiğinden derlenen dört iç değerlendirme setinde kelime hata oranını ölçüyor: müşteri destek çağrılarından gelen telefon sesi, Grok ile yapılan konuşmalar, hesap kodu ve e-posta adresi gibi sözlü bilgiler ve kısa çok dilli sesli komutlar. Yeni model dört setin tamamında 1.0 sürümünü geçiyor ve 8 kHz İngilizce çağrılardan oluşan telefon setinde test edilen tüm modellerin önüne geçiyor. Şirketin yayınladığı grafiklerde Gemini 3.5 Transcribe, MAI-Transcribe-2, ElevenLabs Scribe v2, Deepgram Nova-3 ve Whisper Large v3 ile karşılaştırma yapılıyor.
xAI’ye göre en büyük doğruluk kazancı çok dillilikte. Model onlarca dili yazıya çeviriyor, dili otomatik algılıyor ve kayıt sırasındaki dil değişimlerini tek geçişte takip ediyor. Araç içi komutlar gibi kısa ifadelerde dil tahmini için çok az bağlam kalıyor; 19 dili kapsayan kısa komut setinde kelime hata oranı yüzde 20,6’dan yüzde 6,8’e iniyor.
API özellikleri ve fiyat
Speech-to-Text API üzerinden hem kayıtlı dosya ve URL’lerin toplu transkripsiyonu hem de gerçek zamanlı akış destekleniyor. Belgelenen özellikler arasında güven puanlı kelime düzeyi zaman damgaları, ek ücret alınmayan konuşmacı ayrımı, sekiz kanala kadar çok kanallı transkripsiyon, istek başına 100 terime kadar anahtar terim yönlendirme, sayı, tarih, para birimi, telefon numarası ve e-posta adreslerinin yazılı biçimde döndürülmesi, dolgu kelime temizliği ve sesli ajanlar için konuşma sırası sonu algılama yer alıyor. Mevcut entegrasyonlar doğruluk iyileşmesini kod değişikliği yapmadan alıyor.
Belgelerde 12 ses formatı, 500 MB dosya sınırı ve 8000 ile 48000 Hz arasındaki örnekleme oranları listeleniyor. Toplu isteklerde dosya veya indirilecek bir URL gönderiliyor; yanıt tam transkripti, algılanan dili BCP-47 kodu olarak, ses süresini saniye cinsinden ve başlangıç-bitiş zamanlı kelime bölümlerini döndürüyor. Akış tarafında istemciler ham sesi WebSocket uç noktasına gönderiyor ve ses işlendikçe JSON transkript olayları alıyor; istenirse yaklaşık 500 milisaniyede bir ara sonuç üretilebiliyor. Fiyat 1.0 sürümüyle aynı kaldı: toplu transkripsiyon saat başına 0,10 dolar, akış 0,20 dolar; konuşmacı ayrımı, zaman damgaları ve anahtar terimler ücrete dahil.
Loom ve geçiş süreci
Atlassian, ekran kaydı ürünü Loom’daki tüm videoları artık bu modelle yazıya çeviriyor. Şirket, modeli mevcut transkripsiyon çözümüne kıyasla daha doğru bulduğunu açıkladı. xAI, Grok Voice Transcribe 2.0’ın yakında Speech-to-Text API’de varsayılan model olacağını, 1.0 sürümünün ise önümüzdeki haftalarda kullanımdan kaldırılacağını duyurdu. Geçiş boyunca eski sürümde kalmak isteyenler isteklerinde grok-voice-transcribe-1.0 modelini sabitleyebiliyor.
Kaynak: Unite.AI

Deneyimini paylaş
Bir sorunun, farklı bir çözümün veya eklemek istediğin bir notun var mı?
Yorum yazmak için giriş yap veya aramıza katıl.
Giriş yap ↗︎Üye ol ↗︎