Gemini 3.8 Live, yüksek hacimli ve düşük gecikmeli sesli diyaloglar için ölçek ve maliyet verimliliğine odaklanırken; Extended Thinking, karmaşık çok adımlı görevlerde arka planda muhakeme yürütmek üzere tasarlandı. Extended Thinking’in temel vaadi, araçlardan sonuç beklerken veya plan yaparken konuşmayı kesmemesi:...
YayımlayanGPT-5.6 Terra ile düzenlendiGörseller GPT Image 2 ile oluşturuldu
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Google announce about Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking, including their real-time conversational, visual-under. Article summary: Google introduced two generally available, native audio-to-audio models for real-time voice agents: Gemini 3.8 Live for lower-cost, high-volume dialogue, and Gemini 3.8 Live Extended Thinking for more difficult, multi-st. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Google, gerçek zamanlı sesli ajanlar ve canlı diyaloglar için iki yerel sesten-sese model tanıttı: Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking. Standart model; ölçeklenebilir, düşük maliyetli ve akıcı konuşmalar için konumlandırılırken Extended Thinking, arka planda daha yoğun muhakeme gerektiren çok adımlı işler için geliştirildi. 10
2
Yeni serinin ayırt edici özelliği Gemini 3.8 Live Extended Thinking’de bulunuyor. Google’a göre model, sesli yanıtı akıtmaya devam ederken arka planda plan yapabiliyor ve eşzamansız araç çağrıları gerçekleştirebiliyor. Uzun süren bir araç işlemi tamamlanırken konuşmayı tümüyle durdurmak yerine, etkileşimi canlı tutacak doğal geçiş ifadeleri kullanabiliyor. 1
2
Bu, yalnızca hızlı yanıt verme iddiasından daha fazlası. Google’ın tarif ettiği mimaride konuşma üretimi, arka plan planlaması ve eşzamansız araç işlemleri paralel ilerleyebiliyor. Böylece bir sesli ajan, veri beklerken ya da çok adımlı bir süreci yürütürken kullanıcıya sonraki aşamayı açıklamayı sürdürebilir. Bunun pratikte iyi bir deneyime dönüşmesi ise araçların güvenilirliğine, diyalog tasarımına ve üretilen sözlerin gerçekten faydalı olup olmadığına bağlı olacak. 1
2
Google, standart Gemini 3.8 Live modelini muhakeme kaynaklı gecikmeler olmadan, düşük gecikmeli ve yüksek hacimli konuşma deneyimleri için öneriyor. Model; akıcı diyalogu görsel bağlamla birleştiriyor. Bu da ajanın, konuşmanın yanında kamera görüntüsü veya ekrandaki görsel içerik gibi bağlamlardan yararlanabilmesi anlamına geliyor. 10
45
Google temsilcilerinin açıklamasına göre Gemini 3.8 Live, 97 dili destekliyor ve görüşme sırasında diller arasında geçiş yapabiliyor. Ancak geliştiricilerin kendi kullanım senaryolarında dil kalitesini, bölgesel erişimi ve farklı aksanlardaki performansı ayrıca test etmesi gerekiyor. 16
Kısaca seçim şöyle özetlenebilir:
Lansman kapsamındaki bir karşılaştırmada Speech-to-Speech Quality Index sonuçları; Gemini 3.8 Live için 76,0, Gemini 3.8 Live Extended Thinking için 82,6 ve orta düzey eforla OpenAI GPT-Live-1 için 81,5 olarak bildirildi. 25
Bu karşılaştırmada Extended Thinking en yüksek puana sahip görünüyor. Yine de bu rakamlar, tüm üretim ortamları için bağımsız olarak doğrulanmış bir “en iyi model” hükmü sayılmaz. Gerçek bir sesli ajan kurulumunda kesintiye girme, farklı aksanlar ve diller, araç çağrılarının doğruluğu, yoğun yük altındaki gecikme, güvenlik, gözlemlenebilirlik ve başarılı sonuç başına toplam maliyet de değerlendirilmelidir. Bu puanlar tek bir sinyaldir; satın alma kararı değildir. 25
Google’ın resmi fiyatlandırma sayfası, iki yeni modeli Live API altında listeliyor. Ücretli standart katmanda ses girişi 1 milyon token başına 3,00 ABD doları veya dakikada 0,005 ABD doları; ses çıkışı ise 1 milyon token başına 12,00 ABD doları veya dakikada 0,018 ABD doları olarak belirtiliyor. Metin girdisi 1 milyon token başına 0,75 ABD doları, düşünme tokenları dâhil metin çıktısı ise 4,50 ABD doları. 37
Buradaki önemli ayrım şu: Gemini 3.8 Flash için başka yerlerde görülen token ücretleri, Live modellerinin fiyatı olarak doğrudan alınmamalı. Bütçe planlamasında güncel Live API fiyat tablosu ve model belgeleri esas alınmalı; ardından gerçek oturumlar test edilmelidir. Çünkü maliyet; giriş ve çıkış sesinin yanı sıra metin, görsel bağlam ve kullanılan araçların bileşimine göre değişir. 37
Google DeepMind, her iki modeli de genel kullanıma açık olarak listeliyor. Yayınlanan erişim tablosuna göre iki model de Gemini uygulaması, Google AI Studio, Gemini API ve Google Enterprise Agent Platform üzerinden bulunuyor. Extended Thinking için Google Search Live; standart 3.8 Live için ise Google Workspace erişimi de listeleniyor. 54
Bu tablo geliştiricilere, aynı yerel ses ailesi içinde iki farklı seçenek sunuyor: hızlı canlı diyalog için standart model ve daha yoğun muhakeme için Extended Thinking. Kurumlar açısından ise yalnızca modelin erişilebilir olması yeterli değil; kullanılacak ürün yüzeyi, veri kontrolleri, coğrafi bölge ve entegrasyon yönteminin de hedef kurulum için doğrulanması gerekiyor. 54
Google’ın rekabetçi tezi, daha bütünleşik bir gerçek zamanlı yığın sunmak: sesli etkileşim, görsel bağlam, arka plan muhakemesi ve eşzamansız araçlar aynı model ailesinde buluşuyor. Teoride bu yaklaşım; konuşmayı metne çevirme, metin modeli, araç orkestrasyonu ve metni sese dönüştürme gibi ayrı katmanları özel olarak birbirine bağlama ihtiyacını azaltabilir. Aynı zamanda işlem sürerken konuşmanın sürekliliğini korumaya yardımcı olabilir. 1
10
OpenAI’nin GPT-Live-1 modeli, özellikle çift yönlü eşzamanlı konuşma davranışını değerlendiren ekipler için önemli bir karşılaştırma noktası olmaya devam ediyor. Ancak tek bir kıyaslama, platform seçimini belirlemek için yeterli değil. Sağlam bir değerlendirme; temsilî görüşmelerle kesinti yönetimini, araç çağrısı doğruluğunu, çok dilli performansı, güvenlik kontrollerini, hata sonrası toparlanmayı, gecikmeyi ve tamamlanan iş başına maliyeti ölçmelidir. 25
Sağlanan lansman materyalleri, Gemini 3.8 Live veya Extended Thinking için kesin bir SynthID ses filigranı politikasını ortaya koymuyor. Google, SynthID’nin Gemini uygulaması ve web deneyiminde üretilen metinleri filigranlama ve tanımlama kapsamına genişletildiğini söylüyor. Ancak bu açıklama, Live modellerden gelen her ses akışının filigranlandığını doğrulamıyor; algılama yöntemini veya kullanım kapsamını da ayrıntılandırmıyor. 59
Bu nedenle üretim ortamında kullanımı planlayan ekiplerin mimariye bağlanmadan önce güncel model belgelerini, fiyatlandırmayı, platform erişimini ve geçerli hizmet koşullarını kontrol etmesi gerekiyor. 37
54
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Gemini 3.8 Live, yüksek hacimli ve düşük gecikmeli sesli diyaloglar için ölçek ve maliyet verimliliğine odaklanırken; Extended Thinking, karmaşık çok adımlı görevlerde arka planda muhakeme yürütmek üzere tasarlandı.
Gemini 3.8 Live, yüksek hacimli ve düşük gecikmeli sesli diyaloglar için ölçek ve maliyet verimliliğine odaklanırken; Extended Thinking, karmaşık çok adımlı görevlerde arka planda muhakeme yürütmek üzere tasarlandı. Extended Thinking’in temel vaadi, araçlardan sonuç beklerken veya plan yaparken konuşmayı kesmemesi: Model, sesli yanıt akışını sürdürürken arka planda çalışabiliyor.