Gemini 3.8 Live gerçek zamanlı ses, 97 dil, görsel bağlam ve arka planda tool calling sunarken Extended Thinking karmaşık görevlerde çok adımlı reasoning yapabiliyor.
Sesli yapay zekâ kullanmak artık şaşırtıcı bir özellik değil. Telefonlarımızdaki asistanlarla konuşabiliyor, yapay zekâ uygulamalarına sesli sorular sorabiliyor ve birkaç saniye içerisinde yanıt alabiliyoruz.
Ancak gerçek zamanlı sesli yapay zekâ sistemlerinin önemli bir sorunu hâlâ vardı:
Kullanıcı karmaşık bir görev verdiğinde sistem ya yeterince düşünmeden hızlı cevap vermek zorunda kalıyor ya da işlem yaparken konuşmayı kesip kullanıcının beklemesine neden oluyordu.
Google, 15 Eylül 2026 tarihinde duyurduğu Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking modelleriyle bu davranışı değiştirmeye çalışıyor.
Yeni modeller yalnızca daha doğal konuşan bir yapay zekâ sunmuyor.
Gerçek zamanlı ses, görüntü ve video girdilerini anlayabiliyor, uygulamanızdaki araçları ve API’leri kullanabiliyor ve özellikle Extended Thinking sürümünde karmaşık bir görev üzerinde arka planda çalışırken kullanıcıyla konuşmayı sürdürebiliyor.
Örneğin kullanıcı:
“Gelecek ay İstanbul’dan Roma’ya uygun uçuşları kontrol et, otelleri karşılaştır ve bana üç günlük bir program hazırla.”
dediğinde sistem yalnızca tek bir cevap üretmek zorunda değil.
Uçuş arama aracını çalıştırabilir, otel sonuçlarını kontrol edebilir, farklı seçenekleri karşılaştırabilir ve bütün bunlar devam ederken kullanıcıya:
“Uçuş seçeneklerini kontrol ediyorum. Ardından otelleri karşılaştıracağım.”
gibi doğal ilerleme bilgileri verebilir.
Peki Gemini 3.8 Live nedir? Extended Thinking ne işe yarıyor? İki model arasındaki fark ne? Türkçe konuşabiliyor mu? API üzerinden nasıl kullanılıyor? Fiyatı ne kadar? Android uygulamalarında kullanılabilir mi?
Google’ın resmi Gemini API belgeleri ve 15 Eylül 2026 duyurusundaki bilgiler üzerinden ayrıntılı olarak inceleyelim.
Gemini 3.8 Live, Google’ın gerçek zamanlı ve düşük gecikmeli sesli yapay zekâ uygulamaları için geliştirdiği audio-to-audio Gemini modelidir.
Google modeli özellikle hızlı ve doğal karşılıklı konuşmanın önemli olduğu uygulamalar için konumlandırıyor.
Örneğin:
Gemini 3.8 Live’ın doğal kullanım alanları arasında.
Google, Gemini 3.8 Live’ı çoğu düşük gecikmeli voice agent senaryosu için temel seçenek olarak öneriyor.
Gemini 3.8 Live Extended Thinking, Gemini 3.8 Live’ın daha karmaşık görevlerde kullanılmak üzere geliştirilen yüksek reasoning sürümüdür.
Temel fark konuşmanın kendisinden çok modelin arka planda ne yaptığıyla ilgili.
Basit bir:
“Saat kaç?”
sorusu için uzun reasoning gerekmiyor.
Ancak:
“Bu üç sigorta teklifini teminatlarına göre karşılaştır, eksik noktalarını bul ve benim verdiğim kriterlere göre farklarını açıkla.”
gibi bir görev çok daha fazla analiz gerektiriyor.
Extended Thinking bu tür senaryolarda arka planda:
yürütebiliyor.
| Özellik | Gemini 3.8 Live | Gemini 3.8 Live Extended Thinking |
|---|---|---|
| Ana kullanım | Hızlı ve düşük gecikmeli gerçek zamanlı konuşma | Karmaşık ve çok adımlı sesli görevler |
| Reasoning yapısı | Interleaved reasoning | Arka planda genişletilmiş reasoning |
| Thinking seviyesi | Manuel olarak ayarlanamıyor | Low, Medium veya High |
| Function calling | Senkron ve asenkron destek | Yalnızca asenkron non-blocking |
| Araç çalışırken konuşma | Destekleniyor | Özellikle uzun işlemler için geliştirildi |
| Görsel giriş | Var | Var |
| Ses çıkışı | Native audio | Native audio |
| En uygun kullanım | Akıcı diyalog ve hızlı görevler | Planlama ve multi-tool workflow |
Google yeni model için “reason and speak simultaneously” yaklaşımını öne çıkarıyor.
Ancak bunu modelin bütün özel reasoning sürecini kullanıcıya kelimesi kelimesine anlattığı şeklinde yorumlamamak gerekiyor.
Extended Thinking arka planda reasoning veya tool çağrısı devam ederken kullanıcıya doğal ara bilgiler verebiliyor.
Örneğin:
gibi ifadeler kullanılabiliyor.
Bunun amacı kullanıcıyı birkaç saniyelik sessiz ve belirsiz bir bekleme ekranında bırakmamak.
Yeni modellerin geliştirici açısından en önemli özelliklerinden biri function calling.
Function calling, Gemini’nin yalnızca cevap vermek yerine geliştiricinin tanımladığı gerçek fonksiyonları ve servisleri kullanabilmesini sağlıyor.
Örneğin bir agent:
Extended Thinking modelinde bu çağrıların NON_BLOCKING yani asenkron olarak tanımlanması gerekiyor.
Model araç sonucunu beklerken sesli görüşmeyi tamamen durdurmak zorunda kalmıyor.
Bir e-ticaret uygulamasındaki yapay zekâ asistanını düşünelim.
Kullanıcı:
“Geçen hafta verdiğim sipariş hâlâ gelmedi. Nerede olduğunu kontrol eder misin?”
diyor.
Voice agent şu şekilde ilerleyebilir:
Böylece yapay zekâ yalnızca “müşteri destek chatbot’u” değil, gerçek işlemler yapabilen bir agent haline geliyor.
Extended Thinking kullanırken geliştiricilerin dikkat etmesi gereken önemli teknik farklılıklardan biri interaction_status.
Normal Live modelinde turnComplete: true geldiğinde konuşma turu tamamlanmış kabul edilebilir.
Extended Thinking’de ise durum farklı.
Model bir ara sesli mesaj verdikten sonra arka planda reasoning yapmaya veya tool sonucu beklemeye devam edebilir.
Bu nedenle istemcinin:
interaction_status: "IN_PROGRESS"
ve:
interaction_status: "IDLE"
durumlarını takip etmesi gerekiyor.
IN_PROGRESS, modelin görev üzerinde hâlâ çalıştığını gösteriyor.
Bu sırada model:
IDLE ise bütün reasoning ve tool işlemlerinin tamamlandığını ve modelin yeni kullanıcı girdisini beklediğini gösteriyor.
Bu ayrım özellikle mobil veya web arayüzündeki “çalışıyor” durumunu doğru göstermek açısından önemli.
Gemini 3.8 Live Extended Thinking’de geliştirici modelin reasoning seviyesini belirleyebiliyor.
Desteklenen seviyeler:
şeklinde.
MINIMAL seviyesi desteklenmiyor.
Basit görevlerde Low kullanılarak gecikme azaltılabilir.
Daha kapsamlı araştırma, teknik analiz veya multi-tool workflow gibi işlemlerde Medium veya High tercih edilebilir.
Standart Gemini 3.8 Live modelinde ise thinking_level ayarı desteklenmiyor.
Gemini 3.8 Live yalnızca ses alıp ses üreten klasik bir voice model değil.
Resmi model belgelerine göre giriş olarak:
kabul edebiliyor.
Çıkış tarafında ise metin ve native audio oluşturabiliyor.
Bir teknik destek uygulamasını düşünelim.
Kullanıcı telefonun kamerasını modemine yöneltiyor ve:
“Bu kırmızı ışık neden yanıyor?”
diye soruyor.
Gemini kameradan gelen görsel bağlamı ve kullanıcının konuşmasını birlikte değerlendirebilir.
Daha sonra:
Bu yapı teknik destek uygulamalarında çok daha doğal bir deneyim oluşturabilir.
Google, Gemini 3.8 Live’ın görsel girdileri near real-time yani gerçek zamana yakın şekilde işleyebildiğini belirtiyor.
Şirketin tanıtım örneklerinden birinde model görsel bağlamı kullanarak çalışanların onboarding sürecindeki sorularını anlık olarak cevaplıyor.
Başka bir örnekte model ekrandaki satranç tahtasını takip ederek kullanıcıyla sesli biçimde oynuyor.
Bu örnekler ses + görüntü + reasoning birleşiminin nerelere gidebileceğini gösteriyor.
Google’ın resmi açıklamasına göre Gemini 3.8 Live 97 dili destekliyor.
Daha da önemlisi model, konuşma sırasında dil değişikliğini otomatik olarak algılayabiliyor.
Örneğin kullanıcı:
“Bu kodda dependency injection kısmını explain eder misin?”
gibi Türkçe ve İngilizceyi karıştırarak konuştuğunda sistemin manuel olarak farklı bir dil moduna alınması gerekmiyor.
Evet.
Türkçe desteklenen Gemini Live dilleri arasında bulunuyor.
Bu da Türkçe konuşan kullanıcılar için:
gibi projelerin geliştirilebilmesini mümkün hale getiriyor.
Gemini 3.8 Live’ın resmi model sayfasına göre:
Extended Thinking modeli de aynı temel token limitlerine sahip.
Ancak ses, görüntü ve video girdilerinin de token tükettiğini unutmamak gerekiyor.
Özellikle uzun süren canlı konuşmalarda context penceresi büyüdükçe maliyet artabilir.
Live API kalıcı bir WebSocket oturumu üzerinden çalışıyor.
Konuşma uzadıkça önceki konuşma geçmişi context içerisinde tutuluyor.
Google’ın güncel Live API maliyet rehberinde dikkat çektiği noktalardan biri, eski context token’larının sonraki turlarda yeniden işlenebilmesi.
Bu nedenle uzun bir voice agent görüşmesinin dakikalık maliyetini yalnızca anlık ses süresine bakarak hesaplamak doğru olmayabilir.
Google uzun Live oturumlarının maliyetini kontrol etmek için contextWindowCompression özelliği sunuyor.
Belirlenen token eşiğine ulaşıldığında eski içerikler context penceresinden çıkarılabiliyor ve daha küçük bir kayan pencere tutulabiliyor.
Örneğin uygulama 25.000 token’a ulaştığında eski içerikleri temizleyip son 8.000 token’ı tutacak şekilde yapılandırılabilir.
Bu yaklaşım uzun müşteri hizmetleri görüşmelerinde önemli maliyet avantajı sağlayabilir.
Gemini 3.8 Live modellerinde proactive audio kalıcı olarak etkin.
Model kullanıcı konuşurken ortamı dinleyip ne zaman cevap vermesi gerektiğine karar verebiliyor.
Google’ın güncel dokümantasyonuna göre Gemini 3.8 Live ve Extended Thinking modellerinde proactive audio kapatılamıyor.
proactive_audio: false kullanılması hata oluşturuyor.
Evet.
Google, proactive audio etkinken API’nin dinlediği süre boyunca input token ücretlendirmesinin devam ettiğini belirtiyor.
Model yalnızca cevap ürettiğinde output token ücretlendiriliyor.
Dolayısıyla sürekli açık mikrofon kullanan uygulamalarda oturum yönetimi maliyet açısından önemli.
Evet.
Google’ın 15 Eylül 2026 tarihli Gemini API sürüm notlarına göre iki model de genel kullanıma açılmış durumda.
Model kodları:
gemini-3.8-live ve:
gemini-3.8-live-extended-thinking şeklinde.
Evet.
Google her iki modeli de Gemini API’nin yanında Google AI Studio üzerinden geliştiricilerin kullanımına sunuyor.
AI Studio özellikle gerçek bir uygulama geliştirmeden önce:
denemek için kullanılabilir.
Gemini Live API gerçek zamanlı ve iki yönlü iletişim için kalıcı WebSocket bağlantısı kullanıyor.
İstemci Gemini’ye sürekli olarak ses veya diğer medya girdilerini gönderebiliyor.
Model de aynı bağlantı üzerinden ses çıktısını parça parça geri gönderebiliyor.
Böylece klasik REST API’deki:
istek gönder → tamamlanmasını bekle → cevabı al
modelinden farklı, gerçek zamanlı bir etkileşim oluşturuluyor.
Google Gen AI SDK ile temel Live API bağlantısı şu şekilde kurulabilir:
import asyncio
from google import genai
from google.genai import types
client = genai.Client()
model = "gemini-3.8-live"
config = types.LiveConnectConfig(
response_modalities=["AUDIO"]
)
async def main():
async with client.aio.live.connect(
model=model,
config=config
) as session:
print("Gemini 3.8 Live bağlantısı kuruldu.")
if __name__ == "__main__":
asyncio.run(main()) Bu yalnızca temel bağlantı örneği.
Gerçek bir voice agent için ayrıca:
gerekiyor.
Extended Thinking’e geçmek için model kodu değiştirilir:
model = "gemini-3.8-live-extended-thinking" Daha sonra thinking seviyesi yapılandırılabilir:
config = types.LiveConnectConfig(
response_modalities=["AUDIO"],
thinking_config=types.ThinkingConfig(
thinking_level="low"
)
) Göreve göre:
seviyelerinden biri kullanılabilir.
Extended Thinking’de function declaration NON_BLOCKING olarak tanımlanmalıdır.
Örnek:
search_flights = types.FunctionDeclaration(
name="search_flights",
description="Belirtilen destinasyon için uçuş arar.",
behavior="NON_BLOCKING",
parameters={
"type": "OBJECT",
"properties": {
"destination": {
"type": "STRING"
}
},
"required": ["destination"]
}
) Bu şekilde model uçuş aracını arka planda çalıştırırken sesli görüşmeyi sürdürebilir.
Google’ın güncel Gemini Developer API fiyatlandırmasına göre Gemini 3.8 Live ve Extended Thinking modellerinin ücretli katman fiyatları şu şekilde:
| İşlem | Fiyat |
|---|---|
| Metin girişi | 1 milyon token başına 0,75 dolar |
| Ses girişi | 1 milyon token başına 3 dolar / yaklaşık 0,005 dolar dakika |
| Görüntü ve video girişi | 1 milyon token başına 1 dolar / yaklaşık 0,002 dolar dakika |
| Metin çıktısı | 1 milyon token başına 4,50 dolar |
| Ses çıktısı | 1 milyon token başına 12 dolar / yaklaşık 0,018 dolar dakika |
Thinking token’ları output fiyatına dahil ediliyor.
Bu nedenle Extended Thinking kullanan uygulamalarda maliyet yalnızca ses süresine göre değerlendirilmemeli.
Google’ın güncel fiyatlandırma tablosunda Live modelleri için ücretsiz geliştirici katmanı bulunuyor.
Ancak üretim uygulamalarında limitler, gizlilik koşulları ve kullanım hacmi açısından ücretli API planının şartlarını ayrıca incelemek gerekiyor.
Özellikle Google ücretsiz katmanda gönderilen verilerin ürün geliştirme amacıyla kullanılabileceğini, ücretli katmanda ise kullanılmadığını fiyatlandırma sayfasında açıkça belirtiyor.
Evet.
Gemini 3.8 Live ve Extended Thinking Google Search grounding özelliğini destekliyor.
Bu özellik voice agent’ın gerektiğinde güncel Google Search sonuçlarından yararlanabilmesini sağlıyor.
Örneğin kullanıcı:
“Bugün İstanbul’da hangi teknoloji etkinlikleri var?”
gibi güncel bilgi gerektiren bir soru sorduğunda uygulama Search grounding kullanabilir.
Google’ın mevcut fiyatlandırmasına göre ücretli katmanda Gemini 3.x modelleri arasında paylaşılan aylık 5.000 ücretsiz Search sorgusu bulunuyor.
Bu sınırdan sonra yapılan her 1.000 Google Search sorgusu için 14 dolar ücret uygulanıyor.
Bir kullanıcı isteğinin arka planda birden fazla arama sorgusu oluşturabileceğini hesaba katmak gerekiyor.
Live API güçlü olsa da normal Gemini API’deki bütün özellikler mevcut değil.
Resmi model sayfasına göre Gemini 3.8 Live’da:
Dolayısıyla mevcut bir Gemini uygulamasını Live API’ye geçirirken özellik eşitliği olduğunu varsaymamak gerekiyor.
Extended Thinking’de function calling destekleniyor ancak yalnızca asenkron yani NON_BLOCKING kullanım kabul ediliyor.
Synchronous BLOCKING tool tanımı kullanılırsa API hata döndürüyor.
Bu nedenle mevcut tool altyapısını Extended Thinking’e taşırken kod tarafında güncelleme gerekebilir.
Google artık eski:
gemini-3.1-flash-live-preview modelinden:
gemini-3.8-live modeline geçilmesini öneriyor.
Ancak yalnızca model string’ini değiştirmek yeterli olmayabilir.
Gemini 3.8 Live’a geçişte:
thinking_level kaldırılmalı,Gerçekçi AI sesleri yaygınlaştıkça içeriğin insan tarafından mı yoksa yapay zekâ tarafından mı oluşturulduğunu anlamak zorlaşıyor.
Google bu nedenle AI ürünlerinin oluşturduğu seslere SynthID filigranı eklediğini belirtiyor.
SynthID insan kulağının normalde fark etmeyeceği şekilde ses çıktısına yerleştiriliyor.
Amaç yapay zekâ tarafından üretilen seslerin daha sonra tespit edilebilmesini kolaylaştırmak.
Google’ın 15 Eylül duyurusunda paylaştığı sonuçlara göre Gemini 3.8 Live Extended Thinking bazı ses ve agent benchmark’larında güçlü sonuçlar elde etmiş durumda.
Google’ın açıkladığı değerler:
şeklinde.
Google duyuru sırasında Extended Thinking’in Artificial Analysis Speech-to-Speech Quality Index’te genel sıralamada ilk sırada bulunduğunu belirtiyor.
Standart Gemini 3.8 Live ise Speech Agent Arena’da kullanıcı tercihleri açısından ikinci sırada yer almış durumda.
Ancak benchmark sonuçları kontrollü testlerden geliyor.
Gerçek uygulamadaki sonuçlar:
gibi faktörlerden etkilenebilir.
Google, Gemini 3.8 Live’ın Search Live içerisinde de dağıtıma başladığını açıkladı.
Amaç kullanıcının karmaşık sorunlarda Google Search ile daha doğal sesli biçimde çalışabilmesi.
Örneğin kullanıcı bir teknik problem hakkında Search Live ile konuşurken model kullanıcıyı adım adım yönlendirebilir.
Google’ın duyurusuna göre Extended Thinking:
tarafında kullanıma sunuluyor.
Google AI Pro ve Ultra aboneleri Docs içerisinde Live deneyimine erişebilirken Gmail ve Keep tarafında Google AI abonelerine dağıtım yapılıyor.
Bir rapor üzerinde çalıştığınızı düşünün.
Belgeyi okuyup manuel olarak arama yapmak yerine:
“Bu rapordaki bütçe risklerini bul ve bana üç ana problem halinde anlat.”
diyebilirsiniz.
Gemini belge üzerinde çalışırken kullanıcıyla sesli görüşmeyi sürdürebilir.
Uzun belgeler üzerinde çalışan kullanıcılar açısından bu yaklaşım oldukça ilginç.
Benzer mantık Gmail ve Keep tarafında da uygulanıyor.
Kullanıcı örneğin:
“Geçen hafta Ahmet’in gönderdiği proje mailindeki teslim tarihini bul.”
veya:
“Keep’teki alışveriş listemde kahve var mı?”
gibi doğal sesli isteklerde bulunabilir.
Voice AI uygulaması geliştirmek yalnızca Gemini API’ye bağlanmak anlamına gelmiyor.
Gerçek uygulamada:
gerekiyor.
Google, Gemini Live API ekosisteminde:
gibi geliştirici platformlarıyla entegrasyonlara dikkat çekiyor.
Bu platformlar gerçek zamanlı medya streaming altyapısının önemli kısmını geliştirici adına yönetebiliyor.
Evet.
Android uygulamasında gerçek zamanlı sesli AI deneyimi oluşturmak teknik olarak mümkün.
Mobil uygulama:
yönetebilir.
Gemini Live API ise konuşma ve reasoning katmanını sağlayabilir.
Hayır.
Kalıcı API anahtarının doğrudan Android uygulamasının içerisine yazılması güvenli değil.
APK içerisindeki anahtar çeşitli yöntemlerle çıkarılabilir.
Üretim uygulamasında API kimlik bilgilerinin backend veya Google’ın desteklediği uygun geçici erişim mekanizmaları üzerinden yönetilmesi daha güvenli.
Burada özellikle Android geliştiricileri açısından oldukça ilginç bir kombinasyon ortaya çıkıyor.
Daha önce ele aldığım ADK for Kotlin 1.0, Android uygulamasının agent mimarisini yönetmek için kullanılabilir.
Gemini 3.8 Live ise kullanıcıyla gerçek zamanlı sesli iletişim katmanını sağlayabilir.
Örneğin:
Bu mimari klasik bir chatbot ekranından çok daha ileri bir kullanıcı deneyimi oluşturabilir.
Örneğin bir ev envanteri uygulamasında kullanıcı uygulamayı açıp:
“Matkabı nereye koymuştum?”
diye sorabilir.
Voice agent yerel veritabanındaki kayıtları arayarak cevabı sesli biçimde verebilir.
Daha sonra kullanıcı:
“Tamam, artık çalışma odasındaki alt dolapta.”
dediğinde agent uygun uygulama aracını çağırıp kaydı güncelleyebilir.
Bu durumda kullanıcı klasik form ekranlarında dolaşmadan doğal konuşmayla uygulama üzerinde gerçek işlem gerçekleştirmiş olur.
Bir şehir rehberi uygulamasında kullanıcı:
“Bugün çocuklarla gezebileceğimiz üç yer öner ve birbirine yakın olanları sırala.”
diyebilir.
Agent:
Buradaki temel fark, AI’ın uygulamanın üzerine eklenmiş ayrı bir sohbet ekranı olmak yerine doğrudan uygulamanın işlevleriyle bütünleşmesi.
Bugün birçok otomatik çağrı merkezi hâlâ:
“Sipariş işlemleri için 1’e, ödeme işlemleri için 2’ye basın.”
mantığıyla çalışıyor.
Gerçek zamanlı voice agent ise kullanıcının:
“Geçen hafta aldığım ürün hâlâ kargoya verilmedi. Nedenini öğrenmek istiyorum.”
cümlesini anlayabilir.
Arka planda:
kontrol edip sonucu kullanıcıya konuşarak aktarabilir.
Her durumda değil.
Rutin işlemlerde voice agent çok faydalı olabilir.
Ancak:
insan müdahalesi gerektirebilir.
Daha mantıklı mimari, agent’ın rutin işlemleri çözmesi ve gerektiğinde kullanıcıyı gerçek operatöre aktarması olabilir.
Hayır.
Her isteğin uzun reasoning’e ihtiyacı yok.
Örneğin:
“Salon ışığını kapat.”
komutunda Extended Thinking kullanmak gereksiz olabilir.
Standart Gemini 3.8 Live daha hızlı sonuç verebilir.
Extended Thinking ise:
daha anlamlı hale geliyor.
Geliştirici açısından iki model arasındaki temel karar aslında burada.
Gemini 3.8 Live:
Hızlı, düşük gecikmeli ve doğal konuşma.
Gemini 3.8 Live Extended Thinking:
Daha karmaşık görevleri çözmek için daha güçlü reasoning.
Dolayısıyla “hangisi daha iyi?” yerine:
“Benim uygulamamda hangi görev yapılıyor?”
sorusunu sormak gerekiyor.
Bana göre yeni modellerde en önemli gelişme ses kalitesinin biraz daha iyi olması değil.
Asıl değişiklik voice AI ile agent mimarisinin birleşmesi.
Eski sesli yapay zekâ yaklaşımı çoğunlukla:
Kullanıcı konuşur → model cevap verir → kullanıcı tekrar konuşur.
şeklindeydi.
Yeni yaklaşım ise giderek:
Kullanıcı konuşur → agent hedefi anlar → plan yapar → araçları çalıştırır → kullanıcıyla iletişimi sürdürür → gerçek görevi tamamlar.
haline geliyor.
Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking’in gösterdiği gelecek yönü oldukça açık.
Sesli yapay zekâ alanındaki rekabet yalnızca:
“Hangi model daha insan gibi konuşuyor?”
sorusuyla sınırlı kalmayacak.
Çok daha önemli soru şu olacak:
“Bu yapay zekâ konuşurken gerçekten hangi işi tamamlayabiliyor?”
Kullanıcı adına uçuş arayabiliyor mu?
Sipariş durumunu kontrol edebiliyor mu?
Kamerada görünen problemi anlayabiliyor mu?
Farklı API’lerden gelen bilgileri birleştirebiliyor mu?
Uzun süren bir işlem devam ederken kullanıcıyla doğal konuşmayı sürdürebiliyor mu?
Gemini 3.8 Live düşük gecikmeli sesli etkileşim tarafını güçlendirirken Extended Thinking bu deneyimin üzerine çok adımlı reasoning ve asenkron tool kullanımını ekliyor.
Geliştiriciler açısından önemli tarafı ise bu teknolojinin yalnızca Google’ın kendi Gemini uygulamasında kullanılmaması.
Gemini API ve Live API üzerinden kendi web, mobil veya kurumsal uygulamalarımızda da gerçek zamanlı sesli agent’lar geliştirebiliyoruz.
Özellikle ADK for Kotlin gibi agent framework’leriyle birlikte değerlendirildiğinde Android tarafında oldukça güçlü kullanım senaryoları ortaya çıkıyor.
Kısacası sesli yapay zekâ, yalnızca soruya cevap veren bir arayüz olmaktan çıkıp kullanıcıyla konuşurken arka planda gerçek görevler gerçekleştiren bir agent katmanına dönüşüyor.
Google, Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking modellerini 15 Eylül 2026 tarihinde genel kullanıma sundu.
Gerçek zamanlı, düşük gecikmeli sesli görüşmeler, multimodal girişler ve tool calling için geliştirilmiş Google Gemini modelidir.
Karmaşık ve çok adımlı gerçek zamanlı ses görevleri için arka planda daha güçlü reasoning ve asenkron function calling kullanan Gemini modelidir.
Evet. Türkçe, Gemini Live’ın desteklediği 97 dil arasında bulunuyor.
Evet. Model metin, görüntü, ses ve video girdilerini destekliyor.
Evet. Gemini API Live API altyapısı üzerinden kullanılabiliyor ve Google AI Studio’da test edilebiliyor.
gemini-3.8-live
gemini-3.8-live-extended-thinking
Model 131.072 token giriş ve 65.536 token çıkış limitine sahip.
Evet. Low, Medium ve High seviyeleri destekleniyor. Minimal desteklenmiyor.
Evet. Ancak function’ların asynchronous NON_BLOCKING olarak tanımlanması gerekiyor.
Ücretli API katmanında ses girişi yaklaşık 0,005 dolar/dakika, ses çıktısı yaklaşık 0,018 dolar/dakika seviyesinde. Gerçek maliyet token, context, tool ve medya kullanımına göre değişebilir.
Evet. Live API kullanılarak Android uygulamalarına gerçek zamanlı sesli AI özellikleri eklenebilir. Üretim ortamında API anahtarları güvenli şekilde yönetilmelidir.
Evet. Gemini Live gerçek zamanlı sesli kullanıcı etkileşimini sağlarken ADK for Kotlin uygulamadaki agent ve araç orkestrasyonu için kullanılabilecek tamamlayıcı bir mimari sunabilir.
Evet. Google Search grounding destekleniyor. Google Maps grounding ise desteklenmiyor.
Evet. Google, AI ürünleri tarafından oluşturulan seslere tespit edilebilir SynthID filigranı eklediğini belirtiyor.
Google Gemini Artık Eşyaların Yerini Hatırlıyor: Find Hub Remembered Nedir? “Pasaportumu nereye koymuştum?”, “Yedek anahtar…
Yeni bir Windows bilgisayar aldığınızda gerçekten kod yazmaya başlamanız ne kadar sürüyor? Visual Studio Code…
1901 yılında Çemişgezek’te doğan bir kız çocuğunun, yıllar sonra Amerika’ya ulaşacağını, hayatını kitaplaştıracağını ve Hollywood’da…
Despacito ne demek sorusu, 2017 yılından bu yana milyonları merak ettiren bir sorudur. Luis Fonsi'nin…
Uzun tunik, tesettür modası için vazgeçilmez bir parça olarak günümüzde birçok kadının gardırobunda yer almaktadır.…
OpenAI, yeni nesil yapay zekâ modeli GPT-6 Astra'yı 3 Eylül 2026 tarihinde duyurdu. Yeni model…