Gemini 3.8 Live Nedir? Extended Thinking ve Gemini API Özellikleri
Yapay Zeka

Gemini 3.8 Live Nedir? Extended Thinking ile Sesli Yapay Zekâda Yeni Dönem

Sesli yapay zekâ kullanmak artık şaşırtıcı bir özellik değil. Telefonlarımızdaki asistanlarla konuşabiliyor, yapay zekâ uygulamalarına sesli sorular sorabiliyor ve birkaç saniye içerisinde yanıt alabiliyoruz.

Ancak gerçek zamanlı sesli yapay zekâ sistemlerinin önemli bir sorunu hâlâ vardı:

Kullanıcı karmaşık bir görev verdiğinde sistem ya yeterince düşünmeden hızlı cevap vermek zorunda kalıyor ya da işlem yaparken konuşmayı kesip kullanıcının beklemesine neden oluyordu.

Google, 15 Eylül 2026 tarihinde duyurduğu Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking modelleriyle bu davranışı değiştirmeye çalışıyor.

Yeni modeller yalnızca daha doğal konuşan bir yapay zekâ sunmuyor.

Gerçek zamanlı ses, görüntü ve video girdilerini anlayabiliyor, uygulamanızdaki araçları ve API’leri kullanabiliyor ve özellikle Extended Thinking sürümünde karmaşık bir görev üzerinde arka planda çalışırken kullanıcıyla konuşmayı sürdürebiliyor.

Örneğin kullanıcı:

“Gelecek ay İstanbul’dan Roma’ya uygun uçuşları kontrol et, otelleri karşılaştır ve bana üç günlük bir program hazırla.”

dediğinde sistem yalnızca tek bir cevap üretmek zorunda değil.

Uçuş arama aracını çalıştırabilir, otel sonuçlarını kontrol edebilir, farklı seçenekleri karşılaştırabilir ve bütün bunlar devam ederken kullanıcıya:

“Uçuş seçeneklerini kontrol ediyorum. Ardından otelleri karşılaştıracağım.”

gibi doğal ilerleme bilgileri verebilir.

Peki Gemini 3.8 Live nedir? Extended Thinking ne işe yarıyor? İki model arasındaki fark ne? Türkçe konuşabiliyor mu? API üzerinden nasıl kullanılıyor? Fiyatı ne kadar? Android uygulamalarında kullanılabilir mi?

Google’ın resmi Gemini API belgeleri ve 15 Eylül 2026 duyurusundaki bilgiler üzerinden ayrıntılı olarak inceleyelim.

Gemini 3.8 Live Nedir?

Gemini 3.8 Live, Google’ın gerçek zamanlı ve düşük gecikmeli sesli yapay zekâ uygulamaları için geliştirdiği audio-to-audio Gemini modelidir.

Google modeli özellikle hızlı ve doğal karşılıklı konuşmanın önemli olduğu uygulamalar için konumlandırıyor.

Örneğin:

  • Sesli yapay zekâ asistanları,
  • müşteri hizmetleri sistemleri,
  • dil öğrenme uygulamaları,
  • teknik destek asistanları,
  • ses kontrollü mobil uygulamalar,
  • canlı eğitim araçları,
  • akıllı cihaz kontrol sistemleri,
  • ürün ve satış danışmanları

Gemini 3.8 Live’ın doğal kullanım alanları arasında.

Google, Gemini 3.8 Live’ı çoğu düşük gecikmeli voice agent senaryosu için temel seçenek olarak öneriyor.

Gemini 3.8 Live Extended Thinking Nedir?

Gemini 3.8 Live Extended Thinking, Gemini 3.8 Live’ın daha karmaşık görevlerde kullanılmak üzere geliştirilen yüksek reasoning sürümüdür.

Temel fark konuşmanın kendisinden çok modelin arka planda ne yaptığıyla ilgili.

Basit bir:

“Saat kaç?”

sorusu için uzun reasoning gerekmiyor.

Ancak:

“Bu üç sigorta teklifini teminatlarına göre karşılaştır, eksik noktalarını bul ve benim verdiğim kriterlere göre farklarını açıkla.”

gibi bir görev çok daha fazla analiz gerektiriyor.

Extended Thinking bu tür senaryolarda arka planda:

  • çok adımlı planlama,
  • reasoning,
  • birden fazla tool çağrısı,
  • farklı sonuçların karşılaştırılması,
  • uzun süren harici işlemler

yürütebiliyor.

Gemini 3.8 Live ile Extended Thinking Arasındaki Fark Ne?

ÖzellikGemini 3.8 LiveGemini 3.8 Live Extended Thinking
Ana kullanımHızlı ve düşük gecikmeli gerçek zamanlı konuşmaKarmaşık ve çok adımlı sesli görevler
Reasoning yapısıInterleaved reasoningArka planda genişletilmiş reasoning
Thinking seviyesiManuel olarak ayarlanamıyorLow, Medium veya High
Function callingSenkron ve asenkron destekYalnızca asenkron non-blocking
Araç çalışırken konuşmaDestekleniyorÖzellikle uzun işlemler için geliştirildi
Görsel girişVarVar
Ses çıkışıNative audioNative audio
En uygun kullanımAkıcı diyalog ve hızlı görevlerPlanlama ve multi-tool workflow

Extended Thinking Gerçekten Düşünürken Konuşuyor mu?

Google yeni model için “reason and speak simultaneously” yaklaşımını öne çıkarıyor.

Ancak bunu modelin bütün özel reasoning sürecini kullanıcıya kelimesi kelimesine anlattığı şeklinde yorumlamamak gerekiyor.

Extended Thinking arka planda reasoning veya tool çağrısı devam ederken kullanıcıya doğal ara bilgiler verebiliyor.

Örneğin:

  • “Bir saniye, uygun seçenekleri kontrol ediyorum.”
  • “Uçuşları buldum, şimdi otel fiyatlarını karşılaştırıyorum.”
  • “İki farklı seçeneğin avantajlarını kontrol ediyorum.”

gibi ifadeler kullanılabiliyor.

Bunun amacı kullanıcıyı birkaç saniyelik sessiz ve belirsiz bir bekleme ekranında bırakmamak.

Asenkron Function Calling Nedir?

Yeni modellerin geliştirici açısından en önemli özelliklerinden biri function calling.

Function calling, Gemini’nin yalnızca cevap vermek yerine geliştiricinin tanımladığı gerçek fonksiyonları ve servisleri kullanabilmesini sağlıyor.

Örneğin bir agent:

  • Sipariş API’sini sorgulayabilir,
  • CRM sisteminden müşteri bilgisi çekebilir,
  • uçuş araması yapabilir,
  • takvim kaydı oluşturabilir,
  • ürün stok bilgisini kontrol edebilir,
  • IoT cihazını yönetebilir.

Extended Thinking modelinde bu çağrıların NON_BLOCKING yani asenkron olarak tanımlanması gerekiyor.

Model araç sonucunu beklerken sesli görüşmeyi tamamen durdurmak zorunda kalmıyor.

Voice Agent Gerçek Bir İşi Nasıl Tamamlayabilir?

Bir e-ticaret uygulamasındaki yapay zekâ asistanını düşünelim.

Kullanıcı:

“Geçen hafta verdiğim sipariş hâlâ gelmedi. Nerede olduğunu kontrol eder misin?”

diyor.

Voice agent şu şekilde ilerleyebilir:

  1. Kullanıcının isteğini anlayabilir.
  2. Gerekliyse sipariş numarasını sorabilir.
  3. Sipariş sistemini sorgulayabilir.
  4. Kargo firmasının API’sini çağırabilir.
  5. İşlem devam ederken kullanıcıya bilgi verebilir.
  6. Sonuç geldiğinde mevcut durumu açıklayabilir.
  7. Gerekirse yeni bir işlem başlatabilir.

Böylece yapay zekâ yalnızca “müşteri destek chatbot’u” değil, gerçek işlemler yapabilen bir agent haline geliyor.

interaction_status Nedir?

Extended Thinking kullanırken geliştiricilerin dikkat etmesi gereken önemli teknik farklılıklardan biri interaction_status.

Normal Live modelinde turnComplete: true geldiğinde konuşma turu tamamlanmış kabul edilebilir.

Extended Thinking’de ise durum farklı.

Model bir ara sesli mesaj verdikten sonra arka planda reasoning yapmaya veya tool sonucu beklemeye devam edebilir.

Bu nedenle istemcinin:

interaction_status: "IN_PROGRESS"

ve:

interaction_status: "IDLE"

durumlarını takip etmesi gerekiyor.

IN_PROGRESS ve IDLE Ne Anlama Geliyor?

IN_PROGRESS, modelin görev üzerinde hâlâ çalıştığını gösteriyor.

Bu sırada model:

  • Reasoning yapıyor olabilir,
  • harici bir tool çalıştırıyor olabilir,
  • function response bekliyor olabilir,
  • yeni bir sesli çıktı hazırlıyor olabilir.

IDLE ise bütün reasoning ve tool işlemlerinin tamamlandığını ve modelin yeni kullanıcı girdisini beklediğini gösteriyor.

Bu ayrım özellikle mobil veya web arayüzündeki “çalışıyor” durumunu doğru göstermek açısından önemli.

Extended Thinking Seviyesi Ayarlanabiliyor

Gemini 3.8 Live Extended Thinking’de geliştirici modelin reasoning seviyesini belirleyebiliyor.

Desteklenen seviyeler:

  • LOW
  • MEDIUM
  • HIGH

şeklinde.

MINIMAL seviyesi desteklenmiyor.

Basit görevlerde Low kullanılarak gecikme azaltılabilir.

Daha kapsamlı araştırma, teknik analiz veya multi-tool workflow gibi işlemlerde Medium veya High tercih edilebilir.

Standart Gemini 3.8 Live modelinde ise thinking_level ayarı desteklenmiyor.

Gemini 3.8 Live Görsel Bağlamı da Kullanabiliyor

Gemini 3.8 Live yalnızca ses alıp ses üreten klasik bir voice model değil.

Resmi model belgelerine göre giriş olarak:

  • Metin,
  • görüntü,
  • ses,
  • video

kabul edebiliyor.

Çıkış tarafında ise metin ve native audio oluşturabiliyor.

Ses ile Kamerayı Birleştirmek Neden Önemli?

Bir teknik destek uygulamasını düşünelim.

Kullanıcı telefonun kamerasını modemine yöneltiyor ve:

“Bu kırmızı ışık neden yanıyor?”

diye soruyor.

Gemini kameradan gelen görsel bağlamı ve kullanıcının konuşmasını birlikte değerlendirebilir.

Daha sonra:

  • Görüntüdeki cihazı tanıyabilir,
  • ışık durumunu yorumlayabilir,
  • kullanıcıya kontrol etmesi gereken adımları anlatabilir,
  • gerekirse servis sağlayıcının API’sini çalıştırabilir.

Bu yapı teknik destek uygulamalarında çok daha doğal bir deneyim oluşturabilir.

Gemini 3.8 Live Görüntüyü Ne Kadar Hızlı İşliyor?

Google, Gemini 3.8 Live’ın görsel girdileri near real-time yani gerçek zamana yakın şekilde işleyebildiğini belirtiyor.

Şirketin tanıtım örneklerinden birinde model görsel bağlamı kullanarak çalışanların onboarding sürecindeki sorularını anlık olarak cevaplıyor.

Başka bir örnekte model ekrandaki satranç tahtasını takip ederek kullanıcıyla sesli biçimde oynuyor.

Bu örnekler ses + görüntü + reasoning birleşiminin nerelere gidebileceğini gösteriyor.

Gemini 3.8 Live Kaç Dil Destekliyor?

Google’ın resmi açıklamasına göre Gemini 3.8 Live 97 dili destekliyor.

Daha da önemlisi model, konuşma sırasında dil değişikliğini otomatik olarak algılayabiliyor.

Örneğin kullanıcı:

“Bu kodda dependency injection kısmını explain eder misin?”

gibi Türkçe ve İngilizceyi karıştırarak konuştuğunda sistemin manuel olarak farklı bir dil moduna alınması gerekmiyor.

Gemini 3.8 Live Türkçe Destekliyor mu?

Evet.

Türkçe desteklenen Gemini Live dilleri arasında bulunuyor.

Bu da Türkçe konuşan kullanıcılar için:

  • sesli müşteri hizmetleri,
  • mobil AI asistanları,
  • eğitim uygulamaları,
  • sesli ürün arama,
  • teknik destek uygulamaları

gibi projelerin geliştirilebilmesini mümkün hale getiriyor.

Gemini 3.8 Live Token Limiti Ne Kadar?

Gemini 3.8 Live’ın resmi model sayfasına göre:

  • Input token limiti: 131.072
  • Output token limiti: 65.536

Extended Thinking modeli de aynı temel token limitlerine sahip.

Ancak ses, görüntü ve video girdilerinin de token tükettiğini unutmamak gerekiyor.

Özellikle uzun süren canlı konuşmalarda context penceresi büyüdükçe maliyet artabilir.

Uzun Live Oturumlarında Maliyet Neden Artabilir?

Live API kalıcı bir WebSocket oturumu üzerinden çalışıyor.

Konuşma uzadıkça önceki konuşma geçmişi context içerisinde tutuluyor.

Google’ın güncel Live API maliyet rehberinde dikkat çektiği noktalardan biri, eski context token’larının sonraki turlarda yeniden işlenebilmesi.

Bu nedenle uzun bir voice agent görüşmesinin dakikalık maliyetini yalnızca anlık ses süresine bakarak hesaplamak doğru olmayabilir.

Context Window Compression Nedir?

Google uzun Live oturumlarının maliyetini kontrol etmek için contextWindowCompression özelliği sunuyor.

Belirlenen token eşiğine ulaşıldığında eski içerikler context penceresinden çıkarılabiliyor ve daha küçük bir kayan pencere tutulabiliyor.

Örneğin uygulama 25.000 token’a ulaştığında eski içerikleri temizleyip son 8.000 token’ı tutacak şekilde yapılandırılabilir.

Bu yaklaşım uzun müşteri hizmetleri görüşmelerinde önemli maliyet avantajı sağlayabilir.

Proactive Audio Nedir?

Gemini 3.8 Live modellerinde proactive audio kalıcı olarak etkin.

Model kullanıcı konuşurken ortamı dinleyip ne zaman cevap vermesi gerektiğine karar verebiliyor.

Google’ın güncel dokümantasyonuna göre Gemini 3.8 Live ve Extended Thinking modellerinde proactive audio kapatılamıyor.

proactive_audio: false kullanılması hata oluşturuyor.

Proactive Audio Maliyeti Etkiliyor mu?

Evet.

Google, proactive audio etkinken API’nin dinlediği süre boyunca input token ücretlendirmesinin devam ettiğini belirtiyor.

Model yalnızca cevap ürettiğinde output token ücretlendiriliyor.

Dolayısıyla sürekli açık mikrofon kullanan uygulamalarda oturum yönetimi maliyet açısından önemli.

Gemini 3.8 Live API’de Kullanılabiliyor mu?

Evet.

Google’ın 15 Eylül 2026 tarihli Gemini API sürüm notlarına göre iki model de genel kullanıma açılmış durumda.

Model kodları:

gemini-3.8-live

ve:

gemini-3.8-live-extended-thinking

şeklinde.

Google AI Studio’da Denenebilir mi?

Evet.

Google her iki modeli de Gemini API’nin yanında Google AI Studio üzerinden geliştiricilerin kullanımına sunuyor.

AI Studio özellikle gerçek bir uygulama geliştirmeden önce:

  • Ses davranışını,
  • prompt yapısını,
  • farklı voice seçeneklerini,
  • model latency’sini,
  • tool davranışlarını

denemek için kullanılabilir.

Live API Nasıl Çalışıyor?

Gemini Live API gerçek zamanlı ve iki yönlü iletişim için kalıcı WebSocket bağlantısı kullanıyor.

İstemci Gemini’ye sürekli olarak ses veya diğer medya girdilerini gönderebiliyor.

Model de aynı bağlantı üzerinden ses çıktısını parça parça geri gönderebiliyor.

Böylece klasik REST API’deki:

istek gönder → tamamlanmasını bekle → cevabı al

modelinden farklı, gerçek zamanlı bir etkileşim oluşturuluyor.

Python ile Gemini 3.8 Live Bağlantısı

Google Gen AI SDK ile temel Live API bağlantısı şu şekilde kurulabilir:

import asyncio
from google import genai
from google.genai import types

client = genai.Client()

model = "gemini-3.8-live"

config = types.LiveConnectConfig(
    response_modalities=["AUDIO"]
)

async def main():
    async with client.aio.live.connect(
        model=model,
        config=config
    ) as session:
        print("Gemini 3.8 Live bağlantısı kuruldu.")

if __name__ == "__main__":
    asyncio.run(main())

Bu yalnızca temel bağlantı örneği.

Gerçek bir voice agent için ayrıca:

  • Mikrofon verisinin okunması,
  • PCM audio stream gönderilmesi,
  • model sesinin oynatılması,
  • tool çağrılarının yönetilmesi,
  • bağlantı kopmalarının ele alınması

gerekiyor.

Extended Thinking Nasıl Kullanılır?

Extended Thinking’e geçmek için model kodu değiştirilir:

model = "gemini-3.8-live-extended-thinking"

Daha sonra thinking seviyesi yapılandırılabilir:

config = types.LiveConnectConfig(
    response_modalities=["AUDIO"],
    thinking_config=types.ThinkingConfig(
        thinking_level="low"
    )
)

Göreve göre:

  • low,
  • medium,
  • high

seviyelerinden biri kullanılabilir.

Extended Thinking Tool Nasıl Tanımlanır?

Extended Thinking’de function declaration NON_BLOCKING olarak tanımlanmalıdır.

Örnek:

search_flights = types.FunctionDeclaration(
    name="search_flights",
    description="Belirtilen destinasyon için uçuş arar.",
    behavior="NON_BLOCKING",
    parameters={
        "type": "OBJECT",
        "properties": {
            "destination": {
                "type": "STRING"
            }
        },
        "required": ["destination"]
    }
)

Bu şekilde model uçuş aracını arka planda çalıştırırken sesli görüşmeyi sürdürebilir.

Gemini 3.8 Live Fiyatı Ne Kadar?

Google’ın güncel Gemini Developer API fiyatlandırmasına göre Gemini 3.8 Live ve Extended Thinking modellerinin ücretli katman fiyatları şu şekilde:

İşlemFiyat
Metin girişi1 milyon token başına 0,75 dolar
Ses girişi1 milyon token başına 3 dolar / yaklaşık 0,005 dolar dakika
Görüntü ve video girişi1 milyon token başına 1 dolar / yaklaşık 0,002 dolar dakika
Metin çıktısı1 milyon token başına 4,50 dolar
Ses çıktısı1 milyon token başına 12 dolar / yaklaşık 0,018 dolar dakika

Thinking token’ları output fiyatına dahil ediliyor.

Bu nedenle Extended Thinking kullanan uygulamalarda maliyet yalnızca ses süresine göre değerlendirilmemeli.

Gemini Live Ücretsiz Kullanılabiliyor mu?

Google’ın güncel fiyatlandırma tablosunda Live modelleri için ücretsiz geliştirici katmanı bulunuyor.

Ancak üretim uygulamalarında limitler, gizlilik koşulları ve kullanım hacmi açısından ücretli API planının şartlarını ayrıca incelemek gerekiyor.

Özellikle Google ücretsiz katmanda gönderilen verilerin ürün geliştirme amacıyla kullanılabileceğini, ücretli katmanda ise kullanılmadığını fiyatlandırma sayfasında açıkça belirtiyor.

Google Search Grounding Destekleniyor mu?

Evet.

Gemini 3.8 Live ve Extended Thinking Google Search grounding özelliğini destekliyor.

Bu özellik voice agent’ın gerektiğinde güncel Google Search sonuçlarından yararlanabilmesini sağlıyor.

Örneğin kullanıcı:

“Bugün İstanbul’da hangi teknoloji etkinlikleri var?”

gibi güncel bilgi gerektiren bir soru sorduğunda uygulama Search grounding kullanabilir.

Google Search Grounding Ücretli mi?

Google’ın mevcut fiyatlandırmasına göre ücretli katmanda Gemini 3.x modelleri arasında paylaşılan aylık 5.000 ücretsiz Search sorgusu bulunuyor.

Bu sınırdan sonra yapılan her 1.000 Google Search sorgusu için 14 dolar ücret uygulanıyor.

Bir kullanıcı isteğinin arka planda birden fazla arama sorgusu oluşturabileceğini hesaba katmak gerekiyor.

Gemini 3.8 Live Neleri Desteklemiyor?

Live API güçlü olsa da normal Gemini API’deki bütün özellikler mevcut değil.

Resmi model sayfasına göre Gemini 3.8 Live’da:

  • Code Execution yok,
  • File Search yok,
  • Google Maps Grounding yok,
  • Image Generation yok,
  • Structured Output yok,
  • URL Context yok,
  • Context Caching yok.

Dolayısıyla mevcut bir Gemini uygulamasını Live API’ye geçirirken özellik eşitliği olduğunu varsaymamak gerekiyor.

Gemini 3.8 Live Extended Thinking’in Ek Sınırı Ne?

Extended Thinking’de function calling destekleniyor ancak yalnızca asenkron yani NON_BLOCKING kullanım kabul ediliyor.

Synchronous BLOCKING tool tanımı kullanılırsa API hata döndürüyor.

Bu nedenle mevcut tool altyapısını Extended Thinking’e taşırken kod tarafında güncelleme gerekebilir.

Gemini 3.1 Flash Live’dan Nasıl Geçilir?

Google artık eski:

gemini-3.1-flash-live-preview

modelinden:

gemini-3.8-live

modeline geçilmesini öneriyor.

Ancak yalnızca model string’ini değiştirmek yeterli olmayabilir.

Gemini 3.8 Live’a geçişte:

  • thinking_level kaldırılmalı,
  • function calling davranışı kontrol edilmeli,
  • proactive audio yapılandırması gözden geçirilmeli,
  • video frame gönderimi maliyet açısından kontrol edilmeli.

SynthID ile Yapay Zekâ Sesi İşaretleniyor

Gerçekçi AI sesleri yaygınlaştıkça içeriğin insan tarafından mı yoksa yapay zekâ tarafından mı oluşturulduğunu anlamak zorlaşıyor.

Google bu nedenle AI ürünlerinin oluşturduğu seslere SynthID filigranı eklediğini belirtiyor.

SynthID insan kulağının normalde fark etmeyeceği şekilde ses çıktısına yerleştiriliyor.

Amaç yapay zekâ tarafından üretilen seslerin daha sonra tespit edilebilmesini kolaylaştırmak.

Gemini 3.8 Live Benchmark Sonuçları Nasıl?

Google’ın 15 Eylül duyurusunda paylaştığı sonuçlara göre Gemini 3.8 Live Extended Thinking bazı ses ve agent benchmark’larında güçlü sonuçlar elde etmiş durumda.

Google’ın açıkladığı değerler:

  • Artificial Analysis Speech-to-Speech Quality Index: 82,6
  • τ-Voice: %68,6
  • Sierra τ-Voice Banking: %35,1
  • Big Bench Audio: %97,7

şeklinde.

Google duyuru sırasında Extended Thinking’in Artificial Analysis Speech-to-Speech Quality Index’te genel sıralamada ilk sırada bulunduğunu belirtiyor.

Standart Gemini 3.8 Live ise Speech Agent Arena’da kullanıcı tercihleri açısından ikinci sırada yer almış durumda.

Ancak benchmark sonuçları kontrollü testlerden geliyor.

Gerçek uygulamadaki sonuçlar:

  • Mikrofon kalitesi,
  • ortam gürültüsü,
  • kullanılan dil,
  • prompt yapısı,
  • tool performansı,
  • ağ gecikmesi

gibi faktörlerden etkilenebilir.

Search Live’da Gemini 3.8 Live Kullanılıyor

Google, Gemini 3.8 Live’ın Search Live içerisinde de dağıtıma başladığını açıkladı.

Amaç kullanıcının karmaşık sorunlarda Google Search ile daha doğal sesli biçimde çalışabilmesi.

Örneğin kullanıcı bir teknik problem hakkında Search Live ile konuşurken model kullanıcıyı adım adım yönlendirebilir.

Gemini Live Extended Thinking Nerelerde Kullanılıyor?

Google’ın duyurusuna göre Extended Thinking:

  • Gemini API,
  • Google AI Studio,
  • Gemini Live,
  • Google Workspace

tarafında kullanıma sunuluyor.

Google AI Pro ve Ultra aboneleri Docs içerisinde Live deneyimine erişebilirken Gmail ve Keep tarafında Google AI abonelerine dağıtım yapılıyor.

Docs Live Ne İşe Yarayabilir?

Bir rapor üzerinde çalıştığınızı düşünün.

Belgeyi okuyup manuel olarak arama yapmak yerine:

“Bu rapordaki bütçe risklerini bul ve bana üç ana problem halinde anlat.”

diyebilirsiniz.

Gemini belge üzerinde çalışırken kullanıcıyla sesli görüşmeyi sürdürebilir.

Uzun belgeler üzerinde çalışan kullanıcılar açısından bu yaklaşım oldukça ilginç.

Gmail Live ve Keep Live

Benzer mantık Gmail ve Keep tarafında da uygulanıyor.

Kullanıcı örneğin:

“Geçen hafta Ahmet’in gönderdiği proje mailindeki teslim tarihini bul.”

veya:

“Keep’teki alışveriş listemde kahve var mı?”

gibi doğal sesli isteklerde bulunabilir.

LiveKit, LangChain ve Vercel Entegrasyonları Neden Önemli?

Voice AI uygulaması geliştirmek yalnızca Gemini API’ye bağlanmak anlamına gelmiyor.

Gerçek uygulamada:

  • mikrofondan sürekli veri alınması,
  • ses stream’inin yönetilmesi,
  • WebSocket bağlantısının korunması,
  • ses çıktısının düşük gecikmeyle oynatılması,
  • bağlantı kesintilerinin ele alınması

gerekiyor.

Google, Gemini Live API ekosisteminde:

  • Agora,
  • Fishjam,
  • LangChain,
  • LiveKit,
  • Pipecat,
  • Vercel,
  • Vision Agents

gibi geliştirici platformlarıyla entegrasyonlara dikkat çekiyor.

Bu platformlar gerçek zamanlı medya streaming altyapısının önemli kısmını geliştirici adına yönetebiliyor.

Android Uygulamasına Gemini 3.8 Live Eklenebilir mi?

Evet.

Android uygulamasında gerçek zamanlı sesli AI deneyimi oluşturmak teknik olarak mümkün.

Mobil uygulama:

  • Mikrofon girişini,
  • kamera görüntüsünü,
  • kullanıcı arayüzünü,
  • ses oynatımını

yönetebilir.

Gemini Live API ise konuşma ve reasoning katmanını sağlayabilir.

API Anahtarı Android APK İçine Konmalı mı?

Hayır.

Kalıcı API anahtarının doğrudan Android uygulamasının içerisine yazılması güvenli değil.

APK içerisindeki anahtar çeşitli yöntemlerle çıkarılabilir.

Üretim uygulamasında API kimlik bilgilerinin backend veya Google’ın desteklediği uygun geçici erişim mekanizmaları üzerinden yönetilmesi daha güvenli.

ADK for Kotlin ile Gemini 3.8 Live Birlikte Kullanılabilir mi?

Burada özellikle Android geliştiricileri açısından oldukça ilginç bir kombinasyon ortaya çıkıyor.

Daha önce ele aldığım ADK for Kotlin 1.0, Android uygulamasının agent mimarisini yönetmek için kullanılabilir.

Gemini 3.8 Live ise kullanıcıyla gerçek zamanlı sesli iletişim katmanını sağlayabilir.

Örneğin:

  • Gemini kullanıcıyla konuşabilir,
  • ADK agent hangi işlemin yapılacağını belirleyebilir,
  • Room oturum durumunu saklayabilir,
  • AppSearch yerel veriyi arayabilir,
  • uygulama araçları gerçek işlemleri gerçekleştirebilir,
  • gerekirse buluttaki Gemini modeli kullanılabilir.

Bu mimari klasik bir chatbot ekranından çok daha ileri bir kullanıcı deneyimi oluşturabilir.

Dolap Hafızası Gibi Bir Uygulamada Nasıl Kullanılabilir?

Örneğin bir ev envanteri uygulamasında kullanıcı uygulamayı açıp:

“Matkabı nereye koymuştum?”

diye sorabilir.

Voice agent yerel veritabanındaki kayıtları arayarak cevabı sesli biçimde verebilir.

Daha sonra kullanıcı:

“Tamam, artık çalışma odasındaki alt dolapta.”

dediğinde agent uygun uygulama aracını çağırıp kaydı güncelleyebilir.

Bu durumda kullanıcı klasik form ekranlarında dolaşmadan doğal konuşmayla uygulama üzerinde gerçek işlem gerçekleştirmiş olur.

Şehir Rehberi Uygulamasında Nasıl Kullanılabilir?

Bir şehir rehberi uygulamasında kullanıcı:

“Bugün çocuklarla gezebileceğimiz üç yer öner ve birbirine yakın olanları sırala.”

diyebilir.

Agent:

  • uygulamadaki mekan verisini sorgulayabilir,
  • kullanıcının kriterlerini anlayabilir,
  • uygun mekanları karşılaştırabilir,
  • sonucu sesli anlatabilir.

Buradaki temel fark, AI’ın uygulamanın üzerine eklenmiş ayrı bir sohbet ekranı olmak yerine doğrudan uygulamanın işlevleriyle bütünleşmesi.

Müşteri Hizmetleri Gemini 3.8 Live ile Nasıl Değişebilir?

Bugün birçok otomatik çağrı merkezi hâlâ:

“Sipariş işlemleri için 1’e, ödeme işlemleri için 2’ye basın.”

mantığıyla çalışıyor.

Gerçek zamanlı voice agent ise kullanıcının:

“Geçen hafta aldığım ürün hâlâ kargoya verilmedi. Nedenini öğrenmek istiyorum.”

cümlesini anlayabilir.

Arka planda:

  • Müşteri hesabını,
  • sipariş kaydını,
  • stok durumunu,
  • kargo sistemini

kontrol edip sonucu kullanıcıya konuşarak aktarabilir.

Voice Agent İnsan Operatörü Tamamen Kaldırır mı?

Her durumda değil.

Rutin işlemlerde voice agent çok faydalı olabilir.

Ancak:

  • Karmaşık şikayetler,
  • yüksek tutarlı finansal işlemler,
  • sağlık kararları,
  • hukuki konular,
  • özel müşteri durumları

insan müdahalesi gerektirebilir.

Daha mantıklı mimari, agent’ın rutin işlemleri çözmesi ve gerektiğinde kullanıcıyı gerçek operatöre aktarması olabilir.

Extended Thinking Her Zaman Kullanılmalı mı?

Hayır.

Her isteğin uzun reasoning’e ihtiyacı yok.

Örneğin:

“Salon ışığını kapat.”

komutunda Extended Thinking kullanmak gereksiz olabilir.

Standart Gemini 3.8 Live daha hızlı sonuç verebilir.

Extended Thinking ise:

  • Birden fazla servis sorgulanacaksa,
  • karmaşık veriler karşılaştırılacaksa,
  • çok aşamalı planlama gerekiyorsa,
  • tool işlemleri birkaç saniye sürüyorsa

daha anlamlı hale geliyor.

Hız mı Reasoning mi?

Geliştirici açısından iki model arasındaki temel karar aslında burada.

Gemini 3.8 Live:

Hızlı, düşük gecikmeli ve doğal konuşma.

Gemini 3.8 Live Extended Thinking:

Daha karmaşık görevleri çözmek için daha güçlü reasoning.

Dolayısıyla “hangisi daha iyi?” yerine:

“Benim uygulamamda hangi görev yapılıyor?”

sorusunu sormak gerekiyor.

Gemini 3.8 Live Neden Önemli?

Bana göre yeni modellerde en önemli gelişme ses kalitesinin biraz daha iyi olması değil.

Asıl değişiklik voice AI ile agent mimarisinin birleşmesi.

Eski sesli yapay zekâ yaklaşımı çoğunlukla:

Kullanıcı konuşur → model cevap verir → kullanıcı tekrar konuşur.

şeklindeydi.

Yeni yaklaşım ise giderek:

Kullanıcı konuşur → agent hedefi anlar → plan yapar → araçları çalıştırır → kullanıcıyla iletişimi sürdürür → gerçek görevi tamamlar.

haline geliyor.

Sesli Yapay Zekâ Artık Sadece Konuşmuyor, İş Tamamlıyor

Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking’in gösterdiği gelecek yönü oldukça açık.

Sesli yapay zekâ alanındaki rekabet yalnızca:

“Hangi model daha insan gibi konuşuyor?”

sorusuyla sınırlı kalmayacak.

Çok daha önemli soru şu olacak:

“Bu yapay zekâ konuşurken gerçekten hangi işi tamamlayabiliyor?”

Kullanıcı adına uçuş arayabiliyor mu?

Sipariş durumunu kontrol edebiliyor mu?

Kamerada görünen problemi anlayabiliyor mu?

Farklı API’lerden gelen bilgileri birleştirebiliyor mu?

Uzun süren bir işlem devam ederken kullanıcıyla doğal konuşmayı sürdürebiliyor mu?

Gemini 3.8 Live düşük gecikmeli sesli etkileşim tarafını güçlendirirken Extended Thinking bu deneyimin üzerine çok adımlı reasoning ve asenkron tool kullanımını ekliyor.

Geliştiriciler açısından önemli tarafı ise bu teknolojinin yalnızca Google’ın kendi Gemini uygulamasında kullanılmaması.

Gemini API ve Live API üzerinden kendi web, mobil veya kurumsal uygulamalarımızda da gerçek zamanlı sesli agent’lar geliştirebiliyoruz.

Özellikle ADK for Kotlin gibi agent framework’leriyle birlikte değerlendirildiğinde Android tarafında oldukça güçlü kullanım senaryoları ortaya çıkıyor.

Kısacası sesli yapay zekâ, yalnızca soruya cevap veren bir arayüz olmaktan çıkıp kullanıcıyla konuşurken arka planda gerçek görevler gerçekleştiren bir agent katmanına dönüşüyor.

Sık Sorulan Sorular

Gemini 3.8 Live ne zaman çıktı?

Google, Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking modellerini 15 Eylül 2026 tarihinde genel kullanıma sundu.

Gemini 3.8 Live nedir?

Gerçek zamanlı, düşük gecikmeli sesli görüşmeler, multimodal girişler ve tool calling için geliştirilmiş Google Gemini modelidir.

Gemini 3.8 Live Extended Thinking nedir?

Karmaşık ve çok adımlı gerçek zamanlı ses görevleri için arka planda daha güçlü reasoning ve asenkron function calling kullanan Gemini modelidir.

Gemini 3.8 Live Türkçe destekliyor mu?

Evet. Türkçe, Gemini Live’ın desteklediği 97 dil arasında bulunuyor.

Gemini 3.8 Live görüntü anlayabiliyor mu?

Evet. Model metin, görüntü, ses ve video girdilerini destekliyor.

Gemini 3.8 Live API üzerinden kullanılabiliyor mu?

Evet. Gemini API Live API altyapısı üzerinden kullanılabiliyor ve Google AI Studio’da test edilebiliyor.

Gemini 3.8 Live model kodu nedir?

gemini-3.8-live

Extended Thinking model kodu nedir?

gemini-3.8-live-extended-thinking

Gemini 3.8 Live kaç token destekliyor?

Model 131.072 token giriş ve 65.536 token çıkış limitine sahip.

Extended Thinking’de thinking seviyesi ayarlanabiliyor mu?

Evet. Low, Medium ve High seviyeleri destekleniyor. Minimal desteklenmiyor.

Extended Thinking function calling destekliyor mu?

Evet. Ancak function’ların asynchronous NON_BLOCKING olarak tanımlanması gerekiyor.

Gemini 3.8 Live fiyatı ne kadar?

Ücretli API katmanında ses girişi yaklaşık 0,005 dolar/dakika, ses çıktısı yaklaşık 0,018 dolar/dakika seviyesinde. Gerçek maliyet token, context, tool ve medya kullanımına göre değişebilir.

Gemini 3.8 Live Android’de kullanılabilir mi?

Evet. Live API kullanılarak Android uygulamalarına gerçek zamanlı sesli AI özellikleri eklenebilir. Üretim ortamında API anahtarları güvenli şekilde yönetilmelidir.

Gemini 3.8 Live ile ADK for Kotlin kullanılabilir mi?

Evet. Gemini Live gerçek zamanlı sesli kullanıcı etkileşimini sağlarken ADK for Kotlin uygulamadaki agent ve araç orkestrasyonu için kullanılabilecek tamamlayıcı bir mimari sunabilir.

Gemini 3.8 Live Google Search kullanabiliyor mu?

Evet. Google Search grounding destekleniyor. Google Maps grounding ise desteklenmiyor.

Gemini tarafından oluşturulan sesler işaretleniyor mu?

Evet. Google, AI ürünleri tarafından oluşturulan seslere tespit edilebilir SynthID filigranı eklediğini belirtiyor.

Kaynaklar

/* ]]> */