OpenAI gerçek zamanlı ses modelleri ailesini genişletti
OpenAI gerçek zamanlı ses modelleri ailesini genişletti

OpenAI gerçek zamanlı ses modelleri ailesini genişletti: GPT-Realtime-2, Translate ve Whisper geliştiricilere açıldı

Teknoloji Haberleri - OpenAI, 7 Mayıs 2026 tarihinde yaptığı açıklamayla API tarafında kullanıma sunduğu üç yeni gerçek zamanlı ses modelini duyurduGPT-Realtime-2GPT-Realtime-Translate ve GPT-Realtime-Whisper ismini taşıyan bu modeller, sesli yapay zekanın artık yalnızca soru-cevap yapan bir asistandan çok daha fazlası olacağını gösteriyor. Şirketin hedefi, konuşmayı yazılım kullanmanın en doğal yolu haline getirmek.

GPT-5 Seviyesinde Mantık Yürütebilen İlk Ses Modeli

Yeni serinin amiral gemisi olan GPT-Realtime-2, OpenAI tarafından “GPT-5 seviyesinde akıl yürütebilen ilk ses modeli” olarak tanımlanıyor. Modelin selefi GPT-Realtime-1.5‘e kıyasla en büyük farkı, karmaşık kullanıcı taleplerini çok daha iyi analiz edebilmesi ve sohbet akışını bozmadan işlem yapabilmesi. Kullanıcı konuşurken araya girse veya fikrini değiştirse bile model diyaloğu koparmadan devam ettirebiliyor. Daha da önemlisi, konuşma esnasında “takviminize bakıyorum” veya “hemen kontrol ediyorum” gibi doğal geri bildirimler vererek arka planda takvim, arama motoru ya da şirket içi sistemler gibi harici araçlara bağlanabiliyor.

Teknik tarafta da ciddi sıçramalar söz konusu. Modelin bağlam penceresi 32K‘dan 128K tokene çıkarıldı. Bu sayede bir buçuk saati aşan uzun konuşmalarda dahi bağlam korunabiliyor. Performans testlerinde ise Big Bench Audio kıyaslamasında bir önceki nesle göre %15,2, talimat takip testlerinde ise %13,8 daha yüksek skor elde edildi. Tıp ve teknik terminoloji gibi özel alan terimlerini anlama kabiliyeti de hissedilir biçimde artmış durumda.

70’ten Fazla Dili Anlayıp 13 Dile Anında Çeviri

İkinci model GPT-Realtime-Translate, canlı konuşmaları eş zamanlı olarak çevirmek için tasarlandı. Sistem 70‘in üzerinde giriş dilini algılayabiliyor ve bunları 13 çıkış diline, konuşmacının temposuna ayak uydurarak tercüme edebiliyor. Çeviri sırasında konuşmanın doğal akışı bozulmuyor; araya giren farklı dillerdeki konuşmacıları da aynı hassasiyetle işleyebiliyor. OpenAI bu modeli özellikle müşteri hizmetleri, sınır ötesi satış, eğitim, etkinlik ve içerik üreticisi platformları için konumlandırıyor.

Avrupa’nın dev telekom şirketlerinden Deutsche Telekom, çok dilli müşteri destek hatlarında bu modeli test etmeye şimdiden başladı. Benzer biçimde seyahat platformu Priceline, kullanıcıların uçuş ve otel rezervasyonlarını sesli komutlarla yönetebildiği bir sistemi deniyor.

Konuşma Anında Metne Dökme

Üçüncü model GPT-Realtime-Whisper ise düşük gecikmeli, akış halinde konuşma-metin dönüşümüne odaklanıyor. Konuşmacı daha cümlesini bitirmeden sistem metni oluşturmaya başlıyor. Canlı yayın altyazıları, toplantı notları ve iş akışı güncellemeleri gibi alanlarda bekleme süresini neredeyse ortadan kaldırıyor.

Fiyatlandırma ve Erişim

Her üç model de OpenAI‘ın Realtime API‘si üzerinden erişime açıldı. Fiyatlandırma şu şekilde:

  • GPT-Realtime-2: Ses girişi için milyon token başına 32 dolar, ses çıkışı için 64 dolar

  • GPT-Realtime-Translate: Dakika başına 0,034 dolar

  • GPT-Realtime-Whisper: Dakika başına 0,017 dolar

Google Gemini Live ile Rekabet Kızışıyor

Bu hamle, sesli yapay zeka alanında Google Gemini Live ile rekabeti yeni bir boyuta taşıyor. Google tarafı genellikle daha hızlı yanıt süreleri ve daha geniş dil desteğiyle öne çıkarken, OpenAI doğal konuşma akışına, uzun diyaloglarda kopmama becerisine ve konuşma sırasında işlem yapabilme yeteneğine yatırım yapıyor. Sesli etkileşimi “komut ver – yanıt al” döngüsünden çıkarıp, ekrana bakmadan iş tamamlayabilen bir arayüze dönüştürme stratejisi izleniyor.

Sektörden İlk Yansımalar

Yeni modelleri test eden şirketler arasında emlak devi Zillow ve çevrim içi seyahat platformu Priceline da var. Zillow, kullanıcıların “bütçeme uygun, yoğun caddelerden uzak evleri bul ve cumartesi için randevu ayarla” gibi karmaşık taleplerini sesle iletebildiği bir asistan inşa ediyor. Priceline ise seyahat planlarının tamamını sesli komutlarla yönetmeyi hedefliyor.

OpenAI‘ın bu atılımı, sesli yapay zekayı bilim kurgudan çıkarıp gündelik yazılım deneyiminin merkezine yerleştirme yolunda atılmış en somut adımlardan biri olarak değerlendiriliyor. Teknoloji Haberleri - Teknoloji Medya

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir


Güncel Haberler
ChatGPT Health ABD’de Geniş Kapsamlı Kullanıma Açıldı: Sağlık Verileri Artık Yapay Zekâ İle Doğrudan Paylaşılabilecek - 24.07.2026Microsoft MAI-Image-2.5-Pro Ve MAI-Voice-2-Flash Modellerini Duyurdu - 24.07.2026Google Gemini Spark AI Pro Abonelerine Sunuldu: Kişisel Yapay Zeka Ajanı Daha Fazla Kullanıcıyla Buluşuyor - 24.07.2026Xiaomi Temmuz 2026 Güvenlik Güncellemesi 58 Cihaz İçin Yayınlandı: İşte Güncelleme Alan Modeller - 24.07.2026Cisco Antares Yapay Zekâ Modelleri Yazılım Güvenliğinde Maliyet Dengesini Değiştiriyor - 22.07.2026Apple iPhone 18 Pro Üretim Hacmini Artırıyor: Foxconn Fabrikalarında Yoğun Mesai Başladı - 22.07.2026Cilde Boya Gibi Uygulanan Yeni Elektrot Teknolojisi Biyometrik Takibi Değiştirebilir - 21.07.2026Hooma Magpulse Slim Manyetik Powerbank Serisi Türkiye’de Satışa Sunuldu - 21.07.2026Apple Live Notes İle Genius Bar Görüşmelerini Yapay Zekâ Destekli Notlara Dönüştürüyor - 21.07.2026Windows 11 İle Linux Karşılaştırması Şaşırttı: Aynı Donanımda Kazanan İş Yüküne Göre Değişti - 21.07.2026Google Chrome Find And Fill With Gemini Özelliği Form Doldurma Deneyimini Değiştiriyor - 21.07.2026Hayat Kimya Yapay Zekâ Destekli Enerji Yönetim Sistemini Kocaeli Kampüsünde Devreye Aldı - 21.07.2026Samsung Tandem OLED Ekran Teknolojisi 1600 Nit Parlaklık Ve Daha Uzun Kullanım Ömrü Sunuyor - 21.07.2026iOS 27 Beta 4 Yayınlandı: Apple TV, ProRes Log 2 Ve Yeni iPhone Donanımına İşaret Eden Değişiklikler Geldi - 21.07.2026Google Pixel 11a Tensor G6 İle Performansını Güçlendirmeye Hazırlanıyor - 20.07.2026Apple Fiyatlarını Neden Artırıyor? Zamların Arkasındaki Küresel Strateji Netleşiyor - 20.07.2026iPhone Sadakat Oranı Yüzde 87’ye Ulaştı: Android’den Geçişler Yavaşlıyor - 20.07.2026Samsung Galaxy A Serisi Temmuz 2026 Güvenlik Güncellemesi Dağıtıma Başladı - 20.07.2026Yapay Zeka Veri Merkezi Elektrikçileri 280 Bin Doları Aşan Maaşlarla Öne Çıkıyor - 20.07.2026Samsung Galaxy Z Fold 8 İçin Üretim Planı Büyüdü: Şirket Talep Beklentisini Yükseltti - 20.07.2026

Teknoloji Gündemi

Microsoft MAI-Image-2.5-Pro Ve MAI-Voice-2-Flash Modellerini Duyurdu

Microsoft MAI-Image-2.5-Pro ile görsel üretim ve düzenleme alanında yeni nesil yapay zekâ yeteneklerini kullanıma açtı. Şirket ayrıca daha düşük maliyet ve yüksek hız sunan MAI-Voice-2-Flash modelinin teknik ayrıntılarını da paylaştı. Microsoft MAI-Image-2.5-Pro, şirketin bugüne kadar...

Takip Et