Xiaomi MiMo-V2.5
Xiaomi MiMo-V2.5

Xiaomi MiMo-V2.5 Ses Teknolojisi ile Yapay Zekada Yeni Dönemi Başlatıyor

Teknoloji Haberleri - Xiaomi, Xiaomi MiMo-V2.5 ses teknolojisi ailesini resmen tanıtarak yapay zeka ajanları döneminde sesli iletişimi yeniden tanımlayacak adımı attı. Şirketin 23-24 Nisan 2026’da duyurduğu bu yeni seri, konuşma sentezinden (TTS) ses tanımaya (ASR) kadar uzanan bütüncül bir yapı sunuyor. Daha bir ay önce MiMo-V2 serisini tanıtan Xiaomi, bu kez işin ses boyutuna odaklanarak geliştiricilere ve son kullanıcılara çok daha doğal bir deneyim vaat ediyor. Xiaomi kurucusu Lei Jun, modellerin yayınlanmasının ardından yaptığı kısa paylaşımda “Gelişmeye devam ediyoruz!” ifadelerini kullandı.

Üç Farklı TTS Modeli: VoiceDesign ve VoiceClone Öne Çıkıyor

MiMo-V2.5-TTS Serisi, üç ayrı modelden oluşuyor ve her biri farklı bir ihtiyaca cevap veriyor. Temel MiMo-V2.5-TTS modeli, konuşma hızı, tonlama, duygu ve vurgu gibi parametreler üzerinde kapsamlı kontrol sağlıyor. Kullanıcılar, tıpkı bir seslendirme yönetmeni gibi doğal dil komutlarıyla (Director Mode) modele istediği tarzı dikte edebiliyor. Model, herhangi bir komut verilmese bile düz metindeki noktalama işaretlerine ve duygusal geçişlere duyarlı bir okuma performansı sergiliyor.

Serinin asıl yıldızları ise VoiceDesign ve VoiceClone. VoiceDesign, herhangi bir referans sese ihtiyaç duymadan, yalnızca metinle tarif ettiğiniz yaş, cinsiyet, aksan veya karakter özelliklerine uygun yepyeni bir ses profili yaratabiliyor. VoiceClone ise 30 saniye gibi kısa bir ses örneğinden hedef konuşmacının sesini yüksek doğrulukla kopyalayabiliyor. Bu modeller, oyun NPC’lerinden sanal asistanlara, sesli kitap prodüksiyonundan içerik üretimine kadar geniş bir alanda kullanılabilecek.

ASR Modeli Açık Kaynak Kodlu Olarak Yayınlandı

Ses girişi tarafında konumlanan MiMo-V2.5-ASR modeli, yayınlandığı an itibarıyla model ağırlıkları ve koduyla birlikte açık kaynak haline getirildi. ASR modeli, arka planda yüksek gürültü olsa bile konuşmayı ayırt edebiliyor. Çince ve İngilizce arasında dil etiketi gerektirmeden otomatik geçiş yapabilmesi, çok dilli ortamlarda büyük kolaylık sağlıyor.

Bununla da kalmıyor; Wu, Kantonca, Minnan ve Sichuan gibi Çince lehçelerini tanıyabiliyor. Çoklu konuşmacının olduğu toplantı kayıtlarında kimin ne söylediğini ayırt ederek noktalama işaretleriyle birlikte kullanıma hazır transkript metinler üretebiliyor. Hatta müzikle karışık vokallerde dahi şarkı sözlerini metne dökebiliyor.

Geliştiriciler İçin Kapılar Açık

Xiaomi, bu yeni modelleri MiMo Studio ve MiMo API platformu üzerinden geliştiricilerin kullanımına sundu. TTS modellerine şimdilik ücretsiz erişim imkanı tanınıyor. ASR modelinin açık kaynaklı olması ise topluluk katkısıyla modelin daha da gelişmesinin önünü açıyor. Şirket, bu hamlesiyle ses teknolojileri alanındaki rekabette agresif bir konum alırken, sunduğu esnek fiyatlandırma planlarıyla da bireysel geliştiriciden kurumsal ölçeğe kadar herkesi hedefliyor. Teknoloji Haberleri - Teknoloji Medya

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir


Güncel Haberler
ChatGPT Health ABD’de Geniş Kapsamlı Kullanıma Açıldı: Sağlık Verileri Artık Yapay Zekâ İle Doğrudan Paylaşılabilecek - 24.07.2026Microsoft MAI-Image-2.5-Pro Ve MAI-Voice-2-Flash Modellerini Duyurdu - 24.07.2026Google Gemini Spark AI Pro Abonelerine Sunuldu: Kişisel Yapay Zeka Ajanı Daha Fazla Kullanıcıyla Buluşuyor - 24.07.2026Xiaomi Temmuz 2026 Güvenlik Güncellemesi 58 Cihaz İçin Yayınlandı: İşte Güncelleme Alan Modeller - 24.07.2026Cisco Antares Yapay Zekâ Modelleri Yazılım Güvenliğinde Maliyet Dengesini Değiştiriyor - 22.07.2026Apple iPhone 18 Pro Üretim Hacmini Artırıyor: Foxconn Fabrikalarında Yoğun Mesai Başladı - 22.07.2026Cilde Boya Gibi Uygulanan Yeni Elektrot Teknolojisi Biyometrik Takibi Değiştirebilir - 21.07.2026Hooma Magpulse Slim Manyetik Powerbank Serisi Türkiye’de Satışa Sunuldu - 21.07.2026Apple Live Notes İle Genius Bar Görüşmelerini Yapay Zekâ Destekli Notlara Dönüştürüyor - 21.07.2026Windows 11 İle Linux Karşılaştırması Şaşırttı: Aynı Donanımda Kazanan İş Yüküne Göre Değişti - 21.07.2026Google Chrome Find And Fill With Gemini Özelliği Form Doldurma Deneyimini Değiştiriyor - 21.07.2026Hayat Kimya Yapay Zekâ Destekli Enerji Yönetim Sistemini Kocaeli Kampüsünde Devreye Aldı - 21.07.2026Samsung Tandem OLED Ekran Teknolojisi 1600 Nit Parlaklık Ve Daha Uzun Kullanım Ömrü Sunuyor - 21.07.2026iOS 27 Beta 4 Yayınlandı: Apple TV, ProRes Log 2 Ve Yeni iPhone Donanımına İşaret Eden Değişiklikler Geldi - 21.07.2026Google Pixel 11a Tensor G6 İle Performansını Güçlendirmeye Hazırlanıyor - 20.07.2026Apple Fiyatlarını Neden Artırıyor? Zamların Arkasındaki Küresel Strateji Netleşiyor - 20.07.2026iPhone Sadakat Oranı Yüzde 87’ye Ulaştı: Android’den Geçişler Yavaşlıyor - 20.07.2026Samsung Galaxy A Serisi Temmuz 2026 Güvenlik Güncellemesi Dağıtıma Başladı - 20.07.2026Yapay Zeka Veri Merkezi Elektrikçileri 280 Bin Doları Aşan Maaşlarla Öne Çıkıyor - 20.07.2026Samsung Galaxy Z Fold 8 İçin Üretim Planı Büyüdü: Şirket Talep Beklentisini Yükseltti - 20.07.2026

Teknoloji Gündemi

Microsoft MAI-Image-2.5-Pro Ve MAI-Voice-2-Flash Modellerini Duyurdu

Microsoft MAI-Image-2.5-Pro ile görsel üretim ve düzenleme alanında yeni nesil yapay zekâ yeteneklerini kullanıma açtı. Şirket ayrıca daha düşük maliyet ve yüksek hız sunan MAI-Voice-2-Flash modelinin teknik ayrıntılarını da paylaştı. Microsoft MAI-Image-2.5-Pro, şirketin bugüne kadar...

Takip Et