Sesli bir asistan uygulaması kurduğunuzda akla ilk gelen soru genelde şu olur: "Söylediklerim nereye gidiyor?" Sürekli dinleyen, sürekli not alan bir uygulamadan bahsediyorsak bu soru haklı bir kaygı. Hey Asistan'ı tasarlarken bu sorunun cevabını mimarinin en başına koyduk: ses, cihazınızdan hiç çıkmadan yazıya dönüşür.
Ses tanıma cihazınızda çalışır, sunucuda değil
Hey Asistan konuştuğunuz sesi bir sunucuya gönderip orada çözdürmez. iPhone ve iPad'de Apple'ın kendi ses tanıma sistemini, Android'de ise Android'in sistem düzeyindeki ses tanımasını kullanır. Yani "bu ses dosyasını dinle ve yazıya çevir" işlemi tamamen telefonunuzun içinde, işletim sisteminin kendi altyapısıyla gerçekleşir. Hey Asistan sunucuları o ham ses kaydını hiçbir zaman görmez.
Kameradan okunan metin de aynı prensiple çalışır
Bir not defterindeki yazıyı ya da bir fatura üzerindeki bilgiyi fotoğraflayıp Hey Asistan'a eklediğinizde de aynı yaklaşım geçerli. Fotoğraftaki yazının metne dönüştürülmesi (OCR) yine cihazınızda yapılır. Sunucuya gönderilen, fotoğrafın kendisi değil, ondan çıkarılmış düz metindir.
Sunucuya yalnızca bitmiş metin ulaşır
Hey Asistan'ın yapay zeka tarafı — kategori önerisi, özetleme, görev çıkarma, takvime ekleme — devreye girdiğinde elinde olan şey sesin veya fotoğrafın kendisi değil, sizin zaten onayladığınız düz metindir. Bu küçük ama önemli bir fark: sistemin işleyebileceği en az veri, elinde tuttuğu en az veridir.
Bunun pratikte anlamı ne?
Üç somut sonucu var:
Daha az veri, daha az risk. Ham ses kaydı hiç oluşmadığı, sunucuya gitmediği için, olası bir veri sızıntısında ortada dinlenecek bir kayıt yok — yalnızca sizin zaten görüp onayladığınız metinler var.
Dönüşüm anlık. Ses tanıma ağ üzerinden bir sunucuya gidip gelmeyi beklemediği için, konuştuğunuz metin ekranda neredeyse gecikmesiz belirir.
Onay hâlâ sizde. Cihazda çözülen metni kategoriye ayırma önerisini sesle onaylayan ya da değiştiren yine sizsiniz — sunucuya giden veri, üzerinde son sözü sizin söylediğiniz veridir.
Peki akıllı saatlerde durum ne olacak?
Yol haritamızda yer alan akıllı saat desteğinde (Apple Watch, Wear OS) bu akış birebir aynı şekilde işlemeyecek. Saatlerin donanım ve işletim sistemi kısıtları, telefonlardaki gibi tam kapsamlı bir cihaz-üstü ses tanımayı şu an için mümkün kılmıyor; bu yüzden saat desteği geldiğinde ses işleme adımı farklı bir yoldan ilerleyecek. Bu, sayfada bugün anlattığımız telefon/tablet/masaüstü akışını değiştirmiyor — yalnızca saatler için ayrıca ele alacağımız bir konu.
Sonuç olarak Hey Asistan'ın "konuş, onayla, düzenlensin" akışındaki ilk adım aslında bir gizlilik kararı: ses cihazınızın dışına çıkmadan önce zaten metne dönüşmüş olur. Hey Asistan'ı bu yaklaşımla deneyebilirsiniz.