Griffin modeli insanlarla yüz yüze iletişim kuruyor
Tavus, insanlarla gerçek zamanlı yüz yüze iletişim kurabilen Griffin’i tanıttı. Model video görüşmelerinde ses, görüntü, mimik ve jestleri analiz ederek insan benzeri anlık tepkiler üretiyor.

Tavus, Griffin adlı yapay zeka modelini tanıttı. Model, insanlarla gerçek zamanlı video görüşmelerinde ses, görüntü, mimik ve jestleri analiz ederek doğal tepkiler veriyor.
Geleneksel yapay zeka sistemlerinde kullanıcıların doğru komutu vermesi, düşüncelerini açık biçimde ifade etmesi veya konuşmanın tamamlanmasını beklemesi gerekiyor. Tavus’un Griffin ile değiştirmeye çalıştığı temel nokta ise iletişimin kontrolünün makineye göre şekillenmemesi.
Griffin, insanların yüz yüze iletişimde kullandığı kelimeler, ses tonu, mimikler, bakışlar, jestler ve zamanlama gibi sinyalleri aynı anda değerlendirecek şekilde tasarlanıyor. Model, kullanıcının konuşmasını bitirmesini beklemek yerine görüşmenin durumunu sürekli yeniden değerlendiriyor. Böylece gerektiğinde başını sallayabiliyor, kısa bir onay tepkisi verebiliyor, konuşmaya ara verebiliyor veya kullanıcı halen konuşurken yanıt vermeye başlayabiliyor.
Tavus, bu yaklaşımı “insan odaklı bilgi işlem” olarak adlandırıyor. Şirketin hedefi, kullanıcıların yapay zekayla iletişim kurarken komutları ve sistemin çalışma mantığını düşünmek zorunda kalmaması.
Gerçek zamanlı video Turing testini geçti
Griffin’in en dikkat çekici sonuçlarından biri, Tavus’un gerçekleştirdiği yüz yüze görüşme testinden geliyor. 54 katılımcının 26’sı, yani yüzde 48’i, bir dakikalık görüşmenin ardından karşılarındaki kişinin gerçek bir insan olduğunu düşündü.
Tavus, bu sonucu kendi değerlendirmesine göre bir modelin ilk kez gerçek zamanlı video Turing testini geçtiği sonuç olarak nitelendiriyor.
Bu ilk bakışta düşük bir oran gibi gelebilir ancak kesinlikle öyle değil. Önceki sistemlerin geçiş oranı <%3'tü.
Yapay zeka ile yapılan sohbetlerin günümüzde son derece gerçekçi olduğunu biliyoruz. Çoğu insan bunu ayırt etmekte zorlanıyor. Ancak iş video temelli hale geldiğinde durum çabucak değişiyor. Mevcut modeller video üretiminde artık çok daha iyi olsa da bir videonun AI üretimi olup olmadığını anlamak insanlar için halen daha kolay.
Griffin ise hem ses hem de “canlı” video şeklinde bir iletişim kurarak bu yüzde 48’lik oranı elde ediyor.
Şirketin açıklamasına göre katılımcılara başka bir katılımcıyla bir dakikalık görüntülü görüşme yapacakları söylendi. Gerçekte ise karşılarında Griffin-Lite altyapısını kullanan bir PAL bulunuyordu. PAL; yüzü, sesi ve yanıtları gerçek zamanlı olarak üretilen dijital insan temsilini ifade ediyor.
Katılımcıların yüzde 48’i karşısındaki kişinin insan olduğunu düşünürken bu gruptaki ortalama güven seviyesi yüzde 79 oldu. Yapay zeka olduğunu düşünenlerin kendi yanıtlarına güven seviyesi ise yüzde 81 olarak ölçüldü.
Griffin-Lite, 7 puanlık değerlendirmede doğal görünme açısından 5,4, güvenilir görünme açısından 5,6 ve tekrar konuşma isteği açısından 5,8 puan aldı.
Bu yüksek puanların arkasında Griffin’in teknik mimarisinin merkezinde bulunan Full-Duplex çalışma yapısı bulunuyor.
Griffin’in teknik detaylarında neler var?
Tavus’un geliştirdiği sistem iki temel bileşenden oluşuyor. İlk bölüm Continuous Conversational Modeling adı verilen sürekli konuşma modelleme motoru. Bu bölüm gelen ses ve görüntüyü algılıyor, konuşmanın hangi aşamada olduğunu değerlendiriyor ve ne zaman, nasıl yanıt verilmesi gerektiğine karar veriyor.
İkinci bölüm ise Audio-Visual Generation yani Görsel-İşitsel Üretim motoru. Bu yapı, konuşma modelinden gelen kontrol sinyallerini kullanarak ses ve görüntüyü üretiyor.
Griffin ayrıca yalnızca sesi analiz etmiyor. Görüntüyü de sürekli olarak algılıyor. Böylece kullanıcının bakış yönü ve yüz ifadesinin yanı sıra bulunduğu ortamı veya kameraya gösterdiği bir nesneyi de değerlendirebiliyor.
NVIDIA VideoFDB testinde insan skoruna çok yaklaştı

Griffin-Lite’ın en önemli bağımsız değerlendirmelerinden biri ise Nvidia’nın VideoFDB benchmarkı oldu. Bu test, tam çift yönlü ses-görüntü konuşmalarında bir modelin insan davranışlarını ne kadar iyi okuyabildiğini ve buna ne kadar doğal tepki verdiğini ölçüyor.

Griffin-Lite, testin ilk aşamasında 5 üzerinden 3,83 puan aldı. İnsan referansının skoru ise 3,92. Gemini 2.5 + Anam sistemi 2,80 puanda kaldı.
İkinci aşamada ise Griffin-Lite 3,73 puan aldı. İnsan referansı 4,20 olurken ikinci en güçlü sistem MiniCPM-o 4.5’in skoru 3,44 oldu.
Griffin’in gerçek kullanım alanları oldukça geniş
Tavus, Griffin’in doğal iletişim yapısının eğitimden müşteri hizmetlerine kadar farklı alanlarda kullanılabileceğini düşünüyor. Örneğin bir öğrenci bir konuyu anlamadığında sistem yalnızca sorulan soruya cevap vermek yerine öğrencinin yüz ifadesi ve konuşma biçiminden zorlandığını anlayarak anlatım şeklini değiştirebilir.
Griffin’in en dikkat çekici özelliği aynı zamanda en önemli güvenlik sorunlarından birini oluşturuyor. Bir yapay zekanın insan gibi görünmesi ve davranması, doğal iletişimi kolaylaştırırken karşıdaki kişinin yapay zekayla konuştuğunu fark etmesini de zorlaştırabiliyor.