Tether Data'nın yapay zeka araştırma girişimi QVAC, mobil cihazlar ve uç cihazlarda çalışmak üzere geliştirilen VisionPsy-Nano adlı görüntü ve dil modelini açık kaynak olarak yayımladı. Yaklaşık 460 milyon parametreye sahip model, daha önce bulut altyapısı gerektiren çok modlu yapay zeka yeteneklerini doğrudan mobil cihazlara taşıyor. 0,5 milyar parametrenin altındaki cihazlarda çalışan görüntü ve dil modelleri arasında 62,3 normalize puanla kalite ve performans sıralamasında ilk sıraya yerleşti.
VisionPsy-Nano, yaklaşık 0,5 milyar parametre sınıfındaki modeller arasında yapılan karşılaştırmalarda Liquid AI ve Hugging Face tarafından geliştirilen rakip modelleri geride bıraktı. VisionPsy-Nano-460M, 17 değerlendirme kriterinin 16'sında en yüksek performansı göstererek 62,3 normalize puana ulaştı. Tether, modeli farklı kullanım senaryolarına uygun iki ayrı sürümle sunuyor. VisionPsy-Nano-460M standart görüntü ve dil testlerinde en yüksek performansa odaklanırken, VisionPsy-Nano-460M-Flash mobil cihazlarda çok daha düşük gecikmeyle çalışmak üzere optimize edildi ve tam sürümün performansının yaklaşık yüzde 99'unu korurken çok daha hızlı yanıt veriyor.
Model, kompakt yapısına rağmen karmaşık belgelerden metin çıkarma, finansal raporlar ve infografikleri analiz etme, sahne algılama ve mekansal analiz ile görsel muhakeme gibi görevlerde yüksek performans sergiliyor. MM-IFEval ve POPE gibi değerlendirme testlerinde, kendisinden 1,6 ila 2,3 kat daha büyük modelleri geride bıraktı.






