Google, metin, kod, görsel, video ve sesi tek bir ortak alanda eşleyebilen ve bir telefonda çalışacak kadar küçük olan açık kaynaklı vektör temsil (embedding) modeli EmbeddingGemma 2’yi yayımladı. 740 milyon parametreli model, Apache 2.0 lisansı altında erişime açıldı ve tamamen cihaz üzerinde çalışan arama ve bilgi getirme araçları geliştiren yazılımcıları hedefliyor.
Model, Google’ın nisan ayında yayımladığı açık model ailesi Gemma 4’ün mimarisi üzerine inşa edildi. Google, modelin aynı zamanda Gemini Embedding modelleriyle aynı teknolojiden yararlandığını belirtiyor.
Neler Yeni?
Vektör temsil modelleri, yazılımların anahtar kelimeler yerine anlama dayalı arama ve karşılaştırma yapabilmesi için içerikleri sayısal vektörlere dönüştürüyor. Geçen yıl yayımlanan ilk EmbeddingGemma yalnızca metinleri işleyebiliyordu. Google, bu modelin 20 milyondan fazla indirildiğini ve geliştiricilerin modeli cihaz üzerinde arama ile gizlilik odaklı bilgiyle artırılmış üretim (RAG) hatlarında kullandığını açıklıyor.
EmbeddingGemma 2 bu yeteneği çoklu modlara taşıyor. Google, tek bir modelin örneğin bir ses kaydından belirli bir video klibini bulabildiğini ya da bir metin sorgusuyla saatler süren ses kayıtları içinde arama yapabildiğini ifade ediyor.
Model modüler bir yapıya sahip. Sadece metin içeren iş yükleri en az 270 milyon parametreye ihtiyaç duyarken, tam çok modlu destek için isteğe bağlı olarak görme (170 milyon) ve ses (300 milyon) kodlayıcıları eklenebiliyor. Bağlam penceresi, orijinalinin dört katına çıkarak 8.000 tokene ulaştı. Bu kapasite 5,5 dakikaya kadar ses kaydı, 29 görsel, 58 video karesi veya bunların kombinasyonları için yeterli alan sunuyor.
Geliştiriciler, Matryoshka Representation Learning sayesinde çıktı vektörlerini 768 boyuttan 512, 256 veya 128 boyuta düşürebiliyor. Google, bunun yerel vektör veritabanlarının depolama ihtiyacını 6 katına kadar azalttığını belirtiyor.
Performans

Google, EmbeddingGemma 2’nin MTEB Code ve Massive Audio Embedding Benchmark (MAEB) gibi benchmark testlerinde 1 milyar altı parametreli çok modlu vektör dönüştürücüler arasında lider konumda olduğunu, metin, görme ve ses görevlerinde daha büyük birçok modele denk geldiğini veya onları geride bıraktığını ifade ediyor. Şirket, modelin kendi boyutunun iki katından daha büyük bazı uzman modelleri bile geride bıraktığını ekliyor.

Metin performansı orijinal modelle aynı seviyede kalırken, kod getirme tarafında büyük bir sıçrama var: MTEB Code puanı 68,76’dan 78,68’e yükseliyor. Google’a göre bu performans, modeli yerel kod tabanlarının indekslenmesi, anlamsal kod araması ve kodlama ajanları için bilgi getirme görevlerine oldukça uygun hâle getiriyor.
Telefonda Çalışacak Şekilde Tasarlandı
Google’a göre model daha düşük hassasiyetli sayısal biçime dönüştürüldüğünde, yalnızca metin ağırlıkları Pixel 11 Pro’da yaklaşık 191 MB aktif RAM, tam çok modlu sürümü ise yaklaşık 567 MB aktif RAM gerektiriyor. Gemma 4 ile aynı metin tokenizerı ve ses kodlayıcıyı paylaştığı için geliştiriciler, iki modeli tek bir hatta daha düşük toplam bellek kullanımıyla birlikte çalıştırabiliyor. Örneğin, yerel dosya getirme işlemi için EmbeddingGemma 2 kullanılırken, bulunan veriler üzerinde akıl yürütmek için Gemma 4 ile eşleştirme yapılabiliyor.
Kullanıcı verilerinin cihazdan çıkması gerekmediği için cihaz üzerinde vektör temsilleri gizlilik açısından da cazip bir seçenek sunuyor. Bu durum, Google AI Edge Gallery uygulamasının Gemma 4 rüzgarıyla App Store’da ilk 10’a girmesiyle görünürlük kazanan Google’ın cihaz üzerinde çalışan YZ hamlesiyle de örtüşüyor. Google, EmbeddingGemma 2’yi bu uygulamada Instant Media Search ve Video Moments Finder gibi özelliklerle, yerel dosya getirme işlemi sunan Google AI Edge Foresight uygulamasında ise pratik kullanımlarla sergiliyor.
Erişilebilirlik
Model ağırlıkları Hugging Face ve Kaggle üzerinde yer alıyor; Google’ın Model Garden platformuna da yakında geleceği belirtiliyor. Google, modelin transformers, sentence-transformers, MLX, vLLM, llama.cpp, SGLang, Ollama ve LMStudio gibi araçlarla, ayrıca transformers.js ve WebGPU aracılığıyla tarayıcı içinde çalışabilmesi için ortaklarıyla iş birliği yaptığını söylüyor. Vektörlerin depolanması için Qdrant desteklenirken Unsloth da modelin ince ayarına ilişkin bir rehber yayımladı.
Geliştiriciler,modeli cihaz üzerinde kullanıma almak için Google AI Edge bünyesindeki MediaPipe ve LiteRT çözümlerini kullanabiliyor.
EmbeddingGemma 2’nin kullanıma sunulması, geliştiricilere bulut tabanlı bir gömme API’sine bağımlı kalmak yerine yerel olarak çalışabilen, açık ve ticari kullanıma uygun çok modlu bir bilgi getirme seçeneği sunuyor. Benzer veri türlerini destekleyen Google’ın kendi Gemini Embedding 2 modeli ise bulutta barındırılan bir model olarak sunulmaya devam ediyor.
Kaynak: https://officechai.com/ai/google-launches-embeddinggemma-2-for-multimodal-on-device-embeddings/
