Google DeepMind เปิดตัว EmbeddingGemma 2 โมเดลฝังข้อมูลแบบมัลติโมดัลบนอุปกรณ์
Google DeepMind ในเครือ Alphabet (GOOGL) ประกาศเปิดตัว EmbeddingGemma 2 โมเดลฝังข้อมูลแบบมัลติโมดัลโอเพนซอร์ส ซึ่งขยาย EmbeddingGemma ต้นฉบับที่เน้นข้อความให้รองรับโค้ด รูปภาพ วิดีโอ และเสียง โดยแมปข้อมูลทุกประเภทเข้าสู่พื้นที่เวกเตอร์ 768 มิติร่วมกัน เพื่อการค้นหาและเรียกคืนข้อมูลข้ามรูปแบบบนอุปกรณ์
โมเดลนี้สร้างบนสถาปัตยกรรม Gemma 4 มีพารามิเตอร์ 740 ล้าน ภายใต้สัญญาอนุญาต Apache 2.0 เชิงพาณิชย์ ออกแบบให้ทำงานภายในเครื่องโทรศัพท์และพีซี而不是บนคลาวด์ การออกแบบโมดูลาร์ใช้พารามิเตอร์ 270 ล้านสำหรับข้อความและโค้ด 440 ล้านเมื่อรวมตัวเข้ารหัสภาพ 570 ล้านเมื่อรวมตัวเข้ารหัสเสียง และ 740 ล้านสำหรับทุกรูปแบบ
ความยาวบริบทเพิ่มขึ้นสี่เท่าเป็น 8,192 โทเค็น Google ระบุคะแนน MTEB Code เพิ่มขึ้นเป็น 78.68 จาก 68.76 คิดเป็นการเพิ่มขึ้นประมาณ 14% Matryoshka Representation Learning ช่วยให้นักพัฒนาย่อเวกเตอร์เหลือ 512, 256 หรือ 128 มิติ ลดความต้องการพื้นที่จัดเก็บได้มากถึงประมาณหกเท่า โหมดข้อความแบบควอนไทซ์ใช้ RAM ที่ใช้งานจริงประมาณ 191MB บน Pixel 11 Pro เทียบกับ 567MB สำหรับเวอร์ชันมัลติโมดัลเต็มรูปแบบ
น้ำหนักโมเดลพร้อมใช้งานบน Hugging Face และ Kaggle
ข้อมูลการเงินทั่วไป ไม่ใช่คำแนะนำลงทุนเฉพาะบุคคล ข้อจำกัดความรับผิดด้านการเงิน