Google DeepMind ra mắt EmbeddingGemma 2, mô hình nhúng đa phương thức trên thiết bị
Google DeepMind thuộc Alphabet (GOOGL) công bố EmbeddingGemma 2, mô hình nhúng đa phương thức mã nguồn mở, mở rộng EmbeddingGemma vốn tập trung vào văn bản sang mã, hình ảnh, video và âm thanh, ánh xạ mọi loại dữ liệu vào không gian vector 768 chiều dùng chung để tìm kiếm và truy xuất đa phương thức trên thiết bị.
Mô hình xây dựng trên kiến trúc Gemma 4 với 740 triệu tham số theo giấy phép thương mại Apache 2.0, thiết kế để chạy cục bộ trên điện thoại và PC thay vì trên đám mây. Thiết kế mô-đun dùng 270 triệu tham số cho văn bản và mã, 440 triệu khi có bộ mã hóa hình ảnh, 570 triệu khi có bộ mã hóa âm thanh và đầy đủ 740 triệu cho mọi phương thức.
Độ dài ngữ cảnh tăng gấp bốn lần lên 8.192 token. Google cho biết điểm MTEB Code tăng lên 78,68 từ 68,76, tương đương mức tăng khoảng 14%. Matryoshka Representation Learning cho phép nhà phát triển thu gọn vector xuống 512, 256 hoặc 128 chiều, giảm nhu cầu lưu trữ tới khoảng sáu lần; chế độ văn bản lượng tử hóa cần khoảng 191MB RAM hoạt động trên Pixel 11 Pro, so với 567MB cho phiên bản đa phương thức đầy đủ.
Trọng số mô hình đã có trên Hugging Face và Kaggle.
Thông tin tài chính chung, không phải tư vấn đầu tư cá nhân hóa. Miễn trừ tài chính