الذكاء الاصطناعي
Google Research تكشف عن TurboQuant لضغط ذاكرة الذكاء الاصطناعي
كشفت Google Research عن TurboQuant، وهي خوارزمية جديدة لضغط ذاكرة الذكاء الاصطناعي قد تُقلل من ذاكرة التشغيل أثناء وقت التشغيل بمقدار 6 أضعاف على الأقل.
أعلنت Google Research عن TurboQuant، وهي خوارزمية جديدة فائقة الكفاءة لضغط ذاكرة الذكاء الاصطناعي. صُممت هذه التقنية، التي أُعلن عنها يوم الثلاثاء، لتقليص ذاكرة التشغيل التي تتطلبها نماذج الذكاء الاصطناعي أثناء عملها. وفي حال تطبيقها بنجاح في العالم الحقيقي، قد تجعل TurboQuant تشغيل الذكاء الاصطناعي أقل تكلفة من خلال تقليل ذاكرة التشغيل أثناء وقت التشغيل — المعروفة بـ KV cache — بمقدار 6 أضعاف على الأقل.
تعالج الخوارزمية الاختناقات الأساسية في معالجة الذكاء الاصطناعي باستخدام “تكميم المتجهات” (vector quantization)، وهي طريقة لضغط البيانات. ووفقاً للباحثين، تتيح طريقة الضغط هذه لنماذج الذكاء الاصطناعي الاحتفاظ بمزيد من المعلومات مع استخدام مساحة أقل والحفاظ على الدقة. وتعتزم Google Research عرض النتائج الشهر المقبل في مؤتمر ICLR 2026. وسيوضح العرض التقديمي طريقتين أساسيتين تتيحان هذا الضغط: طريقة تكميم تسمى PolarQuant، وطريقة تدريب وتحسين تسمى QJL.
ومع ذلك، لا تزال TurboQuant طفرة مخبرية ولم يتم نشرها على نطاق واسع بعد. تجعل هذه المرحلة المبكرة من الصعب إجراء مقارنات مباشرة مع النماذج المنشورة بالكامل، حيث لم يتم اختبار التقنية بعد في بيئات الإنتاج الواقعية. ورغم أن TurboQuant قد تؤدي إلى مكاسب في الكفاءة وأنظمة تتطلب ذاكرة أقل أثناء الاستنتاج (inference)، إلا أنها لا تعالج نقص ذاكرة الوصول العشوائي (RAM) الأوسع المرتبط بتدريب الذكاء الاصطناعي. إذ لا تزال مرحلة تدريب نماذج الذكاء الاصطناعي واسعة النطاق تتطلب كميات هائلة من ذاكرة الوصول العشوائي، مما يعني أن فوائد TurboQuant تقتصر حالياً على مرحلة الاستنتاج.
وعلى الرغم من مرحلتها المبكرة، فقد جذبت الإعلانات انتباه مراقبي الصناعة. فقد قارن Matthew Prince، الرئيس التنفيذي لشركة Cloudflare، هذا التطور بمكاسب الكفاءة التي حققتها DeepSeek، وهو نموذج ذكاء اصطناعي صيني تم تدريبه بجزء بسيط من تكلفة منافسيه على شرائح أقل قوة مع بقائه منافساً في نتائجه. كما أثار الإعلان مقارنات فكاهية عبر الإنترنت بـ Pied Piper، وهي شركة ناشئة خيالية من المسلسل التلفزيوني Silicon Valley. ففي المسلسل، الذي عُرض من عام 2014 إلى عام 2019، طور مؤسسو الشركة الناشئة خوارزمية ضغط قللت أحجام الملفات بشكل كبير مع ضغط شبه خالٍ من الفقد. وبينما تركز TurboQuant من Google بشكل مشابه على الضغط الشديد دون فقدان الجودة، فإنها تستهدف اختناقاً محدداً في أنظمة الذكاء الاصطناعي بدلاً من ضغط الملفات العام.
لماذا يهم
في حال تطبيقها بنجاح، قد تؤدي TurboQuant إلى خفض تكاليف استنتاج الذكاء الاصطناعي بشكل كبير من خلال تحسين استخدام الذاكرة، مما يمثل خطوة حاسمة في جعل نماذج الذكاء الاصطناعي واسعة النطاق أكثر كفاءة.