الخلفية
احتاجت الشركة المالية إلى قدرات نماذج لغوية متقدّمة، لكن متطلبات الامتثال والخصوصية منعت إرسال البيانات الحسّاسة إلى واجهات سحابية خارجية، كما كانت تكاليف الاستدعاء الخارجي مرتفعة مع النمو.
ما قمنا به
نشرنا نموذج Llama 3.1 محليًا داخل بنية الشركة باستخدام vLLM ضمن حاويات Docker على معالجات NVIDIA، مع طبقة تخزين مؤقت عبر Redis لتسريع الطلبات المتكرّرة. حسّنّا الأداء لخدمة أحجام طلبات كبيرة بزمن استجابة منخفض.
النتيجة
بقيت 100% من البيانات داخل البنية التحتية للشركة، مع خفض تكاليف واجهات API بنسبة 90% وقدرة على معالجة أكثر من 10000 طلب يوميًا بأمان وامتثال كامل.