الـ evals لوكلاء الذكاء الاصطناعي: كيف تعرف أنه يعمل قبل أن يخبرك عميل
ما هي مجموعة التقييم لوكيل ذكاء اصطناعي، وكيف تبنيها من حالات حقيقية في عملك، وكيف تستخدمها لرصد تراجع الجودة قبل أن يشتكي عميل.
حُدِّثت في 5 أغسطس 2026
إجابة مختصرة
أتمتة عملية محدودة بالذكاء الاصطناعي تبدأ بين 3,000 و8,000 دولار، أما وكيل مرتبط بعدة أنظمة فيقع بين 12,000 و40,000 دولار. ويُضاف إلى ذلك من 150 إلى 1,200 دولار شهريًا للتشغيل: النماذج والبنية التحتية والصيانة. والربط بالأنظمة هو ما يرفع السعر، لا النموذج.
معظم الإجابات عن هذا السؤال عديمة الفائدة للسبب نفسه: تعطيك نطاقًا من 500 إلى 80,000 دولار وتقول «حسب الحالة». وهي فعلًا حسب الحالة. لكنها تعتمد على أمور محددة يمكن تعدادها، ومتى عرفتها استطعت تقدير حالتك بدقة معقولة قبل طلب أي عرض سعر.
هذا هو التفصيل الذي نستخدمه داخليًا لتسعير العمل. ليس قائمة أسعار، بل خريطة لما يحرّك الرقم.
عمليًا، تقع المشاريع في ثلاث فئات متمايزة، والقفزة بينها ليست تدريجية.
| النوع | التكلفة الأولية | شهريًا | ما هو |
|---|---|---|---|
| مسار عمل محدود | 3,000 – 8,000 دولار | 150 – 400 دولار | عملية واحدة، بقواعد واضحة |
| وكيل مرتبط بالأنظمة | 12,000 – 40,000 دولار | 400 – 1,200 دولار | يقرّر، ويطلب الاعتماد |
| نظام متعدد العمليات | أكثر من 40,000 دولار | أكثر من 1,200 دولار | وكلاء منسَّقون |
الفئة الأولى قارئ فواتير يُدخلها إلى نظام ERP ويرفع ما لا يُطابَق. والثانية وكيل يستقبل الطلبات عبر واتساب، ويتحقق من المخزون، ويجهّز الطلب، ويصعّد إلى مندوب حين يخرج الخصم عن السياسة. والثالثة منصة، وتظهر عادةً بعد نجاح الثانية.
وإذا سعّر مورّد شيئًا من الفئة الثانية بـ 1,500 دولار، فهو لا يسعّر ما طلبته.
هذا البند يلتهم نصف الميزانية، ولا يطرحه أحد في الاجتماع الأول. الربط بـ HubSpot نصف يوم. أما الربط بنظام ERP محلي غير موثَّق يُوصل إليه عبر قاعدة SQL Server هيّأها أحدهم في 2014، فأسبوعان إلى ثلاثة قبل كتابة سطر واحد من منطق الوكيل.
والسؤال الأكثر تأثيرًا في ميزانيتك ليس «أي نموذج ستستخدمون؟»، بل: هل لأنظمتك واجهة برمجية موثَّقة وبيئة اختبار؟ إذا كان الجواب نعم للاثنين، فالمشروع أرخص بنسبة 30% إلى 50%.
مسار ينقل البيانات من ألف إلى باء دون أن يقرّر شيئًا رخيص ويتصرّف بالطريقة نفسها كل يوم. أما وكيل عليه تفسير رسالة ملتبسة، والاختيار بين خمسة إجراءات ممكنة، ومعرفة متى لا يفعل شيئًا، فذلك عمل مختلف: عليك تحديد الحدود، وبناء مجموعة التقييم، والقياس، والتصحيح. راجع لماذا يفشل وكلاء الذكاء الاصطناعي في بيئة التشغيل لترى ما ينكسر حين يُتخطّى هذا العمل.
وكيل يكتب مسوّدات ردود يراجعها شخص كلفة خطئه شبه معدومة ويمكن إطلاقه سريعًا. أما وكيل يصدر إشعارات دائنة وحده فيحتاج إلى ضوابط، وسجل تدقيق لكل إجراء، وحدود للمبالغ، وقابلية للتراجع، وتنبيهات. وهذا يعني 20% إلى 40% ساعات إضافية على المشروع نفسه.
وهو غير قابل للتفاوض، لكنه قرار نطاق: في النسخة الأولى يكون الصواب دائمًا تقريبًا ترك الإجراء غير القابل للتراجع بيد شخص، وأتمتته لاحقًا بعد ثلاثة أشهر من البيانات تُظهر كم مرة يخطئ.
يقول الحدس إن عشرة أضعاف الحجم تكلّف عشرة أضعاف. ونادرًا ما يصحّ ذلك في هذه الأنظمة: الفرق بين معالجة 500 و5,000 مستند شهريًا بضعة دولارات من كلفة النموذج، ولاحقًا طابور مهام. ولا يبدأ الحجم في التأثير جديًا إلا فوق عشرات الآلاف من العمليات شهريًا.
كلفة البناء هي ما يُناقَش. وكلفة التشغيل هي ما يفاجئ الناس.
الوكيل في بيئة التشغيل يحتاج، شهرًا بعد شهر، إلى:
وهذه النقطة الأخيرة تفصل مشروعًا لا يزال يعمل بعد عامين عن مشروع انطفأ بهدوء في شهره الرابع. فالوكيل الذي لا يراقبه أحد لا يفشل برسالة خطأ — بل يتدهور، فيجيب بصورة أسوأ قليلًا كل أسبوع، إلى أن يذكر أحد موظفي الدعم عرضًا أن «البوت صار يقول أشياء غريبة مؤخرًا».
اعمل هذا الحساب قبل طلب العروض. وإن لم يخرج لصالحك، فلن يصلح ذلك أي مورّد.
مثال واقعي: 22 ساعة أسبوعيًا في إدخال الطلبات، وكلفة محمَّلة 12 دولارًا للساعة، و70% قابل للأتمتة. يعني ذلك نحو 8,000 دولار توفيرًا سنويًا مقابل بناء بـ 6,500 دولار و250 دولارًا شهريًا. تسدّد كلفتها في السنة الأولى، ومن السنة الثانية تصبح العملية مجانية عمليًا.
بعد قراءة عدد لا بأس به من العروض — عروضنا وعروض غيرنا — هذه أكثر العلامات التي تنبّأت بأن المشروع سيسير سيرًا سيئًا:
النطاق الصادق لعملية حقيقية في شركة هو من 3,000 إلى 40,000 دولار، وضمن هذا النطاق تتحدد حالتك بحال أنظمتك تحديدًا شبه كامل، لا بمدى تطوّر الذكاء الاصطناعي. وقبل مقارنة العروض، اذهب واعرف إن كان لنظام ERP لديك واجهة برمجية وبيئة اختبار: هذه الإجابة وحدها تحرّك الرقم أكثر من أي قرار تقني تتخذه بعدها.
وإذا أعطاك حساب العشر دقائق فترة استرداد تتجاوز 18 شهرًا، فالاستنتاج الصحيح ليس أن «الذكاء الاصطناعي غالٍ»، بل أن هذه هي العملية الخطأ للبدء بها.
بقلم
فريق Vantalogics
وكالة أنظمة ذكاء اصطناعي. نؤتمت العمليات ونبني وكلاء مُقيَّمين ومراقَبين لشركات في الخليج وإسبانيا والولايات المتحدة وأمريكا اللاتينية.
ما هي مجموعة التقييم لوكيل ذكاء اصطناعي، وكيف تبنيها من حالات حقيقية في عملك، وكيف تستخدمها لرصد تراجع الجودة قبل أن يشتكي عميل.
الأعطال الستة التي تظهر حين يخرج وكيل الذكاء الاصطناعي من العرض التقديمي ويبدأ التعامل مع عملاء حقيقيين، ولماذا لا يظهر أي منها في الاختبار، وكيف يُمنع كل واحد منها.