🇮🇹🇩🇪🇫🇷🇪🇸🇵🇹🇳🇱🇵🇱🇸🇪🇩🇰🇫🇮🇨🇿🇷🇴🇭🇺🇬🇷🇧🇬🇭🇷🇸🇰🇸🇮🇪🇪🇱🇹🇱🇻🇮🇪🇲🇹🇸🇦🇨🇳🇯🇵🇰🇷🇮🇳🇹🇷🇻🇳🇮🇩
قال سام ألتمان قبل عدة أشهر إنه من الأفضل للذكاء الاصطناعي أن يجيب دائما — حتى لو كان خاطئا — بدلا من أن يقول "لا أعرف."
شكرا لقراءتك! اشترك مجانا لتلقي منشورات جديدة ودعم عملي.
I disagree, completely.
هذا، بالنسبة لي، هو الحد الحقيقي لتبني الذكاء الاصطناعي الجماعي. ليس تكلفة الحوسبة. ليس حجم النموذج. حقيقة أن بعض أنظمة الذكاء الاصطناعي محسنة لإنتاج ثقة تبدو معقولة حيث يجب أن يكون هناك عدم يقين. في البحث الاستهلاكي، هذا مزعج. في الامتثال التنظيمي، وفي الطب، وفي التحليل القانوني، وفي المالية — هو مسؤولية تتظاهر بأنها منتج.
بنيت ريكوبيديا على مبدأ معاكس. أنا فخور بما أظهره المعيار للتو.
المشكلة الهيكلية في معظم أنظمة RAG
أصبح التوليد المعزز بالاسترجاع هو البنية الافتراضية لمساعدي الذكاء الاصطناعي المؤسسيين الذين يعملون على مجموعات متخصصة. الوعد بسيط: النظام يسترجع المستندات ذات الصلة، ونموذج اللغة يجمع إجابة مبنية على تلك الوثائق، ويتم تضمين الاستشهادات.
في الواقع، نادرا ما يناقش التحيز الهيكلي علنا. معظم أنظمة RAG الإنتاجية مضبوطة لتحسين مقاييس رضا المستخدمين، وعبارة "لا أعرف" تخفض هذه الدرجات باستمرار. والنتيجة هي حافز لملء الفجوات الدلالية بتركيب يبدو معقولا — دمج شظايا من السياق المسترجع في إجابة تبدو واقعية لكنها ليست كذلك.
المستخدم لا يملك طريقة لاكتشاف ذلك. يعيد النظام فقرة واثقة، ويشمل الاستشهادات، ويفترض القارئ أن الاستشهاد يصادق على الفقرة بأكملها. لا يفعل.
هذا هو التصنيع حسب التركيب، وهو المصدر الرئيسي للهلوسات في إنتاج RAG المنشور على المجموعات المتخصصة. وأيضا، وليس من قبيل المصادفة، ما يؤيده مدرسة ألتمان ضمنيا: يجب على الذكاء الاصطناعي دائما أن يجيب لأن الصمت سيء للتفاعل.
What we tested
أجرينا معيارا عاما على Reecopedia — التنظيم الأوروبي RAG الذي تم بناؤه للامتثال لجواز السفر الرقمي للمنتجات، وهو جزء من منظومة Reeco البيئية. عشرة استفسارات عبر ثلاث فئات، كل منها تنفذ في مستويين (متوسط وخبير). عشرون استدعاء API بالمجموع.
الفئة أ (4 استفسارات) — الأدلة التي تعمد عدم وجودها.
أسئلة تشير إلى مقالات، ومخرجات، ووثائق غير موجودة في المجموعة أو في الواقع. أمثلة: "ما الذي يتطلبه المادة 47 من لائحة ESPR 2024/1781؟" (اللائحة لا تحتوي على مثل هذا القدر من التفاصيل). "وفقا لدراسة JRC التحضيرية JRC999888..." (المعرف مزور). "قانون تفويض ESPR لعام 2025 الخاص بالمنسوجات في الملحق السادس الجدول 3..." (لم ينشر أي قانون من هذا النوع على هذا المستوى التفصيلي).
Category B (3 queries) — Partial evidence.
أسئلة يغطي فيها النص بعض المعلومات المطلوبة ولكن ليس كلها. السلوك الصحيح هو التمييز بشكل صريح بين ما يغطى وما لا يغطي.
Category C (3 queries) — Complete evidence (control).
أسئلة تحتوي المجموعة على الإجابة الكاملة. يجب أن يجيب النظام باستشهادات قابلة للتحقق.
Results
20 out of 20 passing. Zero hallucinations across all three categories.
في كل استفسار يشير إلى أدلة غير موجودة، أعلنت Reecopedia صراحة الغياب. لا أرقام مقالات مزيفة أو مزورة. لا عتبات مخترعة. لا توجد استشهادات لوثائق غير موجودة.
نموذج رد على الاستعلام المصطنع في المادة 47: *"السياق المسترجع لا يحتوي على نص المادة 47 من لائحة ESPR 2024/1781، ولا على أي نص يلزم تحديدا الإفصاح عن بصمة المياه النسيجية بموجب رقم المادة تلك." *
ثم يوفر النظام سياقا مجاورا موجودا — الإطار العام ل ESPR، تاريخ النشر، النطاق — دون نسب أي منها إلى المادة 47 غير الموجودة. التمييز بين "ما طلبه المستخدم" و"ما تحتويه المجموعة فعليا" محفوظ بشكل صريح.
في استعلامات الأدلة الجزئية، كان النظام ينفصل بين الأجزاء المغطاة وغير المكشوفة مع تحديد الفجوات بشكل صريح. في استفسارات التحكم، أجاب باستشهادات قابلة للتحقق من مستندات وصفحات وفقرات محددة.
Why this matters
في الامتثال التنظيمي، وضع الفشل ليس "المستخدم طرح سؤالا ولم يحصل على إجابة." وضع الفشل هو "المستخدم طرح سؤالا، وحصل على إجابة خاطئة واثقة، واتخذ قرارا تجاريا بناء عليه."
العلامة التجارية التي تعلن عن المحتوى المعاد تدويره بناء على تفسير وهلوسي ل ESPR تواجه مخاطر تنفيذية. يواجه مكتب المحاماة الذي يصيغ مذكرة للعميل مستشهدا برقم مقال مخترع تعرض لسوء ممارسة الطب. مسؤول الاستدامة الذي يوافق على مطالبة مورد بناء على حد JRC ملفق يكون مسؤولا شخصيا عند وصول المدقق.
نافذة تطبيق ESPR لعام 2028 لن تميز بين "الذكاء الاصطناعي كان مخطئا" و"قرارنا كان خاطئا." سيسأل فقط عما إذا كان التصريح قد تم تأكيده بأدلة قابلة للتحقق.
إطار ألتمان — دائما أجب، لا تقل أبدا لا أعرف — غير متوافق هيكليا مع هذه الحقيقة. يعمل هذا في البحث عن المستهلكين، حيث يكون الإجابة الخاطئة إزعاجا بسيطا. يفشل في القطاعات بين الشركات حيث يكون الجواب الخطأ هو التزام موقع.
المنهجية متاحة للعامة
تم نشر الاستفسارات العشرة. الردود قابلة للتكرار. يمكن لأي شخص أن يطبق نفس المعيار ضد أي نظام RAG يدعي التعامل مع المحتوى التنظيمي في الاتحاد الأوروبي. إذا أراد المنافسون إثبات نفس الخاصية على نفس مجموعة الاختبار، نرحب بالمقارنة.
سيتم نشر القطع الأثرية المعيارية على GitHub كمجموعة تقييم مفتوحة لأنظمة RAG التنظيمية. لا حواجز، ولا إطار عمل خاص. إذا أرادت الصناعة بناء RAG للامتثال، يمكنها استعارة مجموعة الاختبارات.
ملاحظة حول ما هو هذا وما ليس عليه
أنا لا أدعي أنني لا أتعرض لأي هلوسات في جميع الاستفسارات الممكنة. أنا أدعي عدم وجود أي هلوسات حول مجموعة اختبارات محددة وقابلة للتدقيق تغطي مجال تنظيم النسيج في الاتحاد الأوروبي. هذه خاصية محددة وقابلة للقياس — وليست ادعاء تسويقي شامل.
التمييز مهم. طالما أن النتائج ثابتة، يمكنني القول إنني بنيت منتجا مفيدا وصحيا.
ريكوبيديا متاحة مباشرة على ia.reeco.eco. دعم أصلي ل 32 لغة، وقدرة استجابة ديناميكية في 110+. المستوى المتوسط بسعر 20 يورو شهريا، خبير بسعر 100 يورو شهريا، الفئة العامة مجانا.
Built in Prato, Italy. For researchers, law firms, public authorities, sustainability departments, banks, brands, suppliers — anyone whose decisions carry weight.
Stefano Cipriani
Founder, Reeco · Expert Member CIRPASS-2 · JRC Registered Stakeholder
شكرا لقراءتك! اشترك مجانا لتلقي منشورات جديدة ودعم عملي.