كشفت دراسات حديثة أن طرح نفس السؤال بلغات مختلفة على نماذج الذكاء الاصطناعي لا يضمن الحصول على إجابة متطابقة، حيث تظهر التباينات في دقة المعلومات والمصطلحات المختارَة وفهم السياق الثقافي العميق لكل لغة.
واوضحت النتائج أن هذه الاختلافات لا تعني تفوق لغة على أخرى، بل ترتبط بشكل وثيق بكيفية تدريب النماذج وتمثيل اللغات داخل بنيتها المعقدة، ومدى جودة البيانات المتاحة لكل لغة وتنوع مصادرها الرقمية.
واضاف باحثون أن النماذج اللغوية الكبيرة تعتمد على كميات ضخمة من النصوص، ولكن توزيع هذه البيانات ليس عادلا بين اللغات، مما يمنح اللغات ذات الحضور الرقمي القوي ميزة في دقة المعالجة والاستجابة.
تفاوت البيانات وتأثيرها على الأداء
وبينت دراسة منشورة أن أداء النماذج يختلف باختلاف اللغة، حيث تلعب المسافة اللغوية وطريقة تقسيم النصوص دورا محوريا في النتائج، والمفارقة أن الإنجليزية ليست دائما الأفضل، إذ تتفوق لغات أخرى في مهام محددة.
واكدت دراسات أخرى أن إضافة بيانات متعددة اللغات قد تحسن أداء اللغات الأقل موارد، لكن الفائدة مرهونة بحجم البيانات والتشابه اللغوي، بينما قد يفرض التوسع المفرط في عدد اللغات قيودا على قدرات النموذج.
واوضحت التقارير أن طريقة تقطيع الكلمات إلى رموز أو توكنات تختلف بين اللغات، واستخدام أدوات تقسيم تتمحور حول الإنجليزية يؤدي غالبا إلى تراجع الأداء عند التعامل مع لغات أخرى بسبب ضعف التمثيل.
اللغة والسياق الثقافي المترابط
وكشفت ابحاث مؤتمر جمعية اللغويات الحاسوبية أن طريقة تقسيم النص تتأثر بالتنوع اللغوي، مما يعني أن السؤالين المتطابقين في المعنى قد لا يصلان إلى معالجات النموذج في صورة متطابقة من الناحية الحسابية.
واظهرت دراسات أخرى وجود تآزر لغوي ثقافي، حيث يكون أداء النماذج أفضل عندما يتوافق السؤال ثقافيا مع اللغة المستخدمة، مما يفرض ضرورة عدم فصل اللغة عن سياقها الثقافي عند تقييم قدرات الذكاء الاصطناعي.
وذكر الخبراء أن النماذج تمتلك معرفة ثقافية محلية لكنها لا تستحضرها تلقائيا، لذا فإن إدخال السياق الثقافي صراحة في السؤال قد يحسن من جودة الإجابة ويجعلها أكثر ملاءمة للبيئة الثقافية المقصودة.
تحديات العربية واللغات الأقل تمثيلا
واكدت ورقة بحثية حول مؤشر بلسم أن العربية تواجه تحديات ندرة البيانات والتنوع اللهجوي والتعقيد الصرفي، مما يؤثر على كفاءة النماذج في تقديم إجابات دقيقة وشاملة مقارنة باللغات الأكثر تمثيلا في البيانات.
واضافت جهود تقنية مثل معيار اراديس أن هناك فجوة واضحة بين العربية الفصحى واللهجات المحلية، مشيرة إلى أن نقص البيانات المحلية يحد من قدرة الأنظمة على فهم المفاهيم الثقافية والاجتماعية الفريدة لكل منطقة.
وبينت منظمة اليونسكو أن تقنيات الذكاء الاصطناعي المدربة على اللغات المهيمنة تفقد فعاليتها عند التعامل مع اللغات الأفريقية واللغات المحلية، مما يعزز الفجوة الرقمية ويقلل من عدالة الوصول إلى المعلومات الموثوقة.
هل نحن أمام تحيز لغوي تقني؟
واوضحت التحليلات أن اختلاف الإجابة لا يعني بالضرورة وجود تحيز متعمد، بل هو نتاج طبيعي لتفاوت البيانات وطرق المعالجة، ومع ذلك فإن هذه الفوارق قد تنتج تحيزا لغويا فعليا في المخرجات النهائية.
وشدد خبراء التقنية على أهمية اختبار النماذج في لغات وثقافات متنوعة بدلا من الاكتفاء بالإنجليزية، لأن السؤال الجوهري أصبح يتعلق بمدى فهم النموذج للسؤال ضمن السياق الثقافي واللغوي الذي نشأ فيه.
واختتم المحللون بأن اختلاف الإجابات يكشف أن النماذج لا تستخرج معلومة ثابتة، بل تبني إجاباتها اعتمادا على تمثيلات تشكلت خلال التدريب، وكلما تنوعت البيانات والسياقات زادت دقة النموذج في فهم واستيعاب البشر.
