آخر تحديث --:--
بيانات السوق المباشرة

بيتكوين...--| إيثريوم...--| بي إن بي...--| سولانا...--| ريبل...--| كاردانو...--| دوجكوين...--| ترون...--| تشين لينك...--| لايتكوين...--

⁦Ataraxos⁩ يهزم نخبة لاعبي ⁦Stratego⁩ بكفاءة تدريب أعلى من ⁦DeepNash⁩

استمع للمقال -- دقيقة
00:00
00:00

Ataraxos يهزم نخبة لاعبي Stratego بكفاءة تدريب أعلى من DeepNash

الصورة الكبرى
حقق نظام Ataraxos نتائج متفوقة في Stratego وألعاب أخرى ذات معلومات مخفية، مع استخدام أقل من واحد على مئة من أمثلة التدريب التي استخدمها DeepNash وفق الباحثين. لكن التطبيقات المقترحة في التفاوض أو الأمن السيبراني أو المناورات العسكرية ما زالت احتمالات بحثية، فيما يضع الفريق قابلية تفسير التوصيات ضمن أولوياته المقبلة.

أعلن باحثون من معهد ماساتشوستس للتكنولوجيا وجامعات كارنيغي ميلون ونيويورك وستانفورد تطوير نظام ذكاء اصطناعي باسم Ataraxos تفوق على لاعبين بشريين من أعلى تصنيف في لعبة Stratego، وفق ورقة بحثية نُشرت في دورية Nature في 30 سبتمبر 2026.

وبحسب الفريق، حقق النظام نتيجة 15-1-4 أمام أقوى لاعب في العالم، وسجّل 39-2 أمام لاعبين بارزين في بطولة العالم للعبة. ويرتبط الإنجاز بنوع من المسائل الاستراتيجية التي لا تكون فيها معلومات جميع الأطراف متاحة، لا بمجرد إتقان لعبة لوحية.

قرارات تحت معلومات مخفية

في Stratego، يرتب كل لاعب 40 قطعة سراً، ولا تُكشف هوية القطع إلا عند مواجهتها. لذلك لا يقرر اللاعب بناءً على وضع معلن بالكامل كما في الشطرنج، بل على تقديرات بشأن قطع الخصم وما قد يستنتجه الخصم بدوره عن ترتيب القطع المقابلة.

ويقول الباحثون إن عدد الترتيبات الممكنة يتجاوز 10 أس 66، ما يجعل فحص جميع السيناريوهات غير عملي. وقد جعل هذا التعقيد اللعبة اختباراً شائعاً لأنظمة الذكاء الاصطناعي التي تتعامل مع المعلومات الناقصة.

استراتيجية متعلمة وتخطيط أثناء المباراة

دُرّب Ataraxos عبر التعلم المعزز باللعب الذاتي لتكوين ما يصفه الباحثون بـ«استراتيجية أساسية». ثم يعدّل اختياراته خلال المباراة بواسطة تخطيط عند لحظة اتخاذ القرار، بدلاً من الاعتماد على تلك الاستراتيجية وحدها.

ويستخدم النظام نموذجاً توليدياً احتماليّاً لتقدير الهويات المرجحة لقطع الخصم المخفية، ثم يقارن الخيارات المستقبلية قبل اختيار الحركة. ولا يعني ذلك الوصول إلى معلومات غير متاحة، بل تكوين تقدير للحالات المحتملة من مجريات اللعب.

وقال الفريق إن Ataraxos تجاوز DeepNash، نظام Google DeepMind السابق للعبة نفسها، مع استخدام أقل من واحد على مئة من أمثلة التدريب وأقل من واحد على ثلاثين من مباريات اللعب الذاتي. ولا تتضمن المادة أرقاماً مستقلة لتكلفة التدريب بالدولار أو لاستهلاك العتاد، لذا تظل المقارنة المعروضة مقياساً لكفاءة التدريب ضمن منهج الباحثين.

اختبارات في ألعاب مختلفة

كيّف الباحثون النظام لاختباره أيضاً في Barrage Stratego، وهي نسخة أسرع من اللعبة، ولعبة الورق التعاونية Hanabi، ولعبة Dou dizhu التي يتعاون فيها لاعبان ضد لاعب ثالث. وقالوا إن النظام حقق أداءً يفوق البشر في كل حالة.

تدعم هذه النتائج قابلية المنهج للتكيف مع قواعد ألعاب متنوعة تتضمن معلومات غير كاملة. لكنها لا تثبت بمفردها أن النظام جاهز لبيئات واقعية مثل التفاوض التجاري أو الأمن السيبراني، وهي استخدامات طرحها الباحثون بوصفها تطبيقات محتملة.

قابلية التفسير قبل الاستخدامات عالية المخاطر

تشير المادة إلى أن أساليب مشابهة قد تساعد متخذي القرار في مواقف تتسم بعدم اليقين والمنافسة، بما في ذلك المناورات العسكرية. إلا أنه لم يُعلن عن اختبار ميداني للنظام في هذه المجالات، رغم أن البحث تلقى تمويلاً جزئياً من مكتب البحوث البحرية الأميركي.

ويقر الفريق بالحاجة إلى بناء أدوات تتيح للبشر فهم قرارات النظام ومراجعتها قبل أي اعتماد عملي. وبحسب الباحثين، يجب أن يبقى القرار النهائي بيد الإنسان عند استخدام توصيات من هذا النوع.

اقرأ أيضاً

المصدر والمنهج

بُني هذا التقرير على المادة الأصلية المنشورة لدى MIT News Economics.

فتح المصدر الأصلي

مقالات ذات صلة

أسواق أكثر. حساب واحد.
bStocks · Stock Options · TradFi Perps على Binance

رابط إحالة تجاري: قد يحصل الموقع على عمولة أو منفعة عند التسجيل أو الاستخدام عبره. لا يمثل توصية استثمارية.