دراسة من ETH Zurich: نماذج اللغة قد تربط حسابات مستعارة بهويات حقيقية من بيانات عامة
تبحث ورقة صدرت في فبراير، وعاد تداولها هذا الأسبوع، في قدرة نظام يعتمد على نماذج اللغة والبحث على الويب على مطابقة حسابات مستعارة بملفات LinkedIn عامة ضمن اختبارات مضبوطة. وتظهر النتائج أن الأتمتة قد تخفض كلفة ووقت محاولات الربط، لكنها لا تثبت إمكان كشف هوية أي حساب مجهول تلقائياً أو بالنتائج نفسها عبر الإنترنت.
تقول ورقة بحثية صدرت في فبراير عن باحثين من المعهد الفدرالي السويسري للتكنولوجيا في زيورخ ETH Zurich ومجموعة أبحاث سلامة الذكاء الاصطناعي MATS، بمشاركة الباحث في Anthropic نيكولاس كارليني، إن نماذج اللغة الكبيرة يمكن أن تساعد في ربط بعض الحسابات المستعارة بهويات واقعية بالاعتماد على منشورات عامة ونتائج بحث مفتوحة. وعادت الورقة إلى التداول هذا الأسبوع مع تفسيرات واسعة النطاق تفيد بأن إخفاء الهوية على الإنترنت انتهى، وهي خلاصة لا تدعمها نتائج الدراسة وحدها.
الورقة، المعنونة Large-scale online deanonymization with LLMs، لا تصف اختراق حسابات أو تسريب بيانات أو استخدام وصول داخلي إلى المنصات. بل تختبر سلسلة خطوات تبدأ باستخراج إشارات من النصوص المنشورة، ثم البحث عن ملفات مرشحة ومقارنة التفاصيل المتاحة علناً لتقدير مدى توافق هوية محتملة مع حساب مستعار.
اختبار Hacker News حقق 226 مطابقة صحيحة
في أحد الاختبارات، جمع الفريق 338 مستخدماً من منتدى Hacker News كانت ملفاتهم تتضمن رابطاً إلى LinkedIn، ثم أزال الإشارات التعريفية الواضحة وطلب من نظام آلي البحث عن هوياتهم عبر الويب. ووفقاً لما نقلته Decrypt عن الدراسة، حدّد النظام 226 شخصاً بصورة صحيحة، أو نحو 67% من العينة.
وتشير المادة المصدر إلى أن دقة التخمينات التي اختار النظام إعلانها بلغت قرابة 90%، ما يعني أن نحو تخمين واحد من كل عشرة كان خاطئاً. ويختلف ذلك عن «الاستدعاء»، الذي يقيس نسبة الهويات الحقيقية التي عثر عليها النظام من إجمالي الحالات الممكنة.
وفي اختبار ضمن مجموعة مرشحين أكبر تضم 89 ألف شخص، حقق أقوى الأساليب نحو نصف المطابقات الصحيحة عند مستوى دقة بلغ 90%، بحسب المصدر. وتظهر هذه النتيجة أن اتساع مجموعة المرشحين يجعل المطابقة أصعب، حتى عندما يحافظ النظام على عتبة ثقة مرتفعة في التنبؤات التي يقدمها.
سلسلة بحث واستدلال لا قدرة سحرية على معرفة الهوية
قسّم الباحثون العملية إلى أربع مراحل: الاستخراج والبحث والاستدلال والمعايرة. في مرحلة الاستخراج، يلخص نموذج اللغة ما قد تدل عليه منشورات المستخدم بشأن موقعه المحتمل أو عمله أو اهتماماته أو تفاصيل لغوية وشخصية متفرقة. ثم تُحوَّل هذه الإشارات إلى تمثيل رقمي يساعد على العثور على ملفات عامة متشابهة بين عدد كبير من المرشحين.
بعد ذلك، يقارن نموذج أقوى بين عدد محدود من المرشحين والتفاصيل المتاحة علناً، قبل أن يقدّر ثقته في النتيجة ويمتنع عن التخمين في الحالات غير الواضحة. لذلك، تصف الدراسة أتمتة سلسلة من أعمال البحث والمقارنة، لا نموذجاً يستطيع معرفة هوية أي شخص من منشور واحد.
وتقدر الورقة كلفة تشغيل البحث الواحد بين دولار وأربعة دولارات، وفقاً للمادة المصدر. وإذا أمكن تكرار هذا التقدير في بيئات أخرى، فقد يكون خفض كلفة الفرز الأولي هو الجانب الأبرز في النتائج. لكن الرقم لا يثبت كفاءة ثابتة عبر المنصات أو مجموعات المستخدمين المختلفة.
تصميم التجربة يحد من تعميم النتائج
تطلب قياس النجاح أن تكون هوية المشاركين معروفة للباحثين مسبقاً. ففي عينة Hacker News، اختير مستخدمون سبق أن ربطوا حساباتهم بملفات LinkedIn. وفي سيناريوهات أخرى، فصل الباحثون أجزاء من تاريخ منشورات الشخص نفسه ثم اختبروا قدرة النظام على الربط بينها.
وهذا تصميم مفيد لاختبار القدرة التقنية، لكنه لا يثبت أن حساباً مستعاراً عشوائياً، لا يرتبط صاحبه بملف علني، يمكن كشف هويته بالسهولة نفسها. كما لا تقدم المعلومات المتاحة تقديراً موحداً لنسبة الحسابات المعرضة فعلياً أو لنتائج مماثلة عبر شبكات مثل Reddit وX.
وفي اختبار منفصل شمل نصوص مقابلات بحثية مع 125 عالماً لدى Anthropic، تعرّف النظام إلى تسعة أشخاص على الأقل من طريقة وصفهم لأعمالهم، بحسب المصدر. ويضيف ذلك مثالاً آخر على إمكان استخدام الإشارات النصية المتراكمة، لكنه لا يحوّل النتيجة إلى قياس شامل لمخاطر إخفاء الهوية على الإنترنت.
الباحثون لم ينشروا أدوات المطابقة أو الهويات
ذكرت المادة أن الباحثين لم ينشروا الشفرة البرمجية أو المطالبات المستخدمة أو الهويات الحقيقية التي توصّلوا إليها، وقالوا إن الدراسة مرت بمراجعة لجنة الأخلاقيات في ETH Zurich قبل نشرها. ولا يحدد المصدر ما إذا كانت الورقة خضعت لمراجعة علمية محكمة.
إعادة ربط بيانات تبدو مجهولة بهويات حقيقية ليست فكرة جديدة، لكن الدراسة تختبر استخدام نماذج اللغة في التعامل مع نصوص غير منظمة، مثل التعليقات والنكات والإشارات العابرة إلى العمل أو المدينة أو الاهتمامات. وتتمثل دلالتها، ضمن حدود تجربتها، في أن جمع هذه الإشارات والبحث عنها ومقارنتها قد يصبح أسرع وأقل كلفة.
ولا يعني ذلك أن الأسماء المستعارة فقدت قيمتها، بل إن حذف الاسم الصريح وحده قد لا يكون كافياً عندما تتراكم تفاصيل قابلة للربط عبر سنوات ومنصات متعددة.
اقرأ أيضاً
- ما هو TVL في العملات الرقمية؟ ومتى يصبح مقياسًا مضللًا؟
- البيتكوين يتفوق على الذهب: العملة الرقمية تشتري أكثر من 18 أونصة
- ما هو Gas في العملات الرقمية؟ ولماذا تختلف الرسوم بين الشبكات؟
حول المصدر
المعلومات الأساسية في هذا التقرير مأخوذة من Decrypt.
الانضمام إلى المحادثة