التوثيق / أساسيات LLM

أساسيات نماذج اللغة الكبيرة (LLM)

قبل الانتقال إلى العملاء الأذكياء والبروتوكولات، من المهم فهم ما يجري تحت غطاء محرك نموذج اللغة الكبير. هذه الصفحة هي الأساس المفاهيمي لجميع الصفحات الأخرى في هذا التوثيق.

Transformer Tokenization Context Window

ما هو LLM بالضبط؟

نموذج اللغة الكبير هو شبكة عصبية دُرّبت على كمّ هائل من النصوص لأداء مهمة بسيطة لكنها قوية: بالنظر إلى تسلسل من النص، التنبؤ بأكثر "الرمز التالي" احتمالًا. من خلال تكرار هذا التنبؤ، رمزًا تلو الآخر، تُبنى الجمل والفقرات. والمثير للدهشة أن قدرات مثل الاستدلال والتلخيص والترجمة، بل وحتى كتابة الكود، تنبثق من هذه المهمة البسيطة ظاهريًا.

التجزئة إلى رموز (Tokenization)

لا تتعامل نماذج اللغة مباشرة مع الأحرف أو الكلمات؛ بل يُقسَّم النص أولًا إلى وحدات أصغر تُسمى الرموز (tokens) (يمكن أن تكون كلمة كاملة، أو جزءًا من كلمة، أو حتى حرفًا واحدًا). على سبيل المثال، قد تُقسَّم عبارة "hello world" إلى رمزين أو ثلاثة. كما تُحتسب تكلفة استخدام معظم واجهات برمجة تطبيقات نماذج اللغة بناءً على عدد هذه الرموز، لا عدد الأحرف أو الكلمات.

معمارية المحوّلات (Transformer)

تكاد جميع نماذج اللغة الكبيرة اليوم تُبنى على معمارية Transformer التي قُدّمت عام 2017. آليتها الأساسية هي الانتباه الذاتي (Self-Attention): للتنبؤ بكل رمز، ينظر النموذج إلى جميع الرموز السابقة ويُعطي "وزنًا" لأهمية كل منها في هذا التنبؤ. تتيح هذه الآلية للنموذج فهم الروابط بعيدة المدى في النص (مثل تذكّر فاعل جملة ذُكر قبل ثلاثة أسطر).

Input Text Tokenizer Transformer Layers Self-Attention Next Token Probability

مراحل التدريب

  1. التدريب المسبق (Pretraining) — يتدرّب النموذج على كمّ هائل من النصوص العامة (الويب، الكتب، الكود) ليتعلّم اللغة والمعرفة العامة.
  2. الضبط الدقيق (Fine-tuning) — يُضبط النموذج بدقة على مجموعات بيانات أصغر وأكثر تحديدًا (مثل المحادثة أو التعليمات).
  3. RLHF / المحاذاة (Alignment) — بالاستفادة من ملاحظات بشرية، يتعلّم النموذج تقديم إجابات أكثر فائدة وأمانًا وتوافقًا مع نية المستخدم.

نافذة السياق (Context Window)

لا يملك النموذج في كل استدعاء سوى وصول محدود إلى النص (مقاسًا بالرموز) كـ"ذاكرة عمل"؛ يُطلق على هذا النطاق نافذة السياق. أي شيء خارج هذه النافذة لا وجود له عمليًا بالنسبة للنموذج في ذلك الاستدعاء المحدد — وهذا القيد هو السبب الرئيسي للحاجة إلى مفاهيم مثل RAG و ذاكرة العميل.

كتابة المحفزات الأساسية

تستقبل معظم واجهات برمجة تطبيقات نماذج اللغة اليوم المحادثة كقائمة من الرسائل ذات دور محدد:

[
  { "role": "system", "content": "You are an online store assistant." },
  { "role": "user", "content": "How much is the model X wireless headset?" }
]

يحدّد دور system السلوك العام للنموذج، وuser هو رسالة المستخدم، وassistant هو رد النموذج.

معاملات أخذ عيّنات المخرجات (فك الترميز)

يُنتج النموذج في كل خطوة توزيعًا احتماليًا على كامل المفردات الممكنة للرمز التالي، لا إجابة قطعية واحدة. أما أيّ رمز يُختار من ذلك التوزيع، فيعتمد على عدة معاملات قابلة للضبط:

  • Temperature — مقدار "المخاطرة" في الاختيار. قيمة قريبة من الصفر تعني اختيار الرمز الأكثر احتمالًا دائمًا (مخرجات أكثر قابلية للتنبؤ وتكرارًا)؛ وقيمة أعلى (مثلًا أكبر من 1) تمنح الرموز الأقل احتمالًا فرصةً أيضًا (مخرجات أكثر تنوعًا لكن بخطر أعلى للخطأ).
  • Top-p (أخذ العيّنات النووي) — بدلًا من النظر إلى كامل المفردات، يختار النموذج فقط من أصغر مجموعة من الرموز التي يصل مجموع احتمالاتها إلى p (مثلًا 0.9). يُدمج هذا مع Temperature للتحكم في التنوّع مع استبعاد الرموز غير ذات الصلة ذات الاحتمال المنخفض جدًا تمامًا.
  • Top-k — مشابه لـ Top-p، لكن بدلًا من عتبة احتمالية، يُؤخذ بعين الاعتبار عدد ثابت من أكثر الرموز احتمالًا (مثلًا أفضل 40 رمزًا).

بالنسبة للاستخدامات التي تتطلّب الدقة والثبات (مثل استخراج البيانات المهيكلة أو استدعاء الأدوات في عميل ذكي)، عادةً ما تُختار قيمة Temperature أقل؛ أما لتوليد محتوى إبداعي، فتُختار قيمة أعلى.

القيود

  • الهلوسة (Hallucination) — قد يُنتج النموذج معلومات غير صحيحة بثقة تامة.
  • حدّ المعرفة (Knowledge Cutoff) — لا "يعرف" النموذج سوى ما تدرّب عليه حتى تاريخ معيّن.
  • قيود نافذة السياق — لا يمكنه معالجة كمية غير محدودة من النص في وقت واحد.
  • عدم الحتمية (Non-determinism) — قد تختلف الإجابة عن نفس المدخل قليلًا في كل مرة.

لماذا تهم هذه الأساسيات التجارة الوكيلية؟

عندما يكون على عميل ذكاء اصطناعي إتمام عملية شراء نيابةً عن المستخدم، تؤثر هذه القيود ذاتها مباشرةً على تصميم نظامك: حدّ المعرفة يعني أن على العميل جلب معلومات لحظية (مثل توفر المخزون) عبر أداة — وهذا بالضبط ما يُتيحه MCP. وقيد نافذة السياق يعني عدم إمكانية وضع كامل كتالوج المنتجات في محفّز واحد، ما يستدعي استرجاعًا ذكيًا — وهو موضوع صفحة RAG.

الأسئلة الشائعة

هل يُفكّر نموذج اللغة الكبير فعلًا؟

من الناحية التقنية، يقوم النموذج بتنبؤ إحصائي بالرمز التالي، لا باستدلال على الطريقة البشرية. لكن عمليًا، هذا التنبؤ الإحصائي على نطاق واسع يُنتج سلوكًا يشبه الاستدلال إلى حد كبير.

ما الفرق بين معاملات النموذج (parameters) والرموز (tokens)؟

المعاملات هي الأوزان الداخلية للشبكة العصبية التي تُضبط أثناء التدريب (وتصبح ثابتة بعده)؛ أما الرموز فهي وحدات النص التي تمر عبر النموذج أثناء الاستخدام.