مستندات / مبانی LLM

مبانی مدل‌های زبانی بزرگ (LLM)

قبل از سراغ رفتن به ایجنت‌ها و پروتکل‌ها، باید بدانیم زیر کاپوت یک مدل زبانی بزرگ چه می‌گذرد. این صفحه پایه‌ی مفهومی تمام صفحات دیگر این مستندات است.

Transformer Tokenization Context Window

LLM دقیقاً چیست؟

یک مدل زبانی بزرگ (Large Language Model) شبکه‌ی عصبی‌ای است که روی حجم عظیمی از متن آموزش دیده تا یک کار ساده اما قدرتمند را انجام دهد: با دیدن یک دنباله از متن، محتمل‌ترین «توکن بعدی» را پیش‌بینی کند. با تکرار همین پیش‌بینی، توکن به توکن، جمله و پاراگراف ساخته می‌شود. نکته‌ی شگفت‌انگیز این است که از دل همین کار به‌ظاهر ساده، توانایی‌هایی مثل استدلال، خلاصه‌سازی، ترجمه و حتی نوشتن کد بیرون می‌آید.

توکن‌سازی (Tokenization)

مدل‌های زبانی مستقیماً با حروف یا کلمات کار نمی‌کنند؛ متن ابتدا به واحدهای کوچک‌تری به نام توکن شکسته می‌شود (می‌تواند یک کلمه، بخشی از یک کلمه، یا حتی یک نویسنده باشد). برای مثال «سلام دنیا» ممکن است به دو یا سه توکن تقسیم شود. هزینه‌ی استفاده از اکثر APIهای مدل‌های زبانی هم بر اساس تعداد همین توکن‌ها محاسبه می‌شود، نه تعداد کاراکتر یا کلمه.

معماری ترنسفورمر

تقریباً تمام LLMهای امروزی بر پایه‌ی معماری Transformer ساخته شده‌اند که در سال ۲۰۱۷ معرفی شد. مکانیزم کلیدی آن Self-Attention است: برای پیش‌بینی هر توکن، مدل به تمام توکن‌های قبلی نگاه می‌کند و «وزن» می‌دهد که کدام‌یک برای این پیش‌بینی مهم‌تر هستند. همین مکانیزم به مدل اجازه می‌دهد وابستگی‌های دوردست در متن را درک کند (مثلاً فاعل یک جمله را در سه خط قبل‌تر به خاطر بسپارد).

Input Text Tokenizer Transformer Layers Self-Attention Next Token Probability

مراحل آموزش

  1. Pretraining — مدل روی حجم عظیمی از متن عمومی (وب، کتاب، کد) آموزش می‌بیند تا زبان و دانش عمومی را یاد بگیرد.
  2. Fine-tuning — مدل روی مجموعه‌داده‌های کوچک‌تر و هدفمندتر (مثلاً مکالمه یا دستورالعمل) تنظیم دقیق می‌شود.
  3. RLHF / Alignment — با بازخورد انسانی، مدل یاد می‌گیرد پاسخ‌های مفیدتر، ایمن‌تر و همسوتر با نیت کاربر بدهد.

پنجره کانتکست (Context Window)

مدل در هر فراخوانی فقط به مقدار محدودی متن (اندازه‌گیری‌شده بر حسب توکن) به‌عنوان «حافظه‌ی کاری» دسترسی دارد؛ به این محدوده پنجره کانتکست می‌گویند. هر چیزی خارج از این پنجره، برای مدل در آن فراخوانی خاص عملاً وجود ندارد — همین محدودیت، دلیل اصلی نیاز به مفاهیمی مثل RAG و حافظه ایجنت است.

پرامپت‌نویسی پایه

اکثر APIهای مدل‌های زبانی امروزی، مکالمه را به‌شکل فهرستی از پیام‌ها با نقش مشخص دریافت می‌کنند:

[
  { "role": "system", "content": "شما یک دستیار فروشگاه آنلاین هستید." },
  { "role": "user", "content": "قیمت هدفون بی‌سیم مدل X چقدر است؟" }
]

نقش system رفتار کلی مدل را تعیین می‌کند، user پیام کاربر است، و assistant پاسخ مدل.

پارامترهای نمونه‌گیری خروجی (Decoding)

مدل در هر قدم یک توزیع احتمال روی کل واژگان ممکن برای توکن بعدی تولید می‌کند، نه یک پاسخ قطعی. این‌که کدام توکن از آن توزیع انتخاب شود، به چند پارامتر قابل‌تنظیم بستگی دارد:

  • Temperature — میزان «ریسک‌پذیری» در انتخاب. مقدار نزدیک به صفر یعنی همیشه محتمل‌ترین توکن انتخاب شود (خروجی قابل‌پیش‌بینی‌تر و تکراری‌تر)؛ مقدار بالاتر (مثلاً ۱ به بالا) یعنی توکن‌های کم‌محتمل‌تر هم شانس انتخاب دارند (خروجی متنوع‌تر اما ریسک خطای بیشتر).
  • Top-p (Nucleus Sampling) — به‌جای در نظر گرفتن کل واژگان، مدل فقط از کوچک‌ترین مجموعه‌ی توکن‌هایی انتخاب می‌کند که مجموع احتمالشان به p می‌رسد (مثلاً ۰.۹). با Temperature ترکیب می‌شود تا هم تنوع کنترل شود، هم توکن‌های بی‌ربط با احتمال خیلی پایین کاملاً حذف شوند.
  • Top-k — مشابه Top-p، اما به‌جای آستانه‌ی احتمال، تعداد ثابتی از محتمل‌ترین توکن‌ها (مثلاً ۴۰ تای برتر) در نظر گرفته می‌شود.

برای کاربردهایی که نیاز به دقت و ثبات دارند (مثل استخراج اطلاعات ساختاریافته یا فراخوانی ابزار در یک ایجنت)، معمولاً Temperature پایین‌تر انتخاب می‌شود؛ برای تولید محتوای خلاقانه، مقدار بالاتر.

محدودیت‌ها

  • Hallucination — مدل ممکن است با اطمینان کامل، اطلاعات نادرست تولید کند.
  • محدودیت دانش (Knowledge Cutoff) — مدل فقط چیزهایی را «می‌داند» که تا زمان آموزش دیده است.
  • محدودیت پنجره کانتکست — نمی‌تواند حجم نامحدودی از متن را همزمان پردازش کند.
  • عدم قطعیت (Non-determinism) — پاسخ به یک ورودی یکسان ممکن است هر بار کمی متفاوت باشد.

چرا این مبانی برای تجارت عامل‌محور مهم است؟

وقتی یک ایجنت هوش مصنوعی قرار است از طرف کاربر خرید کند، همین محدودیت‌ها مستقیماً روی طراحی سیستم شما اثر می‌گذارند: محدودیت دانش یعنی ایجنت باید بتواند اطلاعات لحظه‌ای (مثل موجودی) را از طریق ابزار بگیرد — دقیقاً کاری که MCP ممکن می‌کند. محدودیت پنجره کانتکست یعنی نمی‌توان کل کاتالوگ محصولات را در پرامپت جا داد، پس به بازیابی هوشمند نیاز است — موضوع صفحه‌ی RAG.

سوالات متداول

آیا LLM واقعاً «فکر» می‌کند؟

از نظر فنی، مدل در حال پیش‌بینی آماری توکن بعدی است، نه استدلال به سبک انسانی. اما در عمل، این پیش‌بینی آماری در مقیاس بزرگ رفتاری شبیه استدلال از خود نشان می‌دهد.

تفاوت پارامتر مدل با توکن چیست؟

پارامترها وزن‌های داخلی شبکه عصبی‌اند که در آموزش تنظیم می‌شوند (ثابت پس از آموزش)؛ توکن‌ها واحدهای متنی هستند که در زمان استفاده از مدل عبور می‌کنند.