منبع فنی

معماری داریک در برابر اتصال مستقیم به مدل

این صفحه مقایسه‌ی داریک با یک مدل زبانی به‌عنوان دو مدل نیست. داریک یک مدل زبانی نیست و جایگزین مدل نمی‌شود؛ لایه‌ای است که تصمیم می‌گیرد آیا اصلاً باید به مدل مراجعه شود. آنچه سنجیده می‌شود، رفتار همین لایه است.

دامنه

تفاوت در مسیر تصمیم است، نه در خودِ مدل

مسیر تصمیم‌گیری

برای هر درخواست ثبت می‌شود که سامانه چه مسیری را انتخاب کرده: پاسخ از دانش، تفکیک چند نیت، پاسخ محتاطانه، ارجاع به مدل، یا درخواست توضیح بیشتر.

خودداری از پاسخ

مهم‌تر از نرخ پاسخ‌گویی، این است که سامانه چند بار به‌جای حدس زدن، توضیح بیشتر خواسته یا محتاطانه عمل کرده است.

اتکا به مدل بیرونی

ثبت می‌شود که پاسخ از دانش ساخته شده یا به مدل بیرونی ارجاع داده شده است.

زمان پاسخ

مدت پردازش هر درخواست ثبت می‌شود، اما تنها زمانی قابل مقایسه است که هر دو مسیر مجموعه‌ی پرسش یکسانی را پاسخ داده باشند.

شناسنامه

شرایط این سنجش

هر عددی که در ادامه می‌بینید فقط در این شرایط معنا دارد. بدون این برگه، هیچ عددی قابل تفسیر نیست.

مدل بیرونی مسیر مقایسهModel
Gemini 2.5 Flash-Lite — مدلی که در مسیر مقایسه فراخوانی شده، نه موضوع رقابت
بازه جمع‌آوریDate
۱ مهر ۱۴۰۵ تا ۲ مهر ۱۴۰۵
روش‌شناسیMethodology
ثبت تله‌متری زنده از آزمایشگاه عمومی داریک؛ بدون گروه کنترل و بدون تخصیص تصادفی.
الگوی ترافیکTraffic Pattern
ترافیک ارگانیک بازدیدکنندگان سایت با پرسش آزاد؛ توزیع موضوعی کنترل نشده است.
شرایط استفاده مجددCache Conditions
استفاده‌ی مجدد از دانش در حالت پیش‌فرض فعال بوده و بین دو مسیر یکسان‌سازی نشده است.
مجموعه دادهDataset
۱٬۲۷۰ درخواست ثبت‌شده — ۱٬۲۷۰ مسیر داریک، ۰ مسیر مستقیم مدل
تعریف سنجهMetric Definition
«مسیر اجرایی» یعنی تصمیمی که موتور پیش از تولید پاسخ گرفته است. سهم هر مسیر بر کل درخواست‌های مسیر داریک محاسبه می‌شود.

نتیجه

داریک در این نمونه چه تصمیم‌هایی گرفته است

توزیع مسیرهای اجرایی داریک در نمونه‌ی ثبت‌شده
مسیر اجراییتعدادسهم از مسیر داریک
پاسخ از دانش ساخته‌شده۹۷۰
۷۶٪
llm_response۱۴۶
۱۱٪
upstream_error۷۰
۶٪
unsupported_fallback۵۶
۴٪
درخواست توضیح بیشتر از کاربر۲۸
۲٪

قابل‌توجه‌ترین بخش این توزیع، سهم مواردی است که به‌جای پاسخ حدسی، توضیح بیشتری از کاربر خواسته شده. این یک ویژگی طراحی است، نه یک خطا.

محدودیت‌ها

این نمونه چه چیزی را ثابت نمی‌کند

  • داده از آزمایشگاه عمومی جمع‌آوری شده است؛ پرسش‌ها را بازدیدکنندگان آزادانه تایپ کرده‌اند و مجموعه‌ی پرسش کنترل‌شده نیست.
  • تعداد نمونه در دو مسیر برابر نیست و پرسش‌های مشترک بینشان اندک است؛ بنابراین مقایسه‌ی زوجی معتبر ممکن نیست.
  • به همین دلیل هیچ ادعایی درباره‌ی درصد کاهش هزینه یا ضریب افزایش سرعت در این صفحه مطرح نشده است.
  • زمان پاسخ به شبکه، بار سرور و ارائه‌دهنده‌ی مدل وابسته است و بین اجراهای مختلف تغییر می‌کند.

عدد درصدی درباره‌ی هزینه یا سرعت تنها پس از اجرای یک آزمون کنترل‌شده — با مجموعه‌ی پرسش یکسان، تعداد نمونه‌ی کافی و شرایط ثبت‌شده — منتشر خواهد شد.