منبع فنی
معماری داریک در برابر اتصال مستقیم به مدل
این صفحه مقایسهی داریک با یک مدل زبانی بهعنوان دو مدل نیست. داریک یک مدل زبانی نیست و جایگزین مدل نمیشود؛ لایهای است که تصمیم میگیرد آیا اصلاً باید به مدل مراجعه شود. آنچه سنجیده میشود، رفتار همین لایه است.
دامنه
تفاوت در مسیر تصمیم است، نه در خودِ مدل
مسیر تصمیمگیری
برای هر درخواست ثبت میشود که سامانه چه مسیری را انتخاب کرده: پاسخ از دانش، تفکیک چند نیت، پاسخ محتاطانه، ارجاع به مدل، یا درخواست توضیح بیشتر.
خودداری از پاسخ
مهمتر از نرخ پاسخگویی، این است که سامانه چند بار بهجای حدس زدن، توضیح بیشتر خواسته یا محتاطانه عمل کرده است.
اتکا به مدل بیرونی
ثبت میشود که پاسخ از دانش ساخته شده یا به مدل بیرونی ارجاع داده شده است.
زمان پاسخ
مدت پردازش هر درخواست ثبت میشود، اما تنها زمانی قابل مقایسه است که هر دو مسیر مجموعهی پرسش یکسانی را پاسخ داده باشند.
شناسنامه
شرایط این سنجش
هر عددی که در ادامه میبینید فقط در این شرایط معنا دارد. بدون این برگه، هیچ عددی قابل تفسیر نیست.
- مدل بیرونی مسیر مقایسهModel
- Gemini 2.5 Flash-Lite — مدلی که در مسیر مقایسه فراخوانی شده، نه موضوع رقابت
- بازه جمعآوریDate
- ۱ مهر ۱۴۰۵ تا ۲ مهر ۱۴۰۵
- روششناسیMethodology
- ثبت تلهمتری زنده از آزمایشگاه عمومی داریک؛ بدون گروه کنترل و بدون تخصیص تصادفی.
- الگوی ترافیکTraffic Pattern
- ترافیک ارگانیک بازدیدکنندگان سایت با پرسش آزاد؛ توزیع موضوعی کنترل نشده است.
- شرایط استفاده مجددCache Conditions
- استفادهی مجدد از دانش در حالت پیشفرض فعال بوده و بین دو مسیر یکسانسازی نشده است.
- مجموعه دادهDataset
- ۱٬۲۷۰ درخواست ثبتشده — ۱٬۲۷۰ مسیر داریک، ۰ مسیر مستقیم مدل
- تعریف سنجهMetric Definition
- «مسیر اجرایی» یعنی تصمیمی که موتور پیش از تولید پاسخ گرفته است. سهم هر مسیر بر کل درخواستهای مسیر داریک محاسبه میشود.
نتیجه
داریک در این نمونه چه تصمیمهایی گرفته است
| مسیر اجرایی | تعداد | سهم از مسیر داریک |
|---|---|---|
| پاسخ از دانش ساختهشده | ۹۷۰ | ۷۶٪ |
| llm_response | ۱۴۶ | ۱۱٪ |
| upstream_error | ۷۰ | ۶٪ |
| unsupported_fallback | ۵۶ | ۴٪ |
| درخواست توضیح بیشتر از کاربر | ۲۸ | ۲٪ |
قابلتوجهترین بخش این توزیع، سهم مواردی است که بهجای پاسخ حدسی، توضیح بیشتری از کاربر خواسته شده. این یک ویژگی طراحی است، نه یک خطا.
محدودیتها
این نمونه چه چیزی را ثابت نمیکند
- داده از آزمایشگاه عمومی جمعآوری شده است؛ پرسشها را بازدیدکنندگان آزادانه تایپ کردهاند و مجموعهی پرسش کنترلشده نیست.
- تعداد نمونه در دو مسیر برابر نیست و پرسشهای مشترک بینشان اندک است؛ بنابراین مقایسهی زوجی معتبر ممکن نیست.
- به همین دلیل هیچ ادعایی دربارهی درصد کاهش هزینه یا ضریب افزایش سرعت در این صفحه مطرح نشده است.
- زمان پاسخ به شبکه، بار سرور و ارائهدهندهی مدل وابسته است و بین اجراهای مختلف تغییر میکند.
عدد درصدی دربارهی هزینه یا سرعت تنها پس از اجرای یک آزمون کنترلشده — با مجموعهی پرسش یکسان، تعداد نمونهی کافی و شرایط ثبتشده — منتشر خواهد شد.