ما هو Prompt Caching؟ لماذا تأخذ Claude وOpenAI عُشر السعر عن النص الذي يتكرر؟

كلما سألت نموذجًا عن كتاب من 50 ألف توكن، أرسل تطبيقك الكتاب كله من جديد مع كل سؤال، ودفعت ثمنه كل مرة. Prompt Caching حيلة تقلب هذه المعادلة: النموذج يتذكر بداية الطلب التي عالجها قبل قليل، ويحاسبك على تكرارها بسعر أقل بكثير.

المعادلة باختصار

تدفع أكثر قليلًا في أول مرة (كتابة الذاكرة المؤقتة)، ثم نحو 10% فقط من سعر الإدخال في كل مرة تُقرأ فيها البداية نفسها. يفيد مطوّري التطبيقات وأصحاب الأنظمة المبنية على الـ API، لا مستخدمي الدردشة العاديين.

كيف يحسبها Claude؟

بحسب توثيق Anthropic، تُحسب العمليات كمضاعف لسعر الإدخال الأساسي:

العملية المضاعف
كتابة ذاكرة لمدة 5 دقائق 1.25×
كتابة ذاكرة لمدة ساعة 2×
القراءة من الذاكرة 0.1× (و0.05× لـ Opus 5.5 وSonnet 5.5)

المدة الافتراضية 5 دقائق، وتتجدد مع كل قراءة دون رسوم إضافية. وأقل طول يُخزَّن في النماذج الأحدث، ومنها Sonnet 5.5 وHaiku 5.5، هو 512 توكن، فالنصوص الأقصر تُعالج بلا تخزين ودون رسالة خطأ.

مثال: مستند 50 ألف توكن و20 سؤالًا

سعر إدخال Sonnet 5.5 في جدول Anthropic هو 2 دولار للمليون توكن (حتى أكتوبر 2026).

  • دون تخزين: 20 × 50 ألف = مليون توكن، أي نحو 2.00 دولار.
  • مع التخزين: كتابة واحدة بـ 2.50 دولار للمليون (نحو 0.125 دولار) و19 قراءة بـ 0.10 دولار للمليون (نحو 0.095 دولار)، أي نحو 0.22 دولار، بشرط أن تأتي الأسئلة قبل انتهاء الدقائق الخمس.

هذا حساب تقريبي يهمل تكلفة السؤال نفسه والرد.

خوادم مرصوصة في رف داخل مركز بيانات
خوادم في رف بمركز بيانات — الصورة: Victorgrigas (ويكيميديا كومنز، CC BY-SA 3.0)

وعند OpenAI؟

تذكر OpenAI أن التخزين المؤقت مفعّل افتراضيًا للنماذج المدعومة. في GPT-5.6 وما بعده: الحد الأدنى 1,024 توكن، والقراءة بـ 0.1× من سعر الإدخال (0.05× في GPT-6.1 Sol)، والكتابة بـ 1.25×، ومدة الاحتفاظ 30 دقيقة على الأقل. أما النماذج الأقدم ففيها قواعد أخرى تُراجع في صفحة الأسعار.

خطأ شائع: يشترط الاستفادة أن تتطابق البداية كلها حرفيًا. ضع التعليمات والمستند الثابت أولًا، وسؤالك المتغير آخرًا، ولا تضع تاريخًا أو رقمًا متغيرًا في أول الطلب، وإلا فُقدت الذاكرة مع كل طلب.

كيف تتأكد أنه يعمل؟

في Claude راجع حقلي cache_creation_input_tokens وcache_read_input_tokens؛ إن كان الاثنان صفرًا فلم يُخزَّن شيء. وفي OpenAI راجع cached_tokens داخل تفاصيل الاستخدام. وتُحتسب التوكنات المخزنة ضمن حدود المعدل لدى OpenAI أيضًا.

تعرّف أيضًا على نافذة السياق والتوكن لتفهم لماذا يكبر النص المرسل، وعلى أسعار نماذج Claude لتطبّق الحساب على نموذجك.

المصادر: توثيق Prompt caching لدى Anthropic وتوثيق Prompt caching لدى OpenAI للمطورين (صفحتان رسميتان).

اترك تعليقاً

لن يتم نشر عنوان بريدك الإلكتروني. الحقول الإلزامية مشار إليها بـ *

This site is protected by reCAPTCHA and the Google Privacy Policy and Terms of Service apply.

The reCAPTCHA verification period has expired. Please reload the page.

زر الذهاب إلى الأعلى