كلما سألت نموذجًا عن كتاب من 50 ألف توكن، أرسل تطبيقك الكتاب كله من جديد مع كل سؤال، ودفعت ثمنه كل مرة. Prompt Caching حيلة تقلب هذه المعادلة: النموذج يتذكر بداية الطلب التي عالجها قبل قليل، ويحاسبك على تكرارها بسعر أقل بكثير.
تدفع أكثر قليلًا في أول مرة (كتابة الذاكرة المؤقتة)، ثم نحو 10% فقط من سعر الإدخال في كل مرة تُقرأ فيها البداية نفسها. يفيد مطوّري التطبيقات وأصحاب الأنظمة المبنية على الـ API، لا مستخدمي الدردشة العاديين.
كيف يحسبها Claude؟
بحسب توثيق Anthropic، تُحسب العمليات كمضاعف لسعر الإدخال الأساسي:
| العملية | المضاعف |
|---|---|
| كتابة ذاكرة لمدة 5 دقائق | 1.25× |
| كتابة ذاكرة لمدة ساعة | 2× |
| القراءة من الذاكرة | 0.1× (و0.05× لـ Opus 5.5 وSonnet 5.5) |
المدة الافتراضية 5 دقائق، وتتجدد مع كل قراءة دون رسوم إضافية. وأقل طول يُخزَّن في النماذج الأحدث، ومنها Sonnet 5.5 وHaiku 5.5، هو 512 توكن، فالنصوص الأقصر تُعالج بلا تخزين ودون رسالة خطأ.
مثال: مستند 50 ألف توكن و20 سؤالًا
سعر إدخال Sonnet 5.5 في جدول Anthropic هو 2 دولار للمليون توكن (حتى أكتوبر 2026).
- دون تخزين: 20 × 50 ألف = مليون توكن، أي نحو 2.00 دولار.
- مع التخزين: كتابة واحدة بـ 2.50 دولار للمليون (نحو 0.125 دولار) و19 قراءة بـ 0.10 دولار للمليون (نحو 0.095 دولار)، أي نحو 0.22 دولار، بشرط أن تأتي الأسئلة قبل انتهاء الدقائق الخمس.
هذا حساب تقريبي يهمل تكلفة السؤال نفسه والرد.

وعند OpenAI؟
تذكر OpenAI أن التخزين المؤقت مفعّل افتراضيًا للنماذج المدعومة. في GPT-5.6 وما بعده: الحد الأدنى 1,024 توكن، والقراءة بـ 0.1× من سعر الإدخال (0.05× في GPT-6.1 Sol)، والكتابة بـ 1.25×، ومدة الاحتفاظ 30 دقيقة على الأقل. أما النماذج الأقدم ففيها قواعد أخرى تُراجع في صفحة الأسعار.
كيف تتأكد أنه يعمل؟
في Claude راجع حقلي cache_creation_input_tokens وcache_read_input_tokens؛ إن كان الاثنان صفرًا فلم يُخزَّن شيء. وفي OpenAI راجع cached_tokens داخل تفاصيل الاستخدام. وتُحتسب التوكنات المخزنة ضمن حدود المعدل لدى OpenAI أيضًا.
تعرّف أيضًا على نافذة السياق والتوكن لتفهم لماذا يكبر النص المرسل، وعلى أسعار نماذج Claude لتطبّق الحساب على نموذجك.
المصادر: توثيق Prompt caching لدى Anthropic وتوثيق Prompt caching لدى OpenAI للمطورين (صفحتان رسميتان).




