كانت النماذج الأولى تقرأ النص وتكتب النص، ولا شيء غير ذلك. اليوم ترفع إليها صورة فاتورة أو لقطة شاشة أو تسجيلًا صوتيًا، وتجيبك عنها. هذا ما يقصده من يقول إن النموذج «متعدد الوسائط».
الوسيط هو نوع المعلومة: نص أو صورة أو صوت أو فيديو. والنموذج متعدد الوسائط يستقبل أكثر من نوع في الطلب نفسه، ويربط بينها، كأن تسأله عن صورة جدول ثم تطلب منه تلخيص أرقامه.
ماذا تفعل الوسائط معًا؟
- صورة + سؤال: «ما هذه الرسالة التي ظهرت على الشاشة؟» دون كتابة نصها.
- عدة صور: قارن بين صورتين لعقدين أو لغرفتين.
- صوت + نص: تفريغ تسجيل وتلخيصه، وفي Gemini مثلًا يسمح الحد الرسمي بعشر دقائق للحسابات العادية وثلاث ساعات لمشتركي AI Pro وAI Ultra.
حدود الصور في Claude
تعرض وثائق Anthropic الحدود بالتفصيل. هذه أهم ما يخص التطبيق:
| البند | الحد في claude.ai |
|---|---|
| عدد الصور في الرسالة | 20 صورة |
| حجم الصورة | حتى 10 ميغابايت |
| الصيغ | JPEG وPNG وGIF وWebP (والمتحركة تُقرأ لقطتها الأولى فقط) |
| أقصى أبعاد | 8000×8000 بكسل |
متى تفيدك فعلًا؟
في مواقف يومية: صورة جدول من بحث جامعي تريد تلخيصه، ولقطة شاشة لرسالة خطأ لا تعرف معناها، وصورة سبورة بعد محاضرة تريدها ملاحظات مرتبة. في كل حالة توفر عليك أن تعيد كتابة ما تراه عينك.
ما الذي لا يفعله؟
- لا يولّد الصور ولا يعدّلها: هو نموذج لفهم الصور فقط.
- لا يسمّي الأشخاص في الصور.
- قد يخطئ في الصور المنخفضة الجودة أو المقلوبة أو الأصغر من 200 بكسل، وفي عدّ الأشياء الكثيرة الصغيرة.
- لا يستطيع أن يحدد إن كانت صورة مولّدة بالذكاء الاصطناعي أم لا.
هل يُحفظ ما أرفعه من صور؟
تقول وثائق الـAPI إن الصور لا تُخزَّن بعد معالجة الطلب، وإن Anthropic لا تستخدمها لتدريب النماذج. وسياسة التطبيق لها صفحتها الخاصة.
إن أردت تطبيق الفكرة عمليًا فجرّب ميزة الكاميرا في Guided Vision في Gemini Live، فهي أوضح مثال على نموذج يرى ويتكلم في وقت واحد.