ما معنى نموذج متعدد الوسائط (Multimodal)؟ وما الذي تستطيع رفعه إلى Claude؟

كانت النماذج الأولى تقرأ النص وتكتب النص، ولا شيء غير ذلك. اليوم ترفع إليها صورة فاتورة أو لقطة شاشة أو تسجيلًا صوتيًا، وتجيبك عنها. هذا ما يقصده من يقول إن النموذج «متعدد الوسائط».

ببساطة

الوسيط هو نوع المعلومة: نص أو صورة أو صوت أو فيديو. والنموذج متعدد الوسائط يستقبل أكثر من نوع في الطلب نفسه، ويربط بينها، كأن تسأله عن صورة جدول ثم تطلب منه تلخيص أرقامه.

ماذا تفعل الوسائط معًا؟

حدود الصور في Claude

تعرض وثائق Anthropic الحدود بالتفصيل. هذه أهم ما يخص التطبيق:

البند الحد في claude.ai
عدد الصور في الرسالة 20 صورة
حجم الصورة حتى 10 ميغابايت
الصيغ JPEG وPNG وGIF وWebP (والمتحركة تُقرأ لقطتها الأولى فقط)
أقصى أبعاد 8000×8000 بكسل
لعب الشطرنج أمام روبوت — الصورة: École polytechnique (ويكيميديا كومنز، CC BY-SA 2.0)

متى تفيدك فعلًا؟

في مواقف يومية: صورة جدول من بحث جامعي تريد تلخيصه، ولقطة شاشة لرسالة خطأ لا تعرف معناها، وصورة سبورة بعد محاضرة تريدها ملاحظات مرتبة. في كل حالة توفر عليك أن تعيد كتابة ما تراه عينك.

ما الذي لا يفعله؟

لا تسأله عن صحة الصورة: تقول الوثائق صراحة إن Claude قد يخطئ إن سألته هل الصورة مولّدة، ولا يُعتمد عليه في كشف المزيّف. للتحقق اقرأ ما تفعله SynthID وما لا تفعله.
ضع الصورة أولًا: ضع الصورة قبل السؤال. توصي Anthropic بأن يسبق الصور النص، وبأن تعرّف كل صورة بنص قصير إن أرسلت عدة صور، مثل «الصورة 1:» و«الصورة 2:».
هل يُحفظ ما أرفعه من صور؟

تقول وثائق الـAPI إن الصور لا تُخزَّن بعد معالجة الطلب، وإن Anthropic لا تستخدمها لتدريب النماذج. وسياسة التطبيق لها صفحتها الخاصة.

إن أردت تطبيق الفكرة عمليًا فجرّب ميزة الكاميرا في Guided Vision في Gemini Live، فهي أوضح مثال على نموذج يرى ويتكلم في وقت واحد.

Exit mobile version