ما معنى نموذج متعدد الوسائط (Multimodal)؟ وما الذي تستطيع رفعه إلى Claude؟

كانت النماذج الأولى تقرأ النص وتكتب النص، ولا شيء غير ذلك. اليوم ترفع إليها صورة فاتورة أو لقطة شاشة أو تسجيلًا صوتيًا، وتجيبك عنها. هذا ما يقصده من يقول إن النموذج «متعدد الوسائط».

ببساطة

الوسيط هو نوع المعلومة: نص أو صورة أو صوت أو فيديو. والنموذج متعدد الوسائط يستقبل أكثر من نوع في الطلب نفسه، ويربط بينها، كأن تسأله عن صورة جدول ثم تطلب منه تلخيص أرقامه.

ماذا تفعل الوسائط معًا؟

  • صورة + سؤال: «ما هذه الرسالة التي ظهرت على الشاشة؟» دون كتابة نصها.
  • عدة صور: قارن بين صورتين لعقدين أو لغرفتين.
  • صوت + نص: تفريغ تسجيل وتلخيصه، وفي Gemini مثلًا يسمح الحد الرسمي بعشر دقائق للحسابات العادية وثلاث ساعات لمشتركي AI Pro وAI Ultra.

حدود الصور في Claude

تعرض وثائق Anthropic الحدود بالتفصيل. هذه أهم ما يخص التطبيق:

البند الحد في claude.ai
عدد الصور في الرسالة 20 صورة
حجم الصورة حتى 10 ميغابايت
الصيغ JPEG وPNG وGIF وWebP (والمتحركة تُقرأ لقطتها الأولى فقط)
أقصى أبعاد 8000×8000 بكسل
امرأة تلعب الشطرنج أمام روبوت صغير
لعب الشطرنج أمام روبوت — الصورة: École polytechnique (ويكيميديا كومنز، CC BY-SA 2.0)

متى تفيدك فعلًا؟

في مواقف يومية: صورة جدول من بحث جامعي تريد تلخيصه، ولقطة شاشة لرسالة خطأ لا تعرف معناها، وصورة سبورة بعد محاضرة تريدها ملاحظات مرتبة. في كل حالة توفر عليك أن تعيد كتابة ما تراه عينك.

ما الذي لا يفعله؟

  • لا يولّد الصور ولا يعدّلها: هو نموذج لفهم الصور فقط.
  • لا يسمّي الأشخاص في الصور.
  • قد يخطئ في الصور المنخفضة الجودة أو المقلوبة أو الأصغر من 200 بكسل، وفي عدّ الأشياء الكثيرة الصغيرة.
  • لا يستطيع أن يحدد إن كانت صورة مولّدة بالذكاء الاصطناعي أم لا.
لا تسأله عن صحة الصورة: تقول الوثائق صراحة إن Claude قد يخطئ إن سألته هل الصورة مولّدة، ولا يُعتمد عليه في كشف المزيّف. للتحقق اقرأ ما تفعله SynthID وما لا تفعله.
ضع الصورة أولًا: ضع الصورة قبل السؤال. توصي Anthropic بأن يسبق الصور النص، وبأن تعرّف كل صورة بنص قصير إن أرسلت عدة صور، مثل «الصورة 1:» و«الصورة 2:».
هل يُحفظ ما أرفعه من صور؟

تقول وثائق الـAPI إن الصور لا تُخزَّن بعد معالجة الطلب، وإن Anthropic لا تستخدمها لتدريب النماذج. وسياسة التطبيق لها صفحتها الخاصة.

إن أردت تطبيق الفكرة عمليًا فجرّب ميزة الكاميرا في Guided Vision في Gemini Live، فهي أوضح مثال على نموذج يرى ويتكلم في وقت واحد.

اترك تعليقاً

لن يتم نشر عنوان بريدك الإلكتروني. الحقول الإلزامية مشار إليها بـ *

This site is protected by reCAPTCHA and the Google Privacy Policy and Terms of Service apply.

The reCAPTCHA verification period has expired. Please reload the page.

زر الذهاب إلى الأعلى