• قاعدة معارف الذكاء الاصطناعي
  • أدوات الذكاء الاصطناعي
  • الذكاء الاصطناعي

Cohere Parse v5.0: لماذا يبدأ RAG الأفضل بمستندات أفضل

يقوم Cohere Parse v5.0 بتحويل ملفات PDF والشرائح والجداول والنماذج والصور إلى RAG جاهزة لـ Markdown. إليك ما يجعلها مختلفة، وأين تناسبها، وما تعنيه حدودها بالنسبة لبحث المؤسسات.

بواسطة Om Kamathوقت القراءة: 11 دقائق
يقوم Cohere Parse v5.0 بتحويل مجموعة من المستندات الفوضوية إلى بطاقات منظمة وعقد استرجاع متصلة

يعالج نموذج المستند الجديد لـ Cohere الجزء من RAG الذي تتخطىه معظم العروض التوضيحية: تحويل الملفات الفوضوية إلى معلومات يمكن للذكاء الاصطناعي استردادها بالفعل

يمكن لنظام RAG استرداد نسخة المستند التي تم تقديمها له فقط. إذا أسقط المحلل اللغوي صف جدول، أو قرأ صفحة مكونة من عمودين بترتيب خاطئ، أو قام بفصل تسمية توضيحية عن صورتها، يصبح الخطأ جزءًا من قاعدة المعرفة. قد يؤدي نموذج التضمين الأفضل إلى استرداد هذا الخطأ بدقة أكبر. قد يشرح النموذج اللغوي الأكثر قدرة ذلك بطلاقة أكبر. ولا يمكن لأي منهما إعادة بناء المعلومات التي اختفت أثناء الاستيعاب بشكل موثوق.

وهذا هو سبب إطلاق Cohere لـ تحليل v5.0 في 27 أغسطس 2026، أكثر إثارة للاهتمام مما قد توحي به عبارة "محلل المستندات". Parse هو نموذج لغة رؤية مصمم لتحويل ملفات الأعمال المعقدة إلى Markdown قبل أن يتم تقسيم هذه الملفات أو تضمينها أو البحث فيها أو إعادة ترتيبها أو تسليمها إلى وكيل الذكاء الاصطناعي.

بمعنى آخر، يتعامل Cohere مع إعداد المستندات كمشكلة نموذجية خاصة به - وليس كأداة مساعدة صغيرة OCR مخبأة عند حافة المكدس.

ما هو Cohere Parse v5.0؟

يصف Cohere التحليل كنموذج مدمج للغة الرؤية لمعالجة مستندات المؤسسات ذات الحجم الكبير. فهو يقبل ملفات PDF وملفات PowerPoint وصور JPEG من خلال واجهة Parse المستقلة ويعيد Markdown المصمم لتطبيقات الذكاء الاصطناعي النهائية.

يمكنه استخراج أكثر من نص قيد التشغيل:

  • النص في ترتيب القراءة المقصود؛
  • الجداول، ممثلة بتنسيق HTML داخل مخرجات Markdown؛
  • القوائم والنماذج وأزواج القيمة الرئيسية؛
  • الصور والأوصاف أو التسميات التوضيحية التي تم إنشاؤها؛
  • حدود الصفحة ومواقع العناصر المرئية المدعومة.

يقول Cohere أن النموذج مستقر عبر اللغات العربية والإنجليزية والفرنسية والألمانية والإيطالية واليابانية والكورية والبرتغالية والإسبانية. يمكنه تجربة لغات أخرى دون أمثلة، على الرغم من أن Cohere يحذر من أن الجودة قد تكون أقل.

النموذج نفسه صغير نسبيًا وفقًا لمعايير الذكاء الاصطناعي الحالية - 2.3 مليار معلمة وحوالي 4.6 جيجابايت، وفقًا لـ التوثيق النموذجي الرسمي. هذه التفاصيل أقل أهمية كمعيار للذكاء بقدر ما تكون بمثابة دليل لاستراتيجية Cohere: تخصيص نموذج مدمج للتحليل بحيث يمكن تشغيله بسرعة، وبتكلفة زهيدة، وفي بيئات خاصة.

لماذا يعد تحليل المستند مشكلة RAG، وليس مجرد مشكلة OCR

يطرح OCR التقليدي سؤالاً ضيقًا: ما هي الشخصيات التي تظهر في هذه الصفحة؟ إن فهم المستندات يطرح سؤالًا أصعب: كيف ترتبط تلك الشخصيات والمربعات والخطوط والصور والمواضع ببعضها البعض؟

فكر في تقرير ربع سنوي يتكون من عمودين وحاشية سفلية وجدول. قد يتم استخراج نص عادي عبر كلا العمودين، ووضع الحاشية السفلية في منتصف الجملة، وتسوية الجدول إلى مجموعة من الأرقام. يمكن أن يكون كل حرف صحيحًا من الناحية الفنية بينما يتضرر المعنى بشدة.

يحاول المحلل اللغوي الحديث الحفاظ على ترتيب القراءة وبنيتها. وهذا يعطي نظام القطع حدودًا أفضل، ونموذج التضمين فقرات أكثر تماسكًا، ومحرك استرجاع مرشحات أكثر أهمية، ومولدًا أفضل للاستشهاد به.

رسم تخطيطي يوضح تدفق الملفات الفوضوية عبر Cohere Parse، والتقطيع والتضمين، ثم الاسترجاع وإعادة الترتيب
حيث يوجد Parse في خط أنابيب RAG النموذجي. يمكن أن ينتقل خطأ العرض خلال كل مرحلة تالية.

هذه هي النقطة المعمارية الرئيسية: ترتبط جودة التحليل وجودة الاسترجاع. إذا كان تمثيل المصدر خاطئًا، فإن بقية المكدس يحل المشكلة الخاطئة.

ما الذي يجعل Cohere Parse مختلفًا؟

وهي مصممة لرؤية بنية الوثيقة

يستخدم التحليل المعلومات المرئية بدلاً من التعامل مع الملف كحقيبة نصية. الغرض منه هو التعرف على الجداول والنماذج والرسوم البيانية والصور المضمنة والعلاقات المكانية. يعد ذلك مفيدًا بشكل خاص في مستندات الأعمال حيث يتم نقل المعنى من خلال التخطيط: مبلغ بجانب الملصق، أو قيمة أسفل عنوان عمود، أو ملاحظة مرفقة بمخطط واحد بدلاً من آخر.

هذه اللغة "ما وراء OCR" ليست فريدة من نوعها بالنسبة إلى Cohere - حيث تجمع العديد من أنظمة ذكاء المستندات الآن بين التعرف على النص والتخطيط والرؤية - ولكنها تضع Parse في الجيل الأحدث من المحللين المتعددي الوسائط بدلاً من فئة استخراج الأحرف الأقدم.

إنتاجها مخصص للذكاء الاصطناعي

يُرجع التحليل Markdown القابل للقراءة بدلاً من نسخة متماثلة مرئية من الصفحة. يتم الاحتفاظ بالجداول بتنسيق HTML، وتتلقى الصور الأوصاف، وتتضمن العناصر المدعومة الإحداثيات. يعد هذا التنسيق مناسبًا للتقطيع والفهرسة والفحص البشري وسير عمل الاستشهادات.

هناك مقايضة في هذا الاختيار. يتميز Markdown بالمرونة وسهولة العمل معه، ولكن الفرق التي تتطلب مخطط تطبيق صارم ستحتاج إلى خطوة تحويل وتحقق أخرى. لا يُرجع التحليل حاليًا JSON المنظم.

إنه يهدف إلى حجم المؤسسة والنشر الخاص

سعر API العام هو 1.50 دولارًا لكل 1000 صفحة. يُبلغ Cohere عن إنتاجية تبلغ 4.5 صفحة في الثانية على وحدة معالجة رسومات H100 واحدة و36 صفحة في الثانية على عقدة H100 الثمانية. هذه هي قياسات Cohere، لذا يجب على المشترين اختبار مزيج الملفات الخاص بهم، لكنهم يوضحون السوق المقصود: مهام الاستيعاب الكبيرة بدلاً من التحميلات العرضية لصفحة واحدة.

يتوفر التحليل بشكل عام من خلال Cohere API وCohere Model Vault للمستأجر الفردي وMicrosoft Foundry وAWS SageMaker. تعتبر خيارات Model Vault والسحابة الخاصة أو المحلية ذات أهمية خاصة عندما تحتوي الملفات المصدر على معلومات منظمة أو خاصة.

كيف يتناسب التحليل مع مكدس Cohere الخاص بـ RAG

قام Cohere ببناء مجموعة مميزة من مكونات الاسترجاع. يقوم التحليل بتحضير الملف. يمثل التضمين محتواه للبحث الدلالي. تبحث ميزة إعادة الترتيب في المجموعة الأولية من المرشحين وتنقل المرشحين الأكثر صلة إلى الأعلى. يمكن لنموذج الجيل بعد ذلك الإجابة من هذا الدليل.

طبقةمكون Cohereوظيفة
استيعابتحليلتحويل المستندات المرئية إلى محتوى منظم
تمثلتضمينتحويل القطع إلى ناقلات قابلة للبحث
استردادبحث + إعادة الترتيبابحث عن المرشحين، ثم قم بتحسين ترتيبهم
أجب أو تصرفالقيادة أو نموذج آخراستخدم الأدلة المستردة في الاستجابة أو سير العمل

يمكن للفرق استخدام Parse كمكون مستقل أو كجزء من البوصلة Cohere. تضيف البوصلة الإدارة المُدارة، والتقطيع، والتضمين، والفهرسة، والبحث المختلط، والاسترداد على مرحلتين، والموصلات، وعناصر التحكم في الوصول. كما يقبل أيضًا مجموعة واسعة من تنسيقات المصدر، بما في ذلك Word وExcel وHTML، عن طريق توجيهها عبر مسارات النص أو الرؤية المناسبة.

وهذا الاختيار استراتيجي. يمكن للفريق الاحتفاظ بقاعدة بيانات المتجهات الحالية وطبقة الاسترجاع أثناء استبدال المحلل اللغوي فقط، أو اعتماد المزيد من مسار المستندات إلى الإجابة المدار في Cohere. التحليل يجعل Cohere أكثر مصداقية على طرفي هذا الطيف.

تحليل معايير الإصدار 5.0: ما يطالب به Cohere

يبلغ Cohere متوسط درجة 79.2 على ثلاثة أبعاد من ParseBench: استخراج الجدول، وإخلاص المحتوى، والتنسيق الدلالي. في نفس التقييم، أبلغ Cohere عن 78.3 لطبقة LlamaParse الفعالة من حيث التكلفة، و77.7 لـ Chandra OCR 2، و74.5 لـ Mistral OCR 4، و72.4 لـ Databricks AI Parse.

مخطط شريطي أفقي لنتائج ParseBench التي تم الإبلاغ عنها بواسطة Cohere بقيادة Cohere Parse عند 79.2
أنظمة تحليل المستندات المحددة في كشف ParseBench الخاص بـ Cohere. هذه هي النتائج التي تم الإبلاغ عنها من قبل البائع، وليست اختبارات مستقلة. راجع المنهجية والجدول الكاملين لـ Cohere.

النتائج التفصيلية تكشف. يُبلغ Cohere عن 87.0 للجداول و86.6 لإخلاص المحتوى، ولكن 64.0 للتنسيق الدلالي. يبدو التحليل أقوى عندما تشعر فرق RAG بالألم أولاً - التقاط الجدول بشكل صحيح وعدم فقدان المحتوى أو اختراعه - بينما يظل التنسيق منطقة أكثر صعوبة.

هناك تحذيران مهمان. أولاً، استبعد Cohere مخطط ParseBench والأبعاد الأساسية المرئية من متوسط ​​العنوان الرئيسي لأنها تقع خارج نطاق المنتج الحالي. ثانيًا، سجلت النماذج الحدودية ذات الأغراض العامة درجات أعلى في اختبار Cohere، لكنها أكبر بكثير وسعرها مناسب لوظيفة مختلفة. تتمحور حجة Cohere في المقام الأول حول أداء السعر على نطاق واسع، ولا تفوز بكل مقارنة الدقة الأولية.

حيث يبدو التحليل أكثر فائدة

  • وثيقة ثقيلة RAG: قواعد معرفية مبنية على التقارير والأدلة والعروض التقديمية والعقود والمواد التجارية الممسوحة ضوئيًا.
  • الجداول والنماذج: الفواتير والمطالبات والبيانات المالية والتطبيقات والملفات الأخرى التي تحمل فيها الصفوف والتسميات المعنى.
  • مجموعات متعددة اللغات: المنظمات التي تعمل عبر اللغات التسع تسرد Cohere على أنها مستقرة.
  • ابتلاع بكميات كبيرة: يتم قياس المحفوظات بمئات الآلاف أو ملايين الصفحات، حيث تكلفة الصفحة الواحدة ومركب الإنتاجية.
  • البيانات المنظمة: عمليات النشر التي تحتاج إلى مستأجر واحد، أو سحابة خاصة، أو استدلال محلي.
  • سير عمل الوكيل: الوكلاء الذين يحتاجون إلى سياق مستند موثوق به قبل أن يتمكنوا من اتخاذ قرار أو اتخاذ إجراء.

قد يكون الأمر أقل إلحاحًا بالنسبة للنص الرقمي النظيف الذي يتعامل معه المستخرج الحالي بشكل مثالي. يضيف محلل الرؤية المتخصص القيمة الأكبر عندما يكون التخطيط والمحتوى المرئي جزءًا من المعلومات بالفعل.

القيود المعروفة مهمة بقدر العنوان

Cohere واضح بشكل غير عادي بشأن ما لا يفعله إصدار Parse الأول. وفقا لتوثيقها:

  • ولا يُرجع درجات الثقة للمحتوى المستخرج؛
  • ولا يحدد الرؤوس أو التذييلات أو التسلسل الهرمي للخطوط كعناصر وثيقة صريحة؛
  • تقوم بإرجاع Markdown بدلاً من JSON المنظم؛
  • ويدعم النموذج المستقل ملفات PDF وPowerPoint وJPEG، وليس كل تنسيقات Office الشائعة؛
  • فهو يصف المخططات كعناصر مرئية ولكنه لا يستخرج حاليًا سلسلة بيانات المخطط في الجداول.

قيود الرسم البياني مهمة بشكل خاص. قد يقوم نظام RAG باسترداد وصف مفيد للرسم البياني، ولكن لا ينبغي أن يفترض سير عمل التحليلات أنه قد تلقى القيم الأساسية. يقول Cohere أنه تم التخطيط لاستخراج بيانات المخطط لإصدار المحلل اللغوي في المستقبل.

يؤدي غياب درجات الثقة أيضًا إلى تغيير طريقة التعامل مع الأخطاء. لا يمكن للفرق ببساطة توجيه كل صفحة منخفضة الثقة إلى المراجعة البشرية. سيحتاجون إلى قواعد التحقق الخاصة بهم - التحقق من الإجماليات، أو الحقول المطلوبة، أو شكل الجدول، أو إجابات الاسترجاع، أو المقارنات مقابل مجموعة ذهبية.

كيفية تقييم التحليل قبل إضافته إلى خط أنابيب RAG

  1. قم ببناء مجموعة مستندات صعبة. قم بتضمين ملفات PDF متعددة الأعمدة، وعمليات المسح الضوئي، والصفحات المدورة، والجداول الكثيفة، والنماذج، والحواشي السفلية، والرسوم البيانية، وكل لغة تتوقع دعمها.
  2. تحديد الحقيقة الأرضية الهيكلية. لا تسجل دقة الشخصية فقط. تحقق من ترتيب القراءة، وخلايا الجدول، والتسميات، وحدود الصفحة، وموضع الصورة، وما إذا كان التنسيق ذو المعنى موجودًا.
  3. أسئلة استرجاع الاختبار من النهاية إلى النهاية. قم بتحليل المستندات وفهرستها، ثم اطرح أسئلة تعتمد إجاباتها على التخطيط. قياس ما إذا كان تم استرداد المقطع الصحيح قبل الحكم على الاستجابة النهائية.
  4. فحص الاستشهادات. الإجابة المعقولة ليست كافية. تأكد من أن الجزء المستشهد به يحتوي على دليل المصدر الصحيح وما زال يشير إلى صفحة أو منطقة مفيدة.
  5. قياس عبء العمل الحقيقي. تسجيل الصفحات في الثانية، والتكلفة لكل ألف صفحة، وإعادة المحاولة، والمخرجات الكبيرة بشكل غير عادي، ومعدلات الفشل عبر الملفات النظيفة والفوضوية.
  6. تصميم مسار احتياطي. حدد ما يحدث عندما تكون الصفحة غير مدعومة، أو فارغة، أو مشوهة، أو تفشل في قاعدة التحقق من صحة الأعمال.
  7. قارن مع خط الأنابيب الحالي. السؤال الصحيح ليس ما إذا كان Parse يتفوق على المعيار. يتعلق الأمر بما إذا كان يعمل على تحسين دقة الاسترجاع وتقليل تكلفة التشغيل الإجمالية لمستنداتك.

لمزيد من المعلومات الأساسية عن بقية الهندسة المعمارية، راجع دليلنا ل واجهات برمجة التطبيقات RAG وتوليد الاسترجاع المعزز، نظرة عامة على قواعد بيانات المتجهات، والفرق بين البحث الدلالي والضبط.

هل Cohere Parse أفضل من OCR التقليدي؟

بالنسبة للتخطيطات المعقدة والجداول والنماذج والمحتوى المرئي المختلط، يمكن لمحلل لغة الرؤية الحفاظ على المعنى الذي يفتقده OCR الأساسي. هذا لا يجعل OCR التقليدي قديمًا.

قد يظل نظام OCR الناضج أسرع، أو أرخص، أو أسهل في التدقيق، أو أكثر قابلية للتنبؤ به لعمليات المسح النظيفة والقوالب الثابتة. تقدم بعض خدمات ذكاء المستندات أيضًا درجات الثقة وحقول JSON المكتوبة التي يفتقر إليها التحليل. يجب أن يعتمد الاختيار على الملفات والمهمة النهائية، وليس على حداثة التسمية.

التقسيم المفيد بسيط: إذا كانت المشكلة تكمن بشكل أساسي في التعرف على الأحرف، فقد يكون OCR التقليدي كافيًا. إذا كانت المشكلة تكمن في فهم كيفية تنظيم الصفحة حتى يتمكن الذكاء الاصطناعي من البحث عنها أو التفكير فيها، فإن Parse ينتمي إلى التقييم.

ماذا يعني هذا الإصدار للمؤسسة RAG

لسنوات، ذهب معظم الاهتمام في RAG إلى قواعد البيانات المتجهة، ونماذج التضمين، وإعادة الترتيب، والمولدات. تم التعامل مع التحليل على أنه سباكة. يعكس إطلاق Cohere وجهة نظر أكثر نضجًا: يستحق الاستيعاب نموذجًا خاصًا به ومجموعة تقييم ونموذج تكلفة وقرار نشر.

هذه أخبار جيدة حتى بالنسبة للفرق التي لم تختار Cohere Parse أبدًا. إنه يدفع الصناعة إلى طرح أسئلة أفضل. ما هي المعلومات المفقودة قبل الفهرسة؟ ما هي التخطيطات التي تكسر عملية الاسترجاع؟ هل يمكن إرجاع الاقتباس إلى الصفحة الصحيحة؟ ماذا يحدث عندما يتم تسوية الجدول بشكل غير صحيح؟ هذه الأسئلة أقرب إلى جودة RAG الحقيقية من مقارنة أخرى لنثر روبوت الدردشة.

يعزز Parse أيضًا مكانة Cohere كشركة استرجاع شاملة. يمكن للشركة الآن تقديم مسار من ملف PDF غير مفتوح إلى إجابة مؤرضة، مع الاستمرار في السماح للفرق باعتماد مكون واحد في كل مرة.

الأسئلة المتداولة

ما هو محلل Cohere 5.0؟

"Cohere Parser 5.0" هو اختصار شائع لـ Cohere Parse v5.0، وهو نموذج لغة رؤية يحول مستندات وصور المؤسسة إلى Markdown للبحث وRAG ومعالجة المستندات ووكلاء الذكاء الاصطناعي.

ما هي تنسيقات الملفات التي يدعمها Cohere Parse؟

تسرد وثائق التحليل المستقلة ملفات PDF وPowerPoint وJPEG. يدعم Cohere Compass التنسيقات الإضافية، بما في ذلك Word وExcel وHTML، من خلال مسار الإدخال المُدار الخاص به.

ما هي اللغات التي يدعمها Parse v5.0؟

يسرد Cohere تسع لغات ثابتة: العربية والإنجليزية والفرنسية والألمانية والإيطالية واليابانية والكورية والبرتغالية والإسبانية. قد تعمل اللغات الأخرى بدون طلقة وبدقة أقل.

هل يقوم Cohere Parse بإرجاع JSON؟

لا، يقوم التحليل حاليًا بإرجاع Markdown، مع الجداول الممثلة بتنسيق HTML. يجب على الفرق التي تحتاج إلى مخطط JSON صارم إضافة خطوة منفصلة للاستخراج والتحقق من الصحة.

هل يمكن للتحليل استخراج البيانات من الرسوم البيانية؟

ليست مثل سلسلة البيانات المنظمة في الإصدار الحالي. يمكنه التعامل مع المخططات كعناصر مرئية وتوفير بيانات وصفية، لكن Cohere يقول أنه تم التخطيط لاستخراج المخطط الرقمي لإصدار مستقبلي.

كم تكلفة Cohere Parse؟

يسرد Cohere واجهة برمجة التطبيقات العامة بسعر 1.50 دولارًا لكل 1000 صفحة. تعتمد اقتصاديات نموذج Vault الخاص على النشر والاستخدام، لذلك يجب على الفرق ذات الحجم الكبير مقارنة التكلفة الإجمالية مع الإنتاجية الخاصة بهم.

خلاصة القول

Cohere Parse v5.0 ليس chatbot جديد وليس نظام RAG كاملاً. إنه النموذج الذي يحاول جعل المستند قابلاً للاستخدام قبل بدء استرجاعه.

قد يبدو هذا مهمة ضيقة، لكنه يقع عند النقطة التي يتم فيها إنشاء العديد من حالات فشل RAG. يجلب Parse الفهم البصري واستخراج الجداول والنماذج والدعم متعدد اللغات والتسعير المتوقع لكل صفحة والنشر الخاص إلى تلك المرحلة الأولى. حدوده — إخراج Markdown فقط، ونقاط عدم الثقة، والتنسيقات المستقلة المحدودة، وعدم استخراج المخططات الرقمية — حقيقية ويجب أن تشكل أي تقييم.

الدرس الأكبر واضح ومباشر: الإجابات الأفضل لا تبدأ بنموذج لغوي أكبر. يبدأون بتمثيل صادق للمصدر. بالنسبة للمؤسسات التي تعتمد الذكاء الاصطناعي على المعرفة الخاصة، لم يعد التحليل خطوة مملة. إنها جزء من طبقة الذكاء.

مساعدك الأول على بعد دقائق

ضع معرفتك التجارية في العمل.

ابدأ بحساب Cody مجاني. أضف المحتوى الخاص بك، وقم بإنشاء مساعد، وشارك أول إجابة مفيدة اليوم.