هل مات RAG في 2026؟ الحسابات تقول لا — لكنه غيّر شكله
AI & ML
By Syed Sartaj Ahmed · 7/21/2026 · 9 min read

هل مات RAG في 2026؟ لا — لكن النسخة التي علّمتها معظم الدروس ماتت فعلًا. كل نموذج حدودي يبيع اليوم نافذة سياق بمليون توكن، فعادت نصيحة «احشُر كل شيء في المطالبة». المشكلتان: المطالبة غير المخبأة بمليون توكن تكلف 2–5 دولارات لكل استعلام (بينما استعلام الاسترجاع أقل من سنتين)، والنماذج تتدهور قياسيًا قبل بلوغ نافذتها المعلنة بكثير. ما حدث فعلًا أن الاسترجاع صعد في المكدس — من خط أنابيب ثابت إلى بحث هجين وإعادة ترتيب وأداة يستدعيها الوكيل عندما يقرر.
عصر المليون توكن حقيقي — والفاتورة كذلك
Claude وعائلة GPT-5.6 تشحن نوافذ مليون توكن بالأسعار القياسية (أسقطت Anthropic رسم السياق الطويل؛ وما تزال Gemini تضيف رسمًا فوق 200 ألف). لكن السعة ليست اقتصادًا: استدعاء واحد غير مخبأ بمليون توكن يكلف 2–5 دولارات قبل توكنات الإخراج، بينما استعلام RAG نموذجي بثلاثة إلى خمسة آلاف توكن يكلف أقل من 0.02 دولار. تحليل LightOn الإنتاجي: الاسترجاع أرخص 8–82 مرة من السياق الطويل لأحمال العمل النموذجية، وبزمن استجابة أفضل.
تدهور السياق: مقاس لا انطباعات
- دراسة Chroma (18 نموذجًا): كل النماذج تتدهور بشكل غير منتظم مع نمو الإدخال؛ مشتِّت واحد يخفض الدقة؛ والمطالبات المركزة تتفوق على الكاملة في النماذج الثمانية عشر كلها.
- NoLiMa (ICML 2025): عندما لا تتطابق «الإبرة» معجميًا مع السؤال، يهبط 11 من 12 نموذجًا تحت 50% من خط أساسها القصير عند 32 ألف توكن فقط.
- RULER (NVIDIA): طول السياق الفعّال يعادل 50–65% من الرقم المعلن تقريبًا.
- وإرشادات Anthropic الهندسية تقولها صراحة: كلما كبر السياق انخفضت دقة الاستدعاء — للنماذج «ميزانية انتباه» محدودة.
ألا يصلح تخبئة المطالبات الاقتصاد؟
جزئيًا — وللمجموعات الثابتة المشتركة فقط. القراءة المخبأة أرخص ~90%، لكن ذلك يُبقي استعلام المليون توكن حاملًا 30–80 ضعف حجم توكنات استعلام الاسترجاع. والأسوأ أن الخبيئة تنكسر حيث تعيش المؤسسات: عند تحديث المحتوى، أو عندما يُسمح لكل مستخدم برؤية مجموعته الخاصة فقط (صلاحيات ACL) فيصبح كل مستخدم إخفاق خبيئة. صلاحيات المستخدمين هي حارس RAG الصامت الذي لا تذكره الآراء الساخنة.
ما الذي حل محل RAG الساذج
- الاسترجاع الهجين + إعادة الترتيب: متجهات كثيفة + BM25 ثم مُعيد ترتيب cross-encoder على 100–200 مرشح — هذه الخطوة، لا نموذج تضمين أفضل، هي أكبر مكسب جودة في الإنتاج.
- البحث الوكيلي: Claude Code وCursor يسترجعان الكود بأدوات grep والملفات في حلقة بدل فهرس متجهي. يُستشهد بذلك على «موت RAG» — لكن grep هو استرجاع. (وقصة «Claude Code اقتلع خط RAG» فولكلور: قيّمت Anthropic الاسترجاع بالتضمينات في نماذج أولية واختارت البحث الوكيلي؛ نسخة الإنتاج لم تشحن قاعدة متجهات قط.) الكود هو الحالة الودودة للبحث المعجمي؛ الاستعلامات الدلالية هي بالضبط حيث يفشل — كما يقيس NoLiMa.
- الاسترجاع كاستدعاء أداة: يقرر الوكيل هل وماذا وأين يسترجع في كل خطوة. كما قيل هذا الشهر: لم يمت RAG — صعد في المكدس.
بيانات التبنّي توافق
مسح Menlo Ventures للمؤسسات (ديسمبر 2025) يضع RAG ثاني تقنيات التخصيص بعد تصميم المطالبات. ونبض VentureBeat للربع الأول 2026 يُظهر نية تبنّي الاسترجاع الهجين تتضاعف ثلاثًا في ربع واحد بينما يخسر باعة قواعد المتجهات حصتهم لصالح منظومات استرجاع مخصصة — ليست هجرة عن الاسترجاع بل إعادة بناء له.
أين يبقى الاسترجاع إلزاميًا
الطزاجة (بياناتك تتغير) · الصلاحيات (تصفية ACL لكل مستخدم تكسر السياق الطويل وخبيئته معًا) · المجموعة أكبر بكثير من السياق (مليون توكن ≈ 1,500 صفحة؛ المؤسسات تملك تيرابايتات) · الاستشهاد والتدقيق («استشهد بالبند حرفيًا» يحتاج إسناد استرجاع).
الأسئلة الشائعة
هل مات RAG في 2026؟
لا. خطوط الأنابيب الساذجة تُستبدل، لكن الاسترجاع نفسه ينمو — بحثًا هجينًا وإعادة ترتيب واسترجاعًا وكيليًا داخل حلقات الوكلاء.
هل تعوّض نافذة المليون توكن عن RAG؟
فقط للمجموعات الصغيرة الثابتة المشتركة حيث لا تهم التكلفة. السياق الفعّال ~50–65% من المعلن، والتدهور يبدأ من 32 ألفًا في المهام غير المعجمية، وفجوة التكلفة 8–82 ضعفًا.
هل يستبدل grep التضمينات؟
للكود غالبًا نعم — المعرفات نصوص حرفية. للأسئلة الدلالية على النثر لا: هذا بالضبط نمط الفشل الذي يقيسه NoLiMa.
تبني منظومة استرجاع أو تصلحها؟ تواصل معي — هذا عملي اليومي.
Tags: RAG, Long Context, Retrieval, Agentic AI, LLM