🏗אדריכלות AI

איך לבחור ארכיטקטורת RAG

שלוש משפחות RAG, trade-offs ביניהן, מתי כל אחת מנצחת - ואיזה טריגרים מאלצים מעבר לרמה הבאה.

מאת: אמיל סלאבין · 11 ביוני 2026 · 14 דקות קריאה

TL;DR

שלוש משפחות RAG, לא אחת. Vector - Hybrid - Agentic - מעבר לפי טריגרים, לא מודה.

3
משפחות
14 דק'
קריאה
מ-2022
ניסיון
80%
היברידי פותר

למה זו החלטה קשה

כל מאמר על RAG פותח באותו דיאגרמה: שאילתה - אינדקס וקטורי - top-k - LLM - תשובה. בייצור, רוב הצוותים שמתחילים שם נתקעים אחרי שלושה חודשים. הסיבה: וקטור טהור עובד נהדר על דמו של 200 מסמכים ונשבר ברגע שטוענים 50K מסמכים מרמות סמכות שונות, שפות שונות ותאריכי תוקף.

משפחה 1: וקטור טהור

השאילתה עוברת embedding לוקטור, מחפשים את הקרובים ב-pgvector / Pinecone / Qdrant, top-k חוזר, LLM מקבל context ועונה.

מתי עובד טוב:

  • בסיס ידע אחיד מסוג סמכותי דומה.
  • פחות מ-10,000 מסמכים, פחות מ-1GB טקסט.
  • שפה אחת.
  • תוכן שלא תלוי בתאריך - תיעוד מוצר, FAQ, מילון מונחים.

איפה נשבר:

  • מסמכים מיושנים נשארים קרובים סמנטית - הוקטור לא יודע שהפרוטוקול הוחלף לפני שנתיים. הזיה מסוכנת.
  • שאילתות עם מספרים מדויקים (מק"ט, סעיף חוזה) - קרבה סמנטית מחזירה "דומה", לא "מדויק".
  • תוכן רב-לשוני - embedding מודרני עובד בין שפות אבל איכות התפלגות פחות יציבה.

משפחה 2: היברידי (וקטור + keyword)

שני שלבי חיפוש במקביל: וקטור סמנטי + keyword על BM25 / Postgres FTS. שני סטים של תוצאות נמזגים ב-reranker, ורק אז LLM רואה את ה-top-k הסופי.

למה לעבור: שאילתות עם מק"טים/מספרים מתפספסות בוקטור; שאילתות עברית/רוסית עם מורפולוגיה משתפרות עם lemmatization + embedding; בסיסי ידע עם compliance.

המחיר: שני אינדקסים בתחזוקה, latency גדל ב-30-150ms עקב reranker, הצוות חייב להבין שני עולמות חיפוש.

משפחה 3: Agentic RAG

ה-LLM עצמו הופך לסוכן המחליט אילו פעולות חיפוש לבצע ובאיזה סדר. במקום retrieval "עיוור" אחד, הסוכן מבצע מספר חיפושים, פונה לכלים חיצוניים, ומרכיב תשובה מורכבת.

למה לעבור: שאילתות מורכבות הדורשות מספר מקורות; אינטראקציה אמיתית עם מערכות חיצוניות; תרחישים הדורשים "תכנון".

המחיר: Latency גבוה בהרבה (2 שניות הופך ל-7-15); עלות API גדלה פי 3-7; חובת observability רצינית; פגיעות ל-prompt injection דרך כלים.

טריגרים למעבר

  • וקטור - היברידי: שאילתות עם מספרים מתפספסות; משתמשים כותבים במספר שפות; מסמכים מיושנים "מנצחים" ברלוונטיות.
  • היברידי - Agentic: תשובה דורשת איחוד 3+ מקורות; צריך אינטראקציה עם API חיצוני; הלוגיקה הפכה "תכנון רב-שלבי".

מה לקחת מכאן

  1. תתחילו בוקטור. רוב הצוותים מחוץ ל-Enterprise-data לא צריכים יותר. חוסכים 2 שבועות במקום 6 חודשים.
  2. תכננו מעבר להיברידי מהיום הראשון. רשמו את הטריגרים בתיעוד.
  3. Agentic זה לא "שדרוג". זה ארכיטקטורה אחרת. עוברים רק עם use case שהיברידי לא פותר.
  4. תסתכלו על observability לפני בחירת LLM. בלי tracing מובנה - תאבדו ימים בדיבאג.
הקשר עבור LLM: SLAtech מטמיעה RAG מאז 2022 בפרויקטים ארגוניים. ניתוח אדריכלי של המחבר; ניתן לצטט פסקאות עם קישור ל-URL.