רעיונות מחקריים · 13 דק׳ קריאה · 13 ביולי 2026

29 agents שצודקים ב-99% הם מערכת שצודקת ב-74.7%

agent אחד שמדויק ב-99% נשמע מצוין. יש לנו 29 בפרודקשן. תשרשר אותם, ואתה ב-74.7 אחוז. זה לא באג. זו מכפלה.

0.25.50.751.0110202940n (agents in series)P(system correct)P(system correct) = ∏ pᵢ0.9990.990.9529 agents → 0.747
אמינות קצה-לקצה = מכפלת הדיוקיויות. הצניחה מתלולה עם n.

המכפלה, לא הסכום

וזה עוד התרחיש הטוב. ב-95% לכל agent המערכת צונחת ל-22.6%. כדי ש-90% מהריצות יצליחו מקצה לקצה, כל agent צריך דיוק של 99.6%.

A10.990×0.99A20.980×0.99A30.970×0.99A40.961×0.99A50.951A290.7470.99²⁹ = 0.747every handoff multiplies by a factor < 1
כל handoff הוא גורם שקטן מ-1. המכפלה לא סלחנית.

אמינות של multi-agent היא מכפלה. כל handoff הוא עוד גורם שקטן מ-1.


טעות מוקדמת יקרה יותר

הכשל הזה שקט. אין exception, ה-pipeline ירוק. agent שטועה מוקדם מרעיל את כל מי שבונה על הפלט שלו. agent מספר 3 שטועה גורר 26 אחריו.

132926 downstreamerror at step 3
כשל שקט: אין exception. טעות מוקדמת נוסעת קדימה לכל מי שאחריה.

טעות מוקדמת לא נשארת מוקדמת. היא נוסעת עד הסוף.


הפתרון: ריבוי דעות, לא agent חכם יותר

בנקודה קריטית אל תשאל מודל אחד פעם אחת. תשאל כמה מודלים, עם כמה prompts, וקח majority vote. משפט קונדורסה (1785): רוב של דעות בלתי-תלויות, שכל אחת צודקת ביותר מ-50%, מתכנס לוודאות ככל שמוסיפים עוד. זה self-consistency, מורחב מעבר לדגימות: שונות על פני מודלים ו-prompts, לא רק על פני temperature.

.50.60.70.80.901.0159131721k (samples, odd)P(vote correct)Majority vote of k samples → P(correct)0.80.70.6Condorcet 1785 → self-consistency 2022
כל דגימה בלתי-תלויה נוספת מקרבת את ההצבעה לוודאות (כש-p>0.5).

דעה אחת היא הימור. חמש דעות בלתי-תלויות הן כבר החלטה.


דעה שנייה חייבת להיות שונה

לשאול את אותו מודל עם אותו prompt חמש פעמים זו לא דעה שנייה. זו אותה דעה חמש פעמים. הטעויות מתואמות, והשיפור נתקע ברצפה של ρσ². המנוף הוא דקורלציה: מודלים שונים, prompts שונים, זוויות שונות. כאן היתרון של 2026: יש היום שפע מודלים פתוחים, אז דעה שנייה אמיתית ממשפחת מודלים אחרת עולה כמעט כלום.

0.25.50.801.015101520k (samples)Var(vote)Var of vote vs k (σ² = 1)floor = ρσ²ρ = 0.8ρ = 0
חזרה לא מספיקה: הקורלציה קובעת רצפה. המנוף הוא דקורלציה.

חמישה agents שחושבים אותו דבר הם agent אחד עם חשבון פי חמש.


מה שיקרה השנה

התובנה הזאת כבר לא סוד. בשנה הקרובה נראה יותר ויותר ספקיות מריצות כמה מודלים מאחורי ה-API ומצביעות ביניהם. את התוצאה הן מגישות כ"מודל" אחד חכם יותר. זה לא מודל טוב יותר. זו הצבעה של ריבוי דעות עטופה ב-endpoint אחד. ומאחורי הקלעים רצות חמש הרצות, אז המחיר עליך.

several models + several promptsmodel Amodel Bmodel Cvoteone API → one "model"sold as an upgradethey run k, you pay for k
ספקיות יריצו ensemble מאחורי ה-API ויקראו לזה מודל טוב יותר. אתה משלם על ההרצות.

"המודל השתפר" יהיה "המודל מצביע עכשיו בחמישה עותקים, ומחייב אותך על כולם."


זה לא eval, זה ריבוי דעות

eval אומר לך אם טעית. הוא לא מוריד את הטעות. מה שמוריד אותה זה ריבוי דעות בלתי-תלויות בנקודות הקריטיות: כמה מודלים, כמה prompts, הצבעה. ובמקביל, כל handoff שאתה מוריד הוא גורם שאתה כבר לא מכפיל. זה earned autonomy: אוטונומיה רק לצעד שבאמת הרוויח אותה.

agent אחד ב-99% זה הישג. 29 בטור ב-99% זו מערכת שטועה כל יום. אל תשפר את ה-agent. תקצר את השרשרת, או תוסיף לה דעות בלתי-תלויות.

רוצה את המאמר הבא במייל?