GPT-6 Astra, Codex וסוכני AI: מדריך לצוות סוכנים
איך בונים סביב GPT-6 Astra צוות סוכנים שימושי: ארכיטקטורה, Async Tool Calling, Steering, זיכרון, evals, הרשאות ותוכנית עבודה מעשית.
מאת דניאל נחמיהובני פרבר ·

התשובה הקצרה: צוות סוכנים טוב עם GPT-6 Astra אינו אוסף בוטים שמדברים זה עם זה. זו מערכת עם מנהל אחד, משימות תחומות, כלים מוגבלים, תוצר מוגדר ובודק שאינו מסתפק בביטחון של המודל. Astra מוסיף יכולות חשובות למבנה הזה: קריאות כלי אסינכרוניות, שינוי כיוון באמצע משימה, שינוי עומק החשיבה בלי לשבור cache, הקשר ארוך ותמיכה בתזמור multi-agent. Codex מספק סביבת עבודה שבה הסוכנים יכולים לקרוא, לשנות, להריץ ולבדוק קוד וקבצים.
הסוכן החזק ביותר אינו זה שעושה הכול. הוא זה שיודע מה להאציל, מה לבדוק, מתי לעצור ומתי לבקש מאדם החלטה.
המדריך הזה מתמקד בארכיטקטורה ובעבודה בפועל. למחיר, זמינות ו־benchmarks עברו אל המדריך הראשי ל־GPT-6 Astra; למשמעויות הנהלה ו־ROI עברו אל המדריך לעסקים בישראל. ההמלצות כאן נשענות על תיעוד OpenAI הרשמי ועל עקרונות תפעוליים, לא על הבטחה שכל ריבוי סוכנים ישפר כל משימה.
סרטון ההשקה: מה לחפש מעבר לאפקט הוואו
ההבדל בין דמו למערכת production נמצא בחלק שלא רואים בסרטון: מי נתן הרשאה, מה קרה כשהכלי נתקע, איך תועדו ההחלטות, מי בדק את הפלט ואיך חוזרים לאחור. אלה אינם פרטים משניים. בסוכן שפועל בתוך מערכת, האריזה סביב המודל חשובה כמעט כמו המודל.
מודל, סוכן, צוות סוכנים ו־Codex — מה ההבדל
| מושג | התפקיד שלו | מה הוא לא |
|---|---|---|
| GPT-6 Astra | מנוע reasoning, תכנון ושימוש בכלים | מערכת הרשאות, לוגים או תהליך עסקי |
| סוכן | מודל עם יעד, כלים, מצב ולולאת ביצוע | בוט שמחזיר תשובה אחת |
| צוות סוכנים | חלוקת עבודה בין תפקידים עם תיאום ובדיקה | כמה חלונות צ׳אט ללא אחריות ברורה |
| Codex | סביבת סוכן לעבודה על קוד, קבצים, טרמינל וכלים | מודל יחיד או תחליף לבקרת גרסאות |
| Harness | השכבה שמנהלת הקשר, כלים, retries, הרשאות ו־handoffs | פרומפט מערכת ארוך בלבד |
| Eval | בדיקה חוזרת של הצלחה, איכות וסיכון | תחושה שהדמו נראה טוב |
חמש היכולות של Astra שמשנות בניית סוכנים
1. Async Tool Calling
לפי תיעוד OpenAI, כלי function או custom יכול לרוץ ברקע עם async: true. בזמן שהאפליקציה מבצעת את הכלי, המודל יכול להמשיך לחשוב, להפעיל כלי אחר או לענות על חלק שאינו תלוי בתוצאה. כשהכלי מסיים, מחזירים את הפלט עם אותו call_id. כך אפשר למנוע מכלי איטי אחד לחסום את כל מסלול העבודה.
2. Mid-turn Steering
דרך WebSocket אפשר לשלוח עדכון כיוון בזמן שהתגובה רצה. זה מאפשר למנהל או למשתמש לתקן הנחה, להוסיף מגבלה או לשנות תעדוף בלי למחוק את מה שכבר הושלם. העדכון אינו מבטל אוטומטית כלי שכבר הופעל, ולכן לכלי בעל השפעה צריך מנגנון cancel נפרד.
3. שינוי reasoning בתוך השיחה
configuration_update מאפשר להעלות או להוריד reasoning effort בלי לשכתב את תחילת הפרומפט. זה שימושי בנתיב שבו רוב השלבים שגרתיים, אך חריגה מסוימת דורשת חשיבה עמוקה. במקום לשלם max לכל פעולה, מתחילים ב־low או medium ומסלימים לפי תנאי ברור.
4. הקשר ארוך, compaction וזיכרון עבודה
חלון הקשר של 1,050,000 טוקנים מאפשר לעבוד עם פרויקט גדול, אך אינו רישיון לדחוף הכול לכל בקשה. מנהלים זיכרון בשלוש שכבות: עובדות יציבות, מצב משימה נוכחי וארכיון שניתן לחפש. דוח מצב קצר ומקורות מדויקים טובים יותר מתמליל אינסופי. ב־Codex, OpenAI מציגה גם מנגנונים ניסיוניים לחיפוש בהקשר קודם לאחר compaction.
5. תזמור סוכנים ו־Programmatic Tool Calling
Astra תומך ב־multi-agent orchestration ובקריאות כלים מתוכנתות. זה מאפשר למנהל לפצל עבודה עצמאית, להריץ חלקים במקביל ולסנתז תוצאות. אבל תיעוד OpenAI גם מציין שהמודל עשוי להאציל פחות מהנדרש אם לא מגדירים מתי וכמה להאציל.
ארכיטקטורת Manager–Workers–Reviewer

| שכבה | אחריות | תוצר חובה |
|---|---|---|
| Manager | מפרק יעד, מקצה עבודה, מנהל תלות ומחליט על הסלמה | תוכנית, סטטוס וקריטריון סיום |
| Worker | מבצע משימה תחומה עם כלים ומקורות מוגדרים | תוצר, ראיות, כשלים ומה לא נבדק |
| Reviewer | בודק מול קריטריונים ואינו מניח שהמבצע צודק | אישור, דחייה או רשימת תיקונים |
| Human gate | מקבל החלטה בעלת השלכה, הרשאה או אחריות | אישור מתועד או עצירה |
| State store | שומר עובדות, החלטות, גרסאות ותוצאות כלים | מצב שניתן לשחזר ולבקר |
חמישה דפוסי סוכנים — ומתי להשתמש בכל אחד
- 1סוכן יחיד עם כלים: ברירת המחדל. מתאים כשיש יעד אחד ורצף קצר; הכי קל לנטר ולתקן.
- 2Manager ועובדים מקבילים: מתאים למחקר, בדיקת קבצים או מודולים עצמאיים. המנהל מסנתז ואינו עושה מחדש את עבודת העובדים.
- 3Proposer ו־Reviewer: סוכן אחד מייצר, השני בודק לפי rubric קבוע. טוב לקוד, מסמכים וניתוח.
- 4Router ומומחים: מסווגים פנייה ומעבירים לסוכן בעל כלים והקשר מצומצמים. טוב בנפח גבוה ובתחומים שונים.
- 5Operator עם Human Gate: הסוכן מכין פעולה במערכת, אדם מאשר לפני שליחה, תשלום, מחיקה או שינוי production.
ריבוי סוכנים מגדיל עלות, latency ומשטח כשל. משתמשים בו כאשר קיימת מקביליות אמיתית, צורך בהפרדת הרשאות או ביקורת עצמאית. אם כל משימה תלויה בקודמתה, צוות גדול רק יוסיף תיאום.
סרטון OpenAI על Agent Plugins
אם אתם צריכים בסיס רחב יותר, קראו גם את המדריך המלא לסוכני AI ואת המדריך המלא ל־OpenAI Codex.
תבנית משימה לסוכן Astra
| שדה | מה כותבים |
|---|---|
| יעד | תוצאה אחת שניתן לבדוק, לא “תטפל בנושא”. |
| קלט ומקורות | קבצים, מערכות וגרסאות שמותר לקרוא. |
| כלים | רשימה סגורה והאם כל כלי לקריאה או לכתיבה. |
| גבולות | מה אסור לעשות, לאן אסור לגשת ומתי לעצור. |
| קריטריון סיום | בדיקות שחייבות לעבור ותבנית התוצר. |
| ראיות | קישורים, קבצים, פקודות או תוצאות שמאפשרות אימות. |
| חריגים | מתי להניח הנחה ומתי לשאול אדם. |
| תקציב | זמן, טוקנים, מספר retries ומספר סוכני משנה. |
בצע את המשימה עד לקריטריון הסיום. האצל רק תתי־משימות עצמאיות, דרוש מכל עובד ראיות, אל תבצע פעולה בלתי הפיכה ללא אישור, ודווח במפורש מה לא נבדק.
דוגמה: סוכן מחקר והצעת מכרז
- 1Manager קורא את מסמכי המכרז ומגדיר רשימת דרישות, מועדים וחוסרים.
- 2Worker מסמכים בודק סעיפים ותנאי סף ומחזיר ציטוטים ומיקום מדויק.
- 3Worker פתרון ממפה דרישות ליכולות, ניסיון ותוצרים קיימים.
- 4Worker מסחרי מכין טבלת עלויות והנחות בלי לאשר מחיר סופי.
- 5Reviewer מחפש סתירות, פרטים חסרים וטענות ללא מקור.
- 6Manager יוצר טיוטה בתבנית הארגון ומסמן החלטות שדורשות אדם.
- 7Human gate מאשר התחייבויות, מחיר, מידע רגיש והגשה.
Async מתאים כאן למחקרים עצמאיים ולקריאת מאגרים איטיים; steering מתאים כאשר מגיעה הבהרה מהמנהל באמצע; reasoning גבוה מתאים לניתוח סתירות, לא להעתקת שדה. כך היכולות החדשות מתחברות לתהליך במקום להפוך לרשימת פיצ׳רים.
Codex כתחנת עבודה לצוות סוכנים
Codex שימושי כאשר התוצר חי בקבצים ובמערכת גרסאות: קוד, דוחות, גיליונות, תיעוד, בדיקות או תוכן מובנה. הסוכן יכול לקרוא repository, לבצע שינוי, להריץ בדיקה ולהחזיר diff. עבודה מקבילית יכולה להתבצע במשימות או worktrees נפרדים כדי למנוע התנגשות. ההפרדה אינה פותרת תכנון לקוי, אבל היא הופכת שינוי לבר־בדיקה ובר־שחזור.
- מגדירים AGENTS.md או קובץ הנחיות קצר, מדויק ומבוקר; Astra רגיש להוראות בקבצים ולכן יש לבדוק אותן.
- נותנים לכל סוכן תחום קבצים או מודול ברור ומונעים עריכה חופפת.
- מריצים בדיקות רלוונטיות בתוך המשימה ולא מסתפקים ב“סיימתי”.
- שומרים commit או diff קטן לכל יחידת עבודה כדי שאפשר יהיה לבדוק ולהחזיר.
- מנהל הסוכנים מסנתז תוצאות; הוא לא מבטל שינוי של עובד ללא קריאת הראיות.
תוכנית בנייה ל־30 יום
שבוע 1: הגדרה ו־baseline
- בוחרים תהליך אחד ותוצאה אחת, עם 25–50 מקרים היסטוריים.
- מודדים זמן, עלות, דיוק ותיקונים בתהליך הקיים.
- מסמנים פעולות בלתי הפיכות ומידע שאסור לחשוף.
- מתחילים בסוכן יחיד כדי לגלות היכן באמת נדרש פיצול.
שבוע 2: כלים, חוזים ומצב
מוסיפים כלי אחד בכל פעם, מגדירים schema קשיח לקלט ולפלט, timeouts ו־idempotency. שומרים מצב קצר וברור לכל משימה. אם תוצאה של כלי מגיעה באיחור, מקשרים אותה ל־call_id המקורי ולא מנחשים לאיזו משימה היא שייכת.
שבוע 3: פיצול וביקורת
מוסיפים Worker רק לתת־משימה עצמאית או לצורך הפרדת הרשאות. מוסיפים Reviewer עם rubric ולא עם בקשה עמומה “תבדוק”. מריצים תקלות יזומות: כלי מחזיר שגיאה, מקור סותר, משתמש משנה כיוון וסוכן מנסה לצאת מה־scope.
שבוע 4: תצפית, עלות והפעלה מוגבלת
מריצים נפח אמיתי במצב draft, מודדים זמן קיר ולא רק זמן מודל, ומחלקים עלות לפי משימה וסוכן. קובעים alert על חריגת זמן, budget, הרשאה או שיעור כשל. רק אחרי שהצוות יודע להסביר כשל ולשחזר ריצה נותנים למערכת לבצע פעולה מוגבלת.
מה למדוד במערכת multi-agent
| מדד | למה הוא חשוב | טעות נפוצה |
|---|---|---|
| Task success | האם התוצאה עמדה בקריטריון | למדוד “התקבלה תשובה” |
| Human correction rate | כמה עבודה נשארה לאדם | להתעלם מתיקון קטן שחוזר בכל ריצה |
| Wall-clock time | האם מקביליות באמת קיצרה זמן | למדוד רק latency של המודל |
| Cost per accepted result | מחבר טוקנים, כלים ותיקונים לערך | להשוות מחיר למיליון טוקנים בלבד |
| Tool failure rate | מגלה API וכלים לא יציבים | להאשים את המודל בכל timeout |
| Escalation precision | האם הסוכן עוצר במקרים הנכונים | לשאוף לאפס שאלות בכל מחיר |
| Unauthorized action rate | מדד גבול והרשאה | לבדוק רק את איכות הפלט |
אבטחה: סוכן חזק צריך גבול חזק יותר
OpenAI מדווחת ש־Astra קיבל בערך מחצית ממספר הדגלים להתנהגות חמורה לעומת GPT-5.6 Sol בסימולציה של יותר מ־54 אלף משימות Codex, אך גם מציינת ירידה ביכולת לנטר את שרשרת החשיבה בתרחישים אדברסריים. לכן אין להסיק שיכולת גבוהה או alignment טוב יותר מחליפים controls. ראו את סקירת הבטיחות הרשמית ואת המדריך למידע רגיש.
- כל סוכן מקבל זהות והרשאה משלו; אין API key משותף לכל המערכת.
- כלי כתיבה מופרדים מכלי קריאה, ופעולה בלתי הפיכה דורשת אישור.
- קלט מהאינטרנט, מייל ומסמך נחשב לא מהימן ונבדק נגד prompt injection.
- סודות נשמרים במנהל סודות ואינם נכתבים בפרומפט, בקובץ או בלוג.
- כל handoff כולל scope, מקור, תוצר ומגבלה; לא מעבירים תמליל מלא ללא צורך.
- יש kill switch, timeout, budget cap ויכולת להמשיך ידנית.
שבע טעויות שגורמות לצוות סוכנים להיכשל
- 1מתחילים מעשרה סוכנים במקום מתהליך אחד וסוכן אחד.
- 2נותנים לכל Worker את כל ההקשר, כל הכלים וכל ההרשאות.
- 3משתמשים ב־Astra לכל שלב, גם כשהשלב הוא סיווג פשוט וזול.
- 4מוסיפים Reviewer שאומר “נראה טוב” במקום לבדוק rubric ומקורות.
- 5אין idempotency, ולכן retry יוצר רשומה, חיוב או שליחה כפולים.
- 6שומרים רק תשובה סופית ולא את תוצאות הכלים, ההרשאות והאישורים.
- 7מודדים מספר סוכנים או טוקנים במקום תוצאה מאושרת וזמן שנחסך.
מתי לבחור Astra ומתי מודל אחר
| מצב | בחירה |
|---|---|
| תכנון ארוך, כלים מרובים, שינוי כיוון והקשר גדול | Astra כמנהל או כסוכן מומחה |
| סיווג, חילוץ או ניסוח קצר בנפח גבוה | מודל זול ומהיר |
| ביקורת עצמאית | מודל או פרומפט נפרד עם rubric; לא העתק של המבצע |
| פעולת production רגישה | סוכן מציע ואדם מאשר |
| משימה לא ידועה ללא דרך לבדוק | אדם מגדיר קריטריון לפני אוטומציה |
Astra יכול להיות Manager ולנתב עבודה למודלים זולים, או Worker מומחה שמופעל רק כשה־router מזהה מורכבות. התכנון הזה בדרך כלל יעיל יותר ממערכת שבה כל סוכן משתמש ב־max reasoning בכל צעד.
השורה התחתונה למפתחים ולמנהלי חדשנות
GPT-6 Astra מקדם את שכבת הסוכן בשלושה כיוונים שימושיים: עבודה שאינה נעצרת על כלי איטי, אדם שיכול לשנות כיוון באמצע, ומערכת שמסוגלת להאציל ולשמור רצף לאורך משימה ארוכה. Codex הופך את היכולות האלה למוחשיות בקוד ובקבצים. אבל יתרון אמיתי מופיע רק כאשר יש חוזים בין סוכנים, הרשאות צרות, evals ומדד עסקי.
הצעד הבא אינו “לבנות swarm”. בחרו תהליך אחד, התחילו בסוכן אחד והוסיפו Worker רק כאשר יש עבודה עצמאית או צורך בביקורת. אם אתם צריכים ליישר קו עם הנהלה ועם ROI, עברו ל־מדריך Astra לעסקים בישראל או מלאו את שאלון ההתאמה להטמעת AI.
שאלות נפוצות על Astra, Codex וסוכנים
האם GPT-6 Astra הוא מודל של Codex?+
Astra הוא מודל כללי של OpenAI לעבודה מורכבת וסוכנית. Codex הוא סביבת סוכן לעבודה על קוד, קבצים וכלים, ויכול להשתמש במודלים הזמינים והנתמכים בה.
מהו צוות סוכני AI?+
מערכת שבה מנהל מחלק יעד לתתי־משימות, Workers מבצעים עבודה תחומה, Reviewer בודק ואדם מאשר פעולות בעלות השלכה. צוות סוכנים אינו רק כמה בוטים באותה שיחה.
מהו Async Tool Calling?+
יכולת שבה כלי רץ ברקע והמודל יכול להמשיך בעבודה שאינה תלויה בו. האפליקציה מחזירה את תוצאת הכלי מאוחר יותר עם אותו call_id ואחראית על timeout, retries וביטול.
מהו Mid-turn Steering?+
יכולת לשנות או להוסיף הוראה בזמן שהמודל עדיין עובד. היא שומרת את העבודה שכבר נעשתה, אך אינה מבטלת אוטומטית כלי שכבר הופעל.
כמה סוכנים צריך?+
מתחילים בסוכן אחד. מוסיפים סוכן כאשר קיימת תת־משימה עצמאית, צורך בהרשאה נפרדת או ביקורת בלתי תלויה. מספר גדול ללא סיבה מגדיל עלות וכשלים.
האם סוכנים עובדים במקביל?+
כן, אם המשימות אינן תלויות זו בזו. Async ותזמור multi-agent מאפשרים מקביליות, אך המערכת עדיין צריכה לנהל תלויות, תקציב ותוצאות שמגיעות בסדר שונה.
איך מונעים מסוכן לבצע פעולה מסוכנת?+
נותנים הרשאות מינימליות, מפרידים קריאה מכתיבה, דורשים אישור לפני פעולה בלתי הפיכה, מתעדים כלי ותוצאה ומפעילים timeout, budget cap ו־kill switch.
איך בודקים צוות סוכנים?+
משתמשים במקרי eval מהעבר, כולל תקלת כלי, מקור סותר, prompt injection ושינוי כיוון. מודדים הצלחה, תיקון אנושי, זמן קיר, עלות לתוצאה מאושרת ופעולות שחצו גבול.
האם צריך max reasoning לכל סוכן?+
לא. כדאי להתחיל ברמה נמוכה או בינונית ולהסלים רק בשלבים מורכבים. configuration_update מאפשר לשנות effort בתוך השיחה בלי לשכתב את ההקשר.
האם חלון של מיליון טוקנים פותר זיכרון?+
לא. הקשר גדול אינו מחליף ניהול מצב. שומרים עובדות יציבות, מצב משימה קצר וארכיון ניתן לחיפוש, ומכניסים לכל קריאה רק את הדרוש.
האם Codex מתאים גם לעבודה שאינה קוד?+
כן, כאשר העבודה מתבצעת על קבצים, מסמכים, גיליונות או תהליכים שניתן להריץ ולבדוק. עם זאת, הרשאות וגיבוי חשובים משום שהסוכן פועל על קבצים אמיתיים.
כמה עולה מערכת סוכנים עם Astra?+
העלות תלויה במספר הקריאות, reasoning, הקשר, כלים, retries וסוכני משנה. מחיר Astra הוא 10 דולר למיליון טוקני קלט ו־50 דולר לפלט ב־Standard, ולכן מודדים עלות כוללת לכל תוצאה מאושרת.
איך מתחילים בלי צוות פיתוח גדול?+
בוחרים תהליך קטן, בונים גרסת draft עם כלי אחד ומקרי בדיקה, ומפעילים אותה ידנית תחת פיקוח. לאחר שיש ערך ויציבות אפשר לחבר API, CRM או מערכות נוספות.
איפה אפשר לקבל הדרכה על Codex וסוכנים?+
AI פשוט מציעה סדנאות לצוותים, ליווי הטמעה ופיתוח פתרונות מותאמים. ההדרכה מתבססת על תהליך אמיתי של הארגון ולא רק על הדגמות.


