[קלוד·LEARN]מבית אנתרופיק ישראל
מאמר

חשיבה מורחבת - מה קורה לפני שקלוד עונה

המודלים החדשים חושבים לבד לפני התשובה: מתכננים, בודקים ומתקנים. מה זה אומר, כמה זה עולה, ומתי לכוון את זה.

מה זה חשיבה מורחבת

מודל שפה קלאסי מייצר תשובה מילה אחרי מילה, בלי אפשרות לעצור באמצע ולומר “רגע, טעיתי בהתחלה”. אם הצעד הראשון של הפתרון היה שגוי, כל השאר נבנה עליו. חשיבה מורחבת שוברת את הדפוס הזה: לפני שהמודל מתחיל לכתוב את התשובה שאתם רואים, הוא מייצר לעצמו מרחב עבודה - מפרק את הבעיה, שוקל כמה גישות, בודק את עצמו, מגלה סתירה וחוזר בו.

ההבדל מתשובה רגילה הוא לא בסגנון אלא בסדר הפעולות. בלי חשיבה, המילה הראשונה של התשובה נכתבת לפני שהמודל “החליט” מה הפתרון. עם חשיבה, ההחלטה מתגבשת קודם, והתשובה היא הצגה מסודרת שלה. לכן ההשפעה הגדולה ביותר מורגשת דווקא במשימות שיש בהן שלבים תלויים זה בזה: מתמטיקה, ניפוי באגים, תכנון ארכיטקטורה, ניתוח מסמך ארוך שדורש הצלבה בין חלקים.

בממשק של claude.ai זה לא מוסתר. מעל התשובה מופיע בלוק חשיבה מתקפל, ואפשר לפתוח אותו ולראות סיכום של מהלך המחשבה תוך כדי שהוא נכתב. זה שימושי לא רק מסקרנות: כשהתשובה יוצאת מוזרה, הסיכום מראה בדרך כלל בדיוק איפה המודל הבין את הבקשה אחרת ממה שהתכוונתם.

חשיבה אדפטיבית - המודל מחליט

בגרסאות הראשונות של היכולת, החשיבה הייתה מתג שהמפתח מפעיל, עם תקציב טוקנים שהוא קובע ידנית: כמה טוקנים מותר למודל לבזבז על מחשבות. זה עבד, אבל הכריח לנחש. תקציב נמוך מדי חתך את החשיבה באמצע; תקציב גבוה מדי בזבז כסף על שאלות פשוטות.

בדור הנוכחי - משפחת קלוד 5 - הגישה התהפכה. החשיבה היא אדפטיבית: המודל מחליט בעצמו, לכל בקשה בנפרד, אם בכלל צריך לחשוב וכמה. שאלה כמו “מה בירת פורטוגל” לא מקבלת חשיבה בכלל. בקשה לאתר באג בפונקציה רקורסיבית תקבל מהלך מחשבה ארוך. הפרמטר budget_tokens הישן הוסר מהמודלים החדשים, ובמקומו מגיע thinking במצב adaptive.

ב-Fable 5, המודל החזק ביותר בשורה, החשיבה פעילה תמיד - היא לא תוספת אלא חלק מאיך שהמודל עובד. אין מה לכבות, והשאלה “להפעיל או לא” פשוט לא רלוונטית יותר. מה שנשאר בידיים שלכם זו שאלה אחרת: כמה עומק.

פרמטר effort - כמה עומק להשקיע

השליטה עברה מתקציב טוקנים לחוגה איכותית אחת: output_config.effort. יש לה חמישה מצבים - low, medium, high, xhigh ו-max - וברירת המחדל היא high.

  • low - כשמהירות ועלות חשובות יותר מהניואנס האחרון. סיווג, חילוץ שדות ממסמך, ניסוח מחדש של טקסט קצר.
  • medium - איזון סביר כשהמשימה לא טריוויאלית אבל גם לא באמת קשה.
  • high - ברירת המחדל, ומתאימה לרוב העבודה הרצינית. אם אתם מתלבטים, זו התשובה.
  • xhigh - מומלץ לקוד ולמשימות סוכן קשות: ריפקטור שנוגע בהרבה קבצים, באג שלא מצליחים לשחזר, תכנון של מהלך רב-שלבי.
  • max - הקצה. לשמור למקרים שבהם באמת שווה לחכות.

הבקשה עצמה נשארת פשוטה:

POST /v1/messagesjson
{
  "model": "claude-opus-5",
  "max_tokens": 8000,
  "thinking": { "type": "adaptive" },
  "output_config": { "effort": "xhigh" },
  "messages": [
    {
      "role": "user",
      "content": "הפונקציה הזו מחזירה תוצאה נכונה על מערכים קצרים ונתקעת על ארוכים. מצא את הבאג והסבר אותו."
    }
  ]
}

בתשובה יחזרו בלוקים מסוג thinking לצד בלוקי הטקסט הרגילים. שימו לב שכשמעלים את effort, כדאי להשאיר max_tokens נדיב - הטוקנים של החשיבה נספרים באותו תקציב פלט, ותקרה נמוכה מדי תקטע את התשובה באמצע.

מה זה עולה

כאן הנקודה שמפתיעה בחשבון הראשון: טוקני חשיבה מחויבים כטוקני פלט, גם אלה שלא מוצגים לכם. כלומר לפי המחיר היקר של השניים - ובמודלים הגדולים הפער בין קלט לפלט הוא פי חמישה.

בפועל ההתפלגות דרמטית. בשאלות פשוטות המודל כמעט לא חושב, והתוספת זניחה עד אפסית - זה בדיוק היתרון של חשיבה אדפטיבית על פני תקציב קבוע. אבל בבקשה מורכבת באמת, מהלך המחשבה יכול להיות ארוך מהתשובה עצמה פי כמה, ואז החשיבה היא רוב החשבון ולא תוספת קטנה בשוליים.

המסקנה התכנונית: אל תעריכו עלות לפי אורך התשובות שאתם רואים על המסך. בדקו את usage שחוזר בתגובה, והפרידו בין המשימות היקרות לזולות לפני שמכפילים בכמות. מי שרוצה לראות איך החישוב הזה נראה מקצה לקצה ימצא דוגמה מלאה ב-כמה זה באמת עולה.

אם יקר לכם

התגובה האינטואיטיבית - “לכבות את החשיבה” - היא לרוב הטעות. מודל בלי חשיבה במשימה קשה מייצר תשובה שגויה, ואז משלמים שוב על התיקון ועל הסיבוב הנוסף. הכיוון הנכון הוא להוריד את effort: מ-xhigh ל-high, או מ-high ל-medium בזרימות פשוטות. משאירים למודל את היכולת לתקן את עצמו, רק בפחות עומק.

היחס ל-Chain of Thought

אנשים מתבלבלים בין השניים, ובצדק - הרעיון דומה. אבל הם חיים בשכבות שונות. Chain of Thought הוא טכניקת פרומפט: אתם מבקשים מהמודל “תחשוב שלב אחרי שלב”, וההסבר מופיע בתוך התשובה. חשיבה מורחבת היא יכולת מובנית שקורית לפני התשובה, מנוהלת על ידי המודל ומופרדת ממנה ב-API.

ההשלכה המעשית: רוב ההנחיות מסוג “חשוב שלב אחרי שלב לפני שאתה עונה” שיושבות היום בפרומפטים ותיקים כבר לא נחוצות. המודל עושה את זה לבד, ולעיתים ההוראה אפילו מזיקה - היא גורמת לו לשפוך לתשובה עצמה את מה שהיה אמור להישאר בשלב החשיבה, ומקבלים תשובה מנופחת.

מתי CoT עדיין שווה? כשאתם רוציםאת ההסבר בתוצר: חומר לימודי שבו הדרך חשובה כמו התשובה, החלטה שצריכה תיעוד נימוקים לצורך ביקורת, פלט שאדם אחר יצטרך לבדוק. אז מבקשים במפורש “הצג את השיקולים בתשובה”. הרחבה על הטכניקה יש ב-Chain of Thought ופירוק משימה.

למעשה - מתי להתערב

התשובה המשעממת והנכונה: ברוב המקרים, לא. ברירת המחדל של המודלים החדשים - חשיבה אדפטיבית עם effort: high - מכוונת היטב, וכל ניסיון לכוון אותה ידנית בלי סיבה בדרך כלל רק מייקר או מחליש.

שני מצבים מצדיקים התערבות. הראשון: המשימה קשה במיוחד ואתם רואים שהמודל מפספס - ריפקטור רחב, באג עמוק, תכנון מערכת. שם xhighמשנה תמונה, ושווה את הזמן והטוקנים. השני: המהירות היא הפיצ'ר - השלמה בזמן הקלדה, סיווג של אלפי פריטים, כל זרימה שבה משתמש ממתין למסך. שם low או medium הם הבחירה הנכונה, וההפרש באיכות במשימות פשוטות זניח.

וכשעובדים בממשק של claude.ai - אין מה לכוון בכלל. אין חוגה, אין הגדרה, המודל מחליט לבד לכל הודעה. מה שכן בידיים שלכם זה איך אתם מנסחים: בקשה שמפרטת אילוצים, פורמט רצוי ומה כבר ניסיתם תיתן לחשיבה על מה לעבוד. בקשה מעורפלת תקבל חשיבה מעורפלת, בכל רמת effort שהיא.

שאלות נפוצות

מה זה Extended Thinking?
מצב שבו קלוד 'חושב' לפני התשובה - מפרק את הבעיה, שוקל גישות, בודק את עצמו - ורק אז כותב את התשובה הסופית. החשיבה מתומחרת כטוקני פלט, ובמודלים החדשים היא אדפטיבית: המודל מחליט לבד מתי וכמה לחשוב.
מה ההבדל בין חשיבה מורחבת ל-Chain of Thought?
CoT הוא טכניקת פרומפט - אתם מבקשים מהמודל להסביר שלבים בתוך התשובה. חשיבה מורחבת היא יכולת מובנית של המודל שמתרחשת לפני התשובה, בלי שביקשתם, ומנוהלת על ידי ה-API. הן משלימות זו את זו.
מה עושה פרמטר effort?
effort קובע כמה מאמץ להשקיע: low לתשובות מהירות וזולות, medium לאיזון, high (ברירת המחדל) לרוב העבודה הרצינית, ו-xhigh או max למשימות הקשות באמת. עומק גבוה יותר = תשובות טובות יותר במשימות מורכבות, אבל יותר טוקנים וזמן.
האם חשיבה עולה כסף?
כן - טוקני החשיבה מחויבים כטוקני פלט גם כשלא רואים אותם. במשימות פשוטות המודל חושב מעט או בכלל לא, ובמשימות קשות החשיבה יכולה להיות רוב העלות. אם העלות חשובה, הורידו את ה-effort במקום לוותר על חשיבה.
האם אפשר לראות את החשיבה של קלוד?
אפשר לקבל סיכום של החשיבה (display: summarized ב-API), אבל לא את שרשרת החשיבה הגולמית. בממשק claude.ai אפשר לפתוח את בלוק החשיבה ולראות את הסיכום תוך כדי עבודה.