איך 79 כלים שברו סוכן AI ואיך Tool Pruning תיקן את זה. -80% טוקנים, תגובות מהירות, בלי שקרים.
תוכן מלא
# Tool Pruning — למה הסוכן שלכם משקר 🤥
תובנה קריטית מ**יובל אבידני** (בונה Logan, בוט WhatsApp AI עם 79 כלים).
## הבעיה
יובל בנה בוט עם **79 כלים**: מייל, יומן, משימות, תמונות, סרטונים, שיחות טלפון. הכל.
אבל הבוט אמר: "אני לא יכול לגשת למייל שלך" — למרות שיש לו גישה מלאה!
## מה קרה?
```
79 כלים × ~165 טוקנים לכלי = ~13,000 טוקנים
+ פרומפט + היסטוריה = ~17,000 טוקנים
מגבלת המודל = 8,000 טוקנים
```
**הבקשה נדחתה לפני שהמודל ראה אותה.** הוא אפילו לא הספיק לקרוא את ההודעה.
> זה כמו להגיש לאורח במסעדה תפריט של 79 עמודים כשהוא ביקש סטייק.
## הפתרון: Tool Pruning
לפני שליחה ל-LLM — קוראים את ההודעה ושולחים **רק כלים רלוונטיים**:
| הודעה | כלים שנשלחים |
|-------|---------------|
| "מה המייל שלי?" | 11 (מייל + בסיס) |
| "צור תמונה של חתול" | 8 (מדיה + בסיס) |
| "מה ביומן מחר?" | 9 (יומן + בסיס) |
במקום 79. בכל פעם.
## התוצאות
- 📉 **-80% טוקנים** לבקשה
- ⚡ תגובות **מהירות יותר**
- 💰 **עלויות נמוכות** יותר
- ✅ **הבוט הפסיק לשקר**
## למה אף אחד לא מספר על זה?
API של OpenAI, Anthropic, Google — בדוקומנטציה כתוב: "תשלח כלים, המודל יבחר."
וזה **עובד עם 5 כלים**. עם 79? **זה מתפרק.**
## איך לממש Tool Pruning?
### גישה 1: סיווג לפי קטגוריות
```
mail_tools = [read_email, send_email, search_email, ...]
calendar_tools = [get_events, create_event, ...]
media_tools = [generate_image, create_video, ...]
base_tools = [reply, help, status] # תמיד נשלחים
```
### גישה 2: LLM Router קל
מודל קטן וזול שמסווג את ההודעה לקטגוריה ובוחר כלים.
### גישה 3: Embedding similarity
מחשבים דמיון בין ההודעה לתיאור כל כלי, שולחים את ה-top-K.
## 💡 הלקח
> **יותר יכולות ≠ ביצועים טובים יותר.**
> לפעמים הדבר הכי חכם שאפשר לעשות הוא להגיד למודל **פחות**.
בפעם הבאה שהסוכן שלכם "לא יכול" לעשות משהו — אולי הוא לא טיפש. **אולי הוא חנוק.**
---
*מאת [יובל אבידני](https://yuv.ai) — בונה Logan*