Agent interface — AI Launchpad (read-only)

Self-Hosting Local LLMs: Complete Guide

Human site · עברית · llms.txt · llms-full.txt · JSON index · Markdown

← All guides · JSON · Markdown

Everything you need to know before running AI models locally - hardware, privacy, prompting, and realistic expectations.

מדריך חיוני לכל מי שרוצה להריץ AI מקומית. מציג ציפיות ריאליסטיות ומדריך מעשי.

Full content

# הרצת מודלי AI מקומית על המחשב

AI מקומי חצה את הסף מ"צעצוע מגניב" ל"כלי שימושי באמת" בזכות מודלים דחוסים (quantized) ותוספים שמפתיעים ביכולות שלהם, גם על חומרה צנועה.

---

## 🖥️ חומרה: ה-GPU הוא לא צוואר הבקבוק שחשבתם

כשמדברים על LLM מקומי, השיחה מיד נופלת ל"כמה VRAM יש לך". אבל בפועל, זה רק חלק מהתמונה:

- **מודל 7B ב-Q4/Q5** נכנס בנוחות גם ב-GTX 1070
- **צוואר הבקבוק האמיתי**: רוחב פס של זיכרון (memory bandwidth) ועומס CPU
- **מהירות דיסק חשובה** - טעינת מודלים של מספר GB מדיסק איטי = המתנה מתסכלת
- **SSD עם PCIe Gen 3** ומעלה מומלץ מאוד

**טיפ:** כרטיס גרפי ישן למשחקים מסוגל יותר ממה שאתם חושבים!

---

## 🔒 מקומי לא תמיד אומר פרטי

אחת הסיבות העיקריות להרצה מקומית היא פרטיות - אין prompts שיוצאים מהרשת שלכם. **אבל זה נכון רק אם אתם זהירים:**

- הרבה ממשקים מקומיים פופולריים מחזירים תלויות ענן בשקט: בדיקות עדכונים, embedding APIs, מערכות תוספים, אנליטיקס
- קל מאוד לחשוף בטעות את ה-UI לרשת דרך reverse proxy
- חשבו היכן השיחות נשמרות, כמה זמן הן נשארות, ומי יכול לגשת

**כלל: אם המטרה היא פרטיות - בדקו כל רכיב בשרשרת!**

---

## ✍️ פרומפטינג חשוב הרבה יותר

מודלים ענקיים בענן (ChatGPT, Claude) יכולים להסתדר עם פרומפטים מעורפלים כי יש להם שכבות fine-tuning שמפצות. **מודלים מקומיים קטנים - לא.**

- **מודל 7B עם פרומפט טוב** ירגיש חד ואמין יותר ממודל 13B עם פרומפט גרוע
- **System prompts קריטיים** - אין שכבת כיול מוסתרת שמפצה על הוראות מעורפלות
- היו ספציפיים ומדויקים במה שאתם מבקשים

---

## ⚖️ זה לא תחליף 1:1 למנוי

גם אם תריצו מספר GPUs חזקים עם מודל ענק - זה עדיין זעיר בהשוואה למה שחברות כמו OpenAI ו-Anthropic בנו. **וזה בסדר.**

### איפה מודל מקומי כן מצטיין:
- ✅ עוזר פרטי זמין תמיד
- ✅ סיכום מסמכים
- ✅ חיפוש בקבצים מקומיים
- ✅ עזרה בסקריפטים
- ✅ לוח תהודה לרעיונות
- ✅ שליטה מלאה שלכם

### איפה הוא לא מספיק:
- ❌ משימות מורכבות שדורשות reasoning עמוק
- ❌ יצירת קוד מורכב
- ❌ ניתוח מסמכים ארוכים (חלון קונטקסט מוגבל)

---

## 🚀 איך מתחילים?

### שלב 1: התקנת Ollama (הדרך הקלה ביותר)
```bash
curl -fsSL https://ollama.com/install.sh | sh
```

### שלב 2: הורדת מודל
```bash
# מודל קל ומהיר (מומלץ להתחלה)
ollama pull llama3.2:3b

# מודל חזק יותר (צריך 8GB+ VRAM)
ollama pull deepseek-r1:8b

# מודל עברית/רב-לשוני
ollama pull qwen2.5:7b-instruct
```

### שלב 3: שימוש
```bash
# צ׳אט בטרמינל
ollama run llama3.2:3b

# או חברו ל-Open WebUI לממשק גרפי
docker run -d -p 3000:8080 ghcr.io/open-webui/open-webui:main
```

### דרישות חומרה מינימליות
| מודל | VRAM | RAM | דוגמאות GPU |
|------|------|-----|------------|
| 3B (Q4) | 2-3 GB | 8 GB | GTX 1060, RX 580 |
| 7B (Q4) | 4-5 GB | 16 GB | GTX 1070, RTX 2060 |
| 13B (Q4) | 8-10 GB | 16 GB | RTX 3070, RTX 4060 |
| 70B (Q4) | 40+ GB | 64 GB | 2x RTX 3090 |

---

## 💡 השורה התחתונה

AI מקומי מתגמל סבלנות יותר מחומרה חזקה. אם אתם מצפים לשחזר את חוויית ChatGPT - תתאכזבו. אם אתם מתייחסים לזה כמו לכל תשתית self-hosted - משהו לא מושלם, ניתן להתאמה, ותלוי באיך שמשתמשים בו - זה מתחיל להיות הגיוני מאוד.

[מקור: Ty Sherback - XDA Developers](https://www.xda-developers.com/things-i-wish-someone-had-told-me-before-i-tried-self-hosting-a-local-llm/)

Human guide page (canonical)

Dror Moshe Aharoni / דרור משה אהרוניAha.Dror.AI@gmail.com WhatsApp

Detected agents are redirected here automatically. Override with ?view=agent or ?view=human.