עוזר קולי מבוסס בינה מלאכותית, מקומי
Jarvis
עוזר קולי שרץ כולו על המחשב שלי. הוא מקשיב לשם שלו, מבין מה אומרים לו ועונה בקול, בלי ענן ובלי מפתחות API.
- תפקיד
- לבד
- רץ על
- המחשב שלי, בלי אינטרנט
- שפה
- Python
- מודלי AI
- מקומיים, דרך Ollama
למה מקומי
רוב העוזרים הקוליים שולחים כל מה שאומרים להם לשרת. רציתי עוזר שרץ כולו על המחשב שלי: שומע, חושב ועונה בלי ששום דבר יוצא מהמחשב, ובלי לשלם על API.
איך זה עובד
אומרים ״ג׳רוויס״ והוא מתעורר. Whisper הופך את הדיבור לטקסט על כרטיס המסך, מודל שפה מקומי מחליט מה לעשות, והתשובה מוקראת בקול. אחרי כל תשובה יש חצי דקה להמשיך לדבר בלי מילת ההפעלה, ואפשר לקטוע אותו באמצע משפט.
- מוזיקה: הפעלה, השהיה ותור שירים ב-Spotify
- Google: אירועים ביומן, Drive ו-Gmail
- המחשב: עוצמת שמע, אפליקציות, מעבד וזיכרון
- המסך: קורא טקסט מהמסך עם OCR מקומי, ויכול להסתכל דרך המצלמה
גרסה שנייה: למדוד לפני שבוחרים
הגרסה השנייה, שבנויה על מודלי Nous Hermes, היא סוכן שיכול להריץ פקודות במחשב. לפני שבחרתי מודל, מדדתי אותם על כרטיס המסך שלי, RTX 5060 עם 8GB זיכרון.
ההפתעה: רק בערך 6.5GB מהזיכרון הזה באמת פנויים, כי אותו כרטיס מפעיל גם את המסך. מודל שנכנס במלואו רץ בערך פי 14 מהר יותר ממודל גדול יותר שגולש למעבד, ובשלושה מבחני חשיבה המודל הקטן נתן את אותן תשובות.
| מודל | על כרטיס המסך | מהירות |
|---|---|---|
| Hermes 3 8B (Q4) | 100% | 72 טוקנים לשנייה |
| Hermes 4 14B (IQ3_M) | 80% | כ-8 טוקנים לשנייה |
| Hermes 4 14B (Q4_K_M) | 58% | 5.4 טוקנים לשנייה |
שומרים על בטיחות
לתת ל-AI גישה לשורת הפקודה זה מסוכן, אז כל פקודה נבדקת מול רשימה של פקודות קריאה בלבד שמוכרות מראש. כל דבר אחר, כמו מחיקת קובץ, דורש אישור, ואם אין מי שיאשר, התשובה היא לא. בדיקה אוטומטית יוצרת קובץ אמיתי, מנסה למחוק אותו ומוודאת שהוא שרד.
מה זה עושה
- זיהוי הדיבור, מודל השפה וההקראה רצים כולם מקומית
- שליטה קולית ב-Spotify, בעוצמת השמע, באפליקציות, ביומן Google וב-Gmail
- קורא את המסך, ויכול להסתכל דרך המצלמה כשמבקשים
- הגרסה השנייה בוחרת בין מודל מהיר למודל מעמיק, לפי מדידות אמיתיות
- פקודות במחשב רצות רק מתוך רשימה מאושרת, וכל השאר מבקש אישור
נבנה עם
- Python
- Ollama
- Whisper
- Nous Hermes
- pywebview
גלריה



