Spikeלתיאום שיחת אבחון

צ'אט בוט בעברית: איך בוחרים אחד שבאמת מבין את השפה

לא כל בוט שכתוב לו 'תומך בעברית' באמת מבין עברית. המדריך מסביר למה נטיות, RTL וקוד-מיתוג עברית-אנגלית שוברים בוטים שנשמעו מעולה בדמו, ונותן טבלת בדיקה מעשית לפני שחותמים על ספק.

סער5 דק׳ קריאה
תשובה מהירה

צ'אט בוט בעברית טוב הוא לא כזה שרק מסומן כ'תומך בעברית' בהגדרות, אלא כזה שעומד מול נטיות, סלנג וקוד-מיתוג עברית-אנגלית בלי לאבד את הכוונה של הלקוח. הפער נובע ממבנה המילה בעברית עצמה - ולכן הבדיקה חייבת לקרות לפני שחותמים על ספק, לא אחרי ההשקה.

תוכן העניינים

המדריך הזה עוסק בשאלה אחת: מה הופך צ'אט בוט בעברית לכזה שבאמת עובד, לא רק 'תומך' בשפה בתפריט ההגדרות. לא נעסוק כאן בבחירת פלטפורמה או במחיר (יש לזה מדריכים נפרדים) - אלא במה שקורה כשהבוט פוגש הודעה אמיתית מלקוח ישראלי: נטיות, שגיאות כתיב, מונח באנגלית באמצע משפט, ותאריך שכתוב בסדר הפוך. אלה הדברים שמפילים בוטים שנשמעו מצוין בדמו.

מה ההבדל בין 'תומך בעברית' לבין מבין עברית

כמעט כל צ'אט בוט היום מפרסם תמיכה בעברית, כי כמעט כל מודל שפה גדול יודע לייצר משפט בעברית. השאלה שפחות נשאלת היא כמה יקר וכמה מדויק זה קורה מתחת למכסה המנוע. מודלים כלליים נבנו קודם כל על אנגלית, ועברית מתפרשת דרך אותו מנגנון בלי שהותאם לה מראש.

מחקר של Dicta, מכון לעיבוד שפה עברית, שבחן את ההתאמה של מודל Mistral לעברית (2024) מצא שה-tokenizer הגנרי שלו דוחס מילה עברית בממוצע ל-5.81 טוקנים - ורק הוספה של 1,000 טוקנים ייעודיים לעברית חתכה את המספר הזה ביותר מחצי. בפועל זה אומר תשובה איטית ויקרה יותר לכל שיחה בעברית, עוד לפני שדיברנו על איכות ההבנה עצמה.

כמה טוקנים צריך מודל שפה כדי לקרוא מילה אחת בעברית
כמה טוקנים צריך מודל שפה כדי לקרוא מילה אחת בעבריתתרשים עמודות. כמה טוקנים צריך מודל שפה כדי לקרוא מילה אחת בעברית. Tokenizer גנרי (לפני התאמה) 5.81טוקנים, Tokenizer מותאם לעברית (אחרי הרחבה) 2.9טוקנים.Tokenizer גנרי (לפני התאמה)Tokenizer גנרי (לפני התאמה): 5.81טוקנים5.81טוקניםTokenizer מותאם לעברית (אחרי הרחבה)Tokenizer מותאם לעברית (אחרי הרחבה): 2.9טוקנים2.9טוקנים
הצגת הנתונים כטבלה
קטגוריהטוקנים למילה
Tokenizer גנרי (לפני התאמה)5.81טוקנים
Tokenizer מותאם לעברית (אחרי הרחבה)2.9טוקנים

מקור: Shmidman et al. - Adapting LLMs to Hebrew: DictaLM 2.0 (arXiv)

מאיפה הפער מגיע: איך בנויה מילה בעברית

עברית היא שפה עשירת-מורפולוגיה: מידע על זמן, מין, מספר ויידוע מקודד בתוך המילה עצמה, ולא נגזר מהמקום שלה במשפט כמו באנגלית. אותו שורש - למשל ב-ט-ל - יוצר מילים שנראות שונה לגמרי זו מזו על פני השטח. מחקר משנת 2019 של Tsarfaty ושותפיה, שמיפה את הכשלים ב-NLP עברי, הראה שהבעיה האמיתית היא לא זיהוי מילה בודדת אלא שרשור: טעות בניתוח המורפולוגי המוקדם נגררת להמשך השרשרת ומייצרת פרשנות שגויה למשפט שלם.

הנה דוגמה פשוטה: בוט חוקים שמוגדר להגיב לכל הודעה שמכילה את המילה 'בטל' יתפוס רק חלק מהפניות האמיתיות, כי הטיות שונות של אותו שורש שוברות את הרצף של האותיות:

# בוט חוקים מחפש מילת מפתח: "בטל"
if "בטל" in message:
    return "פותח בקשת ביטול"

# ארבע הודעות אמיתיות מלקוחות, כולן מבקשות אותו דבר:
"אני רוצה לבטל את ההזמנה"     -> תואם ("לבטל" מכיל "בטל" ברצף)
"ביטלתי כבר אתמול, מה קורה"    -> לא תואם (בין ב' ל-ט' יש י')
"ההזמנה כבר בוטלה"            -> לא תואם (בין ב' ל-ט' יש ו')
"למה זה מבוטל?"                -> לא תואם (בין ב' ל-ט' יש ו')

שלושה סוגי בוטים בעברית, ומתי כל אחד מספיק

הבחירה בין בוט חוקים לבוט AI משפיעה ישירות על כמה חשוב כל מה שתואר למעלה. בגדול, יש שלוש רמות עומק:

  • בוט חוקים (מבוסס מילות מפתח) - זול ומהיר להקמה, אבל שביר מול נטיות עבריות כמו שראיתם למעלה. מתאים לתפריט סגור עם מספר קטן של אפשרויות קבועות.
  • בוט AI גנרי - מבין הקשר רחב יותר, אבל רץ על מודל שלא הותאם לעברית ועלול להיכשל מול סלנג, ראשי תיבות או שילוב עברית-אנגלית באותה הודעה.
  • בוט AI מותאם או מפוקח - שכבת בקרה שמכוונת את המודל למקרי הקצה של העסק הספציפי. זה בערך ההבדל בין סוכן AI לעסק לבין תיבת צ'אט גנרית שהודבקה לאתר.

טבלת בדיקה לפני שחותמים על בוט בעברית

לפני שבודקים מחיר, הריצו את חמש הבדיקות האלה על כל בוט מועמד:

מה בודקיםלמה זה קריטיאיך בודקים בפועל
נטיות ומורפולוגיהמילה אחת בעברית משתנה בעשרות צורות (מבטל / ביטלתי / בוטלה)לשלוח חמישה ניסוחים שונים לאותה בקשה ולוודא שכולם מזוהים
קוד-מיתוג עברית-אנגליתמונחי מוצר כמו CRM, WhatsApp ו-monday נשארים באנגלית באמצע משפט עברילשלוח הודעה שמערבבת מונח באנגלית עם עברית ולבדוק שההקשר לא נאבד
כיוון תצוגה (RTL)תאריכים, מספרי טלפון ומונחים באנגלית בתוך משפט עברי נוטים להתהפך בממשקלבדוק הודעה עם תאריך, מספר וטלפון יחד ולוודא שהיא מוצגת נכון
פנייה ניטרלית-מגדריתלעברית יש נטיות זכר ונקבה שאנגלית לא מכריעה מראשלוודא שהבוט לא פונה בברירת מחדל בלשון זכר או נקבה יחיד
עלות וזמן תגובהמודל גנרי צריך יותר טוקנים למילה עברית, מה שמייקר ומאט כל תשובהלהשוות זמן תגובה ועלות לאותה שיחה בעברית מול אנגלית

חמש בדיקות שמפרידות בין בוט שנשמע טוב בדמו לבוט שעובד בשטח

כשהלקוחות לא כותבים רק בעברית

עסק ישראלי טיפוסי מקבל פניות גם ברוסית וגם בערבית, ולא רק בעברית. הבדיקה שתוארה למעלה - נטיות, קוד-מיתוג, RTL - חוזרת על עצמה בכל שפה בנפרד, כי לכל שפה יש מבנה משלה. לפני שבוחרים ספק, שווה להבין מה חשוב לבדוק בבוט AI לוואטסאפ ברמת הפלטפורמה כולה, לא רק ברמת השפה.

כשעברית ואנגלית מתערבבות באותה הודעה

האיכות של העברית בבוט היא לא עניין של יוקרה - היא משפיעה ישירות על התנהגות קנייה. מחקר של CSA Research משנת 2020, בקרב יותר מ-8,700 צרכנים ב-29 מדינות, מצא ש-76% מהקונים מעדיפים לקנות מוצר עם מידע בשפת האם שלהם, ו-40% פשוט לא יקנו מאתר שאינו בשפתם. אותו היגיון חל על שירות: 75% מהנשאלים ציינו שיחזרו לאותו מותג אם קיבלו שירות בשפתם.

if a company chooses to not localize the buying experience they risk losing 40% or more of the total addressable market.Dr. Donald A. DePalma, CSA Research, 2020

אם עוד לא בחרתם ספק, כדאי להכיר קודם את כל האפשרויות לפני שבוחרים פתרון לעסק, כי בחירה נכונה ברמת הפלטפורמה חוסכת חלק גדול מהבדיקות שתוארו כאן.

הבדיקה הכי טובה לא דורשת מומחיות בבלשנות: קחו עשר הודעות אמיתיות שלקוחות שלחו לעסק שלכם בחודש האחרון, כולל שגיאות כתיב, קיצורים ומונח באנגלית באמצע משפט, והריצו אותן מול הבוט המועמד. אם הוא נכשל בשלוש מתוכן, זו התשובה שצריך, לא הדמו שהראו לכם.

מקורות

  1. Shmidman et al. - Adapting LLMs to Hebrew: DictaLM 2.0 (arXiv)מודל שפה גנרי דוחס מילה עברית בממוצע ל-5.81 טוקנים, ולאחר הרחבת ה-tokenizer ב-1,000 טוקנים ייעודיים לעברית הקצב נחתך ביותר מחצי (2024)
  2. Tsarfaty, Sadde, Klein, Seker - ACL Anthology (ONLP)טעות בניתוח מורפולוגי מוקדם בעברית נגררת לכל שרשרת העיבוד ומייצרת פרשנות שגויה למשפט שלם (2019)
  3. CSA Research76% מהקונים מעדיפים לקנות מוצר עם מידע בשפת האם שלהם, 40% לא יקנו מאתר שאינו בשפתם, ו-75% יחזרו לאותו מותג אם קיבלו שירות בשפתם (2020)

שאלות ותשובות

סער

סער

עודכן

מייסד Spike · monday Certified Partner

סער הוא המייסד של Spike. אנחנו בונים את שכבת התפעול של עסקים ישראליים — monday CRM, אוטומציות וסוכני וואטסאפ מבוססי AI — ואת הכלים שמריצים אותה.

רוצים שנסתכל על התפעול שלכם?