מילון מונחים: תמלול, זיהוי דיבור ו-AI

כל מונח שפוגשים כשעובדים עם תמלול אוטומטי בעברית, בהגדרה של שתיים-שלוש שורות, עם השם באנגלית. 32 מונחים, מסודרים מהבסיס (מה זה תמלול) דרך המדידה (WER) והבינה המלאכותית (LLM, הזיה) ועד החיבורים (API, MCP) והחוק (הסכמה, האזנת סתר). כל הגדרה עומדת בפני עצמה, כדי שאפשר יהיה לצטט אותה.
המונחים
תמלול (Transcription). המרה של דיבור מוקלט לטקסט כתוב. תמלול אנושי נעשה בהאזנה והקלדה; תמלול אוטומטי נעשה על ידי מודל זיהוי דיבור.
תמלול אוטומטי. תמלול שנעשה על ידי תוכנה בלי מתמלל אנושי. ב-IvreetMeet כולל גם הפרדת דוברים, חותמות זמן וסיכום.
זיהוי דיבור (ASR, Speech Recognition). Automatic Speech Recognition: הטכנולוגיה שהופכת אות קול למילים. המודל של IvreetMeet הוא מודל זיהוי דיבור שאומן על עברית מדוברת.
מודל. רשת נוירונים שאומנה על הרבה דוגמאות (הקלטות עם תמליל) ולומדת למפות קול למילים או טקסט לסיכום. "מודל שאומן על עברית" הוא מודל שהדוגמאות שלו היו בעברית.
כוונון (Fine-tuning). המשך אימון של מודל קיים על דוגמאות מתחום מסוים, למשל עברית מדוברת, כדי שיטעה פחות בו.
הפרדת דוברים (Diarization). חלוקה של ההקלטה לפי מי שמדבר: המערכת מזהה מתי הקול מתחלף ומסמנת "דובר 1", "דובר 2". לא מזהה מי האדם, רק שמדובר בקול אחר.
זיהוי דוברים (Speaker Recognition). זיהוי של אותו אדם בהקלטות שונות לפי טביעת הקול שלו. ב-IvreetMeet כבוי כברירת מחדל ומופעל רק בהסכמת הדובר.
טביעת קול (Voiceprint). ייצוג מספרי של המאפיינים של קול מסוים, שמאפשר לזהות אותו שוב. מידע ביומטרי כשמשתמשים בו לזיהוי אדם, ולכן דורש הסכמה.
חותמת זמן (Timestamp). הזמן בהקלטה שבו נאמרה מילה או התחיל קטע. מאפשרת לקפוץ לרגע הנכון ולצטט במדויק.
שיעור שגיאות מילים (WER, Word Error Rate). מדד הדיוק של תמלול: מספר המילים שהוחלפו, נמחקו או נוספו ביחס לתמליל אנושי, חלקי מספר המילים. נמוך יותר טוב יותר; תלוי בערכת הבדיקה ובנרמול.
ערכת בדיקה (Benchmark, Test set). אוסף הקלטות עם תמליל אנושי מדויק שעליו מודדים מודלים. השוואה בין מערכות תקפה רק על אותה ערכה ובאותה שיטה.
נרמול טקסט. איחוד של פיסוק, כתיב מלא וחסר, מספרים וכדומה לפני מדידה, כדי ששתי כתיבות תקינות של אותה מילה לא ייספרו כשגיאה.
מודל שפה גדול (LLM). Large Language Model: מודל שקורא טקסט ומייצר טקסט. ב-IvreetMeet כותב את הסיכום, ההחלטות והמשימות מתוך התמליל, ועונה בצ'אט. מקבל טקסט בלבד, לא את ההקלטה.
סיכום אוטומטי. סיכום שנכתב על ידי מודל שפה מתוך התמליל המלא: עיקרי הדברים, החלטות, משימות. ניתן להנחיה ולסיכום מחדש.
הזיה (Hallucination). טקסט שמודל שפה מייצר בלי שיש לו בסיס בקלט. ב-IvreetMeet הסיכום נכתב רק מהתמליל ונבדק מול מבנה קבוע; לשימוש קריטי בודקים אותו מול התמליל.
הנחיה (Prompt). הטקסט שנותנים למודל השפה כדי לכוון את הסיכום: מי המשתתפים, מה מטרת הפגישה, על מה להתמקד.
תמלול מילולי (Verbatim). תמליל שכולל כל מילה שנאמרה, כולל חזרות והיסוסים. "תמלול נקי" משמיט אותם. תמלילים אקדמיים לעיתים מסמנים גם הפסקות וחפיפות בסימון מיוחד.
דיבור חופף (Overlap). שני דוברים או יותר שמדברים בו-זמנית. המקרה הקשה ביותר לכל תמלול, אנושי או אוטומטי.
מעבר בין שפות (Code-switching). מעבר מעברית לאנגלית ובחזרה בתוך משפט, כמו ברוב הפגישות בישראל. המודל של IvreetMeet אומן על דיבור כזה.
זיהוי דיבור/שקט (VAD, Voice Activity Detection). זיהוי של הקטעים בהקלטה שיש בהם דיבור. קטעים בלי דיבור לא הופכים לטקסט מומצא.
קידוד וקצב סיביות (Codec, Bitrate). הדרך שבה קובץ שמע דחוס והכמות של המידע לשנייה. M4A או MP3 ב-64 עד 128 kbps מספיקים לתמלול; WAV לא דחוס גדול פי כמה בלי יתרון.
OPUS / OGG. פורמט הדחיסה של הודעות קוליות בוואטסאפ ובטלגרם ושל הקלטות מהדפדפן. נתמך כמו שהוא.
SRT / WebVTT. קובצי כתוביות: טקסט עם זמן התחלה וסיום לכל שורה. SRT הוותיק לכל עורך ונגן; WebVTT לדפדפנים ולפלטפורמות וידאו.
פרוטוקול. התיעוד הרשמי של ישיבה: נוכחים, סדר יום, דיון, החלטות, משימות, אישור. IvreetMeet כותב טיוטת פרוטוקול מהתמליל.
ניתוב ללא שמירה (Zero data retention). הסדר עם ספק מודל שפה שלפיו הטקסט שנשלח לסיכום אינו נשמר אצלו ואינו משמש לאימון. כך IvreetMeet שולח את הטקסט לסיכום.
API. Application Programming Interface: הדרך שבה קוד של לקוח מדבר עם השירות: העלאת הקלטה, קריאת תמליל וסיכום, חיפוש. ב-IvreetMeet עם מפתח אישי.
MCP (Model Context Protocol). תקן פתוח שמחבר עוזר AI (Claude, ChatGPT, Cursor ואחרים) למקור מידע. שרת ה-MCP של IvreetMeet מאפשר לעוזר לחפש ולקרוא את הפגישות של הארגון אחרי אישור חד-פעמי.
OAuth. הדרך שבה אפליקציה מקבלת הרשאה מוגבלת לחשבון בלי לקבל את הסיסמה. כך עוזרי AI מתחברים ל-IvreetMeet, בעמוד אישור שמראה מה האפליקציה תוכל לעשות.
Webhook. הודעה אוטומטית שהשירות שולח לכתובת של הלקוח כשמשהו קורה, למשל כשתמליל מוכן. ב-IvreetMeet חתומה, כדי שהמקבל ידע שהיא אמיתית.
הסכמה מדעת. הסכמה שניתנת אחרי שהאדם יודע מה נאסף, למה ומה הזכויות שלו. נדרשת להקלטה של משתתפים ולשמירת טביעת קול.
חוק האזנת סתר. החוק הישראלי שקובע שמותר לצד לשיחה להקליט אותה, ואסור להקליט או להאזין לשיחה שאינך צד לה בלי הסכמה.
ivrit.ai. פרויקט ישראלי ללא מטרות רווח שמפרסם מאגרי דיבור בעברית, מודלים פתוחים ולוח תוצאות ציבורי לתמלול בעברית. ערכות הבדיקה שלו הן המדד הציבורי שבו IvreetMeet מודד את עצמו.
איפה המונחים האלה פוגשים אתכם
- איך תמלול אוטומטי עובד, שלב אחרי שלב: תמלול אוטומטי בעברית.
- הפרדת דוברים, טביעות קול והסכמה: זיהוי דוברים אוטומטי: איך זה עובד.
- WER, ערכות בדיקה ונרמול: דיוק תמלול בעברית ומדד דיוק תמלול בעברית.
- API, MCP, OAuth ו-webhooks: API ושרת MCP.
- הסכמה, ניתוב ללא שמירה ואיפה המידע: אבטחת מידע.
שאלות על המונחים
מה ההבדל בין הפרדת דוברים לזיהוי דוברים?
הפרדת דוברים (diarization) מסמנת בתוך הקלטה אחת מתי הקול מתחלף: "דובר 1", "דובר 2". זיהוי דוברים (recognition) מזהה שאותו אדם מדבר גם בהקלטה אחרת, לפי טביעת הקול, וזה מידע ביומטרי שדורש הסכמה. ב-IvreetMeet הראשון תמיד פועל; השני כבוי כברירת מחדל.
מה ההבדל בין מודל זיהוי דיבור למודל שפה?
מודל זיהוי דיבור הופך קול למילים; מודל שפה הופך טקסט לטקסט (סיכום, תשובה). ב-IvreetMeet הראשון הוא המודל שלנו, מאומן על עברית מדוברת; השני מקבל רק את הטקסט של התמליל.
WER נמוך אומר תמלול טוב?
על אותה ערכת בדיקה ובאותה שיטה, כן. מספר בודד בלי ערכה, תאריך ושיטה לא אומר כלום, ועל ההקלטה שלכם הדיוק תלוי בהקלטה עצמה. ראו דיוק תמלול בעברית.
כמה זה עולה?
התוכנית החינמית כוללת עד 7 הקלטות ו-120 דקות בחודש קלנדרי לארגון, עם תמלול לפי דוברים, סיכום, ייצוא PDF ושיתוף בקישור, בלי כרטיס אשראי. Pro עולה ₪99 לחודש (₪79 לחודש בתשלום שנתי) ופותח עד 70 שעות תמלול בחודש; Business, ₪299 למשתמש לחודש, פותח עד 200 שעות. ביטול בכל עת.
מוכנים לנסות?
IvreetMeet מתמלל ומסכם פגישות בעברית. התוכנית החינמית כוללת עד 7 פגישות ו-120 דקות בחודש.
להתחלה בחינם