זיהוי דוברים אוטומטי: הסוד מאחורי הקלעים

אי אפשר לקרוא תמלול של פגישה עם 5 אנשים בלי לדעת מי אמר מה. טכנולוגיית זיהוי הדוברים (Diarization) פותרת את הבעיה הזו. הנה איך.
מה זה Speaker Diarization?
דיאריזציה היא התהליך שבו מערכת מחשב מנתחת קובץ אודיו ומזהה מתי דובר אחד מפסיק לדבר ודובר אחר מתחיל. בסוף התהליך, כל משפט מתויג עם זהות הדובר.
ניתוח קול
המערכת מזהה מאפיינים ייחודיים בכל קול
פילוח דוברים
קיבוץ כל הקטעים שנאמרו על ידי אותו אדם
תיוג
הוספת תווית לכל דובר (דובר 1, דובר 2...)
איך זה עובד ב-IvreetMeet?
המערכת מפרידה בין דוברים ויוצרת טביעת קול לכל דובר. כך זה עובד:
- 1חילוץ מאפיינים: המערכת מחלצת "טביעת קול" ייחודית לכל דובר
- 2קיבוץ: כל קטעי הדיבור מקובצים לפי דמיון בטביעת הקול
- 3מיזוג עם תמלול: התוצאה משולבת עם התמלול לקבלת טקסט מחולק לפי דוברים
שמות במקום מספרים
המערכת לא יודעת את השמות האמיתיים של הדוברים, אז היא מתייגת אותם כ"דובר 1", "דובר 2" וכו'. אחרי התמלול, תוכלו לערוך את השמות ב-IvreetMeet. זיהוי חוזר של אותו אדם בפגישות הבאות (טביעת קול) כבוי כברירת מחדל: הארגון מפעיל אותו, ורק דובר שהסכים לשמירת טביעת הקול שלו מזוהה שוב. טביעת קול ללא הסכמה נמחקת אחרי 30 יום, וטביעה שלא הייתה בשימוש 365 יום נמחקת גם היא.
מגבלות
זיהוי דוברים עובד טוב יותר כשהדוברים לא מדברים בו-זמנית. איכות אודיו נמוכה או הרבה דיבור חופף עלולים לפגוע ברמת הדיוק.
רוצים לראות את זה בפעולה?
העלו הקלטה עם כמה דוברים וראו איך המערכת מזהה כל אחד.