טרולים מדינתיים משתמשים בשפה מקטבת יותר — והיא זוכה ליותר הפצה בשיח פוליטי

אלמוג שמחון, ויליאם ג׳ בריידי וג׳יי ג׳ ואן באוול פיתחו מילון בן 205 מילים, אימתו אותו בארבעה הקשרים ויישמו אותו על יותר מ־2.3 מיליון ציוצים כדי לזהות את הרטוריקה המקטבת של מבצעי השפעה מדינתיים.

מאמר: Troll and divide: the language of online polarization

חוקרות/ים: Almog Simchon, William J. Brady, Jay J. Van Bavel

כתב עת: PNAS Nexus, 1(1), pgac019

תאריך: פורסם: 10 במרץ 2022; כרך 1, גיליון 1, מאמר pgac019

DOI: https://doi.org/10.1093/pnasnexus/pgac019

חוקרים מנתחים זרמים מתפצלים של שיח פוליטי מקוון על מסכים, המחשה לשימוש ברטוריקה מקטבת בידי רשתות טרולים
קרדיט תמונה: OpenAI OpenAI image generation Generated site asset

ביותר מ־2.3 מיליון ציוצים, חשבונות טרולים מדינתיים השתמשו ביותר שפה מקטבת, ובשיח פוליטי כל מילה כזאת נקשרה ליותר הפצה.

איזה סוג של קיטוב המחקר מנסה למדוד?

המחקר עוסק בשפה הקשורה לקיטוב פוליטי, ולא רק בשאלה אם משתמש מזוהה עם שמאל או ימין. הוא בוחן ביטויים המופיעים בתקשורת שנוטה להתפשט בתוך מחנה פוליטי יותר מאשר בין מחנות.

החוקרים מבחינים בקירוב בין קיטוב של סוגיות, כלומר מרחק בעמדות ובמונחים אידאולוגיים, לבין קיטוב רגשי המתבטא בעוינות, חשד ושיפוט מוסרי של הצד האחר. החלוקה שימושית אך אינה גבול מושגי חד, והמאמר מציג אותה כפרשנות של אשכולות השפה.

מה היו שתי מטרות המחקר?

המטרה הראשונה הייתה לבנות כלי פשוט ופתוח שמזהה שפה מקטבת בהקשרים שונים בלי לבצע בכל פעם ניתוח רשת יקר ומורכב. המטרה השנייה הייתה לבדוק אם חשבונות טרולים הקשורים למדינות משתמשים ברטוריקה הזאת יותר ממשתמשים אמריקאים רגילים.

החוקרים גם בדקו אם השימוש בשפה השתנה לאורך זמן ואם הוא קשור להפצה באמצעות ציוצים מחדש. כך המאמר עובר ממדידה ואימות להשוואה בין אוכלוסיות ולבחינת הקשר בין ניסוח לבין תשומת לב.

כיצד נבנה מילון הקיטוב?

המילון נבנה בארבעה שלבים: איתור מונחים מתוך נתונים, סינון ידני, הרחבה באמצעות ייצוגי GloVe של קרבה בין מילים וסינון ידני נוסף. התוצר כלל 205 מילים שנמצאו קשורות להפצה מפלגתית של מסרים.

ציון הקיטוב חושב כשיעור מילות המילון מתוך אורך הטקסט לאחר הסרת קישורים, תגיות וסמלי הבעה. זהו מדד יחסי להשוואת קורפוסים, ולא סיווג מוסרי הקובע שכל שימוש במילה מסוימת הוא מניפולטיבי.

כיצד אומת המילון מחוץ לנתוני הפיתוח?

החוקרים בנו את המילון על 80% ממאגר הפיתוח ובדקו אותו על 5,008 ציוצים שלא שימשו לאימון. במדגם הבדיקה, שיעור מילות הקיטוב היה 6.70 במסרים מקוטבים לעומת 4.39 במסרים לא־מקוטבים, עם גודל אפקט d=0.27.

בהמשך הוא הבחין גם בין מסרים בשיח Black Lives Matter שהתפשטו בתוך מחנה לבין מסרים שחצו בין קהילות, עם d=0.13. בדיקה מחוץ למדגם ומחוץ לנושא מפחיתה את הסיכון שהכלי רק שינן את הנתונים שעליהם נבנה.

האם המדד עבד גם בפלטפורמה אחרת?

ב־Reddit נותחו 49,230 פוסטים: קהילות פוליטיות מן השמאל ומן הימין קיבלו ציוני קיטוב גבוהים יותר מקהילות לא־פוליטיות, וההשוואה המתוכננת הניבה d=0.31. גם בהשוואה לקהילת NeutralPolitics נמצאה רטוריקה מעט פחות מקטבת מן הקהילות הפוליטיות.

בבדיקת NeutralPolitics גודל האפקט היה d=0.04 בלבד. לכן המעבר בין פלטפורמות תומך ביכולת הכללה, אך גם מראה שחלק מן ההבדלים קטנים ותלויים בקבוצת הביקורת.

כיצד שפת קורונה שימשה בדיקת תוקף נוספת?

החוקרים השוו 553,876 ציוצים אמריקאיים על קורונה בין 25 בפברואר ל־14 באפריל 2020 לפער היומי בין דמוקרטים לרפובליקאים בדאגה מן המגפה. נתוני הסקר התבססו על פאנל של 22,256 משיבים.

ציון השפה המקטבת היה קשור לפער המפלגתי בדאגה לאורך זמן במתאם r=0.45. הקשר מראה שהמדד נע יחד עם פער ציבורי חיצוני, אך אינו קובע אם השפה הובילה את דעת הקהל או רק שיקפה אותה.

אילו ציוצים נכללו בניתוח הטרולים?

הקורפוס כלל 2,306,233 ציוצים מקוריים באנגלית לאחר הסרת ציוצים מחדש. מתוכם 383,510 פורסמו בידי חשבונות רוסיים, 329,453 בידי חשבונות איראניים, 85,970 בידי חשבונות ונצואליים ו־1,507,300 במדגם ביקורת אמריקאי אקראי.

זהות חשבונות מבצעי ההשפעה התבססה על ארכיונים שפרסמה Twitter בדוחות השקיפות שלה. ההשוואות הישירות הותאמו לטווחי זמן חופפים והוגבלו לאנגלית, ולכן אינן מתארות את מלוא הפעילות בכל שפה ובכל תקופה.

מה נמצא בהשוואה בין טרולים רוסיים למשתמשים אמריקאים?

בהשוואה מותאמת בזמן של 61,413 ציוצים רוסיים ל־516,525 ציוצי ביקורת, ציון הקיטוב הממוצע היה 2.37 אצל הטרולים לעומת 1.47 בביקורת. ההבדל היה מובהק וגודל האפקט שלו היה d=0.17.

בהשוואה מחמירה יותר של 55,726 חשבונות־תוכן מכל צד, שהותאמה גם לתגיות פוליטיות, הממוצעים היו 5.16 ו־2.91 וגודל האפקט d=0.30. ההתאמה מפחיתה את האפשרות שהפער נובע רק מכך שהטרולים כתבו יותר על פוליטיקה.

האם הדפוס הופיע גם אצל טרולים מאיראן ומוונצואלה?

בהשוואות מותאמות בזמן, ציוצים איראניים קיבלו ציון ממוצע 2.15 לעומת 1.46 בביקורת האמריקאית, עם d=0.13. ציוצים ונצואליים קיבלו 1.80 לעומת 1.45, עם d=0.07.

כל ההבדלים היו מובהקים, אך גדלי האפקט אינם זהים והם קטנים יותר מן ההשוואה הפוליטית המותאמת לרוסיה. הממצא המשותף הוא שימוש יחסי רב יותר בשפה מקטבת, לא אסטרטגיה אחידה או השפעה שווה של כל מדינה.

כיצד השימוש ברטוריקה מקטבת השתנה לאורך זמן?

אצל הטרולים הרוסיים עלה ציון הקיטוב החודשי בשיפוע b=0.03, ואצל הוונצואליים הוא עלה בשיפוע b=0.02. אצל הטרולים האיראניים נרשמה דווקא ירידה בשיפוע b=-0.03, ובמדגם האמריקאי האקראי לא נמצאה עלייה מובהקת.

טווחי הזמן של הקבוצות לא היו זהים במלואם, ולכן החוקרים מציגים את ההשוואה המגמתית בזהירות. התוצאה החשובה היא שאין מסלול זמן אחד לכל מבצעי ההשפעה, גם אם רמת השפה המקטבת גבוהה יותר בכל שלוש הקבוצות.

האם הטרולים קידמו רק צד אידאולוגי אחד?

המאמר מדגיש שטרולים יכולים להפיץ מסרים משני צדי מחלוקת, כפי שנמצא בעבר בשיח על Black Lives Matter ועל חיסונים. המטרה האפשרית אינה בהכרח לשכנע בעמדה שמרנית או פרוגרסיבית אחת, אלא להגביר עימות וחוסר אמון בין קבוצות.

גם בניתוח הנוכחי כל שלוש קבוצות הטרולים השתמשו ביותר מונחים הן מרכיב הסוגיות והן מרכיב העוינות הרגשית לעומת הביקורת. ההבדלים היו גדולים יותר ברכיב הסוגיות, אך החוקרים מזהירים שהחלוקה בין שני האשכולות אינה מוחלטת.

כיצד שפה מקטבת קשורה להפצה?

ב־118,215 ציוצי טרולים שהיו להם נתוני ציוצים מחדש, כל מילה מקטבת נוספת נקשרה לעלייה של 72% במספר הציוצים מחדש, עם IRR=1.72. לאחר בקרה על מספר העוקבים נשאר הקשר חיובי אך הצטמצם ל־IRR=1.61.

אצל 55,726 משתמשי ביקורת המעורבים פוליטית נקשרה כל מילה מקטבת לעלייה של 39% בציוצים מחדש. במדגם אמריקאי אקראי של 1,144,767 ציוצים הקשר לא היה מובהק, ולכן היתרון בהפצה הופיע בעיקר בהקשר פוליטי.

האם אפשר לקבוע שהשפה גרמה לקיטוב?

לא באופן חד־משמעי. רוב ההשוואות הן תצפיתיות, ושפה מקטבת יכולה למשוך תשומת לב מפני שהקהל כבר מקוטב או מפני שהנושא עצמו שנוי במחלוקת.

גם קשר לציוצים מחדש אינו מלמד אם המשתמש הסכים, התנגד או לעג למסר. המחברים מפרשים את הדפוסים כמנגנון אפשרי של העצמת קיטוב, אך מציינים שהשיטות אינן מספיקות להסקת סיבתיות.

מהן מגבלות המילון ככלי ניטור?

המילון נבנה מנתונים שנאספו ב־2015 ומשלושה נושאים מקטבים, בעוד ששפה ברשת משתנה במהירות. חלק מן המילים עשויות להופיע גם בטקסט לא־מקטב, והמשמעות שלהן תלויה במשפט, באירוניה ובקהילה.

לכן החוקרים ממליצים להשתמש בו באופן השוואתי מול קורפוס בסיס ולא כחותמת על פוסט יחיד. בכל הקשר חדש יש לאמת מחדש שהמילים אכן מבחינות בין שיח מקטב לבין שיח אחר.

מהי המשמעות להגנה על שיח דמוקרטי?

מבצעי השפעה אינם חייבים לקדם מחנה יחיד כדי לפגוע במרחב הציבורי; די בכך שהם מגבירים שפה שמחריפה גבולות, עוינות ומחלוקת. מערכות ניטור המתמקדות רק בתוכן שקרי או בעמדה פוליטית אחת עלולות להחמיץ פעולה מתואמת שמקדמת את שני הקצוות.

כלי לשוני פתוח יכול לסייע לזהות דפוסים לאורך זמן ולהשוות בין קבוצות, אך אסור להפוך אותו לצנזורה אוטומטית של מילים. הגנה דמוקרטית דורשת לשלב שקיפות על רשתות מתואמות, בדיקת הקשר, מחקר סיבתי והגנה על ביטוי פוליטי לגיטימי.

התקציר שלעיל הוא תקציר עצמאי בעברית, שנכתב בסיוע כלי בינה מלאכותית ובעריכה אנושית, על בסיס המאמר המקורי. הוא אינו תרגום רשמי של התקציר או של המאמר, אינו מטעם המחברים או כתב העת, ואינו מחליף קריאה במקור

עודכן לאחרונה: 21 באוגוסט 2026