מפרוטוקולים לאותות: מסגרת פתוחה למעקב אחר עבודת פרלמנטים
CAPD אוספת ומאחדת עשרות אלפי פרוטוקולים מארצות הברית, קנדה וישראל כדי לאתר ישיבות חריגות ושינויים בדפוסי פעילות — אך עדיין זקוקה לכיול ולאימות אנושי
קרדיט תמונה: מקור התמונה IPPA photographer CC BY 4.0 Wikimedia Commons; Dan Hadani Collection, National Library of Israel
נתונים פתוחים נעשים שימושיים לפיקוח כאשר עשרות אלפי פרוטוקולים הופכים לאותות ממוקדים שאדם יכול לבדוק — לא כאשר החריגה מוצגת כפסק דין אוטומטי.
מושגי יסוד בקצרה
נתוני ממשל פתוחים הם מידע ציבורי שמוסדות מפרסמים בפורמט שאפשר לגשת אליו ולעשות בו שימוש חוזר. פרסום הוא רק הצעד הראשון, משום שמסמכים מפוזרים, פורמטים משתנים ומטא־נתונים חסרים עדיין מקשים על פיקוח והשוואה.
חריגה היא תצפית יוצאת דופן בתוך התפלגות, למשל ישיבה ארוכה במיוחד. נקודת שינוי היא מועד שבו הדפוס הסטטיסטי של סדרת זמן משתנה, למשל ירידה ממושכת במספר הישיבות; אף אחד מן המושגים אינו מסביר לבדו מדוע הדבר קרה.
מהי CAPD ומה היא מבקשת לפתור?
CAPD היא מסגרת קוד לאיסוף, הבניה וניתוח של נתוני ועדות פרלמנטריות ממקורות שונים. היא נועדה לצמצם את הפער בין פרסום פורמלי של אלפי פרוטוקולים לבין יכולתו של הציבור לזהות בהם דפוסי פעילות ואירועים שראוי לחקור.
כיצד פועל צינור העיבוד?
השלב הראשון אוסף נתונים באמצעות API רשמי או סריקת אתרים ומנקה קבצים חסרים או פגומים. השלב השני ממיר פורמטים שונים לסכמה משותפת ומחלץ מאפיינים, והשלב השלישי בונה סדרות זמן ומפעיל איתור חריגות ונקודות שינוי.
מהו היקף המאגר שנאסף?
הפירוט בטבלת התוצאות כולל 64,913 פרוטוקולים מ־98 ועדות בשלוש מדינות. ארצות הברית תרמה 16,989 מסמכים מ־21 ועדות, קנדה 12,124 מ־44 ועדות וישראל 35,800 מ־33 ועדות.
אילו תקופות ומוסדות מכוסים?
בארצות הברית נאספו פרוטוקולים של ועדות בית הנבחרים מינואר 1999 עד מאי 2021, ובקנדה של ועדות בית הנבחרים מינואר 2009 עד מאי 2022. בישראל נאספו פרוטוקולים של ועדות הכנסת מינואר 1999 עד ינואר 2021.
כיצד מאחדים פרלמנטים שונים בלי למחוק הבדלים?
הסכמה הכללית כוללת שדות כמו מדינה, פרלמנט, ועדה, מזהה ישיבה, תאריך, כותרת, משתתפים ואורך מסמך. לצדה יכולה כל מדינה להוסיף סכמה ייחודית, כגון עדים ומיקום בנתוני ארצות הברית, ולכן האיחוד אינו מחייב שכל פרט יהיה זהה.
אילו מאפיינים שימשו לניתוח?
הניתוח המרכזי משתמש במספר הישיבות, במספר חברי הוועדה המשתתפים ובאורך טקסט הפרוטוקול. אלה מאפיינים פשוטים וזמינים יחסית בשלוש המדינות, אך הם מודדים קצב והיקף פעילות ולא את איכות הדיון או את תוכנו.
כיצד IQR מסמן ישיבה חריגה?
לכל ועדה ומאפיין מחושב הטווח שבין הרבעון הראשון לשלישי, וערך הנמצא מעבר ל־1.5 טווחים בין־רבעוניים מן הגבולות מסומן כחריג. השיטה משווה כל ישיבה לדפוס של הוועדה שלה, ולכן חריגה היא יחסית ולא סף אחיד לכל הפרלמנטים.
מה נמצא בבדיקת החריגות?
IQR סימן 656 פרוטוקולים חריגים בשלושת המאפיינים, ומתוכם נדגמו ידנית 263. המחברים מדווחים שכל המקרים המזוהים במדגם היו חריגים אמיתיים ולא תוצר של שגיאת פורמט, אף שהיו פערים קטנים בין ספירה אוטומטית לבדיקה ידנית.
אילו ישיבות המחישו את ערך הסינון?
בקנדה סומנה ישיבת ועדת כספים טעונה וארוכה שעסקה ביישום סעיפי תקציב ובדרישה שנוכחות השר לא תוחלף בפקידים. בארצות הברית סומן דיון ארוך ורב־משתתפים על תפקידה של BP בפיצוץ ובדליפת Deepwater Horizon.
מהו איתור נקודות שינוי?
במקום לחפש ישיבה בודדת יוצאת דופן, איתור נקודות שינוי מחפש מועד שבו מאפייני הסדרה עוברים לדפוס אחר. המאמר בוחן ארבע שיטות לא מקוונות — PELT, Binary Segmentation, Window Sliding ו־DYNP — המשתמשות בכל ההיסטוריה הזמינה.
מדוע נבחרה רזולוציה של שישה חודשים בכנסת?
החוקרים שרטטו סדרות ברזולוציה חודשית, תלת־חודשית וחצי־שנתית ובחרו ידנית את זו שנתנה ייצוג מתאים לדפוסי העבודה. בכנסת נבחר חלון של שישה חודשים, בחירה שמחליקה תנודות קצרות אך עלולה גם להסתיר אירועים מהירים.
כיצד נבחרו PELT ו־DYNP?
ארבעת האלגוריתמים הופעלו תחילה על כמה ועדות ותוצאותיהם נבדקו ידנית. PELT ו־DYNP נראו מתאימים יותר והועברו להערכה על עשר ועדות הכנסת הפעילות ביותר ובשלוש סדרות לכל ועדה.
כיצד אומתו נקודות השינוי?
כל נקודה שזוהתה הוצלבה עם מערכות, מאגרים, רשומות ופרוטוקולים של הכנסת כדי לחפש אירוע מסביר. כאשר היה אפשר, החוקרים פנו למנהלי ועדות, לחברי ועדות ולמנהלים ותיקים, וסיווגו את הנקודה כאירוע אמיתי או כאזעקת שווא.
אילו אירועים הופיעו בסדרות הכנסת?
בין ההסברים שנמצאו היו פגרות קיץ, תקופת הקורונה, דיונים מיוחדים ואי־יציבות או שיבוש בתפקוד הכנסת. הרשימה מבהירה שנקודת שינוי יכולה לנבוע מלוח שנה רגיל, ממשבר חיצוני או מאירוע פוליטי, ולכן האיתור אינו מספק פרשנות אחת.
עד כמה האלגוריתמים היו מדויקים?
PELT מצא 124 נקודות ו־DYNP מצא 165, וביחד נבדקו 289 נקודות שינוי. הדיוק הממוצע של DYNP היה 0.76 לעומת 0.604 של PELT, אך הטבלה מראה שהיתרון משתנה לפי ועדה ומאפיין ולעיתים PELT הצליח יותר.
מדוע אין כאן מדד מלא של ביצועי האלגוריתם?
החוקרים יודעים אילו נקודות שסומנו היו נכונות, אך אינם מחזיקים רשימה מלאה של כל האירועים שהאלגוריתמים החמיצו. משום כך הם יכולים לדווח דיוק ושיעור אזעקות שווא לפי הגדרתם, אך לא Recall או Accuracy המבוססים על אמת־מידה מלאה.
האם חריגה מעידה על כשל פרלמנטרי?
לא, חריגה סטטיסטית אומרת רק שהערך שונה מן הרגיל לוועדה או לתקופה. ישיבה חריגה יכולה להיות חשובה ורצויה, לנבוע מאסון או מפגרה, או לשקף שינוי טכני, ולכן היא הזמנה לבדיקה ולא פסק דין על תפקוד או יושרה.
כיצד המסגרת יכולה לקדם שקיפות?
היא יכולה להפנות עיתונאים, חוקרים ואזרחים ממאגר עצום אל מספר קטן יותר של מועדים וישיבות לבדיקה. הערך הדמוקרטי תלוי גם בפתיחת הקוד, הנתונים וכללי הניקוי והכיול, כדי שאחרים יוכלו לשחזר את האות ולחלוק על הפרשנות.
מה מקשה על הרחבה לפרלמנטים נוספים?
אתרים וממשקים משתמשים בפורמטים שונים ולעיתים דורשים סורק, Parser ושדות מותאמים. גם לוחות עבודה, פגרות ומוסכמות תיעוד שונים, ולכן בחירת רזולוציה, חישוב מאפיינים וספים מחייבים כיול מקומי ולא העתקה אוטומטית.
מה מגביל אימות ידני בקנה מידה גדול?
הצלבת מאות נקודות עם מאגרים ושיחות מומחים מחזקת את ההערכה, אך היא צורכת זמן ותלויה בזמינות ידע אנושי. המחברים מציעים בעתיד לאמת אירועים גם באמצעות מקורות חיצוניים כגון חדשות ורשתות חברתיות, אך אוטומציה כזאת תכניס הטיות וכשלים חדשים שיצטרכו בדיקה.
האם מספר הוועדות במאמר עקבי?
לא לחלוטין: התקציר אומר ״יותר מ־90״ וטבלת התוצאות מפרטת 21, 44 ו־33 ועדות, כלומר 98. בפרק המסקנות נכתב 264 ועדות ללא הסבר, ולכן ראוי להשתמש בפירוט הטבלאי ולסמן את הפער במקום ליישב אותו בהשערה.
האם הקוד והנתונים אכן זמינים?
הצהרת הזמינות במאמר אומרת שהמסגרת וכל הנתונים יהיו זמינים עם הפרסום, אך אינה נותנת קישור ישיר למאגר באותה הצהרה. לכן המאמר מדגים מתודולוגיה פתוחה ושאיפה לשחזור, אך הקורא צריך לאתר בנפרד את החומרים ולבדוק את שלמותם ותחזוקתם.
לאן מציעים המחברים להרחיב את CAPD?
הם מציעים להוסיף מדינות וגופים, לחלץ מספר דוברים ומספר מילים, ולנתח נושאים וסנטימנט באמצעות עיבוד שפה טבעית. הם גם מציעים אתר אינטראקטיבי ומחקרים משווים על אירועים כגון קורונה ושינוי אקלים, אך כל הרחבה תדרוש הערכת איכות נפרדת.
מהו הלקח הדמוקרטי המרכזי?
שקיפות אפקטיבית דורשת יותר מהעלאת מסמכים לאתר: היא דורשת סטנדרטיזציה, חיפוש, הסבר ואפשרות לביקורת. CAPD מראה כיצד חישוב יכול להוזיל פיקוח ציבורי, בתנאי שהאותות נשארים ניתנים לבדיקה אנושית ואינם מוצגים כאמת פוליטית אוטומטית.
התקציר שלעיל הוא תקציר עצמאי בעברית, שנכתב בסיוע כלי בינה מלאכותית ובעריכה אנושית, על בסיס המאמר המקורי. הוא אינו תרגום רשמי של התקציר או של המאמר, אינו מטעם המחברים או כתב העת, ואינו מחליף קריאה במקור
עודכן לאחרונה: 20 בספטמבר 2026