מודלי שפה בענישה פלילית: עקביות גבוהה אינה בהכרח הכרעה צודקת

מאמר: Evaluating Large Language Models as Judicial Decision-Makers

חוקרות/ים: אורן גזל־אייל, זוהר אליוסף, אדיר סולומון

כתב עת: Justice Quarterly 43(5), 1184–1219

תאריך: פורסם מקוון ב־21 בינואר 2026

DOI: DOI: 10.1080/07418825.2026.2618254

קרדיט תמונה: OpenAI image generation OpenAI AI-generated image

מודל יכול להיות עקבי וקרוב לממוצע בלי שהממוצע מוכיח צדק. ההבחנה מרכזית להבנת ההשוואה בין המלצות ממוחשבות לשיקול דעת שיפוטי.

מה מודדת השוואה בין שופטים למודלי שפה

המחקר בוחן הכרעות ענישה של 123 שופטים בדימוס מול תוצרים של מודלי שפה בשני מקרים בדיוניים. המקרים עסקו באונס ובאלימות. המחברים מצאו אצל המודלים פיזור קטן יותר וסטייה קטנה יותר מממוצע השופטים, שאותו הגדירו כנקודת ייחוס בהיעדר עונש נכון ידוע.

מושגי יסוד בקצרה

עקביות מתארת עד כמה הכרעות שונות דומות זו לזו. דיוק ביחס לנקודת ייחוס מתאר קרבה למדד שנבחר. במחקר זה המדד הוא ממוצע השופטים, ולכן יש להבחין בינו לבין קביעה נורמטיבית של הענישה הראויה.

אילו מודלים נבחנו?

החוקרים בחנו מודלים ממשפחות GPT, Gemini ו־Claude. ההשוואה כללה גם דרכי הנחיה שונות למודלים.

מי סיפק את ההכרעות האנושיות להשוואה?

123 שופטים בדימוס הכריעו במקרים הבדיוניים. המאמר משווה את התפלגות החלטותיהם להצעות הענישה של המודלים.

האם מדובר במשפטים פליליים שהתקיימו בפועל?

המקרים שנבחנו היו בדיוניים. לכן הממצאים מתייחסים למשימת הכרעה בתרחישים שניתנו למשתתפים ולמודלים.

אילו סוגי הנחיות נכללו?

נבחנו הנחיות ללא דוגמאות, עם מספר דוגמאות ועם בקשה להנמקה מדורגת. כך נבחן תפקיד אופן ההנחיה בהכרעות המודל.

מה נמצא בנוגע לפערי ענישה?

המודלים הפיקו עונשים בעלי פיזור קטן יותר משל השופטים. זהו ממצא על עקביות בתנאי המחקר.

מדוע נבחר ממוצע השופטים כמדד?

המחברים מציינים שהעונש הנכון אינו ידוע. הם משתמשים בממוצע כנקודת ייחוס שמאפשרת להשוות סטיות באופן מוגדר.

מה נמצא לגבי המרחק מממוצע השופטים?

כל המודלים שנבחנו סטו פחות מהממוצע מאשר השופטים עצמם. המחברים מפרשים זאת כראיה לטובת יכולת ההכרעה של מודלים המונחים כראוי.

האם קרבה לממוצע מוכיחה שעונש הוא צודק?

המדד אינו קובע כשלעצמו מהו העונש הראוי. קרבה אליו ועמידה בעקרונות צדק הן שאלות שונות.

מדוע צמצום פערי ענישה חשוב מבחינה מוסדית?

פערים בהכרעות דומות נוגעים ליכולת לקיים מערכת עקבית. המחקר מספק דרך לבחון את התרומה האפשרית של מודלים להיבט הזה.

האם התוצאות לבדן מצדיקות החלפת שופטים?

המחקר המתואר בוחן שני תרחישים והשוואה למדד מוגדר. הוא אינו בוחן את מכלול תפקידי השופט בניהול הליך, בשמיעת ראיות ובהגנה על זכויות הנאשם.

התקציר שלעיל הוא תקציר עצמאי בעברית, שנכתב בסיוע כלי בינה מלאכותית ובעריכה אנושית, על בסיס המאמר המקורי. הוא אינו תרגום רשמי של התקציר או של המאמר, אינו מטעם המחברים או כתב העת, ואינו מחליף קריאה במקור

עודכן לאחרונה: 6 באוקטובר 2026