Alex ChernyshAlex ChernyshAI Systems Engineer · תל אביב
כתיבה
חזרה לכתיבה

הערה

רשימת המילים האסורות שלכם פגה במרץ 2024

סימן מת מרגע שהוקיעו אותו, ולכן כל רשימת מילים מתחילה להתיישן ביום שהיא מתפרסמת. מתחתיה יושב הכשל שאף רשימה לא נוגעת בו: הטיוטה לא מתחייבת לכלום. בניתי סקיל עריכה בשביל זה.

12 באוגוסט 2026·5 דק׳ קריאה
Delivery
בעמוד הזה(5)
הרשימה מתה כי מישהו פרסם אותהמה שלא מתיישןהסקילהתקנהמה שכנע אותי שהסימן הרביעי הוא האמיתי

כל מדריך ל"להוריד מהטקסט את הריח של בינה מלאכותית" מגיש רשימת מילים למחיקה. הרשימה מתחילה להתיישן ביום שהיא מתפרסמת: סימן מת מרגע שהוקיעו אותו. מתחתיה יושב הכשל שאף רשימה לא נוגעת בו — הטיוטה לא מתחייבת לשום דבר. בניתי סקיל עריכה שמתקן קודם את זה, והעליתי אותו ל-GitHub.

לפני

בנוף הפיתוח המהיר של ימינו, חשוב לציין שנצפוּת הפכה לקריטית. הגרסה האחרונה שלנו מציגה מערך שיפורים חזק במתכנן השאילתות, שהולך כעת לפי trace ID במקום לסרוק כל span בחלון, ומייעל את זמן החיפוש החציוני של trace מ-4.2 שניות ל-380 מילישניות תוך שהוא מאפשר לצוותים לצלול אל תוך ה-traces בבהירות חסרת תקדים.

אחרי

זמן החיפוש החציוני של trace ירד מ-4.2 שניות ל-380 מילישניות. מתכנן השאילתות הישן סרק כל span בחלון; החדש הולך קודם לפי trace ID. אם אתם מדפדפים ב-traces באמצע אירוע, תרגישו את זה.

כל מספר וכל מנגנון בגרסה השנייה נמצאים כבר בראשונה. העריכה הסירה את מה שעמד מולם.

הרשימה מתה כי מישהו פרסם אותה

כשהמילים delve, intricate ו-showcasing הוקעו בפומבי בתחילת 2024, התדירות שלהן בתקצירי arXiv התחילה לרדת בערך במרץ — לפני ש-GPT-4o יצא במאי. הכותבים הרגו את המילים, לא עדכון של מודל. במקביל significant ו-additionally המשיכו לעלות בשקט, כי אף אחד לא הוקיע אותן (Geng ו-Trotta, כ-1.29 מיליון תקצירים).

כלומר כל רשימה שאפשר לקרוא היום כבר מתפוררת, ובאיזה קצב אף אחד לא יודע: לוחות הזמנים שמסתובבים כעובדה נשענים על כלום.

מה שלא מתיישן

בקרב שבעה מודלים מכווני-הוראות וחמישה רגיסטרים, ההתפלגות של 67 מאפיינים לקסיקו-דקדוקיים של כל מודל נמצאת מחוץ לרווח הסמך שבני אדם יוצרים בינם לבין עצמם. שנו את ניסוח הפרומפט והמרחק המוחלט יזוז; הדירוג לא, במתאמים של 0.985 ומעלה (Nieth et al.).

"תכתוב יותר בקלילות" פשוט לא מגיע למקום השבור.

ארבעה סימנים ששורדים כל שחרור של מודל

  • אין עמדה. אפשר להדפיס את הפסקה מחדש לטובת כל אחד מצדדי הוויכוח
  • דוגמה גנרית. כזו שכל פרומפט היה מפיק, ולא כזו שמישהו נזכר בה
  • אחידות רגיסטר. פסקה 12 נשמעת בדיוק כמו פסקה 1
  • ספציפיות מומצאת. מקור או מספר שאף אחד לא פתח

הרביעי הוא היחיד שעריכה לא מתקנת, והמצב רק מחמיר. מקורות מומצאים: מאמר אחד מתוך 2,828 ב-2023, אחד מתוך 458 ב-2025, ואחד מתוך 277 בשבעת השבועות הראשונים של 2026 (Topaz et al., Lancet 407(10541):1779–1781). Retrieval לא תיקן את הכשל אלא שינה לו את הצורה. הגרסה העדכנית מצטטת מאמר אמיתי, שנפתח, ושלא תומך במשפט שאליו הוצמד.

הסקיל

bluepencil עורך טיוטה, או מבקר אותה בלי לגעת במילה. קודם הוא כותב voice contract: הנקודה המרכזית, ועוד שלושה עד חמישה ביטויים שצוטטו מהטיוטה שלכם מילה במילה ושהוא התחייב לשמור. אחר כך הוא עורך, ואז מריץ רובריקה של 36 סעיפים על הפלט של עצמו. בטקסט ארוך או מיועד לפרסום הוא מעביר את התוצאה לשני מבקרים בהקשר נקי: אחד מחפש אובדן קול, השני מחפש שאריות של טקסט מכונה. ממצא של אובדן קול מנצח בתיקו.

השלב האחרון קיים כי ציון עצמי מוטה במידה מדודה, ואפילו לא בכיוון עקבי: שופטי LLM מטים את הציון של הפלט שלהם עצמם, חלקם כלפי מעלה ב-9.40% ואחד מהם דווקא כלפי מטה ב-16.64%, תלוי במודל (Ye et al., CALM, ICLR 2025). אי אפשר לתקן את זה בהנחה שהמודל יחמיא לעצמו. מתקנים את זה עם קורא שמחזיק את החומרים ולא מחזיק את הנימוקים שלכם.

שני דברים הוא מסרב לעשות. הוא לא עורך כדי לעקוף גלאי בינה מלאכותית: התקפת ניסוח מחדש שאומנה ב-RL מורידה את שיעור הזיהוי הנכון של גלאים ל-0.024 ב-1% התרעות שווא (arXiv:2602.08934), ושבעה גלאים נתנו בממוצע 61.3% התרעות שווא על חיבורי TOEFL שנכתבו בידי דוברים לא-ילידיים (Liang et al., Patterns 4(7):100779). עריכה לעבר מסווג מקלקלת את הטקסט ופוגעת הכי חזק במי שלא עשה כלום. והוא לא מנחש מי כתב, אלא נותן שם לסימנים שאתם יכולים לבדוק בעצמכם.

לגבי עברית

כל המספרים כאן נמדדו על אנגלית. לעברית לא מצאתי אף מחקר שפיט-עמיתים על הסימנים האלה, והסקיל אומר את זה במפורש במקום להעמיד פנים שרשימת מילים באנגלית עוברת שפה. ברוסית, לשם השוואה, סטילומטריה ייעודית לשפה כן עובדת.

התקנה

שורה אחת, כל סוכן:

npx skills add chernistry/bluepencil

Claude Code, כתוסף:

/plugin marketplace add chernistry/bluepencil
/plugin install bluepencil@bluepencil

שורה אחת, בלי כלים:

git clone -q --depth 1 https://github.com/chernistry/bluepencil /tmp/bp && mkdir -p ~/.claude/skills && cp -r /tmp/bp/skills/bluepencil ~/.claude/skills/ && rm -rf /tmp/bp && echo "bluepencil installed"

ואז: Blue-pencil this post. או: Audit this draft — don't rewrite it.

מה שכנע אותי שהסימן הרביעי הוא האמיתי

קובץ הראיות שמתחת לסקיל הורכב משישה מחקרי עומק עצמאיים שענו על אותו פרומפט. חמישה מהם דיווחו שקבוצת שאלות מסוימת לא נמדדה: כמה סבבי ביקורת עד שהתועלת נגמרת, האם voice contract כתוב מנצח עריכה חופשית, ומהי באמת השונות באורך המשפט אצל בני אדם.

השישי ענה על כל אחת מהשאלות האלה במספר מדויק ובמזהה arXiv. שימור קול של 88.7%. ממצאי ביקורת מומצאים שמגיעים ל-42% בסבב הרביעי. אף אחד מהמאמרים האלה לא קיים.

המספרים שנשמעו הכי שימושיים בכל הקורפוס נוצרו בדיוק כדי למלא את החורים שבהם אין מדידה. במסמך שקיבל הוראה מפורשת לפתוח כל מקור. בגלל זה קובץ הראיות מתפרסם בשלוש רשימות נפרדות: מה נמדד, מה פולקלור שלבש מספר, ומה אף אחד לא מדד.

איך נכתב הפוסט הזה

הפוסט נכתב כטיוטה, נערך בסקיל שהוא מתאר, ואז נבדק בידי קורא שני שהריץ את אותה רובריקה בלי הנימוקים שלי. כמה משפטים השתנו לא אגיד. הטיוטה לא פורסמה, ולכן מספר כזה היה בדיוק מה שהחלק האחרון של הפוסט מזהיר מפניו. מה שכן אפשר לאמת: כל מחקר שציטטתי כאן נמצא בקובץ הראיות הפומבי, בשלוש רשימות נפרדות — מה שנמדד, פולקלור, ומה שלא נמדד.

github.com/chernistry/bluepencil · MIT

✓ Reading complete

Alex ChernyshAlex ChernyshApplied AI Systems & Platform Engineer

עוד על Delivery

חלק מהערות ציבוריות על מערכות AI עם grounding, retrieval, evals ועל איך שולחים את זה תחת מגבלות אמיתיות.

  • →פרוגנוזה ללא נבואה: דיסציפלינה בטקסט פשוט2 במאי 2026·10 דק׳ קריאה
  • →רוב הכשלים ב-RAG מתחילים במסמכים12 בפבר׳ 2026·2 דק׳ קריאה
  • →איך מריצים LLM evals בפרודקשן3 בפבר׳ 2026·5 דק׳ קריאה
בעמוד הזה
  • 01הרשימה מתה כי מישהו פרסם אותה
  • 02מה שלא מתיישן1 min
  • 03הסקיל1 min
  • 04התקנה
  • 05מה שכנע אותי שהסימן הרביעי הוא האמיתי1 min