כל מדריך ל"להוריד מהטקסט את הריח של בינה מלאכותית" מגיש רשימת מילים למחיקה. הרשימה מתחילה להתיישן ביום שהיא מתפרסמת: סימן מת מרגע שהוקיעו אותו. מתחתיה יושב הכשל שאף רשימה לא נוגעת בו — הטיוטה לא מתחייבת לשום דבר. בניתי סקיל עריכה שמתקן קודם את זה, והעליתי אותו ל-GitHub.
לפני
בנוף הפיתוח המהיר של ימינו, חשוב לציין שנצפוּת הפכה לקריטית. הגרסה האחרונה שלנו מציגה מערך שיפורים חזק במתכנן השאילתות, שהולך כעת לפי trace ID במקום לסרוק כל span בחלון, ומייעל את זמן החיפוש החציוני של trace מ-4.2 שניות ל-380 מילישניות תוך שהוא מאפשר לצוותים לצלול אל תוך ה-traces בבהירות חסרת תקדים.
אחרי
זמן החיפוש החציוני של trace ירד מ-4.2 שניות ל-380 מילישניות. מתכנן השאילתות הישן סרק כל span בחלון; החדש הולך קודם לפי trace ID. אם אתם מדפדפים ב-traces באמצע אירוע, תרגישו את זה.
כל מספר וכל מנגנון בגרסה השנייה נמצאים כבר בראשונה. העריכה הסירה את מה שעמד מולם.
הרשימה מתה כי מישהו פרסם אותה
כשהמילים delve, intricate ו-showcasing הוקעו בפומבי בתחילת 2024, התדירות שלהן בתקצירי arXiv התחילה לרדת בערך במרץ — לפני ש-GPT-4o יצא במאי. הכותבים הרגו את המילים, לא עדכון של מודל. במקביל significant ו-additionally המשיכו לעלות בשקט, כי אף אחד לא הוקיע אותן (Geng ו-Trotta, כ-1.29 מיליון תקצירים).
כלומר כל רשימה שאפשר לקרוא היום כבר מתפוררת, ובאיזה קצב אף אחד לא יודע: לוחות הזמנים שמסתובבים כעובדה נשענים על כלום.
מה שלא מתיישן
בקרב שבעה מודלים מכווני-הוראות וחמישה רגיסטרים, ההתפלגות של 67 מאפיינים לקסיקו-דקדוקיים של כל מודל נמצאת מחוץ לרווח הסמך שבני אדם יוצרים בינם לבין עצמם. שנו את ניסוח הפרומפט והמרחק המוחלט יזוז; הדירוג לא, במתאמים של 0.985 ומעלה (Nieth et al.).
"תכתוב יותר בקלילות" פשוט לא מגיע למקום השבור.
הרביעי הוא היחיד שעריכה לא מתקנת, והמצב רק מחמיר. מקורות מומצאים: מאמר אחד מתוך 2,828 ב-2023, אחד מתוך 458 ב-2025, ואחד מתוך 277 בשבעת השבועות הראשונים של 2026 (Topaz et al., Lancet 407(10541):1779–1781). Retrieval לא תיקן את הכשל אלא שינה לו את הצורה. הגרסה העדכנית מצטטת מאמר אמיתי, שנפתח, ושלא תומך במשפט שאליו הוצמד.
הסקיל
bluepencil עורך טיוטה, או מבקר אותה בלי לגעת במילה. קודם הוא כותב voice contract: הנקודה המרכזית, ועוד שלושה עד חמישה ביטויים שצוטטו מהטיוטה שלכם מילה במילה ושהוא התחייב לשמור. אחר כך הוא עורך, ואז מריץ רובריקה של 36 סעיפים על הפלט של עצמו. בטקסט ארוך או מיועד לפרסום הוא מעביר את התוצאה לשני מבקרים בהקשר נקי: אחד מחפש אובדן קול, השני מחפש שאריות של טקסט מכונה. ממצא של אובדן קול מנצח בתיקו.
השלב האחרון קיים כי ציון עצמי מוטה במידה מדודה, ואפילו לא בכיוון עקבי: שופטי LLM מטים את הציון של הפלט שלהם עצמם, חלקם כלפי מעלה ב-9.40% ואחד מהם דווקא כלפי מטה ב-16.64%, תלוי במודל (Ye et al., CALM, ICLR 2025). אי אפשר לתקן את זה בהנחה שהמודל יחמיא לעצמו. מתקנים את זה עם קורא שמחזיק את החומרים ולא מחזיק את הנימוקים שלכם.
שני דברים הוא מסרב לעשות. הוא לא עורך כדי לעקוף גלאי בינה מלאכותית: התקפת ניסוח מחדש שאומנה ב-RL מורידה את שיעור הזיהוי הנכון של גלאים ל-0.024 ב-1% התרעות שווא (arXiv:2602.08934), ושבעה גלאים נתנו בממוצע 61.3% התרעות שווא על חיבורי TOEFL שנכתבו בידי דוברים לא-ילידיים (Liang et al., Patterns 4(7):100779). עריכה לעבר מסווג מקלקלת את הטקסט ופוגעת הכי חזק במי שלא עשה כלום. והוא לא מנחש מי כתב, אלא נותן שם לסימנים שאתם יכולים לבדוק בעצמכם.
התקנה
שורה אחת, כל סוכן:
npx skills add chernistry/bluepencilClaude Code, כתוסף:
/plugin marketplace add chernistry/bluepencil/plugin install bluepencil@bluepencilשורה אחת, בלי כלים:
git clone -q --depth 1 https://github.com/chernistry/bluepencil /tmp/bp && mkdir -p ~/.claude/skills && cp -r /tmp/bp/skills/bluepencil ~/.claude/skills/ && rm -rf /tmp/bp && echo "bluepencil installed"ואז: Blue-pencil this post. או: Audit this draft — don't rewrite it.
מה שכנע אותי שהסימן הרביעי הוא האמיתי
קובץ הראיות שמתחת לסקיל הורכב משישה מחקרי עומק עצמאיים שענו על אותו פרומפט. חמישה מהם דיווחו שקבוצת שאלות מסוימת לא נמדדה: כמה סבבי ביקורת עד שהתועלת נגמרת, האם voice contract כתוב מנצח עריכה חופשית, ומהי באמת השונות באורך המשפט אצל בני אדם.
השישי ענה על כל אחת מהשאלות האלה במספר מדויק ובמזהה arXiv. שימור קול של 88.7%. ממצאי ביקורת מומצאים שמגיעים ל-42% בסבב הרביעי. אף אחד מהמאמרים האלה לא קיים.
המספרים שנשמעו הכי שימושיים בכל הקורפוס נוצרו בדיוק כדי למלא את החורים שבהם אין מדידה. במסמך שקיבל הוראה מפורשת לפתוח כל מקור. בגלל זה קובץ הראיות מתפרסם בשלוש רשימות נפרדות: מה נמדד, מה פולקלור שלבש מספר, ומה אף אחד לא מדד.