Alex ChernyshAlex ChernyshAI Systems Engineer · Тель-Авив
Статьи
Назад к статьям

Статья

Ваш список запрещённых слов протух в марте 2024-го

Признак умирает от того, что его назвали, — поэтому любой список слов начинает протухать в день публикации. Под ним лежит то, чего ни один список не трогает: черновик ни на что не решается. Скилл для агента, который правит именно это.

12 августа 2026 г.·5 мин чтения
Delivery
На странице(5)
Список умирает от того, что его опубликовалиЧто не протухаетСкиллУстановкаЧто убедило меня, что четвёртый признак и есть главный

Любой гайд «как убрать из текста нейросеть» выдаёт список слов на удаление. Такой список начинает протухать в день публикации: признак умирает от того, что его назвали. А под ним лежит то, чего ни один список не трогает, — черновик ни на что не решается. Я собрал редакторский скилл, который чинит сначала это, и выложил его на GitHub.

Было

В современном динамично развивающемся ландшафте разработки стоит отметить, что наблюдаемость стала первостепенной. Наш последний релиз представляет надёжный набор улучшений планировщика запросов, который теперь идёт по trace ID вместо сканирования всех спанов в окне, оптимизируя медианный поиск трейса с 4.2 с до 380 мс и позволяя командам погружаться в трейсы с беспрецедентной ясностью.

Стало

Медианный поиск трейса упал с 4.2 с до 380 мс. Старый планировщик сканировал все спаны в окне; новый сначала идёт по trace ID. Если вы листаете трейсы во время инцидента, вы это почувствуете.

Все числа и весь механизм из второго варианта есть в первом. Правка убрала то, что стояло перед ними.

Список умирает от того, что его опубликовали

Когда в начале 2024-го публично назвали delve, intricate и showcasing, их частота в абстрактах arXiv поехала вниз примерно с марта — раньше, чем в мае вышел GPT-4o. Слова убили авторы, а не апдейт модели. При этом significant и additionally всё это время спокойно росли, потому что их никто не назвал (Geng и Trotta, ~1.29 млн абстрактов).

Значит, список, который вы читаете сегодня, уже разлагается — а насколько быстро, не знает никто: сроки, которые ходят по интернету как факт, ни на чём не основаны.

Что не протухает

На семи instruction-tuned моделях и пяти регистрах распределение 67 лексико-грамматических признаков у каждой модели лежит за пределами доверительного коридора, который живые авторы образуют между собой. Переформулируйте промпт — сдвинется абсолютное расстояние, но не порядок: корреляции не ниже 0.985 (Nieth et al.).

«Напиши поразговорнее» до сломанного места просто не достаёт.

Четыре признака, которые переживают любой релиз модели

  • Нет позиции. Абзац можно перепечатать под любой стороной спора
  • Обобщённый пример. Такой выдаст любой промпт, а не тот, который кто-то вспомнил
  • Однородность регистра. Двенадцатый абзац звучит ровно как первый
  • Выдуманная конкретика. Ссылка или число, которые никто не открывал

Четвёртый правкой не чинится, и дальше только хуже. Выдуманные ссылки: одна работа из 2828 в 2023-м, одна из 458 в 2025-м, одна из 277 за первые семь недель 2026-го (Topaz et al., Lancet 407(10541):1779–1781). Retrieval не починил проблему, а сменил ей форму. Теперь модель цитирует реальную, открывающуюся статью, которая не подтверждает предложение, к которому пришита.

Скилл

bluepencil правит черновик или разбирает его, не трогая ни слова. Сначала пишет voice contract: главная мысль плюс три-пять фраз, процитированных из вашего черновика дословно, которые он обязался сохранить. Потом правит и прогоняет собственный результат через рубрику из 36 пунктов. На длинном или публикуемом тексте зовёт двух критиков в чистом контексте: один ищет потерю голоса, второй — уцелевший слоп. При равном счёте выигрывает потеря голоса.

Последняя стадия нужна потому, что самооценка измеримо смещена, причём даже не в одну сторону: LLM-судьи отклоняются на собственных текстах от +9.40% до −16.64% в зависимости от модели (Ye et al., CALM, ICLR 2025). Поправку на «он себе польстит» сделать нельзя. Её делает читатель, у которого есть артефакты и нет ваших рассуждений.

Две вещи скилл делать отказывается. Он не оптимизирует под детектор ИИ: RL-обученная перефразировка сажает true-positive детекторов до 0.024 при 1% ложных срабатываний (arXiv:2602.08934), а семь детекторов дали в среднем 61.3% ложных срабатываний на эссе TOEFL, написанных неносителями языка (Liang et al., Patterns 4(7):100779). Правка под классификатор портит текст и сильнее всего бьёт по тем, кто ни в чём не виноват. И он не угадывает, кто написал текст, а называет признаки, которые вы можете проверить сами.

Про русский

Все цифры выше измерены на английском. Для русского нативная стилометрия работает: триграммный косинус даёт ARI около 0.70, ансамбли на коротких текстах доходят до 0.95. А вот английские списки слов не переносятся вообще. По ивриту рецензируемых исследований этих признаков я не нашёл ни одного, и скилл говорит об этом прямо, вместо того чтобы делать вид, будто список слов меняет язык вместе с вами.

Установка

Одна строка, любой агент:

npx skills add chernistry/bluepencil

Claude Code, плагином:

/plugin marketplace add chernistry/bluepencil
/plugin install bluepencil@bluepencil

Одна строка, без тулинга:

git clone -q --depth 1 https://github.com/chernistry/bluepencil /tmp/bp && mkdir -p ~/.claude/skills && cp -r /tmp/bp/skills/bluepencil ~/.claude/skills/ && rm -rf /tmp/bp && echo "bluepencil installed"

Дальше: Blue-pencil this post. Или: Audit this draft — don't rewrite it.

Что убедило меня, что четвёртый признак и есть главный

Файл с доказательствами под скиллом собран из шести независимых прогонов deep research по одному промпту. Пять честно написали, что часть вопросов не измерена: сколько раундов критики до того, как польза кончается; выигрывает ли письменный voice contract у свободной правки; какова на самом деле дисперсия длины предложений у людей.

Шестой ответил на каждый такой вопрос точной цифрой и номером arXiv. Сохранность голоса 88.7%. Доля выдуманных замечаний 42% к четвёртому раунду. Ни одной из этих статей не существует.

Самые убедительно звучащие числа во всём корпусе сгенерированы ровно под те дыры, где измерений нет. В документе, которому прямо велели открывать каждый источник. Поэтому reference-файл выложен в виде трёх отдельных списков: что измерено, что фольклор в костюме цифры и что не измерил никто.

Как написан этот пост

Пост написан черновиком, потом отредактирован тем самым скиллом, потом проверен вторым читателем по той же рубрике — без доступа к моим рассуждениям. Сколько предложений изменилось, я не скажу. Черновик не опубликован, и такое число было бы ровно тем, о чём предупреждает последний раздел. Проверить можно другое: каждое исследование, на которое я тут сослался, лежит в публичном файле доказательств, тремя раздельными списками — измеренное, фольклор, неизмеренное.

github.com/chernistry/bluepencil · MIT

✓ Reading complete

Alex ChernyshAlex ChernyshApplied AI Systems & Platform Engineer

Ещё по теме Delivery

Часть публичных заметок про AI-системы с опорой на источники: поиск, evals и поставку под реальными ограничениями.

  • →Прогноз без пророчества: дисциплина в простом тексте2 мая 2026 г.·10 мин чтения
  • →Как доводить разработку с AI до зелёного CI и не ломать код4 мар. 2026 г.·5 мин чтения
  • →Большинство проблем в RAG начинаются с документов12 февр. 2026 г.·5 мин чтения
На странице
  • 01Список умирает от того, что его опубликовали
  • 02Что не протухает1 min
  • 03Скилл1 min
  • 04Установка
  • 05Что убедило меня, что четвёртый признак и есть главный1 min