Может ли Agent Skill устареть после обновления модели?
Да, его вклад может уменьшиться, исчезнуть или стать отрицательным, но это нельзя определить по номеру модели. Нужно повторить одинаковые задачи с навыком и без него при фиксированных модели, клиенте, рабочей области и правилах оценки.
Новая модель может сама выполнять часть прежней инструкции, лучше выбирать инструменты или иначе реагировать на слишком подробные ограничения. Одновременно узкий skill с внутренними правилами, шаблонами и проверками может оставаться ценным независимо от общей способности модели.
Какие признаки требуют повторной проверки?
Перезапускайте оценку после смены модели или клиента, роста времени и токенов, новых ложных активаций, повторения уже встроенных возможностей и появления расхождений между инструкцией и текущими инструментами.
- Модель обновилась или изменился режим reasoning.
- Клиент поменял загрузку skills, инструменты или разрешения.
- Skill стал чаще вмешиваться в чужие задачи.
- Без skill задача теперь выполняется не хуже или быстрее.
- Скрипты, команды, ссылки или формат результата устарели.
- Владелец процесса изменил правило, на котором построена инструкция.
Что зафиксировать до теста?
Зафиксируйте точную модель и режим, версию клиента, commit skill, рабочую область, разрешения, набор инструментов, входные данные, критерии оценки и лимиты. Иначе разницу нельзя честно связать со skill.
| Фиксируем | Пример |
|---|---|
| Среду | Клиент, ОС, runtime, доступ к сети и файлам |
| Модель | Точное имя, режим и параметры запуска |
| Артефакт | Commit или hash каталога skill |
| Задачи | Одинаковые входы без подсказки ожидаемого ответа |
| Оценку | Рубрика качества, время, токены, ошибки и ручные вмешательства |
Базовый протокол уже описан в статье как оценить эффективность Agent Skill; здесь он применяется именно после изменения среды.
Как провести парный тест с навыком и без него?
Для каждой задачи выполните независимый baseline без skill и прогон с ним, сохранив остальные условия. Повторите несколько раз, перемешайте порядок и оценивайте результаты по заранее принятой рубрике.
- 1. Выберите набор
Возьмите реальные прямые, пограничные и отрицательные задачи, включая прежние регрессии.
- 2. Запустите baseline
Отключите целевой skill и сохраните ответ, действия, время, токены и ошибки.
- 3. Запустите skill
Верните ровно одну проверяемую версию и повторите тот же вход в чистой сессии.
- 4. Оцените вслепую
По возможности скрывайте вариант от проверяющего, чтобы название режима не влияло на оценку.
- 5. Повторите
Один прогон показывает пример, а не устойчивый эффект.
Что такое Skill Lift и как его читать?
Skill Lift — разница между результатом с целевым skill и baseline без него при одинаковых условиях. Положительное среднее значение полезно только вместе с разбросом, провальными сценариями и стоимостью выполнения.
В ACES skill оценивается как исполняемый артефакт в парных живых прогонах. Методика подчёркивает: структурная проверка и фактическая польза измеряют разные свойства. Валидный SKILL.md может не улучшить задачу, а полезный процесс всё равно нуждается в проверке структуры и безопасности.
| Наблюдение | Предварительное решение |
|---|---|
| Качество выше, стоимость приемлема | Оставить и зафиксировать новую baseline |
| Качество одинаково, skill дороже | Упростить или отключить для этой задачи |
| Среднее выше, но есть критические провалы | Исправить границы и повторить тест |
| Эффект зависит от типа задачи | Сузить description и область применения |
| Результат хуже baseline | Поставить на паузу, выяснить причину и подготовить откат |
Когда skill лучше упростить, а не удалить?
Упрощайте skill, если уникальны внутренние правила, шаблоны или проверки, но общие объяснения уже повторяют возможности модели. Оставьте только тот контекст, который меняет решение или результат на ваших задачах.
- Удалите общеизвестные советы, не влияющие на рубрику.
- Сузьте description до подтверждённых сценариев.
- Перенесите редко нужные справочники в references.
- Замените повторяемую вычислимую операцию проверяемым script.
- Сохраните обязательные стоп-условия, права и формат доказательств.
Если основной файл вырос вместе с исключениями, примените схему разделения большого SKILL.md.
Как выпустить изменение после переоценки?
Сохраните результаты baseline, измените одну проверяемую гипотезу, выпустите новую версию и повторите регрессионный набор. Прежний commit должен оставаться доступным для сравнения и отката.
Порядок diff, регрессии и возврата к прежней версии описан в руководстве по безопасному обновлению Agent Skill.
Как часто повторять тест?
Повторяйте ключевой набор после значимого изменения модели, клиента, skill или процесса, а также по расписанию для критичных навыков. Для стабильных низкорисковых сценариев достаточно более редкой проверки.
Минимальный артефакт — таблица версий и решений: что изменилось, какие задачи прогнаны, где skill улучшил результат, где мешал и кто принял решение. Так «кажется, навык устарел» превращается в воспроизводимый редакционный и инженерный вывод.
