Скилловик

Практическая статья

Устаревают ли Agent Skills после обновления модели

Смена модели не делает skill автоматически бесполезным, но меняет исходную точку сравнения. Решение принимают по парным прогонам на тех же задачах и в той же среде.

Сравнение работы одного Agent Skill со старой и новой моделью по одинаковым контрольным задачам

Может ли Agent Skill устареть после обновления модели?

Да, его вклад может уменьшиться, исчезнуть или стать отрицательным, но это нельзя определить по номеру модели. Нужно повторить одинаковые задачи с навыком и без него при фиксированных модели, клиенте, рабочей области и правилах оценки.

Новая модель может сама выполнять часть прежней инструкции, лучше выбирать инструменты или иначе реагировать на слишком подробные ограничения. Одновременно узкий skill с внутренними правилами, шаблонами и проверками может оставаться ценным независимо от общей способности модели.

Какие признаки требуют повторной проверки?

Перезапускайте оценку после смены модели или клиента, роста времени и токенов, новых ложных активаций, повторения уже встроенных возможностей и появления расхождений между инструкцией и текущими инструментами.

  • Модель обновилась или изменился режим reasoning.
  • Клиент поменял загрузку skills, инструменты или разрешения.
  • Skill стал чаще вмешиваться в чужие задачи.
  • Без skill задача теперь выполняется не хуже или быстрее.
  • Скрипты, команды, ссылки или формат результата устарели.
  • Владелец процесса изменил правило, на котором построена инструкция.

Что зафиксировать до теста?

Зафиксируйте точную модель и режим, версию клиента, commit skill, рабочую область, разрешения, набор инструментов, входные данные, критерии оценки и лимиты. Иначе разницу нельзя честно связать со skill.

ФиксируемПример
СредуКлиент, ОС, runtime, доступ к сети и файлам
МодельТочное имя, режим и параметры запуска
АртефактCommit или hash каталога skill
ЗадачиОдинаковые входы без подсказки ожидаемого ответа
ОценкуРубрика качества, время, токены, ошибки и ручные вмешательства

Базовый протокол уже описан в статье как оценить эффективность Agent Skill; здесь он применяется именно после изменения среды.

Как провести парный тест с навыком и без него?

Для каждой задачи выполните независимый baseline без skill и прогон с ним, сохранив остальные условия. Повторите несколько раз, перемешайте порядок и оценивайте результаты по заранее принятой рубрике.

  1. 1. Выберите набор

    Возьмите реальные прямые, пограничные и отрицательные задачи, включая прежние регрессии.

  2. 2. Запустите baseline

    Отключите целевой skill и сохраните ответ, действия, время, токены и ошибки.

  3. 3. Запустите skill

    Верните ровно одну проверяемую версию и повторите тот же вход в чистой сессии.

  4. 4. Оцените вслепую

    По возможности скрывайте вариант от проверяющего, чтобы название режима не влияло на оценку.

  5. 5. Повторите

    Один прогон показывает пример, а не устойчивый эффект.

Что такое Skill Lift и как его читать?

Skill Lift — разница между результатом с целевым skill и baseline без него при одинаковых условиях. Положительное среднее значение полезно только вместе с разбросом, провальными сценариями и стоимостью выполнения.

В ACES skill оценивается как исполняемый артефакт в парных живых прогонах. Методика подчёркивает: структурная проверка и фактическая польза измеряют разные свойства. Валидный SKILL.md может не улучшить задачу, а полезный процесс всё равно нуждается в проверке структуры и безопасности.

НаблюдениеПредварительное решение
Качество выше, стоимость приемлемаОставить и зафиксировать новую baseline
Качество одинаково, skill дорожеУпростить или отключить для этой задачи
Среднее выше, но есть критические провалыИсправить границы и повторить тест
Эффект зависит от типа задачиСузить description и область применения
Результат хуже baselineПоставить на паузу, выяснить причину и подготовить откат

Когда skill лучше упростить, а не удалить?

Упрощайте skill, если уникальны внутренние правила, шаблоны или проверки, но общие объяснения уже повторяют возможности модели. Оставьте только тот контекст, который меняет решение или результат на ваших задачах.

  • Удалите общеизвестные советы, не влияющие на рубрику.
  • Сузьте description до подтверждённых сценариев.
  • Перенесите редко нужные справочники в references.
  • Замените повторяемую вычислимую операцию проверяемым script.
  • Сохраните обязательные стоп-условия, права и формат доказательств.

Если основной файл вырос вместе с исключениями, примените схему разделения большого SKILL.md.

Как выпустить изменение после переоценки?

Сохраните результаты baseline, измените одну проверяемую гипотезу, выпустите новую версию и повторите регрессионный набор. Прежний commit должен оставаться доступным для сравнения и отката.

Порядок diff, регрессии и возврата к прежней версии описан в руководстве по безопасному обновлению Agent Skill.

Как часто повторять тест?

Повторяйте ключевой набор после значимого изменения модели, клиента, skill или процесса, а также по расписанию для критичных навыков. Для стабильных низкорисковых сценариев достаточно более редкой проверки.

Минимальный артефакт — таблица версий и решений: что изменилось, какие задачи прогнаны, где skill улучшил результат, где мешал и кто принял решение. Так «кажется, навык устарел» превращается в воспроизводимый редакционный и инженерный вывод.

Обсудить переоценку Agent Skills

Источники

  1. Evaluating Skills, Not Just Agents: Agentic Continuous Evaluation of SkillsarXiv; проверено
  2. SkillEval: Decomposing Agent Skill Quality into Interpretable SignalsarXiv; проверено
  3. Evals design guideOpenAI; проверено
  4. Skill authoring best practicesAnthropic; проверено