NVIDIAは2026年8月19日、AIエージェントに特定の作業手順やツールの使い方などを教えるエージェントスキル
安全性の検証から効果測定まで、3段階で評価
SkillEvaluatorの評価は、形式や安全性の静的検査から、実際のエージェントを使った効果測定までの3段階で構成され、各段階を単独でも実行できる。
- Tier 1:形式と安全性の検証:ファイル構造や記述形式、品質を確認し、プロンプトインジェクションにつながる記述、秘密情報・
個人情報の有無、ライセンス上の問題などを静的に検査する - Tier 2:重複の検出:文章の意味の近さを比較し、スキル内やカタログ内にある重複した内容を検出する
- Tier 3:実際のエージェントを使った効果測定:エージェントにテストケースを実行させ、スキルが成果を改善するかを測る
Tier 3では、オープンソースのエージェント評価基盤
ベンチマークで5項目のSkill Liftを測定
NVIDIAは、30を超える自社製品向けの300以上のスキルを、OpenAI CodexとClaude Codeの2種類のエージェント実行環境で評価した。Skill Liftは、実行環境ごとにスキルありのスコアからスキルなしのスコアを引いて算出する。公開された結果は2026年8月12日時点のベンチマークに基づくマクロ平均で、スキルと実行環境の各組み合わせに同じ重みを与えている。表の数値はCodexとClaude Codeをまとめた全体値で、
| 評価項目 | スキルなし | スキルあり | Skill Lift |
|---|---|---|---|
| 正確性 |
46 | 87 | +41ポイント |
| スキルの適切な読み込み |
42 | 82 | +40ポイント |
| 有効性 |
39 | 78 | +39ポイント |
| 効率性 |
43 | 78 | +35ポイント |
| 安全性 |
97 | 98 | +1ポイント |
5項目全体のSkill Liftは平均31ポイント、安全性を除く4項目では平均39ポイントだった。
環境別のSkill Liftは、5項目全体でClaude Codeが+34ポイント、Codexが+29ポイントだった。安全性を除く4項目では、Claude Codeが+42ポイント、Codexが+36ポイントだった。いずれも各環境内で測ったスキル導入による改善幅であり、Claude CodeとCodexの性能そのものを比べた値ではない。また、製品別のSkill Liftはおおむね+2~+46ポイントの幅があり、実行環境の違いより製品による差のほうが大きかった。
正確性と有効性は、スキルの有無にかかわらず同じ基準で評価される。スキルの適切な読み込み
公開結果では、対象スキルの85%について、各タスクをスキルあり・
スキルの改善や導入判断に活用
SkillEvaluatorでは、スキルの公開前に、形式や安全性に加え、実際にエージェントの成果を改善するかを確認できる。NVIDIAによると、スキルを導入してもトークン数や実行時間が必ず減るわけではなく、評価を通じて追加の最適化が必要なスキルも見つかった。
NVIDIAの公式ブログによると、OpenClawは、ClawHub上の公式組織を対象にSkillEvaluatorを試験導入している。Tier 3で測ったスキルあり・
Nous Researchによると、Hermes AgentのSkills Hubからスキルをインストールする際、必要なスキャナーが導入されていれば、SkillEvaluatorのTier 1による補助的な検査が実行される。検査結果は、ユーザーがインストールを確定する前に表示される。具体的には、個人を特定できる情報
なお、SkillEvaluatorのリポジトリでは、サポートレベルが