skill packIntermediateFree PackEditorial Curated5 prompts sequenced

Agent Observability and Evaluation Skills

A focused collection for teams operating tool-using AI agents. These skills turn raw sessions into traceable evidence, consistent failure taxonomies, risk-aware red-team plans, privacy-safe telemetry policies, and cost-per-accepted-output decisions.

Use case: Evaluate and debug production AI agents with repeatable evidence.
Audience: AI engineers, product teams, reliability leads, and technical editors.
Tools: OpenTelemetry · GitHub Copilot · Codex · Claude

Production Pipeline

Suggested Execution Order

Agent Skill • TS/JSON
Prompt 01
skill

Trace-First Agent Session Debugger

Create trace-first agent session debugger with explicit composition, visual hierarchy, material, lighting, and constraint controls.

Agent Skill • TS/JSON
Prompt 02
skill

Tool Failure Taxonomy Builder

Create tool failure taxonomy builder with explicit composition, visual hierarchy, material, lighting, and constraint controls.

Agent Skill • TS/JSON
Prompt 03
skill

Accepted Output Cost Evaluator

Create accepted output cost evaluator with explicit composition, visual hierarchy, material, lighting, and constraint controls.

Agent Skill • TS/JSON
Prompt 04
skill

Agent Session Red-Team Planner

Create agent session red-team planner with explicit composition, visual hierarchy, material, lighting, and constraint controls.

Agent Skill • TS/JSON
Prompt 05
skill

OTel Privacy Capture Policy

Create otel privacy capture policy with explicit composition, visual hierarchy, material, lighting, and constraint controls.

Keep Exploring

More Curated Packs

View all collections