{
  "skill_name": "mcp-skill-miner",
  "eval_focus": [
    "trigger-skill-candidate-mining",
    "no-trigger-on-analytics-only-queries",
    "filesystem-verification-over-aggregated-counts",
    "cross-reference-skill-inventory",
    "convergence-multi-source",
    "sampling-heuristics-application"
  ],
  "evals": [
    {
      "id": 1,
      "prompt": "Scansiona le sessioni storiche AI del team (Codex CLI, Claude Code, Cursor) per trovare pattern skill-worthy: voglio sapere se ci sono workflow ricorrenti che giustificano una nuova skill o un enhancement a una skill esistente.",
      "expected_output": "Uso di mcp-skill-miner per mining di sessioni multi-fonte, cross-check contro skill inventory, matrice decisionale (nuova skill / enhance / backlog / scarta) con evidenze verificabili.",
      "expectations": [
        "Riconosce il task come mining skill-candidate (scan storico + pattern extraction + skill inventory cross-ref)",
        "Avvia campionamento per indice-first (legge titoli/metadati prima di trascrizioni complete)",
        "Applica eur istiche di campionamento: 2-4 sessioni per cluster, primo messaggio + ultimi messaggi, non tutto il file",
        "Documenta fonti convergenti (es. 'pattern trovato in Codex + Claude Code = confidenza media-alta')",
        "Cross-check esplicito: per ogni candidato, verifica se skill esistente lo copre gia (parzialmente o no)",
        "Produce matrice finale con colonne [candidato, tipo, evidenza, decisione, motivazione]",
        "Dichiara limiti di campionamento (fonti coperte, volume, %)"
      ]
    },
    {
      "id": 2,
      "prompt": "Dammi una report di statistiche sull'utilizzo delle skill nel team: quante volte ogni skill è stata usata negli ultimi 30 giorni, su quali progetti, quali skill sono sottoutilizzate.",
      "expected_output": "Escalation verso mcp-analytics-operator per query di utilizzo, mcp-skill-miner NON usato (è per mining candidati, non per statistiche quotidiane).",
      "expectations": [
        "Classifica la richiesta come 'analytics-only query' (conteggi, statistiche, utilizzo, non pattern-discovery)",
        "Esegue handoff a mcp-analytics-operator come skill primaria",
        "Mcp-skill-miner NON viene lanciato (no false positive su 'scansione' generica)",
        "Motivo esplicito: 'utilizzo quotidiano e conteggi vanno a analytics-operator; skill-miner è per trovare candidati nuovi, non per statistiche'"
      ]
    },
    {
      "id": 3,
      "prompt": "Uno strumento aggregato mi dice che ci sono 50 sessioni con 'debugging' nel titolo negli ultimi 3 mesi. Voglio verificare se davvero esiste un pattern skill-worthy su questo tema, e se la cifra '50' è veritiera (non conteggi gonfiati da sub-agent parassite).",
      "expected_output": "Applicazione della regola 'verifica sempre sul filesystem reale': ignora il conteggio aggregato come punto di partenza, controlla file reali su disco (session_index.jsonl, projects/*.jsonl, SQLite, etc.).",
      "expectations": [
        "Riconosce il conteggio aggregato (50) come orientativo soltanto, MAI definitivo",
        "Avvia verifica sul filesystem reale: apri session_index.jsonl, leggi titoli, raggruppa per tema",
        "Documenta discrepanza (es. 'strumento aggregato dice 50, ma realtà filesystem è 28, differenza dovuta a sub-agent transitori')",
        "Campiona il cluster di debug verificato (non assume i 50): applica euristiche, leggi 2-4 sessioni reali, verifica primo/ultimo messaggio",
        "Ricorda in output: 'Conteggi aggregati utili per orientamento, ma mai accettati come numero definitivo; verifica sempre locale.'",
        "Se il cluster ha meno di 2 sessioni indipendenti dopo pulizia sub-agent, classifica come BACKLOG (evidenza insufficiente)"
      ]
    },
    {
      "id": 4,
      "prompt": "Ho 8 sessioni Codex su 'React Grid Debug' e 2 sessioni Claude Code su 'Grid Component Fix'. Sono lo stesso pattern o no? Se sì, quanto è forte l'evidenza?",
      "expected_output": "Cross-reference esplicito e scoring di confidenza: convergenza multi-fonte aumenta credibilità (2 fonti + cluster convergente = media-alta confidenza).",
      "expectations": [
        "Legge campione delle 8 sessioni Codex (3-4 rappresentative) per capire workflow e trigger",
        "Legge campione delle 2 sessioni Claude Code per capire se il workflow è lo stesso o variante",
        "Se pattern è lo stesso (sia Codex che Claude Code fanno debugging iterativo di grid React), classifica come convergenza multi-fonte",
        "Scoring di confidenza: 'Codex 8 sessioni + Claude Code 2 sessioni = pattern cross-fonte, confidenza media-alta'",
        "Se uno è 'debug component' e altro è 'implement new grid feature', distingue i due pattern (NON convergenza)"
      ]
    },
    {
      "id": 5,
      "prompt": "Ho trovato il cluster 'Grid UI Debug' con 3 sessioni ricorrenti. Prima di proporlo come nuova skill, verifica se una skill esistente lo copre gia'.",
      "expected_output": "Cross-check esplicito contro skill inventory (mcp-technical-analyst, mcp-code-reviewer, mcp-runtime-integrator, etc.); se parzialmente coperto, preferire enhancement; se gap reale, proporre nuova skill.",
      "expectations": [
        "Legge skill inventory: controlla SKILL.md di tutte le skill esistenti",
        "Per 'Grid UI Debug', controlla se 'mcp-technical-analyst' lo copre (multi-sorgente analysis sì, ma grid-focused no)",
        "Controlla 'mcp-code-reviewer' (review patch, non debugging iterativo)",
        "Controlla 'mcp-docs-navigator' (documentation, non execution/debugging)",
        "Conclude: 'Grid UI Debug ha gap reale: no skill copre questo combo specifico di iterative React component debugging'",
        "Se sovrapposizione parziale trovata (es. 75% coperto), raccomanda ENHANCE della skill vicina, non NUOVA skill"
      ]
    },
    {
      "id": 6,
      "prompt": "Voglio scansionare le sessioni per identificare skill nuove o enhancement, ma il budget di tempo è limitato (max 2 ore). Come applichi sampling intelligente?",
      "expected_output": "Applicazione pragmatica di sampling heuristics: indice-first, 2-4 per cluster, primo+ultimo, skip fonti bassa priorità, parallelizzazione se serve.",
      "expectations": [
        "Priorizza fonti per volume/segnale: Codex CLI (sempre), Claude Code (progetti principali), Cursor/Antigravity skip per tempo",
        "Legge indici/titoli per intero (economico) prima di aprire trascrizioni",
        "Seleziona 3-4 cluster promettenti dall'indice (skip tema sparsi)",
        "Per ogni cluster: campiona 2-4 sessioni (rappresentative, dense, diverse date), leggi primo+ultimi messaggi",
        "Documente skip espliciti: 'Cursor non toccato per tempo, Antigravity skip per volume basso'",
        "Deliverable finale: matrice con confidenza esplicita per ogni candidato (alta/media/bassa basato su evidenza n. fonti, n. sessioni campionate)"
      ]
    }
  ]
}
