Методологія

Прозора методологія тестування AI-агентів.

Версовані scenarios, deterministic assertions і reviewable evidence роблять кожен результат підзвітним.

Вимірюйте customer journey, а не наявність tag.

Readiness signal поєднує discoverability, успішне task completion, repeatability і efficiency.

Find

Факти доступні, актуальні, узгоджені та придатні для використання агентом.

Understand

Controls, policies, prices і states мають однозначне значення.

Act

Дозволений workflow досягає незалежно перевіреного final state.

Recover

Validation, auth, session та inventory failures дають робочий next action.

Coverage розділяється за channel і access mode.

Відсутній agent-native surface не може обнулити успішний browser result, і навпаки.

AI search

Crawl access, citation surfaces, content consistency і machine-readable context.

Browser і UI

Rendered interaction, semantic controls, keyboard path, sessions і responsive behavior.

API і MCP

Schemas, authorization, errors, idempotency, permissions і confirmation boundaries.

Public

Unauthenticated surfaces без незворотних дій.

Authenticated

Approved test accounts, fixtures і redacted evidence.

Sandbox

Повні journeys із controlled data та reversible operations.

Scenario є версованим test contract.

Prompt wording не визначає success. Contract фіксує goal, permissions, stop gate і assertions.

  1. Persona і business goal
  2. Prerequisites і test data
  3. Allowed actions і production stop gate
  4. Independent final-state assertions
  5. Required evidence і criticality

Записуйте шлях і вартість завершення.

Session evidence пояснює, чи був nominal success швидким, стабільним, повторюваним і автономним.

  • Video або event-aligned session replay
  • Step trace, screenshots, DOM і accessibility tree
  • Total duration, step latency і waiting time
  • Retries, recovery attempts і human interventions
  • Page CLS і movement потрібного target

CLS записується з interaction context.

Page-level Cumulative Layout Shift корисний, але target stability також перевіряється біля кожного planned click або input.

Repeatability protocol

Standard tasks запускаються тричі. Critical tasks запускаються п'ять разів. Agent, model, tools, viewport, locale, auth state і policy restrictions зберігаються з кожним run.

Відділяйте website defects від executor noise.

Результати розрізняють website, agent-specific, policy та infrastructure failure до scoring.

passpartialfailblocked

Readiness і confidence є різними числами.

Readiness відображає observed capability. Confidence відображає coverage, repetitions, evidence quality і unresolved uncertainty.

P0 блокує critical task або створює material safety risk.

P1 створює значний repeatable friction або unreliable completion.

Evidence корисний лише тоді, коли його безпечно переглядати.

Artifacts зберігаються зі stable IDs, timestamps, environment і retention rules.

  • Screenshots, recording, accessibility tree, DOM, console, network і API traces
  • Redaction для PII, credentials, tokens, payment, financial і medical data
  • Purpose-limited retention і controlled access

Emerging technologies є inventory signals, а не автоматичними оцінками.

WebMCP, MCP, OpenAPI, llms.txt, llms-full.txt та інші agent surfaces отримують lifecycle labels. Їхня відсутність не є автоматичним failure.

Поточні обмеження

Agent products, policies і models змінюються. Результати є версованими observations із визначеного environment, а не постійною compatibility guarantee.

Використовуйте метод, який команда може перевірити.

Почніть зі scoped audit і зберігайте кожен висновок пов'язаним з evidence.