Replay пояснює результат, але не доводить його
Session replay має відтворювати спостережуваний шлях від immutable goal до terminal state. Він записує actions, navigation, tool calls, waits, policy events і видимі повідомлення агента. Він не розкриває hidden chain-of-thought, а власне повідомлення агента про завершення не є success criterion.
Тому кожен run завершується deterministic assertions проти стану сайту або sandbox. Replay допомагає reviewer знайти friction і root cause; assertion report вирішує, чи існує expected outcome.
Оголосіть capture level до початку run
Observability залежить від executor. Використовуйте невелику capability ladder і фіксуйте рівень, який реально доступний, а не той, який продукт хотів би мати.
- L0_METADATA: start, finish, profile, scenario, status і assertions.
- L1_EVENTS: normalized actions, navigation, tool calls, policy events і monotonic timestamps.
- L2_VISUAL: L1 плюс screenshots, screencast або video, коли це дозволяє platform policy.
- L3_BROWSER: L2 плюс DOM і accessibility snapshots, console та network evidence.
- L4_PERFORMANCE: L3 плюс browser performance data, CLS attribution і CPU trace.
Вимірюйте час до verified outcome
Головна user-facing duration триває від передачі goal до незалежної terminal verification. Окрема run duration включає queueing, evidence flush і cleanup. Monotonic clocks вимірюють elapsed time, а wall-clock timestamps лише корелюють системи.
Показуйте окремо startup, navigation, network, DOM settling, tool waits, policy approval, retries і unexpected human intervention. Порівнюйте агентів лише для однакових scenario, fixture, release, locale, viewport, network profile і capture overhead. Публікуйте latency поруч із success rate, щоб швидкий провал не виглядав ефективним.
Пов'язуйте layout shifts з action window
Standard CLS описує неочікуваний visual movement протягом document lifecycle. Для агента критично, чи перемістився control між perception та action. Для кожного relevant shift зберігайте nearest step, affected element, before та after rectangles, screenshots і suspected trigger.
Тримайте standards-based CLS окремо від custom action-window shift sums, target displacement і misclick counts. Shift після recent input може не входити у CLS, але все одно зламати наступну дію агента. Unsupported browser measurements слід позначати unsupported, а не записувати як нуль.
Проєктуйте replay одразу report-safe
Використовуйте synthetic fixtures і masked regions до початку capture. Видаляйте credentials, tokens, cookies, payment data, financial або medical records і direct identifiers зі screenshots, events, DOM snapshots, URLs та network payloads. Client report має посилатися лише на sanitized artifacts з перевіреними hashes.
Визначте raw і sanitized retention periods, authorized viewers та deletion rules до тестування. Evidence зі станом pending або rejected не потрапляє у reports. Масовий production recording неконтрольованих personal data не є прийнятною заміною sandbox.
Пакуйте один reviewable evidence contract
Browser-neutral manifest має індексувати normalized event stream, step traces, screenshots, video, DOM та accessibility snapshots, console і network logs, performance trace, layout-shift log та final assertion report. Кожен artifact потребує stable ID, timestamp, source, hash, redaction state і retention rule.
Controlled Playwright traces корисні, бо один viewer синхронізує actions, screenshots, DOM snapshots, console, network і timing. Також зберігайте normalized event stream, щоб історичні результати можна було перевірити без прив'язки до одного tool. Запускайте стандартні scenarios тричі, а критичні п'ять разів, щоб відділити reproducible defect від випадкової події.
Session evidence checks для agent-readiness audit
- Перевіряти stable IDs, monotonic event timing і final assertion report для кожного scored run.
- Фіксувати фактичний capture level і явні limitations для недоступних DOM, CDP або browser signals.
- Розділяти task time, infrastructure time, retries, planned approval та unexpected human intervention.
- Пов'язувати CLS, action-window shifts і target displacement з точними steps і before або after evidence.
- Валідувати redaction в images, events, URLs, DOM, console, network і tool payloads.
- Перевіряти artifact hashes, viewer authorization, retention і replay integrity до передачі report.
Первинні джерела
- Trace ViewerPlaywright
- Record, replay, and measure user flowsChrome for Developers
- Analyze runtime performanceChrome for Developers
- Cumulative Layout Shiftweb.dev
- Logging Cheat SheetOWASP Cheat Sheet Series
