Матеріали

Evidence і performance

Session replay потребує verified outcome.

Корисний replay пов'язує спостережувані дії агента з timing, browser state і незалежним final assertion без витоку sensitive data чи hidden reasoning.

Aiscovery Research10 хв читанняОстання перевірка: 25 серпня 2026 р.
Єдиний зелений шлях агента проходить через шість прозорих evidence-кадрів над синхронною синьою часовою шкалою

Що це допоможе оцінити

  • Який capture level потрібен для hosted agent, controlled browser або performance investigation
  • Як вимірювати час до verified outcome, не приховуючи retries та human intervention
  • Як пов'язувати CLS і рух targets з точними діями агента та захищати sensitive data

Replay пояснює результат, але не доводить його

Session replay має відтворювати спостережуваний шлях від immutable goal до terminal state. Він записує actions, navigation, tool calls, waits, policy events і видимі повідомлення агента. Він не розкриває hidden chain-of-thought, а власне повідомлення агента про завершення не є success criterion.

Тому кожен run завершується deterministic assertions проти стану сайту або sandbox. Replay допомагає reviewer знайти friction і root cause; assertion report вирішує, чи існує expected outcome.

Оголосіть capture level до початку run

Observability залежить від executor. Використовуйте невелику capability ladder і фіксуйте рівень, який реально доступний, а не той, який продукт хотів би мати.

  • L0_METADATA: start, finish, profile, scenario, status і assertions.
  • L1_EVENTS: normalized actions, navigation, tool calls, policy events і monotonic timestamps.
  • L2_VISUAL: L1 плюс screenshots, screencast або video, коли це дозволяє platform policy.
  • L3_BROWSER: L2 плюс DOM і accessibility snapshots, console та network evidence.
  • L4_PERFORMANCE: L3 плюс browser performance data, CLS attribution і CPU trace.

Вимірюйте час до verified outcome

Головна user-facing duration триває від передачі goal до незалежної terminal verification. Окрема run duration включає queueing, evidence flush і cleanup. Monotonic clocks вимірюють elapsed time, а wall-clock timestamps лише корелюють системи.

Показуйте окремо startup, navigation, network, DOM settling, tool waits, policy approval, retries і unexpected human intervention. Порівнюйте агентів лише для однакових scenario, fixture, release, locale, viewport, network profile і capture overhead. Публікуйте latency поруч із success rate, щоб швидкий провал не виглядав ефективним.

Пов'язуйте layout shifts з action window

Standard CLS описує неочікуваний visual movement протягом document lifecycle. Для агента критично, чи перемістився control між perception та action. Для кожного relevant shift зберігайте nearest step, affected element, before та after rectangles, screenshots і suspected trigger.

Тримайте standards-based CLS окремо від custom action-window shift sums, target displacement і misclick counts. Shift після recent input може не входити у CLS, але все одно зламати наступну дію агента. Unsupported browser measurements слід позначати unsupported, а не записувати як нуль.

Проєктуйте replay одразу report-safe

Використовуйте synthetic fixtures і masked regions до початку capture. Видаляйте credentials, tokens, cookies, payment data, financial або medical records і direct identifiers зі screenshots, events, DOM snapshots, URLs та network payloads. Client report має посилатися лише на sanitized artifacts з перевіреними hashes.

Визначте raw і sanitized retention periods, authorized viewers та deletion rules до тестування. Evidence зі станом pending або rejected не потрапляє у reports. Масовий production recording неконтрольованих personal data не є прийнятною заміною sandbox.

Пакуйте один reviewable evidence contract

Browser-neutral manifest має індексувати normalized event stream, step traces, screenshots, video, DOM та accessibility snapshots, console і network logs, performance trace, layout-shift log та final assertion report. Кожен artifact потребує stable ID, timestamp, source, hash, redaction state і retention rule.

Controlled Playwright traces корисні, бо один viewer синхронізує actions, screenshots, DOM snapshots, console, network і timing. Також зберігайте normalized event stream, щоб історичні результати можна було перевірити без прив'язки до одного tool. Запускайте стандартні scenarios тричі, а критичні п'ять разів, щоб відділити reproducible defect від випадкової події.

Session evidence checks для agent-readiness audit

  • Перевіряти stable IDs, monotonic event timing і final assertion report для кожного scored run.
  • Фіксувати фактичний capture level і явні limitations для недоступних DOM, CDP або browser signals.
  • Розділяти task time, infrastructure time, retries, planned approval та unexpected human intervention.
  • Пов'язувати CLS, action-window shifts і target displacement з точними steps і before або after evidence.
  • Валідувати redaction в images, events, URLs, DOM, console, network і tool payloads.
  • Перевіряти artifact hashes, viewer authorization, retention і replay integrity до передачі report.

Первинні джерела

Перевірте сигнал у реальному journey.

Наявність технології важлива лише тоді, коли покращує verified outcome. Пов'яжіть сигнал із task, evidence і final-state assertion.