Scoring, severity і confidence

Scores узагальнюють observed capability. Severity caps не дають приховати critical defects, а confidence окремо показує coverage.

Останній review
26 серпня 2026 р.
Час читання
10 хв
Навігація документацією

Channel scores

Aiscovery окремо оцінює search, browser та API/MCP channels. Кожен channel поєднує observed task outcomes із technical conditions, repeatability та efficiency.

channel_raw = 0.60T + 0.20C + 0.10R + 0.10E

T є severity-weighted task completion. C є severity-weighted technical conformance. R вимірює repeatable success у planned repetitions. E узагальнює comparable step count, completion time, unexpected interventions і cost, якщо cost доступний.

Standard scenarios запускаються тричі, critical scenarios п'ять разів, якщо audit manifest не фіксує обґрунтовану альтернативу. Stable failure не отримує repeatability points.

Usability

Usability описує якість channels, які реально доступні користувачам.

ChannelBase weight
Browser0.50
Search0.30
API/MCP0.20

Unavailable або approved out-of-scope channel виключається, а решта weights перенормовується. Тому сайт без API/MCP surface може отримати справедливий usability result для browser та search.

browser = 82
search = 76
usability_raw = (82 * 0.50 + 76 * 0.30) / 0.80 = 79.75

Це не стверджує, що відсутній channel існує. Agent-native maturity відповідає на це питання окремо.

Agent-native maturity

Maturity вимірює ширину agent-native capability, включно з governance та observability.

maturity_raw = 0.40B + 0.25S + 0.20A + 0.15G

B є browser readiness, S є search і citation readiness, A є API/MCP readiness, а G є governance та observability. Missing API/MCP channel тут отримує zero, а не зникає через renormalization.

ScoreLevel
0-19inaccessible
20-39fragile
40-59functional
60-79optimized
80-100agent_native

Для прикладу usability вище відсутній API/MCP channel і governance score 58 дають maturity 60.50. Той самий сайт може бути usable сьогодні, але неповним як agent-native platform.

Severity caps

Aggregate scores не повинні приховувати critical defect. Caps застосовуються після raw usability та maturity calculations:

unresolved applicable P0: final score is at most 39
otherwise unresolved applicable P1: final score is at most 59
otherwise: final score equals raw score

Cap застосовується лише тоді, коли finding має valid evidence, відтворюється in scope, впливає на in-scope user або channel і не має verified mitigation. Reports показують raw score, final score та cap reason разом.

Confidence

Confidence не є ще одним readiness component. Він показує, яку частку planned audit weight виконано з достатнім evidence.

confidence = 100 * sum(weight * execution_factor * evidence_factor)
             / sum(planned_weight)

Approved not_applicable work вилучається з denominator. not_run та inconclusive знижують confidence. Задокументований site block може мати повний execution credit, якщо evidence доводить причину.

ConfidenceLabel
90-100High
70-89Medium
0-69Low

Readiness score із confidence нижче 70 не може підтримувати sign-off. High confidence також потребує достатнього session evidence для P0 та P1 runs або explicit capture limitation, якщо hosted agent не відкриває DOM чи protocol data.

Мова

English

Наступний guide

Результати аудиту