Measure candidate outputs with pinned references and retain one comparison

POST/v1/quality/checks/benchmark/{evaluationId}/experiments/{experimentId}/compare

An atomic, idempotent analysis; no target execution. Corrected references conflict instead of silently changing the protocol. Changed per-case eligibility, unknown rates or too few paired examples produce an inconclusive result. Returns descriptive percentage-point differences, not statistical or release approval. Existing comparisons remain readable after subsequent reference corrections.

How to call this endpoint

Every ACP API request uses bearer authentication. The examples here show the actual request path, auth header, and body shape that the platform expects.

Path, query, and header parameters

These parameters control which ACP object the endpoint acts on and how the request is processed.

Path parameters
NameLocationTypeRequiredDescription
evaluationIdpathstringYes
experimentIdpathstringYes
Query parameters
None.

Body schema

Content type: application/json · Optional

None.

What the API returns

Each response code below includes the documented payload shape for the ACP API.

200Immutable comparison or its original retry receiptapplication/json
FieldTypeRequiredDescription
comparisonobjectYes
comparison.schemaVersioncomputer_agents_quality_comparison_v1Yes
comparison.experimentIdstringYes
comparison.evaluationIdstringYes
comparison.protocolFingerprintstringYes
comparison.candidateMeasurementIdstringYes
comparison.candidateMeasurementFingerprintstringYes
comparison.outcomeimproved | not_improved | inconclusiveYes
comparison.metricsobject[]Yes
comparison.metrics[].metricIdstringYes
comparison.metrics[].labelstringYes
comparison.metrics[].baselineobjectYes
comparison.metrics[].baseline.idstringYesUnique identifier.
comparison.metrics[].baseline.labelstringYes
comparison.metrics[].baseline.descriptionstringYesHuman-readable description.
comparison.metrics[].baseline.numeratorLabelstringYes
comparison.metrics[].baseline.denominatorLabelstringYes
comparison.metrics[].baseline.unitpercentYes
comparison.metrics[].baseline.aggregationmicroYes
comparison.metrics[].baseline.directionhigher_is_better | lower_is_better | informationalYes
comparison.metrics[].baseline.statemeasured | partial | unmeasured | invalidYes
comparison.metrics[].baseline.valuenumberYesA percentage
comparison.metrics[].baseline.numeratorintegerYes
comparison.metrics[].baseline.denominatorintegerYes
comparison.metrics[].baseline.populationCountintegerYes
comparison.metrics[].baseline.includedCountintegerYes
comparison.metrics[].baseline.excludedCountsobjectYes
comparison.metrics[].baseline.excludedCounts.unmeasuredintegerNo
comparison.metrics[].baseline.excludedCounts.missing_referenceintegerNo
comparison.metrics[].baseline.excludedCounts.source_changedintegerNo
comparison.metrics[].baseline.excludedCounts.not_applicableintegerNo
comparison.metrics[].baseline.excludedCounts.errorintegerNo
comparison.metrics[].baseline.excludedCounts.skippedintegerNo
comparison.metrics[].baseline.excludedCounts.missing_outputintegerNo
comparison.metrics[].baseline.excludedCounts.invalidintegerNo
comparison.metrics[].baseline.uncertaintyobjectYes
comparison.metrics[].baseline.uncertainty.kindnot_estimatedYes
comparison.metrics[].baseline.uncertainty.reasonstringYes
comparison.metrics[].candidateobjectYes
comparison.metrics[].candidate.idstringYesUnique identifier.
comparison.metrics[].candidate.labelstringYes
comparison.metrics[].candidate.descriptionstringYesHuman-readable description.
comparison.metrics[].candidate.numeratorLabelstringYes
comparison.metrics[].candidate.denominatorLabelstringYes
comparison.metrics[].candidate.unitpercentYes
comparison.metrics[].candidate.aggregationmicroYes
comparison.metrics[].candidate.directionhigher_is_better | lower_is_better | informationalYes
comparison.metrics[].candidate.statemeasured | partial | unmeasured | invalidYes
comparison.metrics[].candidate.valuenumberYesA percentage
comparison.metrics[].candidate.numeratorintegerYes
comparison.metrics[].candidate.denominatorintegerYes
comparison.metrics[].candidate.populationCountintegerYes
comparison.metrics[].candidate.includedCountintegerYes
comparison.metrics[].candidate.excludedCountsobjectYes
comparison.metrics[].candidate.excludedCounts.unmeasuredintegerNo
comparison.metrics[].candidate.excludedCounts.missing_referenceintegerNo
comparison.metrics[].candidate.excludedCounts.source_changedintegerNo
comparison.metrics[].candidate.excludedCounts.not_applicableintegerNo
comparison.metrics[].candidate.excludedCounts.errorintegerNo
comparison.metrics[].candidate.excludedCounts.skippedintegerNo
comparison.metrics[].candidate.excludedCounts.missing_outputintegerNo
comparison.metrics[].candidate.excludedCounts.invalidintegerNo
comparison.metrics[].candidate.uncertaintyobjectYes
comparison.metrics[].candidate.uncertainty.kindnot_estimatedYes
comparison.metrics[].candidate.uncertainty.reasonstringYes
comparison.metrics[].deltaPercentagePointsnumberYes
comparison.metrics[].eligibleExamplesintegerYes
comparison.metrics[].comparablebooleanYes
comparison.metrics[].reasonstringYes
comparison.reasonsstring[]Yes
comparison.adoptionobjectYes
comparison.adoption.allowedfalseYes
comparison.adoption.reasonsstring[]Yes
comparison.createdByUserIdstringYes
comparison.createdAtstringYesISO 8601 timestamp.
comparison.fingerprintstringYes
400Unknown request fields
None.
401Authentication required
None.
403Organization or entitlement unavailable; execution credentials cannot run this analysis
None.
404Experiment or current case-management permission unavailable
None.
409References or retained evidence differ from the pinned protocol
None.
503Durable storage unavailable
None.
Measure candidate outputs with pinned references and retain one comparison
Loading...
Response 200
Loading...
See the ACP quickstart and SDK flow