Scientific Memory evidence-layer benchmarks for PCS release import, portal read-model rendering, query correctness, release comparison, and failed-release interpretability.
Each case directory contains:
case.json— case metadata and fixture pointerrelease_manifest.v0.json— manifest alias (artifacts resolve viafixture_dir)expected_sections.json— required interpretability sectionsexpected_queries.json— CLI query expectationsexpected_lineage.json— lineage fields after importexpected_staleness.json— staleness expectationsexpected_compare.json— release comparison expectations (when applicable)expected_failure.json— failure-evidence checks (failed cases only)
labtrust_qc_release/tool_use_safety/computation_reproducibility/formal_trust_kernel/— LabTrust release with formal trust kernel emphasis
Under failed/:
rejected_certificate/— computation witness rejectedstale_release/— stale lineage after bundle driftfailed_lean_check/— formal kernel failed obligation (read-model evidence)failed_pf_verification/— PF explain on failed formal checkmissing_registry_metadata/— deferred registry checks in read modelresult_hash_mismatch/— computation witness result hash mismatch
just pcs-benchmark-rendering CASES=benchmarks/rendering/labtrust_qc_release OUT=benchmark_runs/labtrust_rendering
just pcs-benchmark-rendering-all OUT=benchmark_runs/pcs_rendering
python -m sm_pipeline.benchmark.pcs_rendering --cases benchmarks/rendering --out benchmark_runs/pcs_renderingReports are written to (validated against schemas/pcs/benchmark/*.schema.json):
benchmark_run.v0.json— aggregate run summary for pcs-benchrendering_coverage_report.v0.json— section coverage per success casequery_coverage_report.v0.json— query and compare coveragefailed_release_rendering_report.v0.json— failure-evidence rendering for failed casespcs_bench_ingest.v0.json— canonical pcs-bench ingest (embeddedBenchmarkRun.v0,CoverageReport.v0,FailureLocalizationResult.v0,ExplainQualityReport.v0, plusartifact_refs)explain_quality_reports/— per-caseExplainQualityReport.v0sidecars referenced from ingestcoverage_reports/— per-metricCoverageReport.v0sidecars referenced from ingestbenchmark_runs/— per-caseBenchmarkRun.v0sidecars (multi-case suites)failure_localization_reports/—FailureLocalizationResult.v0sidecars for failure-mode casespcs_bench_payload.json— legacy flattened alias
external_reviewer_minimal/ — five cases for external review and pcs-bench smoke ingest (see external_reviewer_minimal/README.md).
make pcs-bench-producer
just pcs-bench-producer-gate
just pcs-bench-producer-gate-externalrendering_benchmark_summary.md— human-readable summary
Validate a completed run (auto-detects adjacent pcs-core for schema + semantic checks when present):
just validate-pcs-benchmark-output-pcs-core benchmark_runs/pcs_rendering ../pcs-core
python scripts/validate_pcs_benchmark_output.py benchmark_runs/pcs_rendering
python scripts/package_pcs_bench_bundle.py benchmark_runs/pcs_rendering --validate-pcs-core-output ../pcs-corepcs-bench contract: docs/pcs/bench-ingest-contract.md. Suite registry: benchmarks/pcs_bench/suite_registry.v0.json. Operator guide: docs/pcs/benchmark-producer.md.
Regression floors: baseline_thresholds.json (enforced by default via --check-regression).
After fixture or import changes:
python scripts/bootstrap_pcs_rendering_benchmarks.pyRun this after just refresh-pcs-release when LabTrust source_commit or claim metadata changes.