P-05

clinical-eval-harness(臨床 LLM/模型評測框架)

所有 workflow 上線前後的統一評測:golden dataset 回歸、幻覺偵測、prompt injection 紅隊、模型/提示詞版本升級 CI 守門。對應 TFDA「獨立性能評估」的院內配套,也是 Codex「模型驗證 SOP」的自動化。

DRAFT evidence snapshot

摘要與 purpose

所有 workflow 上線前後的統一評測:golden dataset 回歸、幻覺偵測、prompt injection 紅隊、模型/提示詞版本升級 CI 守門。對應 TFDA「獨立性能評估」的院內配套,也是 Codex「模型驗證 SOP」的自動化。

目前狀態

查看 maturity 與 evidence 定義

Evidence

Repo implementation/automated-test evidence

已找到 mock runner、20 案合成 golden set、red-team set、gates 與 demo report。

Synthetic evidence

Repo inventory 找到合成 fixtures、mock、golden set、對抗測試或工程 drill,因此最高保守標示為 Synthetic validation/Synthetic verification;本 WP 未重新執行該專案 test suite,也不公開未複驗的 pass count 或 coverage。

Clinical/operational evidence

未找到真實模型或醫師 validation evidence。

External/IRB/regulatory evidence

未找到外部、IRB 或 regulatory review evidence。

Known limitations/evidence gaps

目前只有 SOAP golden set;audit 僅產 JSON;部分統計為簡化實作。

本頁不得被解讀為 clinical deployment、external validation、IRB approval、regulatory review、government endorsement、正式服務或可投入臨床使用。

Governance/human-review boundary

Source provenance

Project READMEprojects/P-05-clinical-eval-harness/README.md
Project source commita2185b0
Evidence inventorydocs/website-evidence-inventory.md snapshot 5fdebfe
Website generation base64f0ba78b11942156f40c18cef3b24489b708f68
Last reviewed2026-07-17
Content statusDRAFT