English summary: This repository is preserved as a research archive of Pi agent-harness experiments. Selected guards intercepted selected failure shapes, but the intended reliability goals were not achieved. It is not recommended as a general-purpose coding harness.
專案狀態(2026-08-25):產品實驗已封存。
本專案不再建議一般使用,也不再以「完整 AI 開發環境」或「可靠 autonomous agent harness」為目標。實驗顯示,少數 guard 能攔截特定失敗形狀,但核心可靠性目標沒有達成:L1 專案對齊失敗、L2 先規劃再工作失敗、L3 長週期對齊尚未實作且未證明。
這個 repository 應該被閱讀成一份 Pi harness 的失敗研究、負結果紀錄,以及部分可抽取的實驗工具;它不是完成品,也不是建議直接部署的 agent 平台。
目前測得的實作與配置,沒有可靠解決最初要處理的問題:
| 目標 | 現有證據 | 判定 |
|---|---|---|
| L1:讓 agent 留在正確專案 | 53 個真實 session、2,832 次呼叫、218 次碰到 harness 路徑;整體約 7%,單一 session 最高 18% | 失敗 |
| L2:重大工作開始前先規劃 | plan-first 12.2%、no-plan 82.9%;相關 plan gate 在觀察期間 live 觸發 0 次 | 失敗 |
| L3:長週期內維持目標對齊 | 沒有足夠長週期量測;Handoff Capsule 尚未實作 | 未證明/未完成 |
| PiTaskLab fixture 完成度 | 已知 fixture 修正後反覆得到 11/11 | 僅限單一 fixture |
| 個別 guard | 有些 guard 曾在真實 session 觸發 | 只有機制證據 |
以上是特定 model–harness–host 配置的結果,不代表所有 guardrail、Pi extension 或 planning gate 都必然無效;但足以證明本 repository 不應宣稱能可靠自主完成任務。
詳細資料請先讀:
目前保留下來的價值主要是研究與小範圍重用:
- 真實 agent failure modes,包括 false-green state 與 guard bypass;
- session mining 與 evidence audit 方法;
- 說明「import handler」為什麼弱於真正呼叫 handler 的測試案例;
- 可拆出、但必須重新獨立驗證的 Pi adapter pattern;
- 已回寫到可攜式 C.A.S.E. framework 的協定教訓:lessons-from-adapter-experiments.md。
對讀者而言,正確的問題不是「我要不要安裝它?」,而是:
這份實驗暴露了哪一種失敗?我能不能針對自己的 workload,做一個更小、可驗證的替代方案?
- 不是完整 agent runtime;
- 不是 security sandbox 或 permission boundary;
- 不是只靠 prompt injection 與 event guard 就能讓 Pi 可靠的證明;
- 不是跨模型、跨宿主的相容層;
- 不是一組可直接當 production 使用的 bridge;
- 不是 task-specific evaluation 的替代品。
原始安裝與量測材料仍保留,供研究重現使用。建議先讀 docs/measurements/ 與 docs/retro/ 的日期文件,再查看相應 configuration 與 session evidence。
歷史 setup 資訊仍可從 PROGRESS.md 與 Git history 找到,但必須注意:這些不是 read-only 操作。Pi run 可能寫入工作目錄、啟動 detached background work,或使用外部 model/browser service。重現時請使用隔離的 scratch project,並先讀懂對應實驗。
研究程式碼本身的靜態檢查可以用來了解實作:
python -m unittest discover -s tests
python scripts/verify-bridges.py
python scripts/mine-session.py --latest
這些檢查不能證明 agent 行為變好;live model measurement 是另一種實驗,本次封存整理沒有執行。
本專案已凍結廣泛產品擴張。不要再為了讓 harness 看起來更完整而增加 bridge、skill、prompt rule 或 capability count。
仍然適合接受的變更包括:
- 修正事實或歷史紀錄;
- 改善已記錄實驗的可重現性;
- 加入可以證偽既有說法的新證據;
- 抽取一個有明確 outcome metric 的小元件;
- 將可攜式教訓整理給 C.A.S.E. 或其他 adapter。
任何新研究都必須先寫明 model、host、harness commit、fixture、control、sample size、outcome metric 與 stopping rule。Guard 有觸發,不等於實驗成功。
| 位置 | 用途 |
|---|---|
docs/measurements/ |
日期化量測與 session evidence |
docs/retro/、docs/case/ |
失敗分析與 postmortem |
docs/experiments/negative-results.md |
目前真相與負結果摘要 |
pi-extensions/ |
歷史 Pi adapter 實作 |
pi-skills/、external/ |
歷史 skills 與 prior-art 整合 |
tests/ |
靜態與機制層測試,不是 behavioral proof |
PROGRESS.md |
歷史 ledger 與證據邊界 |
MIT。歷史實作與實驗保留供研究;重新使用前請自行審查並驗證。