Skip to content
This repository was archived by the owner on Aug 25, 2026. It is now read-only.

Latest commit

 

History

593 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

CK's Pi Code Agent Harness — 研究封存

English summary: This repository is preserved as a research archive of Pi agent-harness experiments. Selected guards intercepted selected failure shapes, but the intended reliability goals were not achieved. It is not recommended as a general-purpose coding harness.

專案狀態(2026-08-25):產品實驗已封存。

本專案不再建議一般使用,也不再以「完整 AI 開發環境」或「可靠 autonomous agent harness」為目標。實驗顯示,少數 guard 能攔截特定失敗形狀,但核心可靠性目標沒有達成:L1 專案對齊失敗、L2 先規劃再工作失敗、L3 長週期對齊尚未實作且未證明。

誠實結論

這個 repository 應該被閱讀成一份 Pi harness 的失敗研究、負結果紀錄,以及部分可抽取的實驗工具;它不是完成品,也不是建議直接部署的 agent 平台。

目前測得的實作與配置,沒有可靠解決最初要處理的問題:

目標 現有證據 判定
L1:讓 agent 留在正確專案 53 個真實 session、2,832 次呼叫、218 次碰到 harness 路徑;整體約 7%,單一 session 最高 18% 失敗
L2:重大工作開始前先規劃 plan-first 12.2%、no-plan 82.9%;相關 plan gate 在觀察期間 live 觸發 0 次 失敗
L3:長週期內維持目標對齊 沒有足夠長週期量測;Handoff Capsule 尚未實作 未證明/未完成
PiTaskLab fixture 完成度 已知 fixture 修正後反覆得到 11/11 僅限單一 fixture
個別 guard 有些 guard 曾在真實 session 觸發 只有機制證據

以上是特定 model–harness–host 配置的結果,不代表所有 guardrail、Pi extension 或 planning gate 都必然無效;但足以證明本 repository 不應宣稱能可靠自主完成任務。

詳細資料請先讀:

這個 repository 還有什麼價值?

目前保留下來的價值主要是研究與小範圍重用:

  • 真實 agent failure modes,包括 false-green state 與 guard bypass;
  • session mining 與 evidence audit 方法;
  • 說明「import handler」為什麼弱於真正呼叫 handler 的測試案例;
  • 可拆出、但必須重新獨立驗證的 Pi adapter pattern;
  • 已回寫到可攜式 C.A.S.E. framework 的協定教訓:lessons-from-adapter-experiments.md

對讀者而言,正確的問題不是「我要不要安裝它?」,而是:

這份實驗暴露了哪一種失敗?我能不能針對自己的 workload,做一個更小、可驗證的替代方案?

它不是什麼

  • 不是完整 agent runtime;
  • 不是 security sandbox 或 permission boundary;
  • 不是只靠 prompt injection 與 event guard 就能讓 Pi 可靠的證明;
  • 不是跨模型、跨宿主的相容層;
  • 不是一組可直接當 production 使用的 bridge;
  • 不是 task-specific evaluation 的替代品。

歷史實驗如何閱讀與重現

原始安裝與量測材料仍保留,供研究重現使用。建議先讀 docs/measurements/docs/retro/ 的日期文件,再查看相應 configuration 與 session evidence。

歷史 setup 資訊仍可從 PROGRESS.md 與 Git history 找到,但必須注意:這些不是 read-only 操作。Pi run 可能寫入工作目錄、啟動 detached background work,或使用外部 model/browser service。重現時請使用隔離的 scratch project,並先讀懂對應實驗。

研究程式碼本身的靜態檢查可以用來了解實作:

python -m unittest discover -s tests
python scripts/verify-bridges.py
python scripts/mine-session.py --latest

這些檢查不能證明 agent 行為變好;live model measurement 是另一種實驗,本次封存整理沒有執行。

維護政策

本專案已凍結廣泛產品擴張。不要再為了讓 harness 看起來更完整而增加 bridge、skill、prompt rule 或 capability count。

仍然適合接受的變更包括:

  • 修正事實或歷史紀錄;
  • 改善已記錄實驗的可重現性;
  • 加入可以證偽既有說法的新證據;
  • 抽取一個有明確 outcome metric 的小元件;
  • 將可攜式教訓整理給 C.A.S.E. 或其他 adapter。

任何新研究都必須先寫明 model、host、harness commit、fixture、control、sample size、outcome metric 與 stopping rule。Guard 有觸發,不等於實驗成功。

Repository 導覽

位置 用途
docs/measurements/ 日期化量測與 session evidence
docs/retro/docs/case/ 失敗分析與 postmortem
docs/experiments/negative-results.md 目前真相與負結果摘要
pi-extensions/ 歷史 Pi adapter 實作
pi-skills/external/ 歷史 skills 與 prior-art 整合
tests/ 靜態與機制層測試,不是 behavioral proof
PROGRESS.md 歷史 ledger 與證據邊界

License

MIT。歷史實作與實驗保留供研究;重新使用前請自行審查並驗證。

About

Pi coding-agent 研究紀錄

Topics

Resources

Contributing

Stars

1 star

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages