【S3 Wave 3 交叉评测】Yorimi 对 printf 的反馈 #14
Loading…
Add table
Add a link
Reference in a new issue
No description provided.
Delete branch "%!s()"
Deleting a branch is permanent. Although the deleted branch may continue to exist for a short time before it actually gets removed, it CANNOT be undone in most cases. Continue?
项目理解
该项目同时介绍两个同级产品:
公开仓库重点提供双语产品文档、工作流、技能说明和机器可读 Manifest;实际线上产品和核心实现未在该仓库完整公开。
值得肯定的地方
安全边界定义清晰。
docs/ARCHITECTURE.zh-CN.md 和 docs/WORKFLOWS.zh-CN.md 将模型决策与确定性工具、Policy Engine、隔离预览和发布控制分开。文档明确禁止 SSH、root、特权容器、任意端口和隧道等高风险能力,也没有把模型描述成可以直接发布生产环境。
技能不是只有名称,已提供机器可读契约。
skills/manifests/ 为 project-intake、site-builder、policy-check 和 release-controller 提供 JSON Manifest;skills/README.md 说明了各技能责任。相比单纯在 README 罗列能力,这更便于后续接入自动评审。
工作流和验收材料组织较好。
docs/SPECS.zh-CN.md 给出 AC-01 至 AC-10,docs/EVALUATION_CRITERIA.zh-CN.md 将能力映射到测试名称,examples/end-to-end-demo.md 同时包含正常生成、高风险拒绝和模型降级场景,评审路径较容易理解。
对当前限制说明较诚实。
架构文档明确指出当前会话、JSON 存储、动态后端、回滚、计费、自动扩缩、监控与 SLA 的限制,没有将原型能力包装成完整生产平台。
具体问题或不清楚处
公开仓库现状与部分可复现性声明无法相互验证。
docs/SPECS.zh-CN.md 的 NFR-4 提到依赖锁定、环境变量示例、Docker Compose 和自动化测试;但本次默认分支中未见对应源代码、锁文件、.env.example、Compose 文件或测试文件。docs/EVALUATION_CRITERIA.zh-CN.md 虽列出多个测试名称,公开仓库中也没有可执行测试或测试报告。
不公开完整商业源代码是可以理解的,但目前第三方难以验证这些验收声明对应的是哪个版本、哪次执行结果。
两个关键技能的公开输入契约过于宽泛。
skills/manifests/policy-check.json 和 skills/manifests/release-controller.json 的 input_schema.properties 为空。评审者无法仅根据 Manifest 判断策略检查会接收哪些用户意图、文件或 Compose 信息,也无法确认发布技能如何接收项目版本、发布目标和人工确认凭据。
人工确认要求没有在契约中闭环。
release-controller 标记了 requires_confirmation: true,但公开 Schema 中没有 confirmation token、确认状态或待确认计划 ID 等字段。由此不易验收“未经确认绝不发布”究竟是运行时强约束还是产品流程说明。
当前材料仍以 Wave 2 为主要叙事。
README 标注 Wave 2,且 Printf 与 Lprintf 被描述为同级产品。对于 Wave 3 的 Agents、Skills 和 Demo 评审,主评对象、实际执行链以及技能运行证据还不够集中。另外,README 中 moon_.lprintf.com 与其他位置的 moon.lprintf.com 写法不一致,建议核实。
可验收的下一步建议
在不公开商业源码的前提下,增加一个可公开复验包:包含固定输入、脱敏输出、测试命令或签名后的 CI 测试报告,并标明对应 commit、产品版本和执行时间;否则应调整 NFR-4 的措辞。验收标准是第三方能够把至少一项 AC 与明确版本、输入和测试结果对应起来。
完善 policy-check 与 release-controller 的输入 Schema,明确待检查文件、用户意图、Compose/部署计划、项目版本、确认 ID 和确认状态;为未确认发布提供一个确定性的拒绝样例。
增加 Wave 3 机器可读运行记录,至少展示 objective、intent、selected skills、每项技能结果、policy decision、confirmation status、fallback 状态及最终产物引用。验收标准是正常、策略拒绝和模型降级三条 Demo 路径均能导出同一 Schema 的运行记录。
为 README 和 Demo 链接增加自动链接检查,修正 moon_ 与 moon 的地址不一致,并在首页明确本轮主要验收对象及最短体验路径。
综合评价
项目的产品表达、安全意识和文档质量较强,尤其是“模型负责理解、确定性工具负责执行、策略层负责拒绝”的边界很适合作为 Agent 产品基础。当前主要短板不是必须公开全部源码,而是公开材料中的契约与可验证证据尚不足以支撑部分可复现性声明。补充脱敏验证包和完整技能 Schema 后,交叉评审可信度会显著提高。
查阅信息与限制
您好!群里通知是5号开始正式测评,故内容更新较晚。烦请私信 lprintf@qq.com 获得 token ,并根据文档下载客户端进行测试体验。除此 moon.lprintf.com 指向的 github 可下载 客户端外,我们还提供 hub 服务与可直接体验的 printf 静态网站生成工具(https://gp-pilot.lprintf.com),登录页面已内置多个测试账号。评论后将尝试飞书私信您。
您好! 感谢您的耐心评审与宝贵建议,我们已经根据建议与实际情况提交了 #21 在内的5个PR,共计15个commit。再次感谢!