【S3W3 交叉评测】潜审 AuditAgent:可复现审计链路与 README 修正建议 #1

Open
opened 2026-08-06 08:53:21 +08:00 by harrychen901 · 1 comment

1. 项目理解

潜审从财务账套导入开始,覆盖校验、调整审核、大额科目、盘点和附注等环节;确定性算术交给 Tool,语义建议交给 Agent,最终结论由人工签认。

2. 做得好的地方

  • “LLM 不做算术、职业判断不让渡”的分工非常适合审计场景。
  • 公开 Demo 能看到统一审核中心、调整审核、大额科目确认和双交付物的完整产品叙事。
  • README 提到 57 项 pytest 测试,为工程验证提供了基础。

3. 当前不足

README 快速开始部分存在代码围栏未正确闭合的排版问题,导致后续测试说明渲染混乱。对于审计产品,仅有流程展示还不够,需要一套脱敏账套证明导入、勾稽、调整后 TB 重算、引用与签认能够稳定复现。还应明确模型只生成建议时,系统如何防止建议进入确定性金额字段。

4. 优先建议

先修复 README Markdown 围栏;发布一份小型脱敏账套 fixture、期望勾稽结果、调整分录和最终导出摘要,并附 execution trace。增加借贷不平、重复科目、异常编码、OCR 错误、模型不可用及人工驳回路径测试;在界面中明确标识 Tool 计算值、Agent 建议和人工结论。

5. 综合评价

产品对审计责任边界的理解成熟,公开页面也能清楚传达工作流。补足可复现样例后,评委才能从“合理设计”进一步验证到“可靠执行”。

评测依据:仓库 README、测试说明与公开 Demo;评测日期:2026-08-06。

## 1. 项目理解 潜审从财务账套导入开始,覆盖校验、调整审核、大额科目、盘点和附注等环节;确定性算术交给 Tool,语义建议交给 Agent,最终结论由人工签认。 ## 2. 做得好的地方 - “LLM 不做算术、职业判断不让渡”的分工非常适合审计场景。 - 公开 Demo 能看到统一审核中心、调整审核、大额科目确认和双交付物的完整产品叙事。 - README 提到 57 项 pytest 测试,为工程验证提供了基础。 ## 3. 当前不足 README 快速开始部分存在代码围栏未正确闭合的排版问题,导致后续测试说明渲染混乱。对于审计产品,仅有流程展示还不够,需要一套脱敏账套证明导入、勾稽、调整后 TB 重算、引用与签认能够稳定复现。还应明确模型只生成建议时,系统如何防止建议进入确定性金额字段。 ## 4. 优先建议 先修复 README Markdown 围栏;发布一份小型脱敏账套 fixture、期望勾稽结果、调整分录和最终导出摘要,并附 execution trace。增加借贷不平、重复科目、异常编码、OCR 错误、模型不可用及人工驳回路径测试;在界面中明确标识 Tool 计算值、Agent 建议和人工结论。 ## 5. 综合评价 产品对审计责任边界的理解成熟,公开页面也能清楚传达工作流。补足可复现样例后,评委才能从“合理设计”进一步验证到“可靠执行”。 > 评测依据:仓库 README、测试说明与公开 Demo;评测日期:2026-08-06。

感谢评审。关于可复现性与责任边界,补充如下,便于对照验证:

关于样例与工程验证
仓库已提供用友/金蝶风格账套夹具(tests/fixtures/)、导入/勾稽/调整后 TB/审核签认等自动化测试,以及端到端冒烟脚本。公开 Demo 侧重完整作业叙事;完整可操作路径建议直接试用 Windows 版:
https://www.divesee.com/divemind/

关于 Agent 建议与确定性金额
系统按既定分工执行:算术与勾稽由 Tool 完成,Agent 产出进入审核队列且仅为建议层,正式结论与金额签认由人工完成;界面亦区分规则/Agent 建议与人工决策。该边界在产品设计与实现中一致贯彻。

关于 README
开发文档以仓库内测试与夹具路径为准;产品能力以试用版与公开 Demo 为准。如需评测侧“样例账套 + 期望结果 + 轨迹”的打包清单,我们可按评测口径另行提供。

欢迎基于试用版具体操作路径继续反馈。

感谢评审。关于可复现性与责任边界,补充如下,便于对照验证: **关于样例与工程验证** 仓库已提供用友/金蝶风格账套夹具(tests/fixtures/)、导入/勾稽/调整后 TB/审核签认等自动化测试,以及端到端冒烟脚本。公开 Demo 侧重完整作业叙事;完整可操作路径建议直接试用 Windows 版: https://www.divesee.com/divemind/ **关于 Agent 建议与确定性金额** 系统按既定分工执行:算术与勾稽由 Tool 完成,Agent 产出进入审核队列且仅为建议层,正式结论与金额签认由人工完成;界面亦区分规则/Agent 建议与人工决策。该边界在产品设计与实现中一致贯彻。 **关于 README** 开发文档以仓库内测试与夹具路径为准;产品能力以试用版与公开 Demo 为准。如需评测侧“样例账套 + 期望结果 + 轨迹”的打包清单,我们可按评测口径另行提供。 欢迎基于试用版具体操作路径继续反馈。
Sign in to join this conversation.
No labels
No milestone
No project
No assignees
2 participants
Notifications
Due date
The due date is invalid or out of range. Please use the format "yyyy-mm-dd".

No due date set.

Dependencies

No dependencies set.

Reference
LIGHTNINGWHALE/DiveMind#1
No description provided.