【S3W3 交叉评测】学工管理 Agent:人在回路、权限验证与可核验交付建议 #2

Closed
opened 2026-08-06 16:00:42 +08:00 by visionary · 1 comment

1. 项目理解

我理解该项目希望把学院活动、报名、学分手册、公告和工单等分散管理工作整合到自然语言工作区。

Agent 首先在当前用户权限范围内查询事实、汇总待办并生成 Artifact;涉及提交审核、审批、公告或业务数据修改时,模型只能形成结构化操作提案,必须由用户确认,服务端再次校验权限和业务状态后才执行。

2. 项目亮点

  • 使用者、业务痛点和操作链路清晰,能够直接对应学院活动管理员频繁切换页面、筛选和核对的实际问题。
  • 三分钟评审路径设计得较好,包含只读查询、风险分析、Artifact、写操作提案和历史会话,评审容易理解核心闭环。
  • Action Guard 的思路合理:模型不直接写业务数据,确认时重新校验权限与状态,避免把一次模型输出直接当作执行命令。
  • 每次工具调用重新应用当前账号权限,能够减少 Agent 使用历史上下文越权访问其他活动或学生数据的风险。
  • Artifact 只使用 Markdown、条形图等可信本地组件,不执行模型生成的 HTML 或 JavaScript,这一点对防止输出侧脚本注入很有价值。
  • 项目对公开仓库边界说明比较诚实,明确仓库是参赛展示材料而非完整源码,没有用伪代码冒充开源实现。

3. 当前问题

  • 公开仓库只有说明、样例和评测材料,没有生产源码或可独立运行的最小版本,因此第三方目前只能验证文档和线上 Demo,无法独立核验权限控制、二次校验和审计日志的具体实现。
  • 当前状态中仍标注真实截图和录屏待补充。仅证明线上地址返回 HTTP 200,不能证明关键 Agent 链路和人在回路能够稳定执行。
  • 评测材料以功能对照为主,尚缺任务成功率、错误工具调用率、越权拦截率、操作提案修改率、平均延迟等量化证据。
  • 学工数据可能包含学生身份、联系方式、活动记录、学分和工单内容,需要进一步说明模型输入最小化、脱敏、保存期限、删除机制和日志访问范围。
  • “确认时再次校验”能够缓解状态变化问题,但还需说明目标对象版本、操作摘要、变更前后差异、幂等键和重复点击防护,避免确认后执行到已经变化的业务对象。
  • 自然语言汇总可能遗漏少数异常事项。若管理员把汇总结果当成完整清单,需要有覆盖范围、数据更新时间和无法访问对象的明确提示。

4. 建议

  • 补充一段完整录屏或连续截图,展示登录、只读查询、Artifact、操作提案、拒绝、确认后二次校验和审计记录。
  • 即使不能公开生产源码,也可以发布最小可运行的权限模拟器、接口契约、脱敏响应样例和安全测试结果,提高独立可核验性。
  • 建立角色—资源—动作权限矩阵,并加入负向测试:跨学院访问、非负责人审批、过期操作卡、重复确认和状态已变更。
  • 操作卡中展示对象唯一标识、当前状态、拟变更字段、变更前后差异、风险提示和有效期,让用户确认的是具体动作而非一句自然语言。
  • 为每次汇总显示数据时间、查询范围、成功或失败工具列表和未覆盖项;当部分数据源失败时不要输出看似完整的汇总。
  • 公布一组脱敏评测指标,例如只读任务成功率、权限越界拦截率、操作提案执行成功率、人工修改率和 P95 响应时间。

5. 综合评价

项目的产品定位和人在回路设计较成熟,尤其是“先查事实、再形成提案、最后人工确认”的路径,比让模型直接操作学生事务数据更可信。

当前主要短板是公开证据与独立复现能力不足。若能补充真实演示素材、权限负向测试、操作差异展示和量化指标,即使生产源码不公开,也能让评审更有把握地确认核心能力确实成立。

### 1. 项目理解 我理解该项目希望把学院活动、报名、学分手册、公告和工单等分散管理工作整合到自然语言工作区。 Agent 首先在当前用户权限范围内查询事实、汇总待办并生成 Artifact;涉及提交审核、审批、公告或业务数据修改时,模型只能形成结构化操作提案,必须由用户确认,服务端再次校验权限和业务状态后才执行。 ### 2. 项目亮点 - 使用者、业务痛点和操作链路清晰,能够直接对应学院活动管理员频繁切换页面、筛选和核对的实际问题。 - 三分钟评审路径设计得较好,包含只读查询、风险分析、Artifact、写操作提案和历史会话,评审容易理解核心闭环。 - Action Guard 的思路合理:模型不直接写业务数据,确认时重新校验权限与状态,避免把一次模型输出直接当作执行命令。 - 每次工具调用重新应用当前账号权限,能够减少 Agent 使用历史上下文越权访问其他活动或学生数据的风险。 - Artifact 只使用 Markdown、条形图等可信本地组件,不执行模型生成的 HTML 或 JavaScript,这一点对防止输出侧脚本注入很有价值。 - 项目对公开仓库边界说明比较诚实,明确仓库是参赛展示材料而非完整源码,没有用伪代码冒充开源实现。 ### 3. 当前问题 - 公开仓库只有说明、样例和评测材料,没有生产源码或可独立运行的最小版本,因此第三方目前只能验证文档和线上 Demo,无法独立核验权限控制、二次校验和审计日志的具体实现。 - 当前状态中仍标注真实截图和录屏待补充。仅证明线上地址返回 HTTP 200,不能证明关键 Agent 链路和人在回路能够稳定执行。 - 评测材料以功能对照为主,尚缺任务成功率、错误工具调用率、越权拦截率、操作提案修改率、平均延迟等量化证据。 - 学工数据可能包含学生身份、联系方式、活动记录、学分和工单内容,需要进一步说明模型输入最小化、脱敏、保存期限、删除机制和日志访问范围。 - “确认时再次校验”能够缓解状态变化问题,但还需说明目标对象版本、操作摘要、变更前后差异、幂等键和重复点击防护,避免确认后执行到已经变化的业务对象。 - 自然语言汇总可能遗漏少数异常事项。若管理员把汇总结果当成完整清单,需要有覆盖范围、数据更新时间和无法访问对象的明确提示。 ### 4. 建议 - 补充一段完整录屏或连续截图,展示登录、只读查询、Artifact、操作提案、拒绝、确认后二次校验和审计记录。 - 即使不能公开生产源码,也可以发布最小可运行的权限模拟器、接口契约、脱敏响应样例和安全测试结果,提高独立可核验性。 - 建立角色—资源—动作权限矩阵,并加入负向测试:跨学院访问、非负责人审批、过期操作卡、重复确认和状态已变更。 - 操作卡中展示对象唯一标识、当前状态、拟变更字段、变更前后差异、风险提示和有效期,让用户确认的是具体动作而非一句自然语言。 - 为每次汇总显示数据时间、查询范围、成功或失败工具列表和未覆盖项;当部分数据源失败时不要输出看似完整的汇总。 - 公布一组脱敏评测指标,例如只读任务成功率、权限越界拦截率、操作提案执行成功率、人工修改率和 P95 响应时间。 ### 5. 综合评价 项目的产品定位和人在回路设计较成熟,尤其是“先查事实、再形成提案、最后人工确认”的路径,比让模型直接操作学生事务数据更可信。 当前主要短板是公开证据与独立复现能力不足。若能补充真实演示素材、权限负向测试、操作差异展示和量化指标,即使生产源码不公开,也能让评审更有把握地确认核心能力确实成立。
Collaborator

感谢 @visionary 的详细评测和建设性建议!这次评审覆盖得非常全面,尤其是对“人在回路”、权限校验和可核验交付的关注,对我们进一步完善学工管理 Agent 很有帮助。

▎ 关于评测中提到的问题,我们计划逐项改进:

▎ 1. 补充演示材料:当前仓库确实缺少连续、完整的演示流程。后续会补充截图或录屏,覆盖“查询 → Artifact 生成 → 操作提案 → 拒绝/确认 → 审计记录”的完整链路。
▎ 2. 提供可核验的模拟环境:虽然生产代码暂时不便完全公开,但会整理最小权限模拟器、接口契约和脱敏响应样例,方便第三方独立验证核心权限逻辑。
▎ 3. 完善操作确认的幂等保护:在操作卡中增加对象版本号、变更前后差异以及提案有效期;确认执行时再次校验对象状态,避免对已变更对象重复提交操作。
▎ 4. 补充数据隐私说明:增加学工数据最小化采集、脱敏处理、保存期限和日志访问范围等说明,明确数据使用边界。
▎ 5. 建立量化评测指标:后续会基于脱敏数据整理并公开越权拦截率、操作提案执行成功率、P95 响应时间等指标。
▎ 6. 增强汇总结果的完整性提示:在自然语言汇总中附带数据时间戳、查询范围和工具调用状态,避免管理员将部分结果误认为完整清单。

▎ 再次感谢这次细致且可操作的反馈。我们会持续跟进这些改进项,并在仓库中同步实现进度。

感谢 @visionary 的详细评测和建设性建议!这次评审覆盖得非常全面,尤其是对“人在回路”、权限校验和可核验交付的关注,对我们进一步完善学工管理 Agent 很有帮助。 ▎ ▎ 关于评测中提到的问题,我们计划逐项改进: ▎ ▎ 1. 补充演示材料:当前仓库确实缺少连续、完整的演示流程。后续会补充截图或录屏,覆盖“查询 → Artifact 生成 → 操作提案 → 拒绝/确认 → 审计记录”的完整链路。 ▎ 2. 提供可核验的模拟环境:虽然生产代码暂时不便完全公开,但会整理最小权限模拟器、接口契约和脱敏响应样例,方便第三方独立验证核心权限逻辑。 ▎ 3. 完善操作确认的幂等保护:在操作卡中增加对象版本号、变更前后差异以及提案有效期;确认执行时再次校验对象状态,避免对已变更对象重复提交操作。 ▎ 4. 补充数据隐私说明:增加学工数据最小化采集、脱敏处理、保存期限和日志访问范围等说明,明确数据使用边界。 ▎ 5. 建立量化评测指标:后续会基于脱敏数据整理并公开越权拦截率、操作提案执行成功率、P95 响应时间等指标。 ▎ 6. 增强汇总结果的完整性提示:在自然语言汇总中附带数据时间戳、查询范围和工具调用状态,避免管理员将部分结果误认为完整清单。 ▎ ▎ 再次感谢这次细致且可操作的反馈。我们会持续跟进这些改进项,并在仓库中同步实现进度。
Sign in to join this conversation.
No labels
No milestone
No project
No assignees
2 participants
Notifications
Due date
The due date is invalid or out of range. Please use the format "yyyy-mm-dd".

No due date set.

Dependencies

No dependencies set.

Reference
Cheonyi/activities#2
No description provided.