No description
Find a file
Rech Tan 5d6caa93f9 docs: answer the cross-review with evidence rather than assurances
The stronger of the two reviews did not doubt the design; it doubted that a
third party could check any of it. So this round adds the things that can be
checked: a role/resource/action matrix with fourteen cases that are expected to
fail, metric definitions with their collection endpoint and disclosure rules,
and a data-handling page naming exactly what reaches the model, how long it is
kept, and who can read it.

SAFETY, SKILLS and the samples are updated to match what the product now shows
— target object and validity on the confirmation card, coverage and data
timestamp under every answer — so the documents describe the build rather than
the intention.

The other review read the project as a general event-planning agent with
calendars, invitations and live venue pricing. ITERATION says so plainly and
maps the parts that do apply, instead of quietly answering questions nobody
asked.

Nothing is claimed that was not done. The unit tests cover decision logic, and
are labelled as such next to the cases that still need two accounts and a real
run. The metrics snapshot is left empty: placeholder numbers passed off as
measurements would be worse than no numbers. The recording, the contract
samples and the cross-account run records are listed as outstanding.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
2026-08-06 20:27:32 +08:00
docs docs: answer the cross-review with evidence rather than assurances 2026-08-06 20:27:32 +08:00
media docs: answer the cross-review with evidence rather than assurances 2026-08-06 20:27:32 +08:00
samples docs: answer the cross-review with evidence rather than assurances 2026-08-06 20:27:32 +08:00
.gitignore docs: add Wave 3 competition showcase 2026-08-03 00:42:22 +08:00
NOTICE.md docs: add Wave 3 competition showcase 2026-08-03 00:42:22 +08:00
README.md docs: answer the cross-review with evidence rather than assurances 2026-08-06 20:27:32 +08:00

学工工作平台 · 管理 Agent

Wave 3 参赛展示仓库|自然语言驱动的学院活动与学生事务管理智能体

Demo Status Source

一句话介绍

管理 Agent 将分散在活动、报名、学分手册、公告和工单页面中的管理工作,收拢为一个受权限约束的自然语言工作区:先查询事实、生成可读结果;涉及写操作时只提出结构化方案,必须由人确认后才会执行。

在线 Demo

体验地址:https://activities.rechtan.com/

线上服务已于 2026-08-03 验证可访问HTTP 200。为避免公开仓库泄露评审账号登录信息请从赛事提交页的私密评审备注获取。

3 分钟评审路径

  1. 打开 Demo使用评审账号登录。
  2. 从侧栏进入「Agent」也可登录后直接访问 /agent
  3. 先发送只读任务:汇总我负责活动的待处理事项
  4. 再发送分析任务:查找待审核活动并说明风险
  5. 查看 Agent 的事实摘要、建议追问,以及独立的 Artifact 工作区(如本次结果生成 Artifact
  6. 发送写作与操作任务:为目标活动起草一则提醒公告。观察 Agent 先生成操作卡片,并等待「确认执行」或「拒绝」。共享演示环境中建议点击「拒绝」,即可验证人在回路机制而不改动数据。
  7. 打开历史会话,确认任务上下文可以延续和归档。

更完整的操作脚本、预期现象和异常处理见 Demo 操作指南

解决什么问题

学院活动运营通常横跨多个页面:管理员先看待审活动,再查报名与学分手册进度,随后处理工单、起草公告。数据量变大后,页面切换、筛选和重复核对会显著占用组织者时间,也容易产生漏项。

本项目把这类工作变成四步闭环:

flowchart LR
    A["用户用自然语言描述任务"] --> B["Agent 调用只读 Skills 查询事实"]
    B --> C["生成摘要、清单或图表 Artifact"]
    C --> D{"是否涉及写操作"}
    D -- "否" --> E["交付可继续追问的结果"]
    D -- "是" --> F["生成结构化操作提案"]
    F --> G{"用户确认"}
    G -- "拒绝" --> H["不改变业务数据"]
    G -- "确认" --> I["再次校验权限与状态后执行"]

已具备的交互能力

能力 可见交互 用户价值
管理工作台汇总 一句话汇总活动状态、待处理工单、报名与手册待办 减少跨页面巡检
业务对象检索 按名称、状态或管理范围查找活动和工单 避免凭印象定位数据
活动执行检查 汇总报名、工单、手册提交/盖章/领回进度 快速发现流程卡点
交付物生成 输出 Markdown 清单、报告或条形图 Artifact 结果可直接用于交接和汇报
操作提案 确认卡显示对象 ID、当前状态、前后差异、影响人数与有效期 确认的是具体动作,不是一句自然语言
覆盖范围披露 每条回复标注查询项数、失败项与数据时间;有失败则提示结果不完整 汇总能否当作完整清单,一眼可判断
多轮协作 建议下一步、延续上下文、保存和归档会话 支持连续工作而非一次性问答

Skills 整合

Agent 不是直接连接数据库的聊天框。它通过边界清晰的 Skills 与工具协作:

  • 管理对话 Skill理解任务选择查询路径组织回答、Artifact 和操作提案。
  • 业务查询 Skills:在当前用户权限范围内汇总工作台、搜索活动、读取活动执行概况、查找可处理工单和业务记录。
  • 确定性工具 Skills:当前时间、日期计算和数值计算,避免模型猜测精确事实。
  • Artifact Skill:只允许可信的本地渲染类型,如 Markdown 与条形图,不执行模型生成的 HTML/JavaScript。
  • Action Guard:写操作先形成有类型、有目标、有摘要的提案;确认时再次进行权限和业务状态校验。

详细说明见 Skills 与协作机制

安全与人在回路

读取:每次工具调用都重新应用当前账号的权限与管理范围
写入:模型不能直接写业务数据,只能提出有限类型的操作提案
确认:卡片显示对象 ID、当前状态、前后差异与有效期确认时再校验一次
幂等:重复确认返回既有结果,并发由乐观并发兜底,恰好执行一次
披露:回复标注查询覆盖范围与数据时间,有失败即声明结果不完整
输出Artifact 使用结构化数据和本地组件,不执行模型生成代码
额度:可按用户启停 Agent并设置调用次数与 Token 上限
审计:会话、提案状态与模型调用记录可追踪

安全边界与失败处理见 安全设计;预期失败的负向用例见 权限矩阵与负向测试

参赛材料导航

材料 内容
Demo 操作指南 登录、推荐任务、预期结果与演示注意事项
产品与用户价值 使用者、痛点、流程和当前能力边界
Skills 与协作机制 Skills 分工、读写路径与结构化输出
安全设计 权限、确认、有效期、幂等、覆盖范围与额度
权限矩阵与负向测试 角色—资源—动作矩阵与 14 条预期失败用例
量化指标 成功率、越权拦截率、提案确认/失效率、P95 延迟
数据处理与隐私边界 模型输入白名单、保留期、删除路径与可见范围
交叉评测迭代记录 对两份评测意见的逐条回应与本轮改动
Specs 评测对照 可用性、交互、产出和价值的逐项证据
赛事提交清单 仓库、Demo、私密账号与视频的提交前核验
脱敏交互样例 可公开的示例输入、输出与操作提案
截图与录屏清单 提交前应补充的真实演示素材及脱敏要求

仓库公开边界

这是项目的参赛展示仓库,不是完整源码镜像。公开内容仅包含产品说明、演示路径、交互样例和评测证据;生产源码、配置、密钥、数据库、日志、用户数据、部署脚本和内部设计资料均不在本仓库中。

线上 Demo 是本项目的可运行交付物。本仓库不宣称可从公开材料重建生产系统,也不以伪代码或删减源码冒充“开源版本”。详见 公开范围声明

当前状态

  • 在线 Demo可访问
  • Agent 交互:已集成到业务平台
  • 只读查询:可演示
  • Artifact 输出:可演示
  • 写操作提案与人工确认:可演示
  • 操作卡对象标识、前后差异与有效期:本轮已上线
  • 重复确认幂等与二次校验拦截:本轮已上线
  • 查询覆盖范围与不完整提示:本轮已上线
  • 量化指标接口:已就绪;脱敏快照数字待实机采集
  • 真实截图/录屏:待按 素材清单 由评审账号实机补充

本轮针对交叉评测意见的改动与仍未完成项,见 交叉评测迭代记录


Copyright © 2026. All rights reserved.