【S3W3 交叉评测】BidRoom Agent:证据链、可审计性与安全测试建议 #2
Loading…
Add table
Add a link
Reference in a new issue
No description provided.
Delete branch "%!s()"
Deleting a branch is permanent. Although the deleted branch may continue to exist for a short time before it actually gets removed, it CANNOT be undone in most cases. Continue?
1. 项目理解
BidRoom Agent 将招标文件拆解、证据检索、内容起草、合规审查和模拟评审组织为五项 Skills。核心原则是“没有证据就标记缺失”,并将来源文件、页码和风险状态带入评审流程。
2. 做得好的地方
3. 当前不足
公开仓库主要展示 Agent 核心,并非完整产品源码,因此评委难以复现“83 项需求”等 Demo 指标如何从原文件得到。当前也缺少一套脱敏招标文件、期望分解结果、引用定位和最终审计报告组成的端到端固定样例。招标文件属于不可信输入,还需验证提示注入、恶意附件、跨项目数据隔离和越权引用。
4. 优先建议
发布一份脱敏 fixture 及其结构化期望输出,配套 schema test、页码引用校验和 execution trace;解释需求计数和风险等级的确定性规则;增加文档提示注入、OCR 错页、重复条款、缺页及租户隔离测试。演示账号建议限制为只读、可自动重置环境。
5. 综合评价
项目抓住了招投标生成最关键的可信问题,证据边界是明显优势。若补足公开可复现样例与安全测试,技术评审会更容易确认其工程成熟度。
感谢 @harrychen901 的详细评测和建设性建议!
▎
▎ 您提到的几个问题非常关键,尤其是可复现性、需求统计口径和安全测试覆盖,这些直接影响项目结果的可信度和后续落地。
▎
▎ 针对评测中的反馈,我们计划从以下几个方面改进:
▎
▎ 1. 补充可复现的端到端样例:发布脱敏后的招标文件 fixture,并提供对应的结构化预期输出,包含需求拆分结果、证据引用和页码信息,方便社区独立验证。
▎ 2. 明确需求计数规则:在文档中说明需求识别、去重、合并以及风险等级划分的具体规则,确保“83 项需求”等指标有清晰、可追溯的来源。
▎ 3. 完善安全测试:增加提示注入、OCR 错页、越权引用、租户隔离等测试用例,覆盖文档处理和结果生成的关键环节。
▎ 4. 降低演示环境权限:演示账号会尽量采用只读权限,并支持环境重置,避免测试数据和不同评测之间相互影响。
▎
▎ 再次感谢这次专业且有针对性的反馈。我们会优先围绕证据链、可审计性和安全验证补齐工程化能力,也欢迎继续提供具体测试场景,帮助我们进一步完善项目。