【S3W3 交叉评测】关务通:数据分类、出境路径与模型送数安全建议 #4
Loading…
Add table
Add a link
Reference in a new issue
No description provided.
Delete branch "%!s()"
Deleting a branch is permanent. Although the deleted branch may continue to exist for a short time before it actually gets removed, it CANNOT be undone in most cases. Continue?
1. 项目理解
我理解“关务通”是一款面向中小货代、船代和跨境物流企业的航运舱单数据出境预筛查工具。
用户上传 Excel 或 CSV 舱单后,系统通过字段名规则、字段值正则和 DeepSeek 语义复核识别可疑数据,再结合规则库给出数据分级、脱敏建议、出境结论和 PDF 报告。
项目希望把原本依赖人工逐字段查法规的流程,变成一次自动化的数据出境前检查。
2. 项目亮点
3. 当前问题和疑点
3.1 敏感个人信息不能直接等同于重要数据
当前产品使用“核心数据、重要数据、一般数据”三级分类,并将身份证号、护照号、联系电话等个人信息归入重要数据。
但敏感个人信息和《数据安全法》意义上的重要数据属于不同的分类体系,不能因为个人信息具有敏感性,就自动认定为重要数据。
一项数据可能同时具有个人信息属性和重要数据属性,但应分别判断,不能直接合并。
建议将“数据性质”拆分为:
然后再单独判断适用的数据出境路径。
3.2 仅扫描舱单字段,无法形成最终出境结论
当前系统主要根据舱单中识别出的最高风险字段,输出:
但真实的数据出境合规判断还需要了解:
因此,字段扫描可以形成风险线索,但不足以直接判断该批数据能否合法出境。
建议在上传舱单后增加“出境场景问卷”,补充主体、目的、接收方、人数、必要性、豁免和重要数据认定等信息。
缺少关键信息时,系统结论应为:
不宜默认输出“可安全出境”。
3.3 建议采用“数据性质 × 出境路径”双轴模型
当前逻辑把数据识别、数据分级和出境结论压缩成一条链:
字段名称 → 核心/重要/一般 → 禁止/脱敏/放行。
建议改为两个独立维度。
第一轴:数据性质
第二轴:合规路径
身份证号可以被识别为敏感个人信息,但不能因此直接写成重要数据或自动禁止出境。
3.4 重要数据不是“脱敏后即可出境”,也不是一律禁止出境
如果数据已经被认定为重要数据,脱敏只是风险控制措施,不能替代数据出境安全评估。
另一方面,重要数据也不是一律禁止出境。确有业务需要并通过安全评估的,可以依法向境外提供。
因此不应形成以下简单逻辑:
重要数据 → 脱敏 → 自动放行。
也不应形成:
重要数据 → 永久禁止出境。
建议将重要数据的结论改为:
3.5 AI 全量复核可能先产生新的数据提供风险
当前项目说明会使用 DeepSeek 对字段进行语义复核。
需要明确确认:
如果系统在完成合规判断之前,就把原始舱单字段提交给第三方模型服务,那么系统本身新增了委托处理或第三方提供链路。
建议:
3.6 “高货值超过 100 万美元即属于重要数据”缺少直接依据
当前规则将高货值信息超过 100 万美元判定为重要数据,并给出海关法规依据。
但货物申报金额规则和数据分类分级规则不是同一个概念。货值高可能意味着更高的商业、申报或保密风险,但不能仅凭金额自动认定为数据安全法意义上的重要数据。
建议改为:
同时应明确区分:
3.7 “危险品详情自动属于核心数据”需要更充分依据
危险品运输确实涉及运输安全、申报和监管要求,但危险品舱单字段并不必然自动构成数据安全法意义上的核心数据。
是否属于重要或核心数据,通常还需要考虑:
建议将普通危险品字段先标记为:
只有具备明确认定依据时,才输出“重要数据”或“核心数据”。
3.8 打码不能替代个人信息出境程序
当前脱敏方式主要包括:
这种方式属于掩码或去标识化,并不等于无法识别、不可复原的匿名化。
经过上述处理的数据仍可能属于个人信息,因此不能形成:
打码完成 → 自动满足出境条件。
脱敏只能降低风险,不能替代:
3.9 PDF 报告不应包含原始字段值
当前报告生成逻辑会在 PDF 中写入舱单文件名和原始字段值节选。
这可能使 PDF 报告本身成为新的敏感数据副本,尤其是身份证号、护照号、电话、姓名、地址和危险品信息。
建议报告只保留:
不应写入原始值前缀。
同时建议增加:
3.10 AI 不可用时不能静默输出安全结论
当前产品强调无 Key、断网或模型异常时静默降级为纯规则模式。
在普通内容产品中,静默降级可以提高可用性;但在合规工具中,检测能力下降后仍然输出确定性结论,会产生错误安全感。
建议在降级时明确展示:
降级模式的结论应改为:
不应继续输出“可安全出境”。
3.11 目前没有公开证据支持准确率目标
Specs 中设定了:
这些是合理的评测目标,但当前标注测试集和自动化评测仍在后续路线图中,因此暂时不能证明系统已经达到这些指标。
建议优先建立黄金测试集,覆盖:
建议分别公开:
3.12 “可直接用于对外申报”的宣传需要收缩
当前项目将 PDF 描述为可用于内部留档或对外申报。
但正式的数据出境安全评估、个人信息出境标准合同备案或个人信息保护认证,需要提交主体、境外接收方、出境场景、法律文件、自评估等正式材料。
一份字段检测 PDF 不能直接替代监管申报材料。
建议将表述调整为:
4. 优先改进建议
建议按以下顺序处理:
5. 建议的最终结论类型
建议不再使用过于绝对的“可安全出境”,而采用以下状态:
PRECHECK_PASS
规则预检未发现明确阻断项,但仍需完成适用的告知、同意、影响评估及其他法定义务。
CONDITIONAL
满足报告列出的脱敏、授权、合同或其他条件后,才可进入后续出境流程。
FORMAL_MECHANISM_REQUIRED
需要订立个人信息出境标准合同、通过个人信息保护认证或申报数据出境安全评估。
HUMAN_REVIEW_REQUIRED
信息不足、规则存在不确定性、模型不可用或疑似涉及重要数据,需要人工合规复核。
BLOCKED
存在明确禁止依据、主管部门限制或其他无法通过整改消除的阻断条件。
6. 综合评价
关务通选择了真实且具有业务价值的航运数据出境场景,目标用户、操作入口和交付形式都比较清楚,MVP 也已经形成了从舱单上传到报告下载的完整流程。
当前最大的风险不是界面或模型能力,而是法律决策模型过度依赖字段分类,将个人信息、敏感个人信息、重要数据、核心数据和数据出境机制混合在一条规则链中。
这可能同时产生错误放行和错误阻断。
完成“双轴分类、出境场景问卷、模型送数控制、规则证据化、报告安全和测试集验证”后,项目会从一个演示性的敏感字段检测器,升级为更可信、更适合企业实际使用的数据出境合规预筛查产品。