【S3 Wave 3 交叉评测】Yorimi 对 stylebridge-ai(StyleBridge AI)的反馈 #3
Loading…
Add table
Add a link
Reference in a new issue
No description provided.
Delete branch "%!s()"
Deleting a branch is permanent. Although the deleted branch may continue to exist for a short time before it actually gets removed, it CANNOT be undone in most cases. Continue?
项目理解
StyleBridge AI 是面向俄罗斯服装批发商的选款与采购辅助 Demo:收集买家条件,从 20 款本地样品中进行规则评分和 Top 5 推荐,再生成三套采购组合、轻定制建议、俄语营销素材及英俄双语 RFQ。
具体优点
Demo 边界非常诚实。README 明确说明没有 LLM、实时市场、真实库存、报价或供应商,并区分“请求供应商确认”和“系统承诺”,降低了跨境业务场景中最危险的误导风险。README
决策链路确定、可解释且实现清晰。recommendation_rules.py 对性别硬过滤,并分别计算品类、价格、风格、气候、首单规模和客户类型分数;稳定排序后返回 Top 5。SelectionService 再统一生成组合,页面层没有重复业务规则。推荐规则 · 选款服务
测试覆盖不仅是 smoke test,还包括计分边界、Marketing、RFQ 一致性、图片降级、三语 UI、导航和 Streamlit AppTest;俄语营销规则也只从已存在的产品属性取值,有意识地避免生成不存在的卖点。测试目录 · 营销规则
问题或不清楚处
对 Wave 3 的“Agents + Skills”目标而言,目前核心仍是确定性函数流水线。README 明确写明没有 LLM 或外部 AI API;源码中也主要是 service/rule/template 调用,尚未看到自然语言澄清、多轮状态、Skill 选择、工具调用或 agent-run 证据。“AI 选款智能体”与当前规则型决策 Demo 之间仍有交付差距。
七维评分的权重及产品中的 trial_order_score、volume_score、profit_score 没有看到来源、校准方法或离线基准。20 款数据又明确是 Demo 数据,因此当前 Top 5 只能证明规则执行一致,不能证明俄罗斯市场适配有效。
俄语内容由固定字典和模板组合,测试主要验证结构和确定性;README 也明确建议母语者复核。目前缺少语言自然度、批发行业术语准确性以及误导性营销表述的验收证据。
当前明确不做公开部署,虽然本地说明完整,但交叉评审者必须自行准备 Python 3.12 环境;仓库未提供 CI 结果或一键容器路径,本次无法核验 README 所述测试是否实际通过。
可验收的下一步建议
在现有规则引擎外增加一个最小 Agent 层:接收自然语言采购需求、发现缺失字段并追问、调用 Selection/Marketing/RFQ Skills、解释取舍并保存本轮状态。用两轮会话测试证明追问后 Top 5 和 RFQ 会更新。
为每个评分字段增加 source_type、依据和版本;建立至少 20 个买家场景的 golden set,由领域人员判断 Top 5 是否合理,并公开命中率或分歧记录。
请俄语母语或行业人员盲审至少 20 份营销/RFQ 样例,按语法、术语、承诺风险和可直接发送性打分;将发现的问题转为自动回归用例。
增加 CI 或 Docker 一键验收,至少执行 ruff、pytest 和 Moscow Demo 冒烟路径,并保留与 commit 绑定的结果。
综合评价
这是一个边界清楚、规则可解释、测试意识很强的跨境决策 Demo,工程可信度高于许多“套一层 AI 名称”的原型。但 Wave 3 评审的关键短板也很明确:当前证明的是规则工作流,而不是具备多轮交互和 Skills 调度证据的 Agent。建议保留确定性内核,再补一层薄而可测的 Agent 编排。
查阅依据与静态审查限制