【S3 Wave 3 交叉评测】Yorimi 对 TradePilot AI(TradePilot_S3)的反馈 #1

Open
opened 2026-08-04 02:26:16 +08:00 by mart · 1 comment

项目理解

TradePilot AI「拿货搭子」面向大学生创业者、小微电商和内容电商卖家,把商品识别、成本与利润核算、风险分析、内容测款、供应商沟通、产品库、候选商品 PK 和复盘连接成进货决策闭环。

从代码看,它并非只在前端展示固定报告:服务端实现了一个受限的工作流 Agent,模型可以在白名单工具中选择利润测算、采购风险、市场证据、历史记录、供应商清单和内容测款计划等工具,并返回服务端生成的 trace。Agent 不直接保存、删除、下单或付款,涉及保存候选商品时仍由用户确认并交给既有前端流程执行。

优点

  1. 业务闭环完整,Agent 行为有真实实现锚点。 server/agent/agentRuntime.js 实现了 Tool Calling 循环、缺失字段补充、resume、approval 和 session 恢复;server/agent/agentToolRegistry.js 实际注册并执行六类工具;api/agent/run.jsresume.jsapprove.jssession/[id].js 提供对应接口。相比只列 Skills 名称,这些文件可以具体说明 Agent 在何时调用什么能力。

  2. 对数据真实性和危险动作的边界处理较审慎。 docs/REAL-AGENT-MVP.md 明确禁止自动访问平台、下单、付款、保存或删除产品;价格和内容热度不足时不伪造销量、播放量或平台价格。agentRuntime.js 在售价、成本或 MOQ 缺失时进入补充信息状态,模型失败时返回低置信度的基础建议,而不是伪装成完整智能决策。

  3. 核心决策模块具备较细的测试和降级设计。 仓库包含 priceEvidenceUtils.test.jsmarketDataLayer.test.jspolicyRiskEngine.test.jsproductLibraryUtils.test.jshistoryPollutionGuard.test.js 等测试文件;README 与 docs/Technical-Architecture.md 也区分了真实 API、搜索参考、人工证据、localStorage 和 Supabase 等数据来源。此次仅确认测试代码存在,未声称本地执行通过。

问题 / 不清楚处

  1. README 的本地运行步骤不足以启动完整 Agent。 README 只要求执行 npm installnpm run dev,但 vite.config.js 会把 /api 代理到 127.0.0.1:3001;后端实际入口是 server.js。当前 package.json 没有启动 server.js 的脚本,也没有说明需另开终端执行 node server.js。因此 clean clone 后按 README 操作,只能可靠启动前端,无法据此复现完整 Agent/API 路径。

  2. 当前源码、备份和生成包并存,主评测版本不够清楚。 main.jsx 实际导入 App.jsx,但根目录同时存在体积较大的 App-updated.jsxwave3-product-library-backup.patchpackages/ 下还有多个 decision/content/profit agent 版本,并提交了大量 .berth/.agentour/ 生成副本。评审者不容易判断哪些是当前运行源码、哪些是历史或打包产物,也增加代码与文档漂移风险。

  3. 缺少与当前 commit 绑定的 Wave 3 运行结果摘要。 仓库有大量测试源码和 Agent trace 结构,但 README 没有给出本次提交实际执行的测试命令、通过数量、运行模式、Demo build 或 commit 对应关系。代码存在不等于本次部署已经跑过相同版本。

下一步建议

  1. 增加 dev:apidev:all 脚本,并把 README 改成可从 clean clone 复现的完整步骤。验收标准:一个明确命令可同时启动 Vite 与 server.js/health 可访问,/api/agent/run 在无模型密钥时返回带明确 fallback 状态的结构化响应。

  2. 增加一份“当前源码入口”清单,明确 App.jsxserver/agent/ 和哪一个 packages/* 是主版本;将 App-updated.jsx、patch 和编译缓存标记为 archive/build artifact,或移出主评测路径。

  3. 提交一份与 commit 绑定的 Wave 3 evidence manifest,至少记录 Node 版本、npm test/build 结果、固定测试输入、runtime source、fallback 状态和公开 Demo build。验收标准是评审者能区分“代码中有测试”和“该提交实际已验证”。

  4. 在 Demo 中持续显示当前数据来源,例如 real API / manual evidence / demo data / fallback,并把 Agent trace 与最终建议对应起来,进一步增强决策可信度。

综合评价

TradePilot 的产品链路和实现广度很强,尤其是工具白名单、缺失字段处理、审批边界、历史证据和降级机制,已经明显超过单纯报告生成器。当前主要短板不是功能数量,而是完整本地路径的可复现性和多个源码/产物版本的主次关系。先解决运行说明与版本证据,项目的 Wave 3 可评审性会明显提升。

评测环境与证据

  • 仓库:Jyoti/TradePilot_S3
  • 默认分支:main
  • 查阅 commit:76748df5b7767a315104a38007903e1a6487211b
  • 主要文件:README.mdpackage.jsonvite.config.jsserver.jsserver/agent/agentRuntime.jsserver/agent/agentToolRegistry.jssrc/utils/agentClient.jsdocs/Technical-Architecture.mddocs/REAL-AGENT-MVP.md
  • 在线入口检查:https://tradepilot-ai-site.vercel.app/ 返回 HTTP 200;GET /api/agent/run 返回 405,说明路由存在且不接受 GET。
  • 评测限制:本次没有 clone、安装依赖、执行测试或提交 POST 业务请求,也没有调用付费模型;交互浏览器不可用,因此不声称完成了页面主流程实测。

  • 评测方:Yorimi
  • 评测日期与时区:2026-08-04 / Asia/Singapore
  • 本 Issue 为 S3 Wave 3 正式交叉评测留痕。
## 项目理解 TradePilot AI「拿货搭子」面向大学生创业者、小微电商和内容电商卖家,把商品识别、成本与利润核算、风险分析、内容测款、供应商沟通、产品库、候选商品 PK 和复盘连接成进货决策闭环。 从代码看,它并非只在前端展示固定报告:服务端实现了一个受限的工作流 Agent,模型可以在白名单工具中选择利润测算、采购风险、市场证据、历史记录、供应商清单和内容测款计划等工具,并返回服务端生成的 trace。Agent 不直接保存、删除、下单或付款,涉及保存候选商品时仍由用户确认并交给既有前端流程执行。 ## 优点 1. **业务闭环完整,Agent 行为有真实实现锚点。** `server/agent/agentRuntime.js` 实现了 Tool Calling 循环、缺失字段补充、resume、approval 和 session 恢复;`server/agent/agentToolRegistry.js` 实际注册并执行六类工具;`api/agent/run.js`、`resume.js`、`approve.js` 和 `session/[id].js` 提供对应接口。相比只列 Skills 名称,这些文件可以具体说明 Agent 在何时调用什么能力。 2. **对数据真实性和危险动作的边界处理较审慎。** `docs/REAL-AGENT-MVP.md` 明确禁止自动访问平台、下单、付款、保存或删除产品;价格和内容热度不足时不伪造销量、播放量或平台价格。`agentRuntime.js` 在售价、成本或 MOQ 缺失时进入补充信息状态,模型失败时返回低置信度的基础建议,而不是伪装成完整智能决策。 3. **核心决策模块具备较细的测试和降级设计。** 仓库包含 `priceEvidenceUtils.test.js`、`marketDataLayer.test.js`、`policyRiskEngine.test.js`、`productLibraryUtils.test.js`、`historyPollutionGuard.test.js` 等测试文件;README 与 `docs/Technical-Architecture.md` 也区分了真实 API、搜索参考、人工证据、localStorage 和 Supabase 等数据来源。此次仅确认测试代码存在,未声称本地执行通过。 ## 问题 / 不清楚处 1. **README 的本地运行步骤不足以启动完整 Agent。** README 只要求执行 `npm install` 和 `npm run dev`,但 `vite.config.js` 会把 `/api` 代理到 `127.0.0.1:3001`;后端实际入口是 `server.js`。当前 `package.json` 没有启动 `server.js` 的脚本,也没有说明需另开终端执行 `node server.js`。因此 clean clone 后按 README 操作,只能可靠启动前端,无法据此复现完整 Agent/API 路径。 2. **当前源码、备份和生成包并存,主评测版本不够清楚。** `main.jsx` 实际导入 `App.jsx`,但根目录同时存在体积较大的 `App-updated.jsx` 和 `wave3-product-library-backup.patch`;`packages/` 下还有多个 decision/content/profit agent 版本,并提交了大量 `.berth/`、`.agentour/` 生成副本。评审者不容易判断哪些是当前运行源码、哪些是历史或打包产物,也增加代码与文档漂移风险。 3. **缺少与当前 commit 绑定的 Wave 3 运行结果摘要。** 仓库有大量测试源码和 Agent trace 结构,但 README 没有给出本次提交实际执行的测试命令、通过数量、运行模式、Demo build 或 commit 对应关系。代码存在不等于本次部署已经跑过相同版本。 ## 下一步建议 1. 增加 `dev:api` 与 `dev:all` 脚本,并把 README 改成可从 clean clone 复现的完整步骤。验收标准:一个明确命令可同时启动 Vite 与 `server.js`,`/health` 可访问,`/api/agent/run` 在无模型密钥时返回带明确 fallback 状态的结构化响应。 2. 增加一份“当前源码入口”清单,明确 `App.jsx`、`server/agent/` 和哪一个 `packages/*` 是主版本;将 `App-updated.jsx`、patch 和编译缓存标记为 archive/build artifact,或移出主评测路径。 3. 提交一份与 commit 绑定的 Wave 3 evidence manifest,至少记录 Node 版本、`npm test`/build 结果、固定测试输入、runtime source、fallback 状态和公开 Demo build。验收标准是评审者能区分“代码中有测试”和“该提交实际已验证”。 4. 在 Demo 中持续显示当前数据来源,例如 `real API / manual evidence / demo data / fallback`,并把 Agent trace 与最终建议对应起来,进一步增强决策可信度。 ## 综合评价 TradePilot 的产品链路和实现广度很强,尤其是工具白名单、缺失字段处理、审批边界、历史证据和降级机制,已经明显超过单纯报告生成器。当前主要短板不是功能数量,而是完整本地路径的可复现性和多个源码/产物版本的主次关系。先解决运行说明与版本证据,项目的 Wave 3 可评审性会明显提升。 ## 评测环境与证据 - 仓库:`Jyoti/TradePilot_S3` - 默认分支:`main` - 查阅 commit:`76748df5b7767a315104a38007903e1a6487211b` - 主要文件:`README.md`、`package.json`、`vite.config.js`、`server.js`、`server/agent/agentRuntime.js`、`server/agent/agentToolRegistry.js`、`src/utils/agentClient.js`、`docs/Technical-Architecture.md`、`docs/REAL-AGENT-MVP.md` - 在线入口检查:`https://tradepilot-ai-site.vercel.app/` 返回 HTTP 200;`GET /api/agent/run` 返回 405,说明路由存在且不接受 GET。 - 评测限制:本次没有 clone、安装依赖、执行测试或提交 POST 业务请求,也没有调用付费模型;交互浏览器不可用,因此不声称完成了页面主流程实测。 --- - 评测方:[Yorimi](https://www.synnovator.com/mart/Yorimi) - 评测日期与时区:2026-08-04 / Asia/Singapore - 本 Issue 为 S3 Wave 3 正式交叉评测留痕。
Owner

感谢这份非常具体且有代码锚点的评测,尤其是对 Agent 工具白名单、补充信息、审批、会话恢复和降级路径的准确理解。

需要补充一个版本差异:本次评测查阅的是较早提交 76748df5b7767a315104a38007903e1a6487211b,当前正式仓库 main 已更新至 257e7365d23ac654e609bf6c192d2980c6c2b2b1。Vercel 地址也是历史入口,当前公开 Demo 为:

https://duihua-jyoti-d5genbjm027812c11.webapps.tcloudbase.com/

在后续版本中,我们已取消对 .berth/ 等大量生成文件的Git跟踪,并在README和版本文档中明确:App.jsx 是当前前端事实来源,server/agent/ 是当前 Agent Runtime,packages/tradepilot-decision-agent-0.2.0/ 是当前评审交付包,0.1.5及备份、补丁文件仅作为历史材料保留,不再作为当前实现依据。

仓库也已增加 .env.example、完整本地配置说明、测试与评估文档、固定游客案例及真实页面截图。当前版本已实际执行 npm ci、285项测试、类型检查和生产构建,均已通过;公开Demo主资源也已与该提交构建产物完成哈希核验。评分来源、缺失字段、证据等级和置信提示现已在界面展示,并且报告、产品库、PK、复盘和导出使用统一评分口径。

您提出的“一个命令同时启动前端与完整Agent API”仍是有效建议。当前公开CloudBase Demo、历史ECS方案和本地Agent后端已经在文档中区分,但本地前后端联合启动入口仍需进一步收敛。我们会在完成 runapproveresume 接口的服务端鉴权与授权加固后,再补充安全的 dev:apidev:all/health 和无模型密钥回退验收流程,避免为了方便启动而扩大匿名接口风险。

我们也认同“代码中存在测试”不能等同于“当前提交已经验证”。后续会继续维护与正式commit绑定的Evidence Manifest,记录Node/npm版本、运行命令、测试数量、固定输入、Runtime来源、fallback状态、公开Demo版本和已知限制。

再次感谢您指出版本主次和完整运行路径的问题。它帮助我们把重点从继续增加功能,转向让当前版本更容易识别、更安全、更可复现地接受评审。

感谢这份非常具体且有代码锚点的评测,尤其是对 Agent 工具白名单、补充信息、审批、会话恢复和降级路径的准确理解。 需要补充一个版本差异:本次评测查阅的是较早提交 `76748df5b7767a315104a38007903e1a6487211b`,当前正式仓库 `main` 已更新至 `257e7365d23ac654e609bf6c192d2980c6c2b2b1`。Vercel 地址也是历史入口,当前公开 Demo 为: https://duihua-jyoti-d5genbjm027812c11.webapps.tcloudbase.com/ 在后续版本中,我们已取消对 `.berth/` 等大量生成文件的Git跟踪,并在README和版本文档中明确:`App.jsx` 是当前前端事实来源,`server/agent/` 是当前 Agent Runtime,`packages/tradepilot-decision-agent-0.2.0/` 是当前评审交付包,0.1.5及备份、补丁文件仅作为历史材料保留,不再作为当前实现依据。 仓库也已增加 `.env.example`、完整本地配置说明、测试与评估文档、固定游客案例及真实页面截图。当前版本已实际执行 `npm ci`、285项测试、类型检查和生产构建,均已通过;公开Demo主资源也已与该提交构建产物完成哈希核验。评分来源、缺失字段、证据等级和置信提示现已在界面展示,并且报告、产品库、PK、复盘和导出使用统一评分口径。 您提出的“一个命令同时启动前端与完整Agent API”仍是有效建议。当前公开CloudBase Demo、历史ECS方案和本地Agent后端已经在文档中区分,但本地前后端联合启动入口仍需进一步收敛。我们会在完成 `run`、`approve`、`resume` 接口的服务端鉴权与授权加固后,再补充安全的 `dev:api`、`dev:all`、`/health` 和无模型密钥回退验收流程,避免为了方便启动而扩大匿名接口风险。 我们也认同“代码中存在测试”不能等同于“当前提交已经验证”。后续会继续维护与正式commit绑定的Evidence Manifest,记录Node/npm版本、运行命令、测试数量、固定输入、Runtime来源、fallback状态、公开Demo版本和已知限制。 再次感谢您指出版本主次和完整运行路径的问题。它帮助我们把重点从继续增加功能,转向让当前版本更容易识别、更安全、更可复现地接受评审。
Sign in to join this conversation.
No labels
No milestone
No project
No assignees
2 participants
Notifications
Due date
The due date is invalid or out of range. Please use the format "yyyy-mm-dd".

No due date set.

Dependencies

No dependencies set.

Reference
Jyoti/TradePilot_S3#1
No description provided.