选品推荐算法演进:从规则到图神经网络 - ApexPicker RD001 技术解析
选品推荐算法演进:从规则到图神经网络
我们做亚马逊选品工具做了 10 年,见过太多算法迭代。本文把选品推荐这件事拆成 5 个阶段讲清楚:规则系统 → 协同过滤 → 深度学习双塔 → 多模态学习 → 图神经网络(GNN)。最后落到我们自己在 [RD001 ApexPicker](/technology#rd001) 上的工程实践。
一句话总结:选品推荐的核心矛盾,从”算分高低”变成了”算关联强弱”。图神经网络(GNN)之所以成为 2024 年之后的主流选品方案,是因为它能直接建模”商品 ↔ 类目 ↔ 品牌 ↔ 卖家”之间的高阶关联,而不是把每个商品当成孤立向量。
一、为什么”选品”本身就是一个推荐问题?
很多人以为”选品”就是”查销量、查 ASIN、查关键词”。这其实是查表,不是推荐。
查表回答的问题是:“这个 ASIN 卖得怎么样?” 推荐回答的问题是:“现在应该选什么方向、按什么价位区间、用什么打法?”
后者更接近真正的”决策辅助”。这正是 ApexPicker 想做的事 —— 把查询工具升级为决策工作台。
选品推荐的 3 个特征
| 维度 | 查表工具 | 推荐系统 |
|---|---|---|
| 输入 | 关键词 / ASIN | 多源数据 + 用户上下文 |
| 输出 | 单点数据 | 候选集 + 排序 + 解释 |
| 反馈 | 无 | 在线学习 / A/B |
| 典型代表 | Jungle Scout、Helium 10 | ApexPicker、卖家精灵(高级版) |
我们 2026 年的目标,是把”查表”和”推荐”做成一体化工作台:你查一个 ASIN,系统自动给你推 10 个相似候选 + 风险标签 + Listing 草稿。这背后就是 5 个阶段的算法迭代。
二、阶段 1:规则系统(2010 - 2015)
score = 0.4 * monthly_revenue
+ 0.3 * growth_rate
+ 0.2 * review_growth
+ 0.1 * competition_index
最早期的”算法”其实就是加权打分。选品工具读取亚马逊公开数据(销量榜单、BSR、评论增速),按预设权重算一个总分。
优点:可解释、可调参、上线快。 缺点:完全依赖人工经验,无法发现隐式关联(例如”卖宠物玩具的店都同时卖自动喂食器”这种相关品类)。
ApexPicker 早期 v1.0 也是这么做的,依然保留了作为冷启动 baseline。
三、阶段 2:协同过滤(2015 - 2018)
协同过滤(Collaborative Filtering)的核心假设:相似的人喜欢相似的东西。
迁移到选品场景:
- 把”卖家”看作用户 → “商品”看作 item
- 把”卖家关注过的 ASIN”看作隐式反馈
- 用矩阵分解(MF / SVD++)算出每个 ASIN 的隐向量
# 伪代码
P, Q = matrix_factorize(R_user_item, k=64)
item_embedding = Q # 每个 ASIN 一个 64 维向量
这一代选品系统能推荐”相似 ASIN”,但有 2 个硬伤:
- 冷启动:新 ASIN 没有用户行为数据,推不出来
- 长尾稀疏:5000 万 + 商品里大部分没有用户交互,主推的还是头部
四、阶段 3:深度学习双塔模型(2018 - 2021)
YouTube 在 2016 年那篇著名的 Deep Neural Networks for YouTube Recommendations 把双塔(Two-Tower)模型带火了。选品系统也跟进:
- Query Tower:卖家输入(关键词、类目、价格区间)→ 64 维向量
- Item Tower:商品侧特征(标题、描述、类目、品牌)→ 64 维向量
- 训练目标:让相关商品的 dot-product 尽量大
q_vec = query_tower(query_features)
i_vec = item_tower(item_features)
logit = dot(q_vec, i_vec)
loss = cross_entropy(logit, label_relevance)
优点:能融合文本、图片、销量、趋势等多模态特征,效果比协同过滤好一大截。 缺点:每个商品仍然是一个孤立向量,没有商品之间的关联结构。
五、阶段 4:多模态学习(2021 - 2023)
这一阶段大家意识到:Listing 标题、搜索词、主图、评论文本 都是非结构化信号,用 BERT / ViT 提特征后送进双塔,效果再次提升。
我们 RD001 的 v2.0 阶段(2022 - 2023)就是基于多模态学习的:
- 用 BERT 提取 Listing 标题和评论的语义向量
- 用 ViT 提取主图的颜色 / 形状 / 文字布局向量
- 把销量、趋势、价格区间当结构化特征拼接进 Item Tower
但还是没解决关联建模的问题 —— 多模态只是把每个商品表示得更好,并没有建模”商品之间的关系”。
六、阶段 5:图神经网络 GNN(2024 - 现在)
这一代选品系统最大的变化是:把商品看成一个图,而不是一堆孤立向量。
6.1 选品图长什么样?
我们 RD001 把”商品”和它的属性都当成图节点:
节点类型:
- 商品(ASIN)
- 类目(Category)
- 品牌(Brand)
- 卖家(Merchant)
- 关键词(Keyword)
边类型(来自真实共现关系):
- 商品 ↔ 类目(属于)
- 商品 ↔ 品牌(出品)
- 商品 ↔ 卖家(在售)
- 商品 ↔ 关键词(出现在搜索结果 / Listing)
- 商品 ↔ 商品(共现购买、相似 Listing)
6.2 用 GNN 学什么?
我们用 RGCN(Relational Graph Convolutional Network) 做节点嵌入学习:
class RGCNLayer(nn.Module):
def forward(self, h, edge_index, edge_type):
# 对每种关系类型分别做消息传递
out = 0
for r in range(num_relations):
mask = (edge_type == r)
out += self.W[r] @ self.message_passing(h, edge_index[:, mask])
return F.relu(out)
学完之后,每个 ASIN 的向量就带有高阶关联信息:
- 同品牌其他 ASIN 的销量趋势
- 同类目相邻 ASIN 的竞争密度
- 共同购买 / 共同关注的关联强度
6.3 为什么 GNN 选品更准?
可解释:可以回溯”为什么推荐这个 ASIN”,因为能列出传播路径。
抗稀疏:冷启动新 ASIN 通过”商品 ↔ 类目 ↔ 关键词”的多跳传播拿到非零向量。
捕捉关联:卖家精灵 / Helium 10 主要还是双塔体系,没建模商品之间的关系 —— 这是我们 ApexPicker v3.0 的差异化核心。
七、ApexPicker 工程实践:多源数据 + GNN
ApexPicker 是 RD001(ApexPicker 智能选品,150 万元预算)的直接产出。我们 10+ 人团队从 2026 年 4 月立项,目标是把 GNN 选品从论文搬到生产环境。
7.1 数据层
- 亚马逊:官方 SP-API + 10 个站点的公开榜单
- Keepa:历史 BSR / 价格 / 评论趋势
- 品牌方:自维护的品牌数据库(商标、专利、外观)
- 第三方:海关、专利局、商标局公开数据
7.2 特征层
- 结构化:销量、价格、BSR、库存
- 文本:Listing / 评论 / 问答(BERT-base-multilingual)
- 图像:主图 / 场景图(ViT-base)
7.3 模型层
- 第一版(2026 Q2 - Q3):BERT + 双塔基线,对齐主流通用方案
- 第二版(2026 Q3 - 2027 Q1):RGCN 多源融合,探索高阶关联
- 第三版(2027 Q1 - Q3):在线学习 + 强化学习排序上线
7.4 工程层
- 云原生微服务(与 RD003 跨境电商 SaaS 平台共用基础架构)
- K8s + GPU 推理集群
- GDPR / PIPL / Amazon Data Policy 三重合规框架保障
- 详细合规说明见 [
/trust](/trust)
八、数据合规:选品推荐绕不开的 3 重框架
跨境电商 SaaS 容易踩合规红线。ApexPicker 的 3 重保险:
- GDPR(欧盟):用户授权、数据最小化、删除权、跨境传输走 SCC 合同
- PIPL(中国):境内用户数据境内存储、隐私政策合规
- Amazon Data Policy:仅采集公开市场数据,账号隔离,避免关联风险
合规是选品工具的护城河之一,详细披露见 信任中心。
九、给卖家的实操建议
如果你正在选品工具:
- 别只看分数,看解释:规则系统的可解释性反而是优势
- 多源交叉验证:单一数据源(无论 Jungle Scout 还是 Helium 10)都有盲点
- 关注”商品之间的关系”:这是下一代选品系统的关键差异化
如果你正在做选品工具:
- 别只做双塔:GNN 已经能跑了,工程化工作量远小于首次设计双塔
- 合规先行:跨境数据从 Day 1 就要考虑 GDPR / PIPL
- 可解释是产品力:卖家买的是”决策建议”,不是”分数排序”
十、写在最后
我们做 ApexPicker 不只是为了”再做一个 Helium 10”,而是想把 10 年一线卖家的实战经验编码进算法。选品推荐的下一步,是人机协同:算法给候选和关联,卖家给业务直觉。
继续迭代的路线图:
- 2026 Q4:GNN v2 上线,A/B 测试对比双塔基线
- 2027 Q1:多语言 Listing 写作模块与 GNN 协同
- 2027 目标:申请科技型中小企业(科小)入库,对应软著下证
相关阅读:
- [
/apexpicker](/apexpicker):ApexPicker 选品系统产品主页 /technology:技术架构总览(3 个 R&D 项目详情)- [
/trust](/trust):信任中心(数据合规 / IP / 资质申报路径) - 关于李建成(CTO)
—— 李建成,ApexPicker CTO,2026.08.10