选品推荐算法演进:从规则到图神经网络 - ApexPicker RD001 技术解析
选品算法 图神经网络 GNN ApexPicker 推荐系统 跨境电商 RD001

选品推荐算法演进:从规则到图神经网络 - ApexPicker RD001 技术解析

李建成
选品推荐算法演进:从规则到图神经网络 - ApexPicker RD001 技术解析

选品推荐算法演进:从规则到图神经网络

我们做亚马逊选品工具做了 10 年,见过太多算法迭代。本文把选品推荐这件事拆成 5 个阶段讲清楚:规则系统 → 协同过滤 → 深度学习双塔 → 多模态学习 → 图神经网络(GNN)。最后落到我们自己在 [RD001 ApexPicker](/technology#rd001) 上的工程实践。

一句话总结:选品推荐的核心矛盾,从”算分高低”变成了”算关联强弱”。图神经网络(GNN)之所以成为 2024 年之后的主流选品方案,是因为它能直接建模”商品 ↔ 类目 ↔ 品牌 ↔ 卖家”之间的高阶关联,而不是把每个商品当成孤立向量。


一、为什么”选品”本身就是一个推荐问题?

很多人以为”选品”就是”查销量、查 ASIN、查关键词”。这其实是查表,不是推荐

查表回答的问题是:“这个 ASIN 卖得怎么样?” 推荐回答的问题是:“现在应该选什么方向、按什么价位区间、用什么打法?”

后者更接近真正的”决策辅助”。这正是 ApexPicker 想做的事 —— 把查询工具升级为决策工作台

选品推荐的 3 个特征

维度查表工具推荐系统
输入关键词 / ASIN多源数据 + 用户上下文
输出单点数据候选集 + 排序 + 解释
反馈在线学习 / A/B
典型代表Jungle Scout、Helium 10ApexPicker、卖家精灵(高级版)

我们 2026 年的目标,是把”查表”和”推荐”做成一体化工作台:你查一个 ASIN,系统自动给你推 10 个相似候选 + 风险标签 + Listing 草稿。这背后就是 5 个阶段的算法迭代。


二、阶段 1:规则系统(2010 - 2015)

score = 0.4 * monthly_revenue
      + 0.3 * growth_rate
      + 0.2 * review_growth
      + 0.1 * competition_index

最早期的”算法”其实就是加权打分。选品工具读取亚马逊公开数据(销量榜单、BSR、评论增速),按预设权重算一个总分。

优点:可解释、可调参、上线快。 缺点:完全依赖人工经验,无法发现隐式关联(例如”卖宠物玩具的店都同时卖自动喂食器”这种相关品类)。

ApexPicker 早期 v1.0 也是这么做的,依然保留了作为冷启动 baseline。


三、阶段 2:协同过滤(2015 - 2018)

协同过滤(Collaborative Filtering)的核心假设:相似的人喜欢相似的东西

迁移到选品场景:

  • 把”卖家”看作用户 → “商品”看作 item
  • 把”卖家关注过的 ASIN”看作隐式反馈
  • 用矩阵分解(MF / SVD++)算出每个 ASIN 的隐向量
# 伪代码
P, Q = matrix_factorize(R_user_item, k=64)
item_embedding = Q  # 每个 ASIN 一个 64 维向量

这一代选品系统能推荐”相似 ASIN”,但有 2 个硬伤:

  1. 冷启动:新 ASIN 没有用户行为数据,推不出来
  2. 长尾稀疏:5000 万 + 商品里大部分没有用户交互,主推的还是头部

四、阶段 3:深度学习双塔模型(2018 - 2021)

YouTube 在 2016 年那篇著名的 Deep Neural Networks for YouTube Recommendations 把双塔(Two-Tower)模型带火了。选品系统也跟进:

  • Query Tower:卖家输入(关键词、类目、价格区间)→ 64 维向量
  • Item Tower:商品侧特征(标题、描述、类目、品牌)→ 64 维向量
  • 训练目标:让相关商品的 dot-product 尽量大
q_vec = query_tower(query_features)
i_vec = item_tower(item_features)
logit = dot(q_vec, i_vec)
loss = cross_entropy(logit, label_relevance)

优点:能融合文本、图片、销量、趋势等多模态特征,效果比协同过滤好一大截。 缺点:每个商品仍然是一个孤立向量,没有商品之间的关联结构。


五、阶段 4:多模态学习(2021 - 2023)

这一阶段大家意识到:Listing 标题、搜索词、主图、评论文本 都是非结构化信号,用 BERT / ViT 提特征后送进双塔,效果再次提升。

我们 RD001 的 v2.0 阶段(2022 - 2023)就是基于多模态学习的:

  1. 用 BERT 提取 Listing 标题和评论的语义向量
  2. 用 ViT 提取主图的颜色 / 形状 / 文字布局向量
  3. 把销量、趋势、价格区间当结构化特征拼接进 Item Tower

但还是没解决关联建模的问题 —— 多模态只是把每个商品表示得更好,并没有建模”商品之间的关系”。


六、阶段 5:图神经网络 GNN(2024 - 现在)

这一代选品系统最大的变化是:把商品看成一个图,而不是一堆孤立向量

6.1 选品图长什么样?

我们 RD001 把”商品”和它的属性都当成图节点:

节点类型:
- 商品(ASIN)
- 类目(Category)
- 品牌(Brand)
- 卖家(Merchant)
- 关键词(Keyword)

边类型(来自真实共现关系):
- 商品 ↔ 类目(属于)
- 商品 ↔ 品牌(出品)
- 商品 ↔ 卖家(在售)
- 商品 ↔ 关键词(出现在搜索结果 / Listing)
- 商品 ↔ 商品(共现购买、相似 Listing)

6.2 用 GNN 学什么?

我们用 RGCN(Relational Graph Convolutional Network) 做节点嵌入学习:

class RGCNLayer(nn.Module):
    def forward(self, h, edge_index, edge_type):
        # 对每种关系类型分别做消息传递
        out = 0
        for r in range(num_relations):
            mask = (edge_type == r)
            out += self.W[r] @ self.message_passing(h, edge_index[:, mask])
        return F.relu(out)

学完之后,每个 ASIN 的向量就带有高阶关联信息

  • 同品牌其他 ASIN 的销量趋势
  • 同类目相邻 ASIN 的竞争密度
  • 共同购买 / 共同关注的关联强度

6.3 为什么 GNN 选品更准?

可解释:可以回溯”为什么推荐这个 ASIN”,因为能列出传播路径。

抗稀疏:冷启动新 ASIN 通过”商品 ↔ 类目 ↔ 关键词”的多跳传播拿到非零向量。

捕捉关联:卖家精灵 / Helium 10 主要还是双塔体系,没建模商品之间的关系 —— 这是我们 ApexPicker v3.0 的差异化核心。


七、ApexPicker 工程实践:多源数据 + GNN

ApexPicker 是 RD001(ApexPicker 智能选品,150 万元预算)的直接产出。我们 10+ 人团队从 2026 年 4 月立项,目标是把 GNN 选品从论文搬到生产环境。

7.1 数据层

  • 亚马逊:官方 SP-API + 10 个站点的公开榜单
  • Keepa:历史 BSR / 价格 / 评论趋势
  • 品牌方:自维护的品牌数据库(商标、专利、外观)
  • 第三方:海关、专利局、商标局公开数据

7.2 特征层

  • 结构化:销量、价格、BSR、库存
  • 文本:Listing / 评论 / 问答(BERT-base-multilingual)
  • 图像:主图 / 场景图(ViT-base)

7.3 模型层

  • 第一版(2026 Q2 - Q3):BERT + 双塔基线,对齐主流通用方案
  • 第二版(2026 Q3 - 2027 Q1):RGCN 多源融合,探索高阶关联
  • 第三版(2027 Q1 - Q3):在线学习 + 强化学习排序上线

7.4 工程层

  • 云原生微服务(与 RD003 跨境电商 SaaS 平台共用基础架构)
  • K8s + GPU 推理集群
  • GDPR / PIPL / Amazon Data Policy 三重合规框架保障
  • 详细合规说明见 [/trust](/trust)

八、数据合规:选品推荐绕不开的 3 重框架

跨境电商 SaaS 容易踩合规红线。ApexPicker 的 3 重保险:

  1. GDPR(欧盟):用户授权、数据最小化、删除权、跨境传输走 SCC 合同
  2. PIPL(中国):境内用户数据境内存储、隐私政策合规
  3. Amazon Data Policy:仅采集公开市场数据,账号隔离,避免关联风险

合规是选品工具的护城河之一,详细披露见 信任中心


九、给卖家的实操建议

如果你正在选品工具:

  1. 别只看分数,看解释:规则系统的可解释性反而是优势
  2. 多源交叉验证:单一数据源(无论 Jungle Scout 还是 Helium 10)都有盲点
  3. 关注”商品之间的关系”:这是下一代选品系统的关键差异化

如果你正在做选品工具:

  1. 别只做双塔:GNN 已经能跑了,工程化工作量远小于首次设计双塔
  2. 合规先行:跨境数据从 Day 1 就要考虑 GDPR / PIPL
  3. 可解释是产品力:卖家买的是”决策建议”,不是”分数排序”

十、写在最后

我们做 ApexPicker 不只是为了”再做一个 Helium 10”,而是想把 10 年一线卖家的实战经验编码进算法。选品推荐的下一步,是人机协同:算法给候选和关联,卖家给业务直觉。

继续迭代的路线图:

  • 2026 Q4:GNN v2 上线,A/B 测试对比双塔基线
  • 2027 Q1:多语言 Listing 写作模块与 GNN 协同
  • 2027 目标:申请科技型中小企业(科小)入库,对应软著下证

相关阅读:

—— 李建成,ApexPicker CTO,2026.08.10

分享到微信

扫描二维码分享到微信