目录

系列文章目录

前言

一、预备知识

二、推荐系统模型架构

1、基于内容的过滤(CBF)

2、协同过滤(CF)

三、模型评估与优化方法论

四、增强LF-CF的可解释性

五、局限性

总结


系列文章目录

1. 资金流动与价格形成 - Deciphering How Investors’ Daily Flows are Forming Prices

2. 债券推荐系统 - Recommender Systems for Corporate Bond Trading


前言

本文章所属系列:

《Machine Learning and Data Sciences for Financial Markets: A Guide to Contemporary Practices》文章解读。

该书是由Agostino Capponi和Charles-Albert Lehalle联合主编的学术著作,由剑桥大学出版社于2023年8月出版。

该书整合60余位领域专家的研究成果,涵盖金融机器学习的前沿实践,旨在桥接传统量化金融与现代数据科学,系统探讨机器学习在金融市场的应用。


Recommender Systems for Corporate Bond Trading位于原书110-121页,隶属于该书第一大板块。

文章采用机器学习的建模方法,基于隐式反馈处理和矩阵分解优化,比较并提出了最优的推荐系统技术分析客户的历史报价请求(RFQ)数据,构建预测模型。

该模型及算法可以用于智能顾投(robo advising)业务。

阅读难度:★★☆☆☆(本科/高年级水平)


一、预备知识

  • 历史报价请求/RFQ/Requests for Quote

在公司债券业务中,做市商需要处理来自客户的大量请求,这些请求通常以电子查询(RFQ)的形式出现。(其格式)如图 5.1

简而言之,RFQ包括客户标识、债券标识、数量、方向,都可以在建模中作为变量出现。笔者注。

  • 基于内容的过滤(CBF) 

基于内容的过滤方法(Lops 等人,2011 年)会为用户和项目创建特征描述,以确定其性质,然后通过基于特征描述之间相似度的指标来尝试匹配用户与项目。在债券市场交易业务的背景下,每支债券都可以通过一组经济特征来描述,而每个客户则可以通过他们过去感兴趣债券的特征来描述。

  •   协同过滤(CF)

 协同过滤(CF)(Goldberg 等人,1992 年)仅利用用户的过去行为来检测对项目具有相似偏好的用户。例如,在特定情况下,通过了解客户过去查询的债券情况,可以推断出客户与债券之间的相互关系,从而为新的客户-债券对找到潜在的关联。

 具体的建模和算法会在后文提及,读者也可以自行了解。笔者注。


二、推荐系统模型架构

本章比较了两类主流推荐技术:基于内容的过滤(CBF)和协同过滤(CF),并针对企业债券场景进行适配优化。

1、基于内容的过滤(CBF)

前者的核心思想是利用债券的静态特征与客户历史行为特征的相似性进行匹配。

债券特征向量包含类别型数据(如发行区域、行业、是否可赎回)和数值型数据(如到期期限、票面利率),其中数值特征通过分箱离散化处理。

客户特征向量通过历史RFQ统计生成,同样包括数值特征和类别特征。数值特征取交易频率分布,类别特征取最高频取值。

两个向量的所有特征都需要一一对应,不然以下的计算无意义。笔者注。

偏好预测通过伪内积运算实现,其本质是计算特征重合度。表述如下:

为简化公式阅读,读者可以构建客户-x-u、债券-y-i的对应关系。伪内积无一般定义,在此指逐元素(element-wise)内积的和。总之,通过伪内积表示特征重合度是符合直觉的。笔者注。

为进一步提升精度,模型引入特征权重向量,得到加权伪内积(weighted pseudo inner product)

在模型训练过程中,采用最小二乘的思路,最小化预测值和真值的差距,得到带正则化的岭回归优化目标函数(即损失函数)

该损失函数包含两项关键设计:

(1)偏好标签定义为二元变量(交易过为1,否则为0);

直观理解,结果是预测一个user-item interaction matrix。笔者注。

(2)置信度(confidence)为。该置信度将客户u在债券i上的历史交易名义金额总和作为兴趣强度的量化指标(代理变量)。

大的r值对应大的c值,意味着在损失函数中权重更高,模型对这组u-i对应关系的兴趣强度更高。此设计源于隐式反馈的经典处理(Hu et al. 2008)。在Netflix等场景,类似角色由“观看时长”或“点击次数”扮演,金融场景则用“交易金额”这一天然强度指标。笔者注。

通过求解闭式解(岭回归存在显示解),最终预测分数为:

可基于这组分数进行排序、推荐。

2、协同过滤(CF)

后者的实现无需显式特征工程,而完全依赖用户-债券交互矩阵

该矩阵就是CBF方法得到的u-i矩阵,在CBF方法中不对行列的元素是1或0做探讨,但在CF方法会做探讨,行列的重合度表示相似度,这也是符合直觉的。笔者注。

论文探索了两种实现路径:

  • 邻域模型

通过余弦相似度计算客户间或债券间的相似性。

此公式表示债券i和债券j的相似度,客户相似度是类似的,在此不赘述。笔者注。

例如项目导向邻域模型(I-NCF)根据债券相似度加权预测兴趣,类似"购买了A债券的客户也可能对相似债券B感兴趣"。

邻域模型非常简单,但无法学习跨债券/客户的隐性关联,因此难以捕捉全局隐含模式;计算复杂度随数据量平方增长,且在长尾分布等分布中计算不稳定。因此很早就被弃用了。笔者注。

  • 潜在因子模型(LF-CF) 

为了学习跨债券/客户的隐形关联,以及实现高维数据降维,潜在因子模型(Latent Factor Collaborative Filter)通过(因子)矩阵分解挖掘隐性关联。

需要数据降维(信息压缩)是因为交互矩阵往往是高维稀疏的。在教材或者文章中出现的“矩阵分解”方法,即因子模型方法。笔者注。

其优化目标为:

其中,分别表示客户u和债券iK维因子矩阵。其余的参数和CBF方法的优化问题中的相同。

采用交替最小二乘(ALS)算法迭代求解:固定债券因子优化客户因子,再反向迭代直至收敛,预测分数由因子向量内积给出。

因子模型依旧不复杂,其难度在于实现业务场景中的高效计算。

文章针对该痛点提出三重优化:

  1. 共轭梯度法替代矩阵求逆,将复杂度从 O(K^3)降至O(mn_I) ;
  2. 分解置信矩阵,利用稀疏性降低计算量;
  3. 多线程并行处理客户/债券更新。Cython实现使千万级数据训练在普通桌面机仅需秒级,突破学术模型的落地障碍。

夹带私货。笔者注。


三、模型评估与优化方法论

为确保推荐效果可量化比较,文章设计了严谨的测试框架。

评估指标选用AUC-ROC曲线,其本质是衡量推荐排序的质量:从高到低遍历推荐列表时,计算真正例率(TPR)与假正例率(FPR)的轨迹。

超参数调优采用网格搜索与k折交叉验证。具体策略包括:

  • 将数据集按80%(训练)、10%(验证)、10%(测试)划分

  • CBF需优化正则化强度和置信权重

  • 邻域CF需确定最优近邻数

  • LF-CF额外增加潜在因子维度的三维搜索

实证结果显示:协同过滤显著优于内容过滤,其中LF-CF的AUC最高。

文章实证部分的书写较粗糙,没有提及测试所用数据及具体的测试结果。笔者注。

这验证了金融场景中推荐系统的独特性——债券间的隐性关联(如相似客户群体偏好)比显式特征更能驱动交易兴趣。

这个结论有一点反直觉。但总之,这个结论可以将金融场景下的推荐系统的重心确立为对客户隐式连接的探究,比如客户网络模型、客户深层聚类等,可以进一步应用RNN等方法。笔者注。

文章提到,LF-CF的优势部分源于其隐式处理"长尾"能力:通过因子向量共享信息,稀疏交易的债券仍可被关联到热门债券簇。

个人认为金融场景下的推荐系统无法与购物、游戏平台的推荐系统作类比,因为金融场景下的信息完整度较低,而信息不对称程度极高,导致构造完整的、有效的显示特征难度极高,从而导致了CBF方法的失效。

但是,恰恰因为金融市场的集聚效应和信息不对称,针对个体客户的方案很可能不适用于机构、大型投资者,需要进一步的实验,感兴趣的读者可以自行了解。笔者注。


四、增强LF-CF的可解释性

在实际业务场景,LF-CF的"黑盒"特性是业务落地的痛点,因为领导和客户往往需要理由。

因为因子不可被观测,在多数情况下也不可被解释。笔者注。

为此,文章创新性融合CBF与LF-CF构建可解释框架:

  1. 重建兴趣矩阵:将LF-CF预测分数作为软标签,替换原始二元交互矩阵

  2. 训练解释模型:基于新矩阵重新求解CBF的权重向量

  3. 特征归因分析

用归一化权重的特征重要性代表客户画像

与原本的CBF方法相同,特征贡献度揭示客户u购买债券i的驱动因素:

在下面的例子中,某客户偏好欧元区金融债(这是客户画像)。在某次成功的推荐中他购买了该类债券,是较大地因为"欧元货币"这个特征(这是驱动因素)。

该方法本质是"事后可解释AI",在保持LF-CF预测性能的同时,生成业务可用的叙事逻辑。其思想类似于LIME(Local Interpretable Model-agnostic Explanations),但通过领域适配实现了更高效率:直接复用CBF框架,避免额外训练局部代理模型。

如果不想复用,就可以加一个神经网络,套一个因子模型进去,效果是一样的。笔者注。


五、局限性

文章提到,LF-CF方法的局限性体现在两个方面:

  • 冷启动问题:新债券需积累交互数据才能被推荐。

  • 解释性依赖混合框架:纯LF-CF缺乏业务可用的叙事逻辑(已做出改进)。


总结

本篇文章为模型测试的论文,不涉及复杂理论推导,数据、建模、算法较为简单、结论明确且基本正确,适合金融机器学习相关专业和领域的初学者进行阅读学习。


更多的文章请关注该文章解读系列,我会持续更新。

欢迎各位读者在评论区交流讨论。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐