百万笔交易中的“幽灵”猎手:一个基于无监督聚类的资本市场操纵检测框架导读
“A Clustering-Based Framework for Identifying Suspicious Trading Patterns in Capital Market”
在波谲云诡的股票市场中,有一种无形的“幽灵”在游荡——市场操纵者利用虚假申报、拉高出货、内幕交易等手段,在短时间内攫取暴利,却严重侵蚀了普通投资者的信任与市场的公平性。传统的监管手段如同大海捞针,面对海量、复杂且不断演变的交易数据,常常显得力不从心。
来自孟加拉国美国国际大学的研究团队,开发了一套名为“SMMD”的智能检测框架。该框架如同一位不知疲倦的“幽灵猎手”,无需人工标注数据,便能自动学习并识别异常交易模式。其核心武器是“K-Means++”聚类算法,它像一位经验丰富的侦探,将市场上的常规交易与可疑行为精准区分。
研究团队对2012年至2024年间约一百万笔交易数据进行了“体检”,最终标记出2.02%的交易为可疑。其中,超过一半是意图制造虚假供求假象的“虚假申报”,另有少量“拉高出货”和“内幕交易”行为。该模型以0.561的轮廓系数证明了其有效性,为全球市场,尤其是新兴市场的监管机构,提供了一套高效、可扩展的技术解决方案,有望让金融市场的“幽灵”无处遁形。

【 扫描文末二维码加入星球获取论文 】
摘要
本文提出了一种基于无监督学习的资本市场操纵检测框架,旨在识别和分类股票市场中的可疑交易行为。市场操纵(如通过人为操纵股价以快速获利)严重损害了交易平台的公信力,而传统的监管方法和有监督机器学习模型因依赖标注数据和预定义模式,难以应对复杂多变的欺诈活动。
为解决这一问题,研究团队开发了一个无监督欺诈检测工具包,核心采用K-Means++聚类算法。研究使用了2012年至2024年间约一百万笔金融交易数据。通过构建基于聚类的分析流水线,并利用市场实践中的启发式阈值,该方法成功识别出2.02%的交易为可疑交易。其中,51.10% 指向“虚假申报”(Spoofing),0.10% 指向“拉高出货”(Pump and Dump),0.55% 指向“内幕交易”(Insider Trading),1.43% 指向“虚假突破”(Fake Breakout),另有46.83% 的交易无法归类。尽管缺乏真实标注数据,模型仍通过轮廓系数(Silhouette Score)0.561 验证了其性能。
简介
每个国家的基础设施都高度依赖其经济状况,而股票市场是经济增长的关键组成部分。随着新产品和趋势塑造市场,股票市场也在不断演变。以孟加拉国为例,尽管金融素养有所提高,但达卡证券交易所(DSE)的参与度仍然较低。由于投资者不信任、预期风险以及过往的市场欺诈事件,市场增长依然缓慢。由于DSE与国际市场隔绝,其在危机时期(如COVID-19)的增长尤为受限。孟加拉国股票市场表现出剧烈的波动性,宏观经济因素(如通货膨胀、利率、汇率和外部冲击)对其产生了显著影响。内幕交易和操纵等问题严重损害了投资者信心,并阻碍了长期经济进步。
传统监管和有监督机器学习方法由于依赖标注数据和预定义模式,常常无法识别金融市场中复杂的欺诈活动。相比之下,K-Means聚类在欺诈检测中展现出潜力,能够快速分类常规和可疑交易。因此,研究迫切需要一个轻量级、无监督、基于聚类的欺诈检测框架,能够自适应地从不断变化的市场数据中识别可疑交易行为。本研究的目标是开发一个通用流水线,能够检测历史股票交易数据中潜在的市场操纵行为。
本研究的主要贡献包括:
提出可扩展的无监督框架:整合了基于聚类的结构异常检测与行为金融学启发式规则,构建了股票市场操纵检测(SMMD)框架。
提取技术指标:利用30天滚动窗口提取了九个技术指标,以捕捉异常交易行为的时间模式。
算法性能验证:通过对比,K-Means在准确率(0.987)、轮廓系数(0.965)和可扩展性方面优于DBSCAN、OPTICS和层次聚类,非常适合检测稀疏的欺诈交易模式。
提供可解释的欺诈分类:该分类与真实世界中的操纵模式(如虚假申报、拉高出货)相匹配。
提出自适应风险分类方法:基于百分位数进行自适应风险分类,并建立了个股级别的可疑评级系统。
开发混合异常过滤系统:结合了基于百分位数的行为标准和基于距离的异常值检测,以减少误报。
相关工作
传统监督学习在欺诈检测中的局限性,无监督学习相对监督学习具有优势。
Zengyi等人利用K-Means对实际交易数据进行财务欺诈识别,并使用主成分分析(PCA)进行数据简化。
Xuan Li等人(2024):引入SimCLR对比学习框架,在无监督情况下识别eBay交易数据中的异常活动。
Wenjie等人(2020):设计结合Conv1D和LSTM的深度学习模型,用于检测股票价格时间序列异常。
Li等人(2025):为亚太地区投资者在美国市场的异常交易开发集成机器学习框架,将错误率降低34.7%,AUC-ROC达到0.971。
Darwish等人(2025):提出多阶段混合方法,结合规则过滤、K-Means聚类、人工蜂群(ABC)优化和KNN分类,在电子商务数据集上达到95%的准确率。
方法
研究提出了一个无监督学习模型,用于分析2012年至2024年的每日股票数据。

数据预处理
将“日期”字段转换为正确的日期时间格式,并删除重复、错误和不完整的条目。使用dropna()删除含有缺失值的行,最终得到一个包含1,019,783行数据的干净数据集。
特征工程
为增强模型检测能力,研究人员从清理后的数据集中工程化出多个特征。利用30天滚动窗口生成九个新特征,以捕捉交易趋势和异常。无限的除法值被替换为NaN,然后再替换为默认值。所有特征在用于聚类异常检测前都进行了标准化处理。
特征缩放
使用StandardScaler对所有特征进行标准化,使其均值为0,标准差为1。这确保了所有特征对聚类过程贡献相等,提升了模型性能和稳定性。

模型训练
K-means++聚类算法:K-Means++是K-Means的流行变体,通过迭代选择分散的初始聚类中心,以最小化欧几里得距离平方和(SSEDM),从而更快收敛并避免局部最优。
使用肘部法确定K值:通过肘部法确定最佳聚类数k。从图中(原文档图2)可以看出,当k从2增加到6时,惯性(Inertia)显著下降,最终选择k=5。

K-Means++算法实现步骤:
使用肘部法确定k值。
随机初始化质心位置。
根据欧几里得距离将每个观测值分配给最近的质心,然后计算每个簇的质心。
当质心间的距离小于某个固定阈值时停止迭代,否则重复。
股票市场操纵检测(SMMD)

加载与清理:合并2010-2020和2021-2024年的数据,排除2010和2011年,删除缺失值。
特征计算:计算每日价格变化百分比(ΔP%)、日内价格范围(R)等。按股票代码分组,计算30天滚动平均值(V₃₀, T₃₀)、标准差(σ₃₀),以及峰值比率(S_V, S_T, S_Turn)和VWAP。
缩放与聚类:提取特征矩阵X,移除无穷大和NaN值后标准化得到X_s。使用K-Means(k=5)进行聚类,并预测每个数据点的簇归属。
异常检测:
计算每个点到其簇中心的欧几里得距离 d_i。
设定距离阈值 t_d 为距离的95百分位数。
设定交易量和交易笔数的峰值阈值 t_V, t_T 为95百分位数。
如果一个点同时满足:距离大于t_d,且价格变化绝对值大于10%或交易量峰值大于t_V或交易笔数峰值大于t_T,则标记为“可疑”。
风险与欺诈标记:
按股票代码分组,计算每只股票的可疑分数(Score = 可疑天数百分比 × 100)。
根据分数进行风险等级划分:>90为“严重风险”;75-90为“高风险”;50-75为“中等风险”;25-50为“低风险”;≤25为“最小风险”。
按日期排序,检查未来5天内的价格行为,以判断是否存在拉高出货、Rug Pull、虚假申报等模式。
评估:从数据集中抽样(最多10,000个样本)计算轮廓系数,并绘制欺诈类型分布图。
模型评估
轮廓系数 (Silhouette Score):用于评估聚类效果。得分范围从-1到+1,+1表示样本与自身簇内点紧密,且与其他簇相隔甚远。公式为:

异常检测结果
通过计算每个交易到其簇中心的距离来识别异常值,距离最远的5% 被标记为结构性异常。为了检测可疑交易,研究设定了行为阈值,包括交易量、交易笔数、成交额的95百分位数,以及超过10% 的价格波动。只有同时满足“距离远”和“至少一项行为异常”的交易才会被标记为可疑。最后,这些可疑交易会进入欺诈检测评分系统。
可疑股票评分
每只股票的可疑分数由欺诈频率和异常严重程度共同决定:

其中,F是标记的交易数,T是总交易数,PR(D)是异常距离的百分位数排名,α是频率的权重参数(研究中设为0.6),1-α是严重程度的权重参数(0.4)。
风险分类方法
根据计算出的可疑分数,将股票分为不同风险等级,如下表所示:


欺诈类型分类
标记的交易被归类为六种欺诈类型(原文档图5展示了前20个可疑股票的欺诈模式分布):
拉高出货 (Pump & Dump):价格在5天内快速上涨超过10%且伴随高交易量,随后价格下跌。
虚假申报 (Spoofing):高订单或交易量伴随轻微的价格波动。
Rug Pull:价格和交易量急剧上升,随后急剧下降。
内幕交易 (Insider Trading):在低交易量(小于1倍)的情况下,价格出现超过10%的急剧上涨。
虚假突破 (Fake Breakout):价格在高波动性下上涨超过10%,但在一周内反转。
未分类欺诈 (Unclassified Fraud):不符合以上任何模式。

欺诈类型分类标准
下表定义了用于分类的启发式规则:


欺诈交易可视化
研究将每只股票的收盘价与表示可疑交易的红点绘制在同一张图上(原文档图3、图4)。例如,UNILEVERCL(44.1%)、SQURPHARMA(22.1%)、ACI(19.3%)、MEGCONMILK(18.9%)等股票显示出不同的异常密度。该模型也被应用于印度国家证券交易所(NSE)的数据,以测试其在全球市场的有效性。


模型评估
利用轮廓系数作为主要评估指标。模型在达卡证券交易所(DSE)的数据上获得了0.561的得分,在印度国家证券交易所(NSE)的数据上获得了0.292的得分,表明聚类结构清晰且分离度良好。
结果总结
K-Means聚类模型表现良好,轮廓系数为0.561。2.02% 的交易被标记为可疑,这为识别DSE金融数据中的异常提供了合适的检测率。虚假申报(Spoofing)是最常见的欺诈类型,占比51.1%。该框架适用于全球范围内未标注的数据集,即使在孟加拉国不稳定的交易环境中也能有效工作。
总结
该系统能够检测、可视化并解释现实市场数据中的异常交易行为。它利用规则和聚类技术,对达卡证券交易所超过100万笔交易进行了检查,最终得到了2.02%的可疑识别率,轮廓系数为0.561。该模型在噪声大、不规则的数据上表现良好,并能有效处理全球数据,有助于为无结构的交易数据添加标签。
研究的不足之处在于缺乏确认的真实标注数据(Ground Truth)。此外,阈值可能无法很好地适应高度动态的市场。在计算可疑分数时,60/40的权重分配是一种启发式方法,可能需要根据不同的交易环境进行调整。该系统侧重于对异常股票收益进行分类,而非精确分类。
未来的改进方向包括采用更先进的聚类技术(如DBSCAN/HDBSCAN)和可扩展的实时处理能力。通过确保全球市场的稳定性和透明度,该系统有望为市场分析师和监管机构提供更有效、更灵活的工具。

我们致力于人工智能、量化交易领域前沿研究,分享前沿论文、模型代码、策略实现。如有相关需求,请私信与我们联系。
请加微信“LingDuTech163”,或公众号后台私信“联系方式”。
关注【灵度智能】公众号,获取更多AI资讯。