Automated Summarization of Financial News Using Large Language Models and Retrieval-Augmented Generation: An Early Empirical Study (Fall 2023): 用 LLM 处理海量财经资讯

Automated Summarization of Financial News Using Large Language Models and Retrieval-Augmented Generation: An Early Empirical Study (Fall 2023): 用 LLM 处理海量财经资讯

Marcus Chen
147
original

乔治华盛顿大学的一项早期研究验证了用大语言模型自动摘要金融新闻的可行性,对比了两类摘要流程和多个开源模型,发现 Falcon-7B 配合 Summarize Chains 效果最佳,而 RAG 在小模型上容易产生重复和幻觉。

股票分析师的一天通常从几百条公司新闻开始。这些内容分散在多个平台,读一遍不现实,跳过去又怕漏掉影响判断的关键信息。乔治华盛顿大学 2023 年秋季的一篇 arXiv 论文,试图回答一个很实际的问题:大语言模型能不能替人把这活干了?

一个由公开数据搭起来的实验

研究的路子并不复杂,但每一步都踩在真实场景上。他们用 News API 抓取上市公司新闻,从 Wikipedia 取公司背景,再拉取 Yahoo Finance 的股价数据,覆盖了 AAPL、MSFT、GOOGL、AMZN 等十家大型公司。

一个细节值得留意:LLM 本身不擅长直接处理数字表格。研究者写了一个简单的模板,把股价涨跌、成交区间等数据转换成自然语言描述,再喂给模型。这个思路很务实,等于是给模型铺了一条理解数值信息的捷径。

两类摘要流程,三个开源模型

实验对比了两种摘要组织方式:Summarize Chains(按顺序逐条摘要并汇总)和 检索增强生成(RAG),后者用 FAISS 做向量检索。模型方面则选了三款开源模型——Falcon-7B-InstructDistilBART-CNN-12-6BART-Large-XSum,股票摘要另用 GPT-3(text-davinci-003)生成。

结果很清楚:Falcon-7B 配合 Summarize Chains 效果最好,事件覆盖准确,文字也连贯。相比之下,RAG 在理论上很有吸引力,实际跑起来却暴露了明显缺陷——当检索数量 k 增大时,Falcon 出现严重重复,BART-Large-XSum 甚至开始编造事实。这种幻觉现象在小模型上尤其明显。

RAG 原本是想给模型提供更多上下文,结果反而是“喂太多”把模型带偏了。

一个被反复验证的教训

论文还做了一个基础对照:直接取新闻前几句的 Lead-3 基线。结果显示,两种 LLM 方法在 ROUGE-1 指标上都明显压过基线,说明即便存在幻觉问题,大模型自动摘要仍然比“截取开头”更接近人工总结。

这个研究的价值不在于展示了多惊艳的准确性,而在于它记录了失败模式。论文写于 2023 年,那时 RAG 在金融场景还没有普及,但之后大量金融摘要工具都走了类似路线。“检索越多,幻觉越重”这个现象,对今天仍在用中小模型做 RAG 的开发者来说依然有参考意义。

值得关注的几个要点

  • 模型越大不一定是关键,流程设计(如 Summarize Chains)对结果影响更直接。
  • RAG 的检索数量需要谨慎调参,盲目增加上下文反而可能降低输出质量。
  • 把结构化数据预处理成自然语言模板,是让 LLM 理解金融数据的有效手段。

论文还附带了一个 Streamlit 仪表盘,用于交互式股票数据可视化。虽然这更像是研究配套,但说明实验整体把“可用性”也考虑进去了。作为 2023 年的早期实证,它倒是给后来者留下了一组相当诚实的试验记录。

金融新闻摘要LLM检索增强生成RAG学术论文自动摘要Falcon-7B金融AI实证研究

分享

评论

0
0/500 字符

暂无评论

成为第一个评论的人

探索更多