股票分析师的一天通常从几百条公司新闻开始。这些内容分散在多个平台,读一遍不现实,跳过去又怕漏掉影响判断的关键信息。乔治华盛顿大学 2023 年秋季的一篇 arXiv 论文,试图回答一个很实际的问题:大语言模型能不能替人把这活干了?
一个由公开数据搭起来的实验
研究的路子并不复杂,但每一步都踩在真实场景上。他们用 News API 抓取上市公司新闻,从 Wikipedia 取公司背景,再拉取 Yahoo Finance 的股价数据,覆盖了 AAPL、MSFT、GOOGL、AMZN 等十家大型公司。
一个细节值得留意:LLM 本身不擅长直接处理数字表格。研究者写了一个简单的模板,把股价涨跌、成交区间等数据转换成自然语言描述,再喂给模型。这个思路很务实,等于是给模型铺了一条理解数值信息的捷径。
两类摘要流程,三个开源模型
实验对比了两种摘要组织方式:Summarize Chains(按顺序逐条摘要并汇总)和 检索增强生成(RAG),后者用 FAISS 做向量检索。模型方面则选了三款开源模型——Falcon-7B-Instruct、DistilBART-CNN-12-6 和 BART-Large-XSum,股票摘要另用 GPT-3(text-davinci-003)生成。
结果很清楚:Falcon-7B 配合 Summarize Chains 效果最好,事件覆盖准确,文字也连贯。相比之下,RAG 在理论上很有吸引力,实际跑起来却暴露了明显缺陷——当检索数量 k 增大时,Falcon 出现严重重复,BART-Large-XSum 甚至开始编造事实。这种幻觉现象在小模型上尤其明显。
RAG 原本是想给模型提供更多上下文,结果反而是“喂太多”把模型带偏了。
一个被反复验证的教训
论文还做了一个基础对照:直接取新闻前几句的 Lead-3 基线。结果显示,两种 LLM 方法在 ROUGE-1 指标上都明显压过基线,说明即便存在幻觉问题,大模型自动摘要仍然比“截取开头”更接近人工总结。
这个研究的价值不在于展示了多惊艳的准确性,而在于它记录了失败模式。论文写于 2023 年,那时 RAG 在金融场景还没有普及,但之后大量金融摘要工具都走了类似路线。“检索越多,幻觉越重”这个现象,对今天仍在用中小模型做 RAG 的开发者来说依然有参考意义。
值得关注的几个要点
- 模型越大不一定是关键,流程设计(如 Summarize Chains)对结果影响更直接。
- RAG 的检索数量需要谨慎调参,盲目增加上下文反而可能降低输出质量。
- 把结构化数据预处理成自然语言模板,是让 LLM 理解金融数据的有效手段。
论文还附带了一个 Streamlit 仪表盘,用于交互式股票数据可视化。虽然这更像是研究配套,但说明实验整体把“可用性”也考虑进去了。作为 2023 年的早期实证,它倒是给后来者留下了一组相当诚实的试验记录。











评论
暂无评论
成为第一个评论的人