构建的中文多模态 RAG 系统,在处理带表格的 PDF 文档时生成答案遗漏关键数据或捏造数字
已解决发表于2026-01-03 20:20:48
0 查看
系统构建了一个多模态 RAG 流程:
- 文档解析:使用
Unstructured.io + OCR(PaddleOCR) 提取 PDF 中的文本与表格; - 向量化:将每段文本/表格单元格嵌入为向量(
bge-m3 模型); - 检索:用户提问(如“请列出 2023 年各季度净利润”)→ 向量检索 Top-5 片段;
- 生成:将检索结果拼接为 prompt,送入 Llama-3-8B(vLLM 部署)生成答案。
测试发现:
- 检索阶段返回的片段确实包含正确表格(如“Q1: 1.2亿, Q2: 1.5亿…”);
- 但 Llama-3-8B 生成的答案常出现:
- 遗漏:只提 Q1 和 Q3,跳过 Q2/Q4;
- 捏造:将“1.2亿”写成“1.8亿”;
- 混淆:把 A 公司数据套用到 B 公司;
- 相同 prompt 在 Claude 3 Haiku 上输出准确;
- 增加
temperature=0.1、max_tokens=500 无效; - 将表格转为 Markdown 格式后输入,问题依旧。
本帖最后由 匿名用户 于 2026/01/04 09:20:54 编辑
系统构建了一个多模态 RAG 流程:
Unstructured.io+OCR(PaddleOCR)提取 PDF 中的文本与表格;bge-m3模型);测试发现:
temperature=0.1、max_tokens=500无效;