构建的中文多模态 RAG 系统,在处理带表格的 PDF 文档时生成答案遗漏关键数据或捏造数字
收藏回复举报
构建的中文多模态 RAG 系统,在处理带表格的 PDF 文档时生成答案遗漏关键数据或捏造数字
t('forum.solved') 已解决
发表于2026-01-03 20:20:48
0 查看

系统构建了一个多模态 RAG 流程:

  1. 文档解析:使用 Unstructured.io + OCR(PaddleOCR) 提取 PDF 中的文本与表格;
  2. 向量化:将每段文本/表格单元格嵌入为向量(bge-m3 模型);
  3. 检索:用户提问(如“请列出 2023 年各季度净利润”)→ 向量检索 Top-5 片段;
  4. 生成:将检索结果拼接为 prompt,送入 Llama-3-8B(vLLM 部署)生成答案。

测试发现:

  • 检索阶段返回的片段确实包含正确表格(如“Q1: 1.2亿, Q2: 1.5亿…”);
  • 但 Llama-3-8B 生成的答案常出现:
    • 遗漏:只提 Q1 和 Q3,跳过 Q2/Q4;
    • 捏造:将“1.2亿”写成“1.8亿”;
    • 混淆:把 A 公司数据套用到 B 公司;
  • 相同 prompt 在 Claude 3 Haiku 上输出准确;
  • 增加 temperature=0.1max_tokens=500 无效;
  • 将表格转为 Markdown 格式后输入,问题依旧。

本帖最后由 匿名用户2026/01/04 09:20:54 编辑

我要发帖子