14.6万条假参考文献:AI正在污染学术知识基础设施

发布时间:2026/8/21 8:38:14
14.6万条假参考文献:AI正在污染学术知识基础设施 如果论文里引用的文献根本不存在那这篇论文还能算学术成果吗一、一个令人不安的数字2026年7月康奈尔大学的一个研究团队发表了一项分析——他们研究了大约250万篇论文、1.11亿条参考文献后得出了一个令人不安的结论2025年至少有14.6万条不存在的幻觉参考文献进入了学术文献。14.6万。这不是可能有几条而是一个系统性的问题。更值得注意的是这项研究的作者里包括 Paul Ginsparg——arXiv 的创始人。连学术预印本平台的创始人都站出来关注这个问题说明事情已经严重到什么程度了。二、幻觉参考文献是怎么混进来的幻觉参考文献是什么就是 AI 生成的、看起来像模像样但实际上根本不存在的文献引用。它有几个特点作者名字、期刊名、年份、卷期页码格式完全正确标题看起来很相关甚至和论文主题高度契合但你去数据库里搜——根本搜不到这篇文章这些假引用是怎么混进学术文献的路径主要有三条第一条AI 辅助写作时直接生成。很多研究者用 AI 写论文的引言或讨论部分AI 会自动引用一些看起来很相关的文献。作者可能没仔细核对就直接留着了。第二条AI 润色或改写时补充引用。原文本来有真实引用但 AI 改写的时候觉得这里再加一篇引用会更有说服力于是凭空编了一篇。第三条第三方代写或降重服务。这个就不用多说了——灰色产业链里的 AI 代写生成的引用几乎全是假的。不管是哪条路径结果都一样假文献混进了真论文然后通过引用网络继续传播。三、为什么这比你想的更严重你可能会想不就是几条假引用吗有什么大不了的但实际上这个问题的严重性被严重低估了。第一它会产生级联效应学术研究是建立在前人工作基础上的。如果 A 论文引用了一篇假文献B 论文又引用了 A 论文C 论文再引用 B 论文……假信息就会像滚雪球一样越传越广。而且AI 工具在做文献综述的时候会把这些假引用也挖出来继续生成新的假内容。这就形成了一个正反馈循环AI 生成假引用 → 假引用进入文献 → AI 又基于这些文献生成更多假引用。第二同行评审根本查不出来Nature 在2026年4月就这个问题发过警告说得很直白现有的同行评审和编辑流程无法充分过滤虚假参考文献。为什么因为审稿人不可能把每一条引用都去数据库里核对一遍。一篇论文可能有几十上百条引用逐条查的话审稿时间要翻好几倍。而且假引用做得太像了——格式正确、内容相关、作者名字也像那么回事。不特意去搜根本发现不了。第三它动摇了学术的根基学术的根基是什么是可验证性。每一个结论都应该有证据支撑每一个引用都应该指向真实的研究。如果引用可以是假的那论文里说的已有研究表明前人发现大量证据支持——这些话还有多少可信度当读者无法信任论文的参考文献时他们还能信任论文的结论吗四、目前有什么解决方案面对这个问题各方都在行动但目前还没有完美的解决方案。出版方加强检测和披露要求一些期刊已经开始要求作者披露 AI 工具的使用情况包括是否用 AI 生成了参考文献。但披露是一回事核查是另一回事——作者说我没用AI生成引用编辑也没法验证。检测工具还不够可靠市面上已经有一些 AI 生成内容检测工具但它们主要检测正文对参考文献的检测能力很有限。而且参考文献格式高度标准化AI 生成的和人写的在统计学特征上差别不大检测难度更高。数据库方可以做更多像 PubMed、Web of Science、知网这样的文献数据库其实有能力做交叉验证——当一篇论文提交时系统可以自动检查每一条引用是否真实存在。但这涉及到出版流程的改造不是一朝一夕能实现的。五、研究者能做什么在整个行业的解决方案成熟之前研究者自己能做的其实不少第一AI 生成的引用逐条核对。如果你用 AI 写了论文的任何部分特别是涉及引用的部分一定要逐条去数据库里确认。不要嫌麻烦——一条假引用可能毁掉整篇论文的信誉。第二用专业文献管理工具生成引用。不要让 AI 凭空想引用。从 EndNote、Zotero 或文献数据库里直接导出引用格式准确性有保障。第三对 AI 代写和降重服务保持警惕。这些服务生成的内容里假引用的比例非常高。用了这些服务等于把论文的学术信誉交到了别人手里。第四投稿前做一次引用自查。可以用文献管理工具批量导入参考文献看看哪些匹配不上数据库。匹配不上的大概率有问题。六、写在最后14.6万条假参考文献这个数字可能还只是冰山一角。因为这项研究只分析了能检测到的部分还有很多假引用可能藏得更深。AI 给学术研究带来了效率的提升这是毋庸置疑的。但它也带来了新的问题——而幻觉参考文献可能是其中最隐蔽、也最危险的一个。学术研究的大厦是靠一篇篇论文、一条条引用垒起来的。如果地基里混进了假砖整座大厦的稳定性都会受到影响。保护学术文献的真实性不只是期刊和出版社的事也是每一个研究者的事。毕竟我们每个人都是这个体系的一部分——也是它的受益者。 盈科千信 ChatResearch——学术文献检索与引用生成工具。不同于通用大模型凭空生成引用的方式ChatResearch 基于真实文献索引检索相关论文每一条引用都来自实际存在的学术文献支持一键导出标准引用格式GB/T 7714、APA、MLA等。从源头杜绝幻觉参考文献让你的论文引用每一条都经得起核查。了解更多盈科千信ChatResearch