模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案

首页 AI资讯 AI技术研报 AI监管政策 AI产品测评 AI商业项目 arena全球大模型排行榜 AI产品热榜 AI 源力市场 AI新闻日报
下载 AITNT APP
🍎 iOS 下载 🤖 Android 下载

模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案
AI技术研报 2026-07-24 10:43
+5830 阅读

向ChatGPT问一个看起来挺简单的问题:“Lasha Talakhadze之前的奥运举重纪录是多少?”


结果让人哭笑不得——模型能认出这个人是谁,也说得出来他拿过金牌,但给出来的答案却是他现在的纪录,而不是“之前”的。同理,“第25届奥运会期间布达佩斯的市长是谁?”这种带时间窗口约束的问题,Google和ChatGPT都翻了车。


这不是某个模型的bug,而是所有基于知识图谱的问答系统共有的结构性问题:它们看得见实体,看不见时间。


北航、复旦、浙大联合团队在AAAI上提出的QC-MHM(Question Calibration and Multi-Hop Modeling),用一个三件套方案——问题校准+时序嵌入+多跳图推理——让模型真正拥有了“时间感”。


模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案


作者单位:北京航空航天大学·复旦大学·浙江大学


发表:AAAI(CCF-A类顶会,Pages 19332–19340)


背景


场景与痛点


时序知识图谱问答(Temporal KGQA)的任务是:给定一个带时间约束的自然语言问题,从知识图谱中找到落在正确时间窗口内的答案


听起来只是在普通KGQA上加了个时间字段?实际上差距巨大:


模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案


举个例子:(布达佩斯,市长,某人,1992)和(布达佩斯,市长,另一人,2024)在KG里是两条不同的事实。传统模型很容易把两条混在一起,问“92年谁当市长”时给出2024年的答案。


现有方法的两大硬伤


学界已经有了CronKGQA、TMA、TSQA等一系列时序KGQA模型,但这篇AAAI论文犀利地指出,它们都没绕过两个坎:


硬伤一:PLM对时间“视而不见”。Bert等预训练语言模型编码问题时,注意力天然落在实体名词上(人名、地名),对“之前/之后/期间”这类时间词汇缺乏敏感性。结果就是——模型相当于读了一道“不带时间约束”的问题。


硬伤二:图结构信息被浪费。即使用了知识图谱,多数方法也只把它当作答案查询的索引,没有真正利用其中蕴含的多跳关系结构。遇到需要“两步以上跳转”的问题就掉链子,而且推理过程完全黑箱。


论文做了什么


QC-MHM用一个端到端框架把三个模块串起来:


  • 时序感知嵌入:让KG中的时间戳知道“谁在前、谁在后”
  • 问题校准:让问题向量主动去KG中“找时间线索”,再回来更新自己的表示
  • 多跳GNN推理:单层GNN一次性访问任意跳邻居,同时输出可解释的推理路径


模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案


技术方案


模块一:让时间戳“懂顺序”的KG嵌入


KG里每条事实是(主体,关系,客体,时间)四元组。QC-MHM选择TComplEx做基础嵌入,评分函数为:


模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案


但仅靠TComplEx,时间戳之间还是“散装”的——模型不知道1992在2024之前。为此作者借鉴Transformer的sinusoidal编码,为每个时间戳叠加位置编码:


模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案


进而构造辅助任务——让模型判断“时间m是否早于时间n”:


模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案


模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案


模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案


总训练损失:。这个辅助任务就像给模型做“时间排序”的专项训练——嵌入空间里,1992的向量自然排在2024前面。


模块二:问题校准——让问题主动“找时间”


这是QC-MHM最具想象力的设计。常规做法是:问题→PLM编码→直接查询答案。QC-MHM在中间加了一步:让问题先去KG中检索与时序相关的SPO(主体-关系-客体三元组),再回来修正自己的表示。


第一步:候选SPO召回。把问题和KG中的所有SPO分别过SentenceBERT,用余弦相似度排名,保留Top-10:


模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案


第二步:三注意力多视角匹配。用三种注意力机制同时比较“问题词×SPO候选”:


模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案


三种视角各看各的:Concat看“这两个向量放一块合理吗”,Dot看“关键维度上对齐了吗”,Minus看“哪里不一样”。


第三步:门控自适应融合。让模型自己决定“原始问题语义”和“从KG检索到的时序信息”各占多大权重:


模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案


模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案


经过校准后的问题向量,从此具备了“时间感”。相当于原本的问题是“XXX是谁?”,校准后变成了“XXX在1992年是谁?”。


模块三:多跳GNN推理——一层看穿整条路径


传统GNN的问题是:一层只能看1跳邻居,要想看2跳需要堆2层,看3跳得堆3层,效率和可解释性都不好。


QC-MHM的做法是:先把子图裁剪出来,再一次性做多跳注意力聚合。


子图裁剪:以问题中的实体为起点,抽取k跳范围内的子图,把搜索空间收窄。


路径打分(注意力矩阵):


模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案


一次性多跳聚合:


模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案


模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案


注意力权重本身也可以直接可视化,展示模型的“思考轨迹”——哪条边被高权重激活,推理路径一目了然。


模块四:双通道答案预测


模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案


然后分别投影到实体空间时间戳空间,用TComplEx评分做双通道预测:


模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案


两个通道的分数拼接后softmax,交叉熵优化。这意味着——同一个模型可以同时回答“是谁”和“什么时候”两类问题。


实验结果


CronQuestions:逼近性能天花板


模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案


  • 复杂多跳问题Hits@1绝对提升5.1%,Hits@10提升1.2%
  • 实体型答案与时间型答案两条赛道都打赢
  • 整体Hits@1达0.971——再往上提升已经非常困难


TimeQuestions:跨数据集泛化验证


模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案


迁移到第二个基准同样SOTA,说明方法具有可迁移性,不是针对某个数据集的特化方案。


细粒度问题类型拆解


模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案


Before-After这种典型时间排序题,QC-MHM的优势被放大得最明显——这正是“问题校准”模块的主场:只有显式建模了时间约束,模型才知道“之前”意味着什么。


消融实验:三件套缺一不可


模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案


模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案


三个模块互相成就,不是简单的“拼盘”,去掉任何一个都会导致特定类型问题大幅退化。


可视化:“白盒”推理路径


模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案


可以清晰地看到模型如何在图中逐跳推进,哪些边被高权重激活——这是过往黑箱模型不具备的能力。


模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案


图中高亮的92%、95%等数值,正是问题对最相关时序SPO高度关注的证据,表明门控机制确实抓住了“哪些SPO该被重视”。


模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案


梯度分析印证了问题校准模块确实把关键时序事实反映到了问题向量中。


项目价值


学术贡献


  • 首创“问题校准”机制:多视角注意力+门控融合,让PLM编码的问题向量主动从KG中提取时序知识,根治“时间盲区”
  • 单层多跳聚合:用加权组合的方式让单层GNN访问任意跳邻居,同时输出可解释推理路径
  • 顺序感知的嵌入辅助任务:以“判断时间先后”作为额外监督信号,让嵌入空间隐式编码时间序


落地场景


  • 搜索引擎:精准应答带时间限定词的复杂查询(“之前”“期间”“最早”)
  • 金融合规:跨时间维度查询股权变更、监管事件、诉讼时序
  • 医疗药学:追踪疾病演进、用药史、临床试验时间线
  • 档案管理:跨年代事件因果与关联推理
  • 企业BI:基于时间链路的趋势与因果分析


在LLM普遍强调“事实可追溯”的当下,QC-MHM所代表的“PLM×时序KG×多跳GNN”思路,是构建可信时序推理系统的关键拼图。


论文(arXiv):https://arxiv.org/abs/2402.13188
代码(GitHub):https://github.com/zhouyan0614-sys/QC-MHM-TKGQA
会议:AAAI(CCF-A),Pages 19332–19340


文章来自于"量子位",作者 "QC-MHM团队"。

1
AI数据分析

【开源免费】DeepBI是一款AI原生的数据分析平台。DeepBI充分利用大语言模型的能力来探索、查询、可视化和共享来自任何数据源的数据。用户可以使用DeepBI洞察数据并做出数据驱动的决策。

项目地址:https://github.com/DeepInsight-AI/DeepBI?tab=readme-ov-file

本地安装:https://www.deepbi.com/

【开源免费airda(Air Data Agent)是面向数据分析的AI智能体,能够理解数据开发和数据分析需求、根据用户需要让数据可视化。

项目地址:https://github.com/hitsz-ids/airda

2
RAG

【开源免费】graphrag是微软推出的RAG项目,与传统的通过 RAG 方法使用向量相似性作为搜索技术不同,GraphRAG是使用知识图谱在推理复杂信息时大幅提高问答性能。

项目地址:https://github.com/microsoft/graphrag

【开源免费】Dify是最早一批实现RAG,Agent,模型管理等一站式AI开发的工具平台,并且项目方一直持续维护。其中在任务编排方面相对领先对手,可以帮助研发实现像字节扣子那样的功能。

项目地址:https://github.com/langgenius/dify


【开源免费】RAGFlow是和Dify类似的开源项目,该项目在大文件解析方面做的更出色,拓展编排方面相对弱一些。

项目地址:https://github.com/infiniflow/ragflow/tree/main


【开源免费】phidata是一个可以实现将数据转化成向量存储,并通过AI实现RAG功能的项目

项目地址:https://github.com/phidatahq/phidata


【开源免费】TaskingAI 是一个提供RAG,Agent,大模型管理等AI项目开发的工具平台,比LangChain更强大的中间件AI平台工具。

项目地址:https://github.com/TaskingAI/TaskingAI

3
AI搜索

【开源免费】MindSearch是一个模仿人类思考方式的AI搜索引擎框架,其性能可与 Perplexity和ChatGPT-Web相媲美。

项目地址:https://github.com/InternLM/MindSearch

在线使用:https://mindsearch.openxlab.org.cn/


【开源免费】Morphic是一个由AI驱动的搜索引擎。该项目开源免费,搜索结果包含文本,图片,视频等各种AI搜索所需要的必备功能。相对于其他开源AI搜索项目,测试搜索结果最好。

项目地址:https://github.com/miurla/morphic/tree/main

在线使用:https://www.morphic.sh/

添加客服微信openai178,进AITNT官方交流群