当前位置: 首页 -> 学院新闻 -> 正文

软件学院5篇论文入选NLP顶会EMNLP 2026

2026-09-11  点击:[]

近日,自然语言处理领域国际顶级会议 EMNLP 2026(The 2026 Conference on Empirical Methods in Natural Language Processing)录用结果揭晓,软件学院 5 篇论文成功入选,充分彰显学院在大语言模型、多模态理解等前沿研究方向的深厚积累与创新实力。

EMNLP 是自然语言处理领域的顶会,被中国人工智能学会(CAAI)列为A类会议,在国际 NLP 学术界拥有极高影响力。EMNLP 2026 将于 2026 年 11 月 24 日29 日在匈牙利举办。今年,大会共收到 17669 篇投稿,2719 篇论文被录用为主会论文,另有 2533 篇收录至 Findings of the ACL。主会论文录用率为 15.4%,Findings 板块录用率 14.3%。在此背景下,软件学院学子多篇论文脱颖而出,显得尤为难能可贵。

新意图发现:从局部关系到全局结构

论文标题:《 New Intent Discovery: From Local Relations to Global Structure》(main)

作者团队:陈鹏(第一作者,2024级研究生);指导老师:王邦

简介:新意图发现旨在从无标注用户查询中挖掘未知意图类别,核心目标是学习具备清晰聚类结构的意图表征空间,但在缺少显式监督的条件下,如何可靠构建全局聚类结构仍存在较大挑战。针对该问题,我们从全局结构的组成单元即局部关系出发,引入更容易获取且稳定性更强的局部监督信号,提出 LR2GS 模型。该方法利用多种互补的局部监督信号直接训练意图编码器,让局部约束持续作用于训练过程,逐步形成区分度良好的全局意图结构。

终身意图发现:一种持续学习协议与方法

论文标题:《 Lifelong Intent Discovery: A Continual Learning Protocol and Method》(main)

作者团队:陈鹏(第一作者,2024级研究生);指导老师:王邦

简介:挖掘新意图对各类系统适应用户不断变化的需求至关重要,本质上是一个持续学习的过程,但现有相关工作大多没有研究新意图发现的流式场景。为填补这一研究空白,我们定义了持续开放流式意图发现(COSID)任务,要求模型在混合流式数据中同时识别已有意图并挖掘全新意图。本文提出一套可配置的开放流式数据集构建协议,能够将静态意图数据集转换为按时间切分的流式数据集,同时配套 COSID 任务的评价指标;还设计了增强记忆的持续意图发现智能体 CIDA,对流式输入做筛选、聚类新意图样本,并借助大模型完成意图抽象与记忆扩充。基于该协议构建的 ClincL、BankID 数据集开展实验,验证了协议的表达能力以及 CIDA 相比现有基线方法的优越性。

基于视觉信息增益的多模态思维链压缩

论文标题: 《VIG: Visual Information Gain as a Reward Signal for Multimodal Chain-of-Thought Compression》 (Findings)

作者团队: 罗文(第一作者,2024级研究生);指导老师:黄晓涛、黄立群

简介: 多模态大推理模型在复杂推理任务中高度依赖长思维链(Chain-of-Thought, CoT),但推理过程中充斥着大量重复的视觉描述与无关自省,不仅推高了推理开销,过度冗余的文本反而易导致幻觉和准确率下降。现有的思维链压缩方法主要依赖文本长度约束,无法度量推理步骤是否真正扎根于图像。针对该问题,我们从信息论角度出发,提出了 VIG(Visual Information Gain) 奖励信号。该方法通过同一策略在有图与无图条件下的两次前向推理熵差,直接在线度量图像对每个推理 Token 的不确定性缩减程度,并无缝集成进 GRPO 强化学习框架中。VIG 无需额外标注或辅助评估模型,引导模型自主提高推理链的视觉信息密度,在大幅精简推理长度的同时提升了模型在多模态推理任务上的准确率与推理效率。

MedReaMM:评估多模态大模型的临床诊断能力

论文标题: 《MedReaMM: Evaluating Large Multimodal Models on Expert-Level Clinical Diagnostic Synthesis》(Findings)

作者团队: 魏莱(第一作者,2024级研究生);指导老师:陈伟

简介: 大语言模型与大多模态模型在医疗诊断中的应用受到广泛关注,但现有医学评测通常聚焦文本问答或单一医学图像理解,难以衡量模型综合患者病史、检查结果与多张医学影像进行临床诊断的能力。为弥补这一不足,本文提出 MedReaMM,面向专家级多模态临床诊断综合能力构建评测基准。该基准收集来自高水平医学期刊及临床病例数据库的复杂病例,经标签泄漏筛查、ICD-11 标准化编码及临床专家审核后,最终包含 625 个病例、平均每例 2.79 张医学图像以及 1,042 个标准化诊断,并要求模型以开放式方式生成排序后的鉴别诊断列表。实验系统评测了 23 个主流大多模态模型,结果显示即使采用较宽松的 Top-10 诊断标准,多数模型准确率仍低于 50%,表明当前模型距离可靠的专家级多模态临床诊断仍存在明显差距。进一步分析发现,医学知识、医学图像理解与跨模态证据整合能力均与最终诊断表现高度相关,并共同构成制约模型临床诊断能力的关键因素。

RIDGE:区域感知与导数引导的长视频关键帧筛选方法

论文标题:《RIDGE: Region-Informed Derivative-Guided Evidence Selection for Long Video Understanding》 (Findings)

作者:徐山青(第一作者,2025级研究生); 指导老师:陈伟

摘要:长视频包含的视觉内容远超大视觉语言模型(Large Vision-Language Model, LVLM)在固定视觉 Token 预算下的可处理范围,因而关键帧选择直接决定模型能否看到回答问题所需的证据。现有查询感知方法通常依据帧—问题相似度进行排序或采样,容易忽略峰值前后相似度较低却承载事件原因、过程、结果与转折的证据帧。本文提出 RIDGE,一个面向长视频理解的区域感知与导数引导的证据选择框架,将帧—问题相似度序列视为具有时序结构的信号,利用导数与曲率将其划分为峰值、上升、下降、边界和背景五类区域,并根据问题需求分配帧预算,从而兼顾事件核心、铺垫、后续、转折与上下文。RIDGE 只需分析已有的帧—问题相关性得分即可完成关键帧选择,无需额外训练或反复调用下游 LVLM,计算开销小,并能灵活适配不同骨干模型。在四个长视频基准和三种 LVLM 骨干模型构成的评测组合中,RIDGE 相较于现有先进方法整体表现优异;以 Qwen2.5-VL-7B 为例,其在 Video-MME、LongVideoBench、MLVU 和 LVBench 上较均匀采样基线分别提升 2.5、6.5、9.9 和 12.4 个百分点。

本次 5 篇高质量论文入选,体现了华中科技大学软件学院师生在人工智能前沿方向上的研究积累与实际科研水平。后续学院也将立足现有研究基础,持续开展相关研究工作,推动人工智能技术研究与实际应用结合,产出更多有价值的研究成果。

下一条:连获三项顶会成果!我院李国徽教授团队取得系列科研进展

地址: 湖北省武汉市洪山区珞喻路1037号 

           华中科技大学东校区恩明楼软件学院1011室

Copyright 2023 华中科技大学软件学院 All Rights Reserved

联系我们:

Email: sse@hust.edu.cn 

电话: 027-87792255

院长信箱:ssedean@hust.edu.cn

书记信箱:sseshuji@hust.edu.cn