当前位置: 首页 -> 学院新闻 -> 正文

连获三项顶会成果!我院李国徽教授团队取得系列科研进展

2026-09-09  点击:[]

今年以来,我院李国徽教授团队围绕多模态大语言模型高效推理、细粒度视觉感知和可控人体图像生成持续开展研究,取得系列科研进展。相关成果分别被KDD 2026、CVPR 2026 和第34ACM International Conference on Multimedia(ACM MM 2026)接收,三场会议均为中国计算机学会(CCF)推荐的 A 类国际会议。三项工作从模型推理与生成过程中的关键瓶颈出发,在无需额外训练的条件下提升计算效率、视觉理解能力和生成质量,为多模态智能系统的高效、可靠应用提供了新的思路。

1. MMSep(KDD 2026)

论文标题:MMSep: Efficient Multimodal Long-Generation Reasoning via Multimodal Separator Compression

多模态大语言模型(MLLMs)在复杂多模态推理场景中,模型往往需要生成大量中间推理步骤并反复回溯视觉证据,导致解码阶段的累积开销随生成长度线性增长,最终成为端到端推理的主要瓶颈。

围绕这一问题,团队系统分析解码阶段的注意力行为,发现了两个关键现象:(1)文本分隔符吸引大量注意力:解码过程中,模型将大量注意力集中在少数语义内容有限的标点符号、换行符等结构性token(即“文本分隔符”)上,这些分隔符充当上下文信息的聚合锚点;(2)少量视觉token覆盖绝大部分注意力:在视觉侧,模型在整个解码过程中始终将注意力集中在一小部分相对稳定的视觉token上(称为“视觉分隔符”),而非所有视觉上下文。

MMSep 高效推理方法总览图

基于上述观察,团队提出了无需训练的多模态分隔符定位与压缩框架MMSep,同时优化预填充与解码两个阶段的推理效率。

在预填充阶段,MMSep通过问题引导的注意力排序与空间-语义相似性约束,定位视觉锚点与视觉分隔符,大幅裁剪语言模型后续层的冗余计算。在解码阶段,MMSep在文本侧引入基于分隔符感知的KV缓存压缩机制,动态保留高贡献度的文本分隔符并丢弃低价值词;在视觉侧,维护少量视觉分隔符,并引入文本分隔符触发的按需视觉召回机制,仅在句段结构边界处动态检索更丰富的视觉上下文,在保证生成质量的前提下显著降低注意力计算与KV缓存开销。

在四个主流MLLM骨干模型上,长生成数据集(detail_2k、complex_reasoning_4k)与标准推理基准(ScienceQA、MMMU)的实验表明,MMSep在预填充阶段实现了1.70×–2.18×的加速,在解码阶段实现了1.52×–2.03×的加速,同时在复杂推理任务上性能保留率高达约99%,部分模型甚至出现质量提升。视觉召回机制仅在约8%–9%的解码步骤中被触发,表现出可控的低延迟开销。

该成果被KDD2026接收为长文。KDD是数据挖掘与知识发现领域顶会之一,属于CCF A类会议。

2. SLoFo(CVPR 2026)

论文标题:Seeing What Matters: A Training-Free Self-Guided Framework for Multimodal Detail Perception and Reasoning

固定分辨率的MLLMs在感知细粒度视觉细节方面仍面临两大挑战:(1)注意力分散——模型在推理时将大量注意力错误分配到与问题无关的区域,干扰了对关键细节的判断;(2)视觉模糊——受限于固定输入分辨率,模型无法对关键区域进行有效“放大”以获取清晰的局部视觉信息。

ABE92

图片自引导推理框架 SLoFo总览图

针对这些挑战,团队提出了一个免训练的自引导推理框架SLoFo,模仿人类“扫描、定位、聚焦”(Scan-Locate-Focus)的感知过程。

在扫描与定位阶段,SLoFo采用双分支机制精准识别关键图像区域;在聚焦阶段,SLoFo将裁剪所得的子图像作为额外输入,同时引入逐阶段视觉token剪枝策略,持续提升信噪比,在增强细节感知的同时有效降低计算开销。

在涵盖细节敏感型与通用视觉推理的12个基准数据集上,SLoFo均取得一致性提升,其中在TextVQADocVQA上较基线分别提升 4.79% 12.01%,在POPE-MSCOCO对抗设置下鲁棒性提升 4.60%,且无需任何额外训练或外部模块。

该成果被CVPR2026接收为长文,CVPR是计算机视觉领域中最具权威性和影响力的国际顶级学术会议之一,属CCF A类会议。

3. PriCo(ACM MM 2026)

论文标题PriCo: Prior-Guided Bidirectional Branch Cooperation in ControlNet for Fine-Grained Pose Generation

可控人体图像生成是虚拟试衣、人物动画等应用中的重要基础技术。随着扩散模型和 Diffusion Transformer 的快速发展,生成图像质量不断提升,但在复杂场景下,模型仍难以同时保证人体姿态准确性和文本语义完整性。

针对这一问题,团队以广泛使用的ControlNet框架为研究对象,系统分析了人体生成中的两类典型失败现象:一类是生成姿态与输入骨架不一致的结构错位,另一类是姿态基本正确,但人物动作与交互关系等细粒度语义未能充分体现文本描述。

进一步研究发现,结构错位与初始噪声中隐含的结构先验密切相关,不同初始噪声与目标姿态之间存在明显的结构匹配差异;同时,姿态条件主要提供粗粒度空间结构信息,而文本描述包含更加细粒度的动作与交互语义,两者的信息粒度差异容易导致模型在强姿态约束下忽略文本细节。

基于上述发现,团队提出无需训练的推理增强方法Prior-Guided Bidirectional Branch Cooperation(PriCo)PriCo 通过两个阶段协同提升生成质量:首先利用结构对齐,引导初始噪声中的结构先验与目标姿态建立更加可靠的空间对应;随后通过语义补充,利用文本与姿态信息恢复生成过程中缺失的细粒度动作语义。

实验结果表明,PriCo 在多个以人体为中心的生成基准上均能有效提升姿态一致性与语义准确性,并在复杂生成场景下表现出良好的鲁棒性。

54CAA

图片无需训练的推理增强方法PriCo总览

该成果被34 ACM International Conference on Multimedia(ACM MM 2026)接收。ACM MM 是多媒体领域的国际顶级会议之一,属于中国计算机学会(CCF)推荐的 A 类国际会议。

此次三项高水平成果的接收,体现了团队在多模态大模型、计算机视觉与智能生成等前沿方向的持续积累与创新能力。未来,学院将继续支持科研团队围绕多模态智能、计算机视觉等相关方向开展探索,扎实推进科研创新与人才培养,为相关领域发展贡献更多华科大软件力量。

上一条:软件学院5篇论文入选NLP顶会EMNLP 2026 下一条:2026迎新特辑|执梦研行,启序新园——软件学院研究生迎新工作圆满完成

地址: 湖北省武汉市洪山区珞喻路1037号 

           华中科技大学东校区恩明楼软件学院1011室

Copyright 2023 华中科技大学软件学院 All Rights Reserved

联系我们:

Email: sse@hust.edu.cn 

电话: 027-87792255

院长信箱:ssedean@hust.edu.cn

书记信箱:sseshuji@hust.edu.cn