本小组致力于将计算机视觉与人工智能前沿算法深度融入临床实践,面向真实世界的医学挑战构建智能化解决方案。我们聚焦于医学影像分析的核心痛点,研究方向涵盖医学图像分割、跨模态转换、图像生成与增强以及多模态医学大模型等前沿课题。特别关注 CT、MRI、病理及超声等多模态数据的深度融合与统一建模,旨在提升诊断效率、优化治疗路径及推动个性化医疗发展。团队与多家三甲医院及顶尖科研机构保持长期紧密合作,积极承担国家重点科研任务,相关成果已在 MICCAI、AAAI 等国际顶级会议与期刊上发表。
本方向专注于事件相机(Event Camera)信号的处理与高阶视觉应用,旨在挖掘类脑视觉传感器的极速与高动态范围优势。主要研究内容包括:构建基于自注意力的事件分组与特征提取框架,通过分层聚合提升表征能力;设计纹理增强网络,利用迭代融合技术还原图像细节;探索事件引导的语义分割与多模态特征融合模型,增强复杂场景下的解析能力。此外,我们还致力于开发高效的事件特征选择与检测架构,利用稀疏选择机制在保证精度的同时大幅提升计算效率,为高速运动目标检测与极端光照场景下的视觉感知提供技术支撑。
本方向聚焦于视频理解、生成与具身智能的核心技术突破。在多模态理解方面,构建融合视觉、文本与语音的统一语义框架,攻克跨模态检索、视觉问答及情感分析等难题。在视频动态解析上,利用时空建模技术实现高精度的行为识别与事件预测。同时,我们积极探索跨模态生成技术,结合扩散模型与自监督学习,推动内容可控且具真实感的图像视频创作。此外,团队正拓展视觉-语言-动作模型(VLA)研究,通过多模态指令理解与物理空间交互建模,赋予智能体连接虚拟认知与实体操作的能力,迈向具身智能的新高度。
本小组深入探索下一代图像与视频编码技术,核心方向涵盖端到端编码架构设计、生成式压缩以及特征编码理论。我们致力于突破传统编码框架的性能瓶颈,设计平衡高保真重建与低延迟需求的端到端架构。利用扩散模型与 GAN 等生成式技术,实现低码率下的高感知质量重建,颠覆传统压缩范式。同时,创新性地引入基于类小波变换的子带融合与混合注意力适配器,显著提升对域外图像的压缩鲁棒性。在特征编码方面,我们构建从像素级到语义级的压缩理论体系,探索面向机器视觉任务的语义信息压缩极限,为智能时代的视频传输提供高效解决方案。