短视频多维内容理解与分析
-
短视频多标签分类多标签分类旨在对时长较短、内容丰富的短视频进行多语义、多标签的自动标注与理解。研究围绕视觉帧、音频、文本描述等多模态信息展开,通过特征提取、模态融合、标签相关性建模等方式,实现对视频中场景、物体、行为、事件、主题等多个标签的并行预测。为内容推荐、检索审核、版权管理、舆情分析等上层应用提供基础语义支撑。
相关成果发表在IEEE TMM, IEEE TKDE, IP&M, KBS, ACM TOMM等多媒体领域的SCI一区国际顶级期刊以及AAAI, ICCV等CCF A类国际顶级会议上。 -
短视频情感分析情感分析面向图像、视频等多媒体数据,开展细粒度情感识别、情感强度估计与情感分布预测。研究通过挖掘视觉内容中的语义对象及时序动态信息,构建情感特征与人类主观感知之间的映射模型,实现对积极、消极、中性等基础情感以及喜悦、愤怒、悲伤、平静等细粒度情绪的量化分析。同时结合跨模态语义关联,提升复杂场景下情感理解的鲁棒性,广泛应用于舆情监测、广告效果评估、用户体验分析与智能推荐等领域。
相关成果发表在IEEE TMM等多媒体领域的SCI一区国际顶级期刊以及ACM MM等CCF A类国际顶级会议上。 -
短视频记忆度预测记忆度预测以人类视觉认知机制为基础,对图像或视频内容被人类记住的概率、持久度与重要程度进行量化预测。研究通过分析视觉显著性、语义独特性、结构复杂度、时序动态变化等因素,学习内容特征与主观记忆分数之间的非线性映射关系,可用于优质内容筛选、广告创意优化、教育资源评估与视频摘要生成。
相关成果发表在IEEE TMM, IEEE TCSVT等多媒体领域的SCI一区国际顶级期刊上。 -
短视频个性化推荐个性化推荐通过挖掘用户历史行为、偏好特征、社交关系以及物品内容属性,构建用户 — 物品匹配模型,实现精准、个性化的信息或服务推送。研究涵盖时尚服饰推荐、跨域推荐、社交物联网场景下的偏好感知、多模态兼容性建模等,解决用户兴趣漂移、数据稀疏、冷启动等问题,提升推荐的准确性、多样性与可解释性,广泛应用于电商、短视频、社交网络与智慧生活服务等场景。
相关成果发表在IEEE TMM等多媒体领域的SCI一区国际顶级期刊以及ACM MM等CCF A类国际顶级会议上。
多源图像增强与鲁棒异常检测
-
低照度图像增强低照图像增强针对夜间、逆光、暗光等极端光照条件下采集的图像,开展噪声抑制、动态范围拉伸、色彩还原与细节恢复。研究结合可见光与红外信息互补、频域增强等策略,在提升图像亮度与对比度的同时保留真实纹理,避免过曝、色偏与伪影。该方向服务于安防监控、自动驾驶、夜间摄影、移动端影像优化等对视觉质量与鲁棒性要求较高的实际场景。
相关成果发表在Neural Networks等人工智能领域的SCI一区国际顶级期刊以及WACV等国际顶级会议上。 -
多源图像融合多源图像融合将红外、可见光、雷达、多光谱等不同传感器获取的图像进行信息整合,生成信息更全面、对比度更优、细节更丰富的融合图像。研究重点在于保留源图像的显著结构、热辐射信息与纹理细节,抑制噪声与伪影,提升后续目标检测、跟踪、识别等任务的性能。广泛应用于安防监控、遥感解译、自动驾驶、医疗影像与军事观测等领域。
相关成果发表在KBS等人工智能领域的SCI一区国际顶级期刊上。 -
异常缺陷检测异常检测旨在从大量正常样本中自动识别偏离常态的稀有样本、突发事件或缺陷目标,涵盖工业缺陷检测、图像变化检测、视频异常行为识别、小样本异常检测等。研究通过差异感知、特征重构、对抗学习、多尺度聚合与对比学习等方式,在少标注甚至无标注条件下实现高鲁棒、低误报的异常判别,为安防监控、工业质检、遥感监测、网络安全等提供关键技术支撑。
相关成果发表在IEEE TMM, IEEE TGRS, ESWA等多媒体领域的SCI一区国际顶级期刊上。
医学影像处理与精准诊疗
-
退行性神经疾病筛查及康复该方向以阿尔茨海默病等退行性神经疾病为研究对象,利用眼动追踪、立体视觉刺激、多模态感知数据等方法,实现早期筛查、辅助诊断、病程评估与康复效果监测。通过构建认知-视觉-眼动关联模型,捕捉早期细微认知损伤特征,提高疾病检出率,同时结合物联网与可穿戴设备实现居家监测与长期随访,为神经退行性疾病的早防早诊早治提供智能化技术手段。
本研究课题与天津市环湖医院合作,构建立体眼动追踪系统,VR康复系统等多个成果。相关成果发表在IP&M, IEEE JBHI, IEEE IOT等医学、物联网领域的SCI一区国际顶级期刊上。 -
疼痛评估疼痛评估旨在通过多模态生理信号、面部表情、行为动作等非侵入式数据,实现对人体疼痛程度的客观量化与分级评估。研究涵盖面部微表情识别、生理信号分析、肢体动作特征提取,构建鲁棒的疼痛评估模型。该方向可应用于临床疼痛监测(如术后镇痛、慢性疼痛管理)、重症患者护理、康复治疗效果评估以及疼痛相关药物研发的疗效检测,弥补传统主观疼痛评分(如 VAS 评分)的主观性强、个体差异大、依赖患者配合等不足。
本研究课题与天津市天津医院合作,构建标准化术后疼痛评估数据集。 -
低造影剂图像增强低造影剂图像增强主要面向 CT、MRI 等医学影像,在降低造影剂使用剂量、减少人体副作用与肾脏负担的前提下,通过图像复原技术提升组织对比度、增强病灶显影、抑制伪影与噪声。研究注重图像保真度与临床可用性,辅助医生在低剂量造影条件下实现病灶识别、分期判断与随访评估,推动更安全的影像检查技术落地。
本研究课题与天津市第一中心医院合作,构建临床卵巢癌MR图像增强系统。 -
精准营养推荐精准营养推荐结合用户健康指标、生理状态、饮食偏好、疾病风险与营养需求,构建健康导向的个性化饮食推荐模型。通过多源健康数据融合、营养知识图谱与用户偏好建模,实现膳食方案智能规划、营养成分均衡配比与慢性病风险干预,为健康管理、糖尿病防控、体重管理与老年康养提供智能化饮食支持。
本研究课题与天津市第三中心医院,天津中医药大学第一附属医院,天津医科大学朱宪彝纪念医院等医疗机构合作,构建多维指标糖尿病患者数据集。相关成果发表在ESWA, ACM TOMM等多媒体领域的SCI一区国际顶级期刊上。 -
孤独症谱系障碍筛查孤独症谱系障碍(ASD)早期筛查面向低龄儿童,通过眼动分析与3D视觉刺激技术捕捉注视差异、量化社交注意力、提升检测客观性,辅助实现早期风险识别与干预评估,推动智能化筛查技术发展。
本研究课题与中国人民解放军总医院,重庆医科大学附属儿童医院合作,构建基于眼动追踪与3D刺激的ASD早期筛查系统。 -
面向认知障碍患者的情绪评估面向认知障碍患者的情绪评估主要通过多模态行为与生理信号分析,在减少主观评估偏差、提升评估连续性的前提下,利用智能算法识别情绪状态、解析情绪变化模式、捕捉异常反应特征。研究注重评估客观性与临床适配性,辅助实现情绪监测、病程评估与干预效果分析,推动智能化情绪评估技术在认知障碍人群中的应用。
本研究课题与天津市环湖医院合作,构建面向老年人照护监测场景的情感分析MoniEmo基准数据集。
具身智能与自主决策控制
-
具身智能决策与控制具身智能旨在构建能够在真实或复杂环境中感知—决策—行动一体化的自主智能体,涵盖机器人操作、多模态感知、交互学习、导航与操控等任务。研究通过跨模态表征学习、强化学习、模仿学习与世界模型等方法,在弱监督甚至自监督条件下实现泛化性强、适应性高的智能行为,为智能制造、服务机器人、自动驾驶、人机协作等提供核心技术支撑。
应用导向的多媒体系统工程
-
立体眼动健康状态干预评测系统本项目旨在开发一套自主研发的3D立体视觉刺激平台及同步眼动数据采集系统,用于神经系统疾病的筛查。该系统旨在通过刺激设计、注视反应分析及具有临床意义的行为标志物,支持对阿尔茨海默病、轻度认知障碍和自闭症谱系障碍进行客观的评估,同时构建立体眼动为基础的VR康复系统。
该项目的应用目标是开发一款可部署的医疗筛查设备及分析工作流,并可扩展至医院、康复中心及社区医疗场景。为此本研究团队成功研发全球首个融合边缘计算与联邦学习的眼动物联网架构。此项研究标志着物联网技术在认知障碍相关疾病精准诊断中的范式转变。 -
玉渊谭天本研究团队联合中央广播电视总台技术团队,依托其重磅打造的新媒体栏目《玉渊谭天》,将多模态技术应用于央视总台真实的短视频内容生产场景,累计获得千万级点赞量及亿级播放量。代表性工作包括:
跨视频事件对齐:将非结构化的视频帧序列映射为离散记忆单元,通过多智能体将宏观跨视频理解任务拆解为多个可控子任务,在央视《逐帧解读16次大阅兵》等节目中实现了人工标注结果与自动标注结果的高一致性。
镜头语言解构:开展视频镜头语言的细粒度拆解与重组研究,精细化提取视觉叙事要素,并在此基础上研发智能分镜生成智能体,实现从文本语义到视觉叙事逻辑的跨模态映射,自动输出专业分镜建议。
内容生产与传播优化:在热点素材库构建方面,本项目团队构建短视频热点素材生成网络模型,联合视觉、音频、文本模态完成对短视频热点内容的捕获,并构建跨模态语义的热点素材库;在垂直场景多元素智能标注方面,针对旅游等应用,深度整合视频标题、封面及视频内容等多模态信息,构建了集地理位置识别、热点元素定位与多标签分类于一体的智能解析系统;在动态传播度预测方面,通过引入多模态时序建模方法,将阶段性用户互动数据与短视频内容特征进行异构特征融合,有效解析了传播行为的演化规律,实现了对传播趋势的精准预判。
-
欢乐搭档互动数字人本研究团队与宝盈智能公司合作,旨在开发一套自主研发的欢乐搭档双人互动数字人系统,用于多场景沉浸式情感交互服务。该系统依托三元对话生态、情感化幽默引擎及多模态处理技术,整合多模态处理、数据采集与内容管理能力,确保交互响应流畅、体验贴合需求,支持对等场景提供个性化互动体验,并可扩展至等各类实际应用场景。
-
车门板质量检测系统本项目团队与丰田汽车公司合作,旨在开发一套自主研发的车门板质量检测系统,融合3D视觉核心技术,用于车门板生产全流程质检,实现智能化、高精度质检,替代传统人工检测,提升生产效率与产品合格率。该系统通过高精度视觉采集、智能缺陷识别及装配精度检测,支持对进行精准判定。该项目的应用目标是开发一款可部署的智能化质检设备及高效检测工作流,并可扩展至生产流水线全流程监管场景。
-
水下文物图像复原与增强本项目研究聚焦高噪声与色偏场景下的水下文物图像复原与增强,通过引入水下成像先验构建物理一致性建模,显式刻画波长选择性衰减与后向散射;设计细节—全局双流结构,实现多尺度频域分支与全局上下文协同,达成色彩矫正与细节锐化的自适应权衡;同时兼顾工程与考古友好性,提供批处理与交互式加速低时延方案,支持实船/ROV在线部署,为水下文物图像处理及相关考古应用提供支持。
-
短视频语义标注平台本项目团队自主研发了面向短视频的语义标注平台,用于高效标注短视频数据。该平台具备批量读取、便捷标注和高效存储短视频数据资源的功能,支持多人协同标注,覆盖人群数量、拍摄视角、拍摄场景以及观众情绪等多个主题。此外,平台还针对室内场景、室外场景及抽象场景提供了细粒度的语义级标注,确保对短视频内容的多角度深入描述,从而保证数据集的高质量。
-
多模态情感大模型本研究团队与中电信人工智能研究院合作,研发一款自主创新的情感多模态大模型,用于多场景智能赋能。该模型依托超大规模高质量多模态训练数据体系与“偏好对齐—强化优化”递进式训练机制,支持在等领域实现高水平表现。在视觉理解、复杂推理与幻觉抑制上优势显著,推理高效、部署便捷,已落地政务、工业、交通等场景,是具备产业级能力的国产多模态大模型。