赵宪在湖边的个人照片

赵宪 Xian Zhao

计算机科学与技术博士研究生

北京交通大学 · 导师:桑基韬教授

我的研究方向包括 Agent 强化学习多模态大模型长期记忆建模。目前主要关注能够从长程交互中持续学习、形成并维护有效记忆, 以及综合视觉、音频和文本信息进行推理的智能体系统。

研究经历

2026 - 至今

面向 Days-level 超长视频的主动记忆 Agent

面向第一视角超长视频理解任务,研究 Agent 的长期记忆形成、动态检索与压缩问题。提出 Active Explore Memory Agent,在探索长视频的过程中主动写入、检索、压缩并更新记忆。

EMNLP 2026 在投

在 4 种响应模型下均取得最佳整体准确率;使用 Qwen3-VL-30B 时,Ego-R1 Bench 平均准确率达到 48.5%,每个问题的记忆检索时间仅为 0.269 秒。

AEMAgent 在 EgoLifeQA 和 Ego-R1 Bench 上的任务准确率结果
准确率结果 AEMAgent 在 EgoLifeQA 和 Ego-R1 Bench 上均取得最高加权平均准确率,相比最强基线分别提升 1.9-3.3 和 1.9-9.9 个百分点。
AEMAgent 的记忆开销、检索速度和平均准确率结果
检索速度与准确率 AEMAgent 以 0.269 秒完成单问题检索并达到 48.5% 准确率;相比 WorldMM,检索约快 25 倍、准确率提高 8.5 个百分点,同时减少 32.2% 的记忆 Token。
ACM MM Demo 在投
MemoryLens Demo 超长第一视角视频的主动记忆可视化:从原始事件中选择、探索、学习并整合长期记忆。
2026 - 至今

面向长程 Agent 的强化学习系统优化

针对长轨迹 Terminal Agent,利用Slime分布式强化学习框架,结合参数分片、并行 Rollout、领域数据生成和稀疏奖励优化,研究长程任务下大模型强化学习训练方法。

专注于科学领域任务,在生物学数据上准确率提升20%

2025

EmoOmni:全模态情绪推理与模态均衡强化学习

针对 Omni 模型在视觉、音频与文本联合推理中容易过度依赖单一模态的问题,提出 OmniCoT 数据构建范式和 DyME-GRPO 强化学习方法,使模型能够显式提取多模态证据,并根据不确定性动态调整模态使用。

  • OmniCoT:使用 [vision][audio][dialogue][analysis] Guided Tokens 组织推理链;先分别提取各模态的情绪证据,再通过 LLM 验证模块筛除证据不足或逻辑不一致的推理样本。
  • DyME-GRPO:在 OmniCoT SFT 冷启动基础上,引入动态模态熵奖励,根据模态 Token 的预测熵与实际使用比例衡量不确定性,并结合准确率奖励和格式奖励优化推理策略,减少信息冗余与模态坍缩。
ACL 2026 Findings ICASSP 2026 HumDial Challenge 全球第三名
EmoOmni 两阶段训练框架:OmniCoT 冷启动与 DyME-GRPO 强化学习
EmoOmni 框架 先通过 OmniCoT 进行 SFT 冷启动,再利用 DyME-GRPO 的动态模态熵奖励缓解模态坍缩。
EmoOmni 在四个多模态情绪识别与推理基准上的主要实验结果
主要实验结果 EmoOmni 在 RAVDESS、MELD、IEMOCAP 和 MER2025 的大多数指标上取得最佳结果。
2024.05 - 2024.12

端侧 Omni 全模态模型构建与训练

面向端侧部署场景,研究轻量化 Omni 模型的数据构建、模态对齐与后训练方法,提升模型对视觉、语音和文本信息的统一理解能力。

  • 模型架构:基于 InternVL 引入音频编码器,构建支持视觉、语音与文本联合输入的全模态模型,并完成跨模态特征对齐与训练流程搭建。
  • 数据与训练:整合 LibriSpeech、ShareGPT4V 等公开预训练数据,通过模态数据规模、配比及训练策略的对比与消融实验,分析不同模态数据对模型收敛、理解能力和泛化性能的影响。

完成端侧 Omni 模型的初步训练与多模态能力验证,并评估不同数据配比下模型性能、推理速度和资源占用之间的权衡,为后续数据优化与端侧部署提供实验依据。

端侧 Omni 模型的语音识别与短 Caption 评测结果
多模态能力验证 Ours-Audio 在 LibriSpeech 与 TIMIT 上分别取得 3 和 8 的 WER;Stage2-Text 在 BLEU-4、METEOR、ROUGE-L 和 CIDEr 上均超过 MiniGPT-4。
端侧 Omni 模型 Text、Image、Audio 数据配比消融结果
数据配比消融 在 13 组 Text:Image:Audio 配比实验中,2:1:1 取得最高 CIDEr(0.211),说明适量文本与均衡的图像、音频数据更有利于 Caption 能力。
2020 - 2022

APF:对抗式人像隐私保护滤镜与移动端 Demo

针对社交平台人像可能被恶意爬取并用于人脸识别的问题,提出端云协同的 Adversarial Privacy-preserving Filter(APF)。用户端只向服务器传输图像特定梯度,而不上传原始人像;服务器通过对抗梯度迁移与通用扰动增强生成最终滤镜,在尽量保持视觉质量的同时误导恶意人脸识别模型。

进一步基于 React Native 与 Flask 构建移动端 Demo,支持身份图像注册、待保护图像选择、隐私滤镜生成,以及结果保存和分享。

ACM MM 2021 Demo
APF 端云协同对抗隐私保护滤镜设计框架
APF 方法示意 用户端提取图像特定梯度,服务器完成梯度迁移与通用扰动增强,再将对抗扰动返回用户端生成隐私保护图像。
APF 移动端 Demo 的首页、注册、选图和结果界面
移动端 Demo 从身份注册、选择待保护图像,到生成、保存和分享隐私保护结果的完整交互流程。

实习经历

2025 - 至今

大模型事业部算法实习生 · 云知声智能科技股份有限公司

参与 Agent 强化学习、情绪理解、奖励设计和上下文感知 ASR 等方向的研究与优化。

教育背景

2022 - 至今

计算机科学与技术 · 博士研究生

北京交通大学

2020 - 2022

计算机科学与技术 · 硕士研究生

北京交通大学

2016 - 2020

计算机科学与技术 · 本科

中国石油大学(华东)

论文发表

* 表示第一作者,论文标题保留英文原文。

  1. Beyond Modality Collapse: Taming Guided Modality Entropy for Omni-modal Emotion Reasoning.
    Xian Zhao*, Rui Hu, Yuxiang Zhang, Delai Qiu, Yining Wang, Shengping Liu, Jian Yu, Jitao Sang.
    ACL Findings, 2026.
  2. Omni-SelfICL: A Self-Refining In-Context Learning Framework for Emotion-Aware Multimodal Dialogue Generation.
    Xian Zhao*, Rui Hu, Xue Li, Delai Qiu, Yining Wang, Jian Yu, Shengping Liu, Jitao Sang.
    ICASSP HumDial Challenge, 2026.
  3. Benign Adversarial Attack: Tricking Models for Goodness.
    Jitao Sang, Xian Zhao, J Zhang, Z Lin.
    ACM Multimedia, 2022.
  4. APF: An Adversarial Privacy-preserving Filter to Protect Portrait Information.
    Xian Zhao*, J Zhang, X Huang.
    ACM Multimedia Demo, 2021.
  5. Trustworthy Multimedia Analysis.
    X Huang, J Zhang, Y Zhang, Xian Zhao, Jitao Sang.
    ACM Multimedia, 2021.
  6. Robust Captchas towards Malicious OCR.
    J Zhang, Jitao Sang, K Xu, S Wu, Xian Zhao, Y Sun, Y Hu, J Yu.
    IEEE Transactions on Multimedia, 2021.
  7. Adversarial Privacy-preserving Filter.
    J Zhang, Jitao Sang, Xian Zhao, X Huang, Y Sun, Y Hu.
    ACM Multimedia, 2020.

竞赛奖项与荣誉

专业技能

研究方向Agent 强化学习、多模态推理、长期记忆、SFT
机器学习系统PyTorch、TensorFlow、DeepSpeed、vLLM、ms-swift、Slime
编程语言Python、JavaScript、Java、C++、C
开发能力React、Vue、Flask、Django、Spring Boot

联系方式

欢迎围绕 AI Agent、多模态学习和长期记忆建模等方向开展研究合作与交流。

lavender.zxshane@gmail.com