面向 Days-level 超长视频的主动记忆 Agent
面向第一视角超长视频理解任务,研究 Agent 的长期记忆形成、动态检索与压缩问题。提出 Active Explore Memory Agent,在探索长视频的过程中主动写入、检索、压缩并更新记忆。
在 4 种响应模型下均取得最佳整体准确率;使用 Qwen3-VL-30B 时,Ego-R1 Bench 平均准确率达到 48.5%,每个问题的记忆检索时间仅为 0.269 秒。
面向第一视角超长视频理解任务,研究 Agent 的长期记忆形成、动态检索与压缩问题。提出 Active Explore Memory Agent,在探索长视频的过程中主动写入、检索、压缩并更新记忆。
在 4 种响应模型下均取得最佳整体准确率;使用 Qwen3-VL-30B 时,Ego-R1 Bench 平均准确率达到 48.5%,每个问题的记忆检索时间仅为 0.269 秒。
针对长轨迹 Terminal Agent,利用Slime分布式强化学习框架,结合参数分片、并行 Rollout、领域数据生成和稀疏奖励优化,研究长程任务下大模型强化学习训练方法。
专注于科学领域任务,在生物学数据上准确率提升20%
针对 Omni 模型在视觉、音频与文本联合推理中容易过度依赖单一模态的问题,提出 OmniCoT 数据构建范式和 DyME-GRPO 强化学习方法,使模型能够显式提取多模态证据,并根据不确定性动态调整模态使用。
[vision]、[audio]、[dialogue] 和 [analysis] Guided Tokens 组织推理链;先分别提取各模态的情绪证据,再通过 LLM 验证模块筛除证据不足或逻辑不一致的推理样本。面向端侧部署场景,研究轻量化 Omni 模型的数据构建、模态对齐与后训练方法,提升模型对视觉、语音和文本信息的统一理解能力。
完成端侧 Omni 模型的初步训练与多模态能力验证,并评估不同数据配比下模型性能、推理速度和资源占用之间的权衡,为后续数据优化与端侧部署提供实验依据。
针对社交平台人像可能被恶意爬取并用于人脸识别的问题,提出端云协同的 Adversarial Privacy-preserving Filter(APF)。用户端只向服务器传输图像特定梯度,而不上传原始人像;服务器通过对抗梯度迁移与通用扰动增强生成最终滤镜,在尽量保持视觉质量的同时误导恶意人脸识别模型。
进一步基于 React Native 与 Flask 构建移动端 Demo,支持身份图像注册、待保护图像选择、隐私滤镜生成,以及结果保存和分享。
参与 Agent 强化学习、情绪理解、奖励设计和上下文感知 ASR 等方向的研究与优化。
北京交通大学
北京交通大学
中国石油大学(华东)
* 表示第一作者,论文标题保留英文原文。
欢迎围绕 AI Agent、多模态学习和长期记忆建模等方向开展研究合作与交流。