最新动态
关于我
我是北京航空航天大学博士生,隶属于 SMAT 实验室,导师为黎立教授,副导师为周鸣一。
教育背景
研究聚焦于AI for Software Engineering (AI4SE),将大语言模型(LLM)、程序分析和可验证软件工程环境结合,构建更可靠的代码智能体与生态工具链。 我的工作横跨多个子方向——从执行反馈与静态锚点,到仓库级基准、变更影响分析、OpenHarmony 生态质量保障和低资源编程语言支持——始终围绕同一个核心:让 AI 真正可靠地服务于软件工程实践。
研究动机与愿景
大语言模型已经展现出很强的代码生成能力,但真实软件工程并不只需要“写出补丁”: agent 还要理解仓库、选择证据、控制执行成本、维护变更历史,并在特定生态中经得起验证。 我的研究围绕一个核心问题展开:如何把 LLM 的生成能力、程序分析的确定性和真实软件工程环境结合起来,构建可靠的代码智能体与生态工具链?
具体来说,这意味着:在代码智能体场景中,分析执行反馈到底何时值得使用(如 To Run or Not to Run),并用轻量静态结构提升仓库导航稳定性(如 CodeAnchor); 在OpenHarmony 生态中,把领域规则、静态分析、LLM 和真实反馈结合起来做修复、迁移和性能分析(如 HapRepair 与 Phantom Rendering Detection); 在评估与度量层面,系统分析 LLM 到底理解了什么代码知识,以及 AI4SE 工具应该如何被可靠衡量。
长远愿景是构建高效可靠的代码智能体与可验证 SWE 环境:让 agent 不仅能生成代码,更能自主理解代码库结构、定位缺陷、评估变更影响、维护原子化修改过程,并在真实生态中生成可验证的工程方案。
代表性工作
To Run or Not to Run
系统分析 LLM 程序修复智能体中的代码执行成本与收益,说明执行反馈应被当作有成本的资源,而不是默认动作。
CodeAnchor
研究轻量静态结构如何作为 deterministic anchors,提升代码智能体在真实仓库中的定位稳定性、复现性和导航效率。
Phantom Rendering Detection
识别和分析 UI 中不必要的渲染计算,帮助开发者发现隐藏的性能瓶颈,提升移动应用的流畅度。
MazeBreaker
提出多智能体强化学习框架,动态评估 LLM 安全防线的越狱漏洞,揭示现有防御机制的系统性弱点。
科研历程
我与华为(OpenHarmony 生态质量、UI 性能分析)、BTH 的 Wei Ma(LLM 代码理解与 AI4SE 评估)以及 SMU 的 Zhensu Sun(LLM 编程智能体与执行效率)保持紧密合作。 迄今已在 ICSE、FSE、TOSEM、EMSE 等软件工程顶级会议和期刊发表论文,另有多篇工作在投。
研究方向(可点击展开)
科研之外
平时喜欢运动,是陈奕迅和张敬轩的忠实歌迷,也爱玩 NBA 2K、FIFA 等体育类电子游戏。 相信好的研究和好的生活一样,需要节奏感。
研究兴趣
🔬 研究方向
代码智能体与软件变更过程
研究代码智能体在真实修改中如何选择上下文、执行反馈、仓库关系证据与提交组织方式。
- 执行、静态锚点、影响关系和提交结构都是可量化的设计选择
- 除了最终补丁是否通过,还要评估 agent 留下的过程质量
仓库级基准与可验证 SWE 环境
构建低泄漏、可执行、有约束的真实软件工程任务,让 agent 在仓库级修复、迁移和兼容性维护中接受评估。
- 仓库级任务能暴露文件级 benchmark 看不到的失败模式
- source-only 检查、运行时阻断和场景验证可以减少指标投机
OpenHarmony 与新生语言工具链
面向 OpenHarmony、ArkTS 和 Cangjie 构建生态感知的分析、修复、迁移、性能和程序分析基础设施。
- 从应用修复、UI 性能到 Android 迁移和 OpenHarmony 静态分析
- 新生生态让领域知识、可执行反馈和低资源语言适配变得格外关键
代码理解、程序分析与 AI4SE 度量
评估 LLM 到底理解了什么代码知识,并为 AI 软件工程工具和 LLM-in-the-loop 系统设计更可靠的评测协议。
- 能力声明应该落到语法、静态行为、动态行为和工具失败模式上
- 评测协议需要人工审计、泄漏控制和失败模式分析
开源工具
HapRay
OpenHarmony 应用性能分析工具,用于检测 UI 中的 Phantom Rendering(幽灵渲染)问题。
HomeCheck
OpenHarmony 应用静态检查与自动修复工具,HapRepair 的核心模块,支持规则驱动的缺陷检测。
HomeTrans
Android → OpenHarmony 应用迁移工具,辅助开发者将安卓应用自动转换为鸿蒙生态。
ResearchClaw
⭐ 59AI 驱动的科研桌面应用,集文献管理、智能阅读笔记、Research Idea 生成于一体,支持 arXiv 论文发现、PDF AI 对话、语义搜索与引用网络。
SkillLens
面向 Codex / Claude Code 的本地 SKILL 覆盖分析与优化框架,将 SKILL.md 约束和真实 agent 轨迹对齐,定位遵循、违反和忽略路径。
已接收论文(PDF)
查看全部 →To Run or Not to Run: Analyzing the Cost-Effectiveness of Code Execution in LLM-Based Program Repair
ISSTA 2026
How Much Static Structure Do Code Agents Need? A Study of Deterministic Anchoring
ISSTA 2026
Phantom Rendering Detection: Identifying and Analyzing Unnecessary UI Computations
FSE 2026
MazeBreaker: Multi-Agent Reinforcement Learning for Dynamic Jailbreaking of LLM Security Defenses
ICSE 2026
HapRepair: Learn to Repair OpenHarmony Apps
FSE Industry 2025
Effective Fine-tuning for Low-resource Languages: A Case Study of Cangjie
EMSE 2026
Open-Source AI-based SE Tools: Opportunities and Challenges of Collaborative Software Learning
TOSEM 2024
Exploring Code Analysis: Zero-Shot Insights on Syntax and Semantics with LLMs
TOSEM 2026
合作
- HapRepair:OpenHarmony 应用修复
- Cangjie:低资源编程语言微调
- Phantom Rendering Detection:移动 UI 性能分析
- Phantom Rendering Detection:移动 UI 性能分析
- Phantom Rendering Detection:移动 UI 性能分析
- • OpenHarmony 应用修复
- • Phantom Rendering / UI 性能分析
- • Cangjie 低资源语言微调
衷心感谢 Wei Ma 老师带我走上科研道路。刚开始接触科研时,是他在选题、论文阅读、实验设计和写作上给予了持续而耐心的帮助;我的许多早期科研训练都离不开他的指导与支持。
- MazeBreaker:面向 LLM 越狱评测的多智能体强化学习框架
- HapRepair:面向 OpenHarmony 应用的 LLM 辅助修复
- Exploring Code Analysis:LLM 代码语法与语义理解评估
- Open-source AI-based SE Tools:AI4SE 开源生态综述
- • LLM 代码理解与语义评估
- • MazeBreaker 自适应评测
- • AI4SE 开源生态与实证研究
也衷心感谢 Zhensu Sun。在我逐渐能够独立提出研究想法之后,他仍然在问题定义、实验设计、论文叙事和局限分析等方面给予了许多建设性的意见,帮助我学会把初步 idea 打磨成更完整、更扎实的研究工作。
- EAGER:在 LLM 生成代码时并行执行以隐藏延迟
- To Run or Not to Run:LLM 修复智能体中的执行成本收益分析
- • LLM 编程智能体
- • 执行成本与延迟优化
- • 代码生成与程序修复评估
AI 知识库
28 个 AI / LLM / 多模态 / Diffusion / Agent 面试知识点,支持分类浏览、关键词搜索和中英文切换。