模型架构
协同设计算法与基础设施,让模型能力随规模增长的同时保持高效。
~/qian-dong $
>清华大学博士_
清华大学计算机科学与技术博士(THUIR)。 我的研究聚焦于算法与基础设施协同设计的模型架构, 以扩展参数、上下文,尤其是智能。
我于 2026 年 6 月获得 清华大学计算机科学与技术博士学位, 博士期间在信息检索实验室(THUIR)开展研究。 很荣幸得到马少平教授、 刘奕群教授和 艾清遥教授的指导。 我的研究关注高效、可扩展的模型架构,以及让这些架构真正落地的系统基础设施。
协同设计算法与基础设施,让模型能力随规模增长的同时保持高效。
研究稀疏注意力、索引复用等架构级方法,降低模型推理成本。
在模型质量、显存、吞吐与时延之间取得平衡,扩展有效上下文。
研究排序与检索增强生成,让模型高效连接到正确的信息。
博士毕业,获得清华大学计算机科学与技术博士学位。
IndexCache 发布,通过跨层索引复用加速稀疏注意力。
GLM-5 技术报告发布,我是模型架构核心贡献者之一。
GLM-4.7 发布,详情请见我们的博客。
SelfRACG 被 EMNLP 2025 接收,让大模型自主表达检索查询以提升代码生成。
GLM-4.6 发布,详情请见我们的博客。
GLM-4.5 技术报告发布,我参与了后训练阶段的稀疏注意力适配研究。
Qilin 被 SIGIR 2025 接收,构建了包含真实 App 级用户会话的多模态检索数据集。
DecoupledRAG 被 WWW 2025 接收,通过交叉注意力解耦上下文与知识。
RLCF 被 SIGIR 2024 接收,通过无监督对比反馈对齐信息检索大模型。
I³Retriever 被 CIKM 2023 接收,将隐式查询—文档交互融入检索器。
T²Ranking 被 SIGIR 2023 接收,发布大规模中文段落排序基准。
KERM 被 SIGIR 2022 接收,将显式知识融入预训练模型用于段落重排序。
DGRe 发表于 Data Science and Engineering。
R-FORMER 被 SIGIR 2021 接收。
LGRe 被 DASFAA 2021 接收。
研究工作涵盖模型架构、信息检索、检索增强生成与大语言模型。
计算机科学与技术 · THUIR
计算机技术
软件工程
工作之外,我喜欢探索精酿啤酒: 从清爽的小麦啤、酒花浓郁的 IPA,到比利时白啤与赛松。🍻