基本信息

职位编号:
WD00104371
工作领域:
Hardware Engineering
国家/地区:
中国
省:
北京
市:
北京(Beijing)
日期:
星期三, 8 月 19, 2026
工作性质:
Full-time
其他工作城市
* China - Beijing - 北京(Beijing)

为什么选择联想

联想文化,我们称之为 “We Are Lenovo”(我们,就是联想),其核心是:“说到做到,尽心尽力,成就客户”。

联想集团是一家年收入830亿美元的全球化科技巨头,位列《财富》世界500强第153名,服务遍布全球180个市场数以百万计的客户。为实现“智能,为每一个可能” 的公司愿景,联想在不断夯实全球个人电脑市场冠军地位的基础上,积极构建全栈式的计算能力,现已拥有包括人工智能赋能、人工智能导向和人工智能优化的终端、基础设施、软件、解决方案和服务在内的完整产品路线图,包括个人电脑、工作站、智能手机、平板电脑等终端产品,服务器、存储、边缘计算、高性能计算以及软件定义等基础设施产品。这一变革与联想改变世界的创新一起,共同为世界各地的人们成就一个更加包容、值得信赖的智慧未来。联想集团有限公司在香港交易所上市(港交所:992)(美国预托证券代号:LNVGY)。

欢迎访问联想官方网站 https://www.lenovo.com,并关注“联想集团”微博及微信公众号等社交媒体官方账号,或关注“联想招聘”公众号,获取联想最新动态。

职位描述和要求:

岗位职责:
1. 负责大语言模型的后训练全流程研发,包括SFT、RLHF、DPO、GRPO等主流后训练算法的落地与优化,提升模型在特定场景下的效果与对齐度。
2. 设计并搭建高效的后训练数据处理、训练、评测全链路pipeline,保障训练流程的稳定性、可复现性与高效率。
3. 针对模型幻觉、偏见、安全对齐等核心问题,研发针对性的后训练优化方案,持续提升模型的可靠性与合规性。
4. 负责大模型Agent能力的后训练对齐研发,包括Agentic Workflow的指令遵循、工具调用、多步推理、任务规划、长程记忆等核心能力的后训练优化,提升模型在Agent场景下的任务完成率与稳定性。
5. 探索并落地大模型前沿后训练技术,包括Process Reward Model(PRM)、Outcome Reward Model(ORM)、Agentic RLHF、多模态对齐、Constitutional AI、自洽性对齐等前沿算法,持续提升模型的通用能力与Agent任务执行能力。
6. 设计Agent场景下的后训练评测体系,包括多步任务、工具调用、长程规划、反事实推理等维度的评测基准与自动化评测流程,保障模型Agent能力的持续迭代。
7. 跟进业界前沿的大模型后训练技术与算法,结合业务场景进行创新落地,输出技术方案、专利与技术文档。
8. 与算法、工程、产品团队协同,完成模型迭代的全流程落地,支撑业务场景的效果目标达成。

岗位要求:
1. 精通大语言模型后训练相关技术,深入理解SFT、RLHF、DPO、GRPO、Agentic RLHF等主流对齐算法的原理与工程实现,有相关项目落地经验。
2. 熟练掌握PyTorch、DeepSpeed、Megatron-LM、vLLM等主流训练与推理框架,具备大模型分布式训练、显存优化、性能调优、推理加速的实战经验。
3. 具备扎实的机器学习、自然语言处理基础,熟悉大模型预训练、微调、评测、部署的全流程技术体系。
4. 深入理解大模型Agent的核心技术体系,有Agent能力后训练、工具调用对齐、多步推理优化相关的项目经验,熟悉AgentBench、ToolBench等主流Agent评测基准。
5. 具备优秀的问题分析与解决能力,能够快速定位训练过程中的效果、性能、稳定性问题,并给出有效解决方案。
6. 具备良好的沟通协作能力与文档撰写能力,能够清晰输出技术方案与研发文档,有较强的团队协作意识。

其他工作城市
* China - Beijing - 北京(Beijing)
* China - Beijing - 北京(Beijing)
* China - Beijing
* China