基本信息

职位编号:
WD00104377
工作领域:
Data Management and Analytics
国家/地区:
中国
省:
北京
市:
北京(Beijing)
日期:
星期三, 8 月 19, 2026
工作性质:
Full-time
其他工作城市
* China - Beijing - 北京(Beijing)

为什么选择联想

联想文化,我们称之为 “We Are Lenovo”(我们,就是联想),其核心是:“说到做到,尽心尽力,成就客户”。

联想集团是一家年收入830亿美元的全球化科技巨头,位列《财富》世界500强第153名,服务遍布全球180个市场数以百万计的客户。为实现“智能,为每一个可能” 的公司愿景,联想在不断夯实全球个人电脑市场冠军地位的基础上,积极构建全栈式的计算能力,现已拥有包括人工智能赋能、人工智能导向和人工智能优化的终端、基础设施、软件、解决方案和服务在内的完整产品路线图,包括个人电脑、工作站、智能手机、平板电脑等终端产品,服务器、存储、边缘计算、高性能计算以及软件定义等基础设施产品。这一变革与联想改变世界的创新一起,共同为世界各地的人们成就一个更加包容、值得信赖的智慧未来。联想集团有限公司在香港交易所上市(港交所:992)(美国预托证券代号:LNVGY)。

欢迎访问联想官方网站 https://www.lenovo.com,并关注“联想集团”微博及微信公众号等社交媒体官方账号,或关注“联想招聘”公众号,获取联想最新动态。

职位描述和要求:

岗位职责
1. 评测体系搭建 建立 AI Agent 端到端评测体系,制定覆盖问答质量、多轮对话一致性、工具调用准确率、任务完成率、稳定性、安全性与用户体验的多维评测标准,形成可量化、可复用的评分量表。
2. 评测数据集建设与管理 构建并持续维护高质量 Golden Dataset:完成样本采集、清洗、标注、分层、去重与版本管理;覆盖标准问答、多步推理、边界 Case 与对抗样本,保障数据集的代表性、场景覆盖度与区分度。
3. 自动化评测流水线与基建 开发自动化评测 Pipeline,融合规则校验、代码断言、LLM-as-a-Judge 与人工专家评审多路评分;接入 CI/CD 实现版本发布前自动回归;打通"离线评测 → 自动化回归 → 线上监控"全链路。
4. 竞品 Benchmark 对标 对标 Claude Code、OpenCode 等主流 Coding Agent 产品,定期开展横向 Benchmark 评测,输出能力差距与优化方向。
5. 问题归因与迭代闭环 建立失败案例归因体系,对幻觉、误判、漏答、工具调用失败、执行中断、结果不稳定等问题做聚类分析;输出评测报告,推动算法、工程、产品团队完成 Top 问题专项治理。
6. 离线-线上效果对齐 探索用户线上行为、业务结果与离线指标的相关性,持续提升离线评测对真实用户体验的预测与解释能力。

岗位要求
1、2 年以上大模型/算法评测、自动化测试开发或 AI 产品质量经验
2、精通 Python,能独立开发评测脚本与流水线框架;熟练使用工具做数据处理与实验统计分析
3、熟悉至少 2 种主流评测框架(RAGAS、DeepEval、TruLens、AgentBench、PromptFoo、PawBench 等),4、了解 SWE-Bench、WebArena、GAIA、ToolBench 等学术 Benchmark
5、掌握主流评测方法论:准确率/召回率、成对对比、评分量表、LLM-as-a-Judge、人工评测
6、理解大模型、Agent、RAG、Function-Calling 与 Prompt 工程基本原理
7、具备评测数据集完整构建经验,熟悉标注流程、样本分层与质量控制
8、较强的结构化分析与报告撰写能力,能从失败样本中提炼共性问题并给出可落地建议
9、优秀的跨团队协作能力,能驱动算法、工程、产品、QA 多方落地问题治理

加分
1、有自动化评测平台、大规模评测流水线建设经验
2、有复杂任务 E2E 评测或工具调用 Agent 评测经验
3、熟悉 LangSmith、LangFuse 等 LLM 可观测性工具,能做全链路故障归因
4、有离线评测指标与线上业务指标对齐的实践经验

其他工作城市
* China - Beijing - 北京(Beijing)
* China - Beijing - 北京(Beijing)
* China - Beijing
* China