基本信息

职位编号:
WD00104374
工作领域:
Hardware Engineering
国家/地区:
中国
省:
北京
市:
北京(Beijing)
日期:
星期三, 8 月 19, 2026
工作性质:
Full-time
其他工作城市
* China - Beijing - 北京(Beijing)

为什么选择联想

联想文化,我们称之为 “We Are Lenovo”(我们,就是联想),其核心是:“说到做到,尽心尽力,成就客户”。

联想集团是一家年收入830亿美元的全球化科技巨头,位列《财富》世界500强第153名,服务遍布全球180个市场数以百万计的客户。为实现“智能,为每一个可能” 的公司愿景,联想在不断夯实全球个人电脑市场冠军地位的基础上,积极构建全栈式的计算能力,现已拥有包括人工智能赋能、人工智能导向和人工智能优化的终端、基础设施、软件、解决方案和服务在内的完整产品路线图,包括个人电脑、工作站、智能手机、平板电脑等终端产品,服务器、存储、边缘计算、高性能计算以及软件定义等基础设施产品。这一变革与联想改变世界的创新一起,共同为世界各地的人们成就一个更加包容、值得信赖的智慧未来。联想集团有限公司在香港交易所上市(港交所:992)(美国预托证券代号:LNVGY)。

欢迎访问联想官方网站 https://www.lenovo.com,并关注“联想集团”微博及微信公众号等社交媒体官方账号,或关注“联想招聘”公众号,获取联想最新动态。

职位描述和要求:

岗位职责

1. 设计并实现面向异构算力设备(移动端、边缘盒子、桌面端)的轻量化推理引擎,覆盖 Android/Linux/Windows 多平台,支持动态模型加载、内存优化、算力感知调度。

2. 针对不同设备算力(ARM NEON、x86 AVX、Mobile GPU),设计模型量化策略(INT4/INT8/FP16),适配主流开源模型(Qwen、Llama、Mistral、Phi等),实现推理延迟 < 500ms、内存占用 < 4GB 的生产级标准。

3. 构建端侧 Agent 执行引擎(AgentCore Harness),实现工具调用、多轮对话、上下文管理、流式输出、离线运行能力,与TianxiAI形成端边云协同闭环。

4. 设计端侧模型蒸馏回灌机制,支持云端大模型能力包向端侧增量更新,实现版本一致性校验、能力感知路由、断点续传与灰度发布。

5. 建立端侧推理性能基准体系(RTF、首token延迟、内存峰值、功耗),输出端侧模型选型指南,推动模型压缩工具链、自动化评测、CI/CD 流水线落地。

岗位要求

1、5年以上 AI 系统或推理引擎开发经验,深度参与过至少一个端侧推理框架的核心模块设计(ONNX Runtime / MNN / NCNN / MLX / llama.cpp / ExecuTorch)

2、精通 C++17 及以上版本,具备扎实的多线程与高并发编程能力,熟悉并发队列、无锁/低锁设计、锁竞争分析与性能优化;熟悉 Rust 者优先

3、深入理解大模型推理的核心瓶颈,能够从显存带宽、计算能力、PCIe 传输、CPU-GPU 页交换等维度定位性能问题,理解 Prefill 与 Decode 阶段在计算密集、访存密集及并行特征上的差异

4、有生产环境端侧模型部署经验,熟悉模型转换工具链(ONNX / CoreML / TFLite / MLC-LLM)

5、深入掌握 KV-Cache 底层原理及工程实现,熟悉 PagedAttention、逻辑块与物理块管理、页表映射、显存池等关键机制,能够针对长上下文和高并发场景优化缓存利用率

6、熟悉大模型推理请求调度策略,包括连续批处理(Continuous Batching)、动态批处理、预取与请求抢占,能够在吞吐、时延、公平性和资源利用率之间进行系统性权衡

7、具备 GPU 显存管理与优化经验,熟悉显存池化、显存碎片治理、CPU-GPU 页交换与 Offload 机制,能够设计受限算力和受限内存设备上的模型装载与运行方案

8、熟悉推理服务性能度量与调优方法,能够围绕吞吐量(TPS)、首 Token 时延(TTFT)、单 Token 解码时延(TPOT)建立基准测试、性能剖析和持续优化体系

其他工作城市
* China - Beijing - 北京(Beijing)
* China - Beijing - 北京(Beijing)
* China - Beijing
* China