AI计算架构师
景嘉微职位描述
职位概述 作为AI计算架构师,主导面向人工智能与高性能计算(AI/HPC)负载的通用GPU计算子系统架构定义与创新。深入理解前沿AI模型(如LLM、Diffusion、Graph NN)、框架(PyTorch/TensorFlow/JAX)及编译栈(Triton、MLIR),从算法需求出发,协同软硬件团队,设计下一代AI芯片的架构,达到高吞吐、高能效、可编程的计算核心、内存层次、互连结构与执行模型。 核心职责 分析主流及新兴AI/ML workload(训练/推理)的计算、访存与通信特征,提炼架构需求,应用场景分析 拆解用户需求,从软件架构和硬件架构上做深入分析性能、功耗以及成本,完成解决方案设计 定义GPU+AI计算单元(CUDA Core / Tensor Core 类等效模块)微架构:包括SIMT/SIMD执行模型、数据通路宽度、精度支持(FP8/FP16/BF16/INT4等)、稀疏加速机制; 设计高效片上内存子系统(Register File, Shared Memory, L1/L2 Cache)与全局内存带宽优化策略; 构建可扩展的多核/多芯片互连架构(如UCIe、CXL、NoC),支持大模型分布式训练和推理; 与编译器、驱动、库团队紧密合作,确保硬件可被高效编程(通过CUDA/OpenCL/SYCL或自研编程模型); 使用仿真工具(如Gem5、McSim、自研架构模拟器)评估架构方案,输出PPA(Performance/Power/Area)分析报告; 跟踪学术界与工业界最新进展(如MoE、KV Cache优化、FlashAttention硬件映射),推动架构创新; 撰写架构规格文档(ISA、微架构手册)、参与专利布局与技术白皮书撰写。 任职要求 ·硕士及以上学历,计算机体系结构、微电子、电子工程或相关专业;博士优先。 ·5年以上GPU+AI加速器或高性能计算处理器架构设计经验; ·必须具备GPU+AI专用芯片的完整架构项目经验(从需求定义、微架构设计到成功流片者优先)。 ·深入掌握现代GPU+AI加速器架构(如NVIDIA Hopper/Ampere、AMD CDNA、TPU、Cerebras等),能系统分析其计算、内存与互连设计哲学; ·并行执行模型(SIMT/SIMD)、流水线设计、缓存一致性协议、内存一致性模型; ·AI编程模型(CUDA/OpenCL/SYCL)及其与硬件的交互机制(warp调度、内存层级映射等); ·精通AI workload特性分析,能针对Transformer、CNN、GNN等主流模型进行计算图拆解、瓶颈识别与硬件映射优化; ·熟悉主流AI软件栈生态,包括PyTorch/TensorFlow、cuDNN/cuBLAS、Triton、MLIR、ONNX等,理解编译器与运行时对硬件的需求; ·掌握系统级性能建模与分析方法,能熟练运用 Roofline 模型、Amdahl/Gustafson 定律进行瓶颈量化,并通过 C++/Python 或 gem5/SST/Timeloop 等工具构建架构仿真原型; ·了解先进工艺节点(7nm及以下)对架构设计的关键约束,包括功耗墙、带宽墙、面积效率与良率影响。 ·具备优秀的跨团队协作能力,能与RTL、验证、编译器及算法团队高效协同; 加分项 有LLM大模型训练/推理系统优化经验; 参与过自研AI编译器或运行时开发; 熟悉Chiplet、3D堆叠等先进封装对架构的影响; 具备RISC-V向量扩展(RVV)或自定义DSA设计经验
对这个职位感兴趣吗?