小鹏汽车AI训练构架和优化实习生
任职要求
1、27届-28届毕业的同学,计算机/软件工程等相关专业,硕博优先; 2、扎实的系统与工程能力:精通Python,扎实掌握数据结构与算法,能高质量实现高性能分布式训练逻辑或底层系统组件; 3、分布式训练深度:熟悉PyTorch/FSDP/Megatron等框架,掌握数据并行、模型并行、张量并行等分布式策略,可做端到端性能瓶颈分析与优化; 4、模型理解:熟悉LLM/VLM/扩散模型等主流架构的训练和推理动态,理解收敛性与效率的权衡。 【加…
工作职责
1、参与大规模分布式训练框架的研发与优化,支持VLA等多模态大模型的高效预训练,微调,强化学习,量化感知训练与推理; 2、设计并实现数据并行、模型并行、张量并行、序列并行等混合策略的自动编排系统; 3、进行端到端性能瓶颈分析(通信、计算、内存、IO),优化千卡/万卡集群的训练效率与稳定性; 4、构建训练容错、弹性伸缩、成本感知调度等企业级特性,支撑物理AI业务的快速迭代。
参与AI场景高性能文件存储系统研发,包括: 1、文件系统元数据与数据系统架构设计,以及元数据和数据分离策略下的一致性保障机制; 2、分布式数据和元数据管理,高性能的分布式一致性协议; 3、通过基于访问热度统计,结合启发式算法比如机器学习算法进行文件聚类,结合新型存储介质比如 ZNS SSD 提高存储空间利用率,提升 SSD 使用寿命; 4、用户态文件系统(FUSE)与内核态协同的零拷贝访问技术,并且能和 AI 训练框架(比如PyTorch/TensorFlow)和推理框架(vLLM,SGLang等)深入融合,构建计算侧高性能的分布式缓存,提升 AI 场景端到端性能。
负责贷后催收AI应用的数据准备、模型训练、标签规范、效果评估与持续优化,保障AI催收系统在真实业务场景中的准确性、合规性和可落地性。 按照贷后催收业务需求,设计并执行训练数据采集与标注方案制定并维护催收话术、场景分类、标签规范与数据标准参与AI模型迭代流程,完成模型训练、校验、效果评估与上线验证跟踪模型在生产环境中的表现,分析命中率、误判、漏判并提出优化建议协调业务、风控、法务、运营等团队,确保AI输出符合监管和内控要求构建催收知识库与规则集,持续提升AI对话策略和业务理解能力执行训练过程中的质量控制,处理数据异常、标签歧义与模型偏差
1、参与智算数据中心网络稳定性平台研发,聚焦AI预训练/推理场景的故障监控、根因分析与自愈系统开发; 2、设计并实现AI-based troubleshooting模块(如异常检测、配置验证、故障预测),提升运维智能化水平; 3、构建训练任务全链路追踪能力,优化网络指标与模型训练效率的关联分析模型; 4、协同基础设施团队验证网络架构改进方案,推动AIOps技术在超大规模集群落地。

1. 负责混合云及AI训练平台的项目交付工作 参与客户侧平台部署、环境初始化、资源配置、功能验证、上线支持等工作,保障项目按计划完成交付。 2. 负责客户日常技术支持与问题解答 对接客户在使用平台过程中的各类问题,包括账号权限、资源申请、任务提交、训练环境、镜像使用、数据挂载、作业调度、日志排查等。 3. 协助客户完成计算资源配置与使用指导 根据客户业务需求,协助配置 CPU、GPU、存储、网络、镜像、队列、命名空间等平台资源,指导客户合理使用混合云资源。 4. 解答算法训练相关问题 支持客户在模型训练过程中的常见问题排查,包括训练任务失败、依赖环境异常、显存不足、分布式训练配置、数据读取异常、性能瓶颈、训练日志分析等。 5. 负责平台功能测试与交付验证 根据项目需求和产品版本,编写或执行测试用例,完成平台功能测试、接口测试、部署验证、回归测试、兼容性测试等工作,输出测试结果和问题反馈。 6. 跟踪并推动问题闭环 对客户反馈的问题进行记录、复现、分析和定位,协调研发、产品、运维等团队推动问题解决,并及时向客户同步处理进展。 7. 沉淀交付与支持文档 编写并维护部署文档、操作手册、FAQ、客户培训材料、测试报告、交付报告等,提高交付效率和客户满意度。 8. 参与客户培训和平台使用指导 面向客户管理员、算法工程师或业务团队进行平台功能讲解、操作培训和最佳实践分享。