logo of bytedance

字节跳动模型工程技术专家(AI Infra)-剪映Capcut

社招全职5年以上A106766地点:深圳状态:招聘

任职要求


1、扎实的机器技术基础,了解前沿的AI技术,有不错的工程实践经验;
2、具备5年以上机器学习系统工程经验,其中至少2年专注于大模型相关方向;精通Python,熟练掌握PyTorch深度学习框架,并具备优秀的C++/Linux开发和调试能力;
3、拥有从零构建或深度改造大规模模型训练/推理管线的成功经验;
4、具备丰富的GPU集群性能调优与问题诊断经验,熟悉CUDA编程…
登录查看完整任职要求
微信扫码,1秒登录

工作职责


1、负责将各类大模型(包括MoE架构、多模态模型及未来超大规模模型)高效部署至生产环境,持续跟踪并集成如vLLM、SGLang、xLLM等先进推理框架,保障新模型能够快速、高性能上线;
2、深入数据工程与模型蒸馏领域,通过数据合成、特征工程及知识蒸馏(如软标签蒸馏、特征蒸馏)等技术方案,系统性提升数据利用效率、降低模型部署成本,并验证其在业务中的可行路径;
3、探索并应用创作者Agent等前沿方向,将其能力赋能于训练样本自动合成、Train-Free冷启动及自动化评测等场景,革新传统数据与评估工作流;
4、对业务模型进行深度的推理性能优化,包括但不限于动态批处理、量化压缩、注意力机制优化等,持续降低服务延迟与资源消耗,并积累超大规模(如万亿参数)模型的部署经验与技术储备;
5、负责构建和优化大规模模型的强化学习(RL)、监督微调(SFT)及端到端训练的完整工程链路;提升训练流程的稳定性与吞吐量,并设计和复用离线验证与评测链路,为算法团队提供高效的迭代与效果评估环境。
包括英文材料
机器学习+
大模型+
Python+
PyTorch+
深度学习+
还有更多 •••
相关职位

logo of alibaba
社招2年以上

1. 立足AI Agent研发运维视角,贯穿整个技术栈,在稳定、体验、效率和成本这四个方面持续进行优化 2. 基于AI研发领域的MaaS/PaaS/IaaS,进行模型训练与推理的算力保障,并提升资源使用率 3. 统性地提升Agent研发、部署、运行阶段的稳定性,适应Agent QPS、模型推理TPM每年提升1个量级的发展速度 4. 主导解决Agent研发运维过程中各类疑难问题,并推进完善产品与平台的能力 5. 系统性构建故障节点、慢节点检测平台化能力,响应并解决日常大模型任务的故障问题 6. 负责LLM 后训练(SFT、RLHF/RLAIF 等)相关链路稳定性治理、规范建设:理解研发与优化 LLM + RL/HRF 相关训练框架,提升扩展性、稳定性与性能(吞吐、显存占用、收敛效率等)。结合分布式训练技术(如 tensor / pipeline / data parallel),优化多机多卡训练性能和资源利用率。 7. 平台稳定性与工程质量:建设训练平台的观测与运维体系,完善监控、告警、日志与故障排查工具;持续提升平台的稳定性、可调试性和可维护性,产出高质量技术文档与设计方案。

更新于 2025-12-15杭州
logo of amap
社招3年以上技术类-算法

我们是谁? 作为中国领先的数字地图内容及导航服务提供商,高德地图日均服务数亿用户出行决策,每日处理超百亿级位置数据。视觉技术中心是驱动高德实现厘米级高精地图、实时三维重建、多模态感知等核心技术的引擎,持续突破自动驾驶、AR导航、智慧交通等领域的技术边界。 团队gihub主页:https://github.com/amap-cvlab 为何加入我们? 挑战世界级技术难题,追求智能上限 用AI驱动国民级APP的产品迭代和颠覆式创新 岗位职责: 我们在构建面向具身智能与交互式世界模型的下一代推理基础设施:支持多模态流式输入(视频/传感器/地图)、实时闭环输出(动作/轨迹/场景状态),在端云一体部署下实现确定性低延迟、可规模化吞吐与可持续的成本效率。你将负责推理加速基础框架与关键性能机制建设,打通“模型—引擎—硬件—调度—观测”的全链路。 你将负责 1) 推理基础框架与运行时 ● 设计并实现端云一体推理框架:统一模型加载、版本管理、热更新、灰度与回滚能力 ● 建设流式推理 pipeline:ingest → preprocess/encode → predict/plan → control,支持异步与背压 ● 推理引擎集成与改造:vLLM / TensorRT-LLM / SGLang / TGI(云端),TensorRT / ONNX Runtime / TVM / NPU SDK(端侧) 2) 实时调度与性能关键路径 ● Prefill/Decode 分离调度(如适用)、长度分桶、连续 batching、尾延迟治理(P99/P999) ● KV cache 管理:paged/block、prefix/prompt cache、逐出策略、显存碎片治理 ● 多机多卡并行与通信:TP/PP/EP(MoE),NVLink/IB/RDMA 等链路优化 ● 投机解码/并行解码(Speculative/Medusa 等)在业务场景的落地与收益闭环 3) 量化与算子/Kernel 优化 ● 建立 profiling 体系:算子画像(attention/GEMM/视觉编码/采样解码等)、输入分布、性能回归基线 ● 分层量化策略:FP8/INT8/INT4 与 activation-aware 量化,质量回归与灰度上线 ● CUDA/Triton kernel、算子融合、内存与流水并行优化;端到端 latency 优化而非单点指标 4) 可观测性与可靠性 ● 建立实时推理指标体系:E2E latency、jitter、FPS/Hz、丢帧率、功耗/温控降频、OOM/重试等 ● 帧级/样本级 tracing,故障定位、过载保护、降级与安全回退路径(端侧尤重)"

更新于 2026-07-31北京
logo of alibaba
社招3年以上技术类-开发

1. 模型服务API: 开发实现端到端的模型服务,涵盖LLM/VL/embedding/rerank等大语言模型, 也包含diffusion model方向的生图生视频的模型服务,构建高效的服务框架提升模型接入效率, 优化端到端服务性能,确保稳定性。 2. 百炼大模型开发平台上各领域模型服务架构设计迭代、性能优化以及核心服务开发。 3. 百炼大模型开发平台模型微调、模型评测技术架构设计、算法开发以及对应业务能力建设。

更新于 2026-07-22北京|杭州
logo of antgroup
社招3年以上技术类-算法

1.我们正在寻找充满激情和经验丰富的大模型 AI 工程师/技术专家,加入我们行业领先的基础模型团队(Ling Team)。您将从基础设施的视角出发,深入参与大语言模型(LLM)的研发过程,与算法研究员紧密合作,共同负责并推动算法与工程的协同设计(Co-design)及优化。 在这个职位上,您将有机会解决大规模分布式训练和推理中的前沿挑战,通过极致的性能优化,将硬件潜力发挥到极限,为我们基础模型的迭代和业务落地提供坚实的算力基座和工程保障。 2.岗位职责: 你将从基础设施的视角,参与到新一代基座模型研发中,包括但不限于以下工作: -算法与工程协同设计: 参与scaling law 和 新模型架构的迭代设计,提供专家级工程实现方案,确保新模型架构的可实现性、高效性及可扩展性。 -训练与推理系统优化:基于特定模型架构,系统性分析并优化训练/推理框架性能,识别并解决大规模集群环境下的关键性能瓶颈。 -高性能并行与算子优化:研发高效精细的分布式并行策略(如张量、流水线、序列并行等),并针对核心算子进行定制化优化,充分释放硬件计算潜能。 -前沿技术探索与落地: 跟踪并引入业界最新的 AI 基础设施技术,包括但不限于编译优化、新型硬件架构等,并将其应用于实际的大模型研发中。

更新于 2026-02-02上海|杭州