字节跳动平台研发Leader(基础服务方向)-Flow
任职要求
1、具备良好的大规模资源成本运营、资源保障、GPU使用优化经验; 2、精通Python及1种主流语言(Java/Go/C++)栈,包括对应语言栈工具生态、架构设计;精通复杂业务场景的架构设计、抽象、治理类经验,对成本/GPU优化有成熟经验;掌握大模型的基本原理,理解预训练、SFT、RL等核心流程,对相关数…
工作职责
团队介绍:团队致力于打造AI时代下的下一代数据服务。如你对技术怀有极致追求,对AI数据服务与产品开发充满激情,我们诚邀你加入我们的团队。你将有机会与产品和应用开发团队紧密合作,共同推动技术的创新与发展,致力于塑造行业领先的AI数据服务。 1、对字节跳动大模型基础服务建设工作负责,包括外部模型接入(AI网关)、模型训练、标注、评测工具(Tool-Use)等关键能力的技术、平台规划、迭代、运维工作; 2、对AIDP团队的横向架构演进负责,包括效能、成本(GPU建设)、架构治理等,对打造AI Native型组织的研发范式建设负责,建设、推进AI Coding能力在AIDP的落地,形成最佳实践; 3、对AI Data的前沿、探索性工作的工程能力负责(如具身智能、3D等),建设数据采集、管理、加工合成等相关能力; 4、负责团队招聘、培养与绩效管理,搭建高质量人才梯队,持续提升团队对大模型业务各场景的赋能效果。
我们正在寻找一位具备平台化思维、系统架构能力和团队管理经验的 AI平台研发 Leader,负责企业级 AI 平台的整体技术规划、架构设计和团队建设,打造类似 Dify、OpenClaw 、CoWork的AI 平台能力。你将负责 AI 平台从 0 到 1、从 1 到 N 的建设,带领团队构建Agent生成、Agent部署、Agent调优、模型接入、模型训练、模型部署、AI网关、推理优化、RAG等核心能力,支撑内部员工和团队快速构建基于大模型的应用、工作流和智能体系统。岗位职责平台架构规划: 负责 AI 应用开发平台的整体技术架构设计,规划平台核心模块、系统边界、技术路线和演进方向。带团队拿结果: 负责 AI 平台研发团队的技术管理、任务拆解、人员培养和研发效率提升,推动团队持续交付高质量平台能力。AI平台建设:带领团队建设具备高性能、高可用、高扩展性、高安全性的AI平台。AI Infra 建设: 负责模型推理、训练保障、推理优化、模型服务化、资源调度等 AI Infra 能力建设,提升平台性能、稳定性和成本效率。跨团队项目推进: 与产品、算法、业务、运维、安全等团队协作,推动复杂平台项目落地,支撑多业务场景规模化接入。技术预研与平台演进: 持续跟踪大模型、Agent、RAG、MCP、推理优化等方向的前沿技术,判断技术价值并推动工程化落地。
ByteIntern:面向2027届毕业生(2026年9月-2027年8月期间毕业),为符合岗位要求的同学提供转正机会。 团队介绍:App Infra是字节跳动面向应用的基建中台部门,以App侧性能/稳定性深度优化为基础,结合LLM、Agent、生成式推荐模型等前沿技术,为字节跳动旗下的核心应用提供终端+平台的解决方案。于下层,结合操作系统、虚拟机、工具链、编译器等技术,建设了稳定性、流畅性、电量在内全链路的监控体系和调试分析工具;于上层,则结合端侧特征工程、深度学习模型/决策树模型/SLM训练等基建,围绕搜索/推荐/广告/直播/电商等场景,建设了云端协同推荐、品质体验优化等端智能解决方案。如果你热爱挑战底层技术、追求极致优化,又渴望把AI转化为千万用户感受得到的流畅与智能——欢迎加入,和我们一起打造下一代移动体验! 1、参与字节跳动亿级DAU产品端智能服务端研发,建设高可用、高并发服务架构,保障业务链路稳定; 2、参与大模型端云协同方案的探索,优化资源调度,协同移动研发工程师完成业务落地; 3、通过Agent技术实现解决方案自动化迭代,覆盖特征工程、模型训练、策略优化、部署观测的完整流程。
阿里巴巴智能信息事业群,聚焦AI在信息服务赛道的创新应用,从工具到服务,持续为用户提供高效、智能的AI应用。智能信息事业群核心产品为夸克、通义、UC浏览器、书旗小说、超级汇川等,以多产品矩阵,覆盖横跨各年龄段的7亿+用户人群,服务超10万+客户。 负责智能信息基础技术平台系统相关研发,包括不限于以下方向: 1、构建高效可靠的云原生容器平台、提出资源优化模型以提升业务资源效率、参与机器学习工程平台的建设和优化,以及运用技术和标准化方案确保平台服务的稳定性和可维护性。 2、负责开发和优化大模型应用开发框架,创造高效的搜索应用解决方案,并深度参与智能信息系统的基础架构与组件开发,以确保技术的高效集成与实际落地。 3、开发和优化搜索引擎,高并发检索、大数据分布式存储及流批计算等系统,深入搜索业务需求设计实现解决方案,不断提高业务性能、系统稳定性,提升系统效率和成本效益。 4、开发和优化推荐引擎、模型预测和向量检索等基础系统,深入参与信息流推荐业务以实现业务需求,同时基于业务洞察设计新平台或改进现有系统,提升系统效率和成本效益。 5、开发和优化实验平台与系统,紧跟AB测试技术前沿,为业务提供精准的实验设计和分析、优化关键指标,并应用算法提高业务参数寻优的效果和效率。 6、具备数理统计基础,在数据科学、数据分析方向有经验者优先。
负责云计算和大数据基础技术研发,包括但不限于以下方向: 1. 云原生基础设施技术,包括研发面向百万级服务器的应用容器网络、面向AI超算的100G/200G/400G大规模高性能网络及通信基础设施建设,面向电商、AI、大数据等核心互联网应用场景的高性能计算、存储服务器研发、数据中心,以及构建超大规模的基础设施智能化集群管理和运维系统(例如研发运维平台、资源调度、监控报警、AIOPS等技术方向); 2. 系统软件研发,包括操作系统/内核、JVM、编译器、Docker/安全容器、ETCD/Zookeeper分布式协调系统、网络&存储虚拟化等技术方向; 3. 负责阿里巴巴中间件产品的研发与维护,包括但不限于服务、消息、缓存、数据库、微服务框架等;负责 AI /高性能计算所需要的高性能分布式通信框架;负责阿里巴巴全局高可用产品的研发与维护,包括但不限于单元化架构、容灾、快恢、演练等;负责不断提升应用运行时的研发效率和分析诊断效率;探索 Serverless、AIGC 等新场景下的解决方案; 4. MySQL、Postgre SQL、MongoDB、Redis、HBase等开源数据库内核的改进,TDDL等分布式数据库中间件研发及大规模集群运维平台建设; 5. 参与大型技术平台的开发和维护,完成从需求到设计、开发和上线等整个项目周期内的工作。