
商汤AI算力池产品实习生
任职要求
懂开发,了解模型训练和推理过程的优先; base上海,27届/28届硕士毕业生优先考虑; 优秀的逻辑…
工作职责
根据产品需要,了解内外部用户需求和竞品情况; 根据市场、前场及用户反馈,收集用户诉求,持续优化产品方案; 跟进研发过程,管理项目需求,产出需求方案,推动产品项目落地; 产品上线后,配合运营和市场,将产品推向用户。
我们是专注于大模型服务平台的技术团队,我们的核心业务是提供高效稳定的大模型推理服务API,帮助各行各业轻松利用大模型的强大能力,正在寻找一位有实力的Site Reliability Engineer (SRE) 加入我们,共同打造更可到的大模型服务平台。 负责AI基础设施算力资源的规划、运营管理与精细化数据体系建设。通过系统化、数据化方法提升GPU资源利用率、周转率与成本效益,保障AI训练/推理任务的高效稳定运行,支撑业务快速发展。 【工作职责】 1.大模型服务和平台的稳定性保障与体系建设:负责大模型相关核心业务系统和模型服务的稳定性建设工作,提升业务可用性与可靠性; 2.高并发流量治理:高并发场景下的流量治理方案设计与实施,包括熔断、限流、降级等容灾策略,确保业务弹性与鲁棒性; 3.GPU算力资源规划与运营管理:包含不限于优化GPU资源配置模型,平衡计算性能与成本,推动资源采购决策与部署策略落地,优化GPU资源配置模型,平衡计算性能与成本,推动资源采购决策与部署策略落地; 4.运维流程优化和自动化:推动运维自动化与平台化建设,提升研发效率; 5.架构高可用建设:业务系统稳定性架构方案的设计与实施,推动高可用架构落地,规避系统性风险; 6.应急响应:响应系统故障,快速诊断并恢复服务,分析原因并提出预防性改进措施;

1、负责“商汤”AI算力Token、接口调用Token、授权Token产品的销售与推广,完成个人及团队月度、季度销售指标; 2、开发企业及个人客户资源,通过线上线下渠道拓展新客户,挖掘客户Token用量及采购需求; 3、为客户讲解Token算力规格、计费模式、使用场景、套餐政策,提供专业咨询与方案匹配; 4、跟进客户咨询、报价、谈判、下单、充值及续约全流程,促成成交及复购; 5、维护老客户关系,定期回访,跟进消耗用量,推动增购、续费及转介绍; 6、收集市场同行价格、政策及客户需求反馈,整理销售数据、客户台账,定期提交工作报表; 7、遵守公司业务合规规则,规范业务沟通及成交流程,把控合作风险; 8、配合团队完成市场推广、活动宣发、渠道分销等相关销售工作。
1.建设AI算力池数据层,构建各类资源算力管理模型,研发Agent生产系统,与AI算力池的训推平台SRE各系统Agent联动,实现端到端自动化的TPM智能容量规划、弹性交付、需求应答、智能流量管控调度、自适应限流、资源高效流转腾挪,实现全局TPM利用率、单位算力Token成本的优化 2.建设单机和中心的管控Agent,实现模型的TPM运行时算力质量与性能自适应优化与SLA保障,解决模型部署运行时GPU/CPU/kv显存内存/PCIe互联/网络通信在通用与Scalup机型架构下的各类竞争与干扰,Agent具备端到端的问题识别发现、根因诊断、算力与性能优化、后训练Agentic RL反馈微调垂类模型等自动化闭环,增强Agent对模型运行时算力问题、性能瓶颈和优化策略的理解,自动识别并完成差异化硬件芯片架构、集群/网络/互联架构、系统软件栈如内核/编译下的软硬件结合优化、全局卡型模型最优匹配。 3.构建引擎架构与性能优化Agent,通过各类系统架构与性能优化,实现TPM性能与计算效率、各类模型与Agent能力体验大幅优化。典型如Agent自动优化推理引擎架构代码、训练系统架构代码、模型结构、AIData管线架构代码、Agent Infra架构代码、Agentic RL训推联动系统架构代码等 4.搭建多智能体协作框架,研究数十万智能体Agent的分工、协同、通信机制、后训练、反思与决策机制,提升各Agent系统在复杂场景下的鲁棒性、稳定性、执行效率与优化效果。