阿里云阿里云智能-技术服务专家-能源行业-杭州/北京
任职要求
1. 3年以上行业大型云计算解决、架构设计、维护、优化经验; 2. 3年以上的大型项目管理和团队管理经验,善于推动跨部门复杂项目的实施和较强的拿结果能力; 3. 有责任心,能在日常服务过程中很好实践客户第一,并成就客户; 4. 具有优秀的沟通技巧、团队合作经验、敬业精神和学习能力; 5、具有优秀的文档写作能力、演讲技巧、和技术培训能力 ; 6、具有较强的抗压能力和执行力,并能接受一定频率的出差。 技术方面满足以下一个或者多个条件: 1. 熟悉 Oracle、DB2、SQL Server、MySQL、Postgresql、NoSQL 等数据管理技术中的一种或多种,有 实际的生产系统应用经验,能够独立完成相关产品的部署、排错、性能调优等工作。 2. 熟悉 Nginx、JBoss、WebLogic、WebSp…
工作职责
1. 作为阿里云智能在客户侧的服务界面,全流程深入了解大型企业业务场景,与企业的 IT、应用架 构、人员合作,针对客户现有 IT 架构进行梳理与分析,协助并提供 IT 整体架构战略规划的咨询,协同 售前架构师所提供的设计方案的落地、实施和交付工作。 2. 基于阿里云的产品线、技术体系,帮助企业级客户制定 IT 架构和业务流程,包括定制的最佳实践、 异常处理机制和问题应急预案等。帮助客户深度理解云服务,并持续帮助客户提升技术能力。 3. 推动阿里云智能产品不断优化,解决客户使用云计算服务和解决方案过程中的技术问题,不断完善 问题处理机制和流程,与阿里云服务专家、产品专家直接合作,确保企业技术问题高效地解决。
一、客户技术服务 深入理解客户业务场景,快速定位并高效处置 Agent 执行异常、多模态生成失败、外部系统对接报错等技术问题,建立分级响应机制保障业务连续性。 分析客户在 Agent 定制、Prompt 设计、Skill选型、系统集成等环节的真实需求,系统化梳理高频问题,驱动产品侧持续优化核心能力。 二、平台稳定性保障 建立 AI Agent异常应急处置流程,针对 Agent 执行中断、模型调用故障、API 超时等场景快速定位根因并实施恢复,构建自动化诊断工具降低响应时间。 定期执行业务健康度巡检(执行成功率、模型配额消耗、集成稳定性),识别容量风险与资源瓶颈;为客户关键业务节点提供前置架构评审、压测与实时驻场护航。 设计并执行高可用演练方案,验证 Agent 容错性、多模型 fallback 策略与外部依赖降级能力。 三、AI Agent治理与优化 基于使用数据分析 Agent 执行效率与成本消耗,提供 Prompt 优化、模型选型调整、多模型路由策略优化建议,帮助客户在效果与 TCO 间取得最优平衡。 协助客户完善权限体系、数据隔离、审计日志与敏感信息脱敏方案,确保 AI Agent使用符合企业安全规范与审计标准。 提炼行业通用最佳实践模板,规避常见设计误区,形成可复用的场景化方案库。 四、服务管理与项目交付 设计合理的服务沟通机制,跨产研、售前、交付多团队协同,推动重大技术专项(系统集成、数据迁移、架构重构)按节奏高质量交付。 为企业客户整体满意度负责,定期输出技术健康报告,汇总问题处置、优化建议落地与 AI 应用价值量化成果,推动客户续约与用量增长。
1. 作为阿里云智能在客户侧的服务界面,全流程深入了解大型企业业务场景,与企业的 IT、应用架 构、人员合作,针对客户现有 IT 架构进行梳理与分析,协助并提供 IT 整体架构战略规划的咨询,协同 售前架构师所提供的设计方案的落地、实施和交付工作。 2. 基于阿里云的产品线、技术体系,帮助企业级客户制定 IT 架构和业务流程,包括定制的最佳实践、 异常处理机制和问题应急预案等。帮助客户深度理解云服务,并持续帮助客户提升技术能力。 3. 推动阿里云智能产品不断优化,解决客户使用云计算服务和解决方案过程中的技术问题,不断完善 问题处理机制和流程,与阿里云服务专家、产品专家直接合作,确保企业技术问题高效地解决。
1、对政企客户的项目交付中对需求痛点/项目需求进行识别,根据大模型的能力设计解决方案,并根据具体场景对算法进行实现和调优,包括数据收集与整理、模型训练、参数调优、评测等; 2、参与政企方向智算项目履约工作,包括智能体设计、搭建以及调优、工作流建设,解决客户/项目中的实际痛点问题,探索基于大模型技术的服务新形态; 3、负责为公司商业化输出的大模型产品提供技术支持,解决客户在使用过程中遇到的问题,确保云服务产品的稳定运行,保障项目的交付、运维、技术运营和平台应急; 4、收集和整理客户的反馈意见,为产品的改进和升级提供依据,不断优化大模型的性能和用户体验; 5、保持技术前瞻性,关注AI学术界和工业界的新动态,应用及探索前沿技术,确保技术方案在实际场景中的有效性。
1. 企业级 AI Agent 工程落地指导 作为客户 AI 应用技术服务的第一责任人,深入理解客户业务场景与技术痛点,主导Agent等工程全链路落地服务:从 RAG 构建、知识库向量化、Prompt Engineering 调优,到多 Agent 协作编排、工具链集成与 Function Call调试,确保 AI Agent 在生产环境高效运行。 2. 大模型训练与推理全链路架构设计,负责从数据到模型端到端技术支持 数据侧:设计数据采集、清洗、标注流程,搭建高质量训练数据 Pipeline 训练侧:基于 PAI 平台进行模型微调(SFT/RLHF)、LoRA 适配、分布式训练集群调度 推理侧:优化推理性能(KV Cache、Flash Attention)、推理服务弹性伸缩、Tokens成本治理 3. AI 云原生稳定性保障 从客户架构视角出发,通过自动化巡检、AIOps 工具链推动问题主动发现与风险预防。构建 AI 云原生全链路可观测体系,覆盖 SaaS 层(百炼/通义)、PaaS 层(PAI/DashScope)、IaaS 层(GPU 实例/高速网络)。结合大模型业务的高并发、长文本等流量特征,制定 GPU 算力集群的弹性扩缩容策略。负责推理延迟优化、显存 OOM 治理、模型服务灰度发布、模型流量调度、算力混沌工程、故障快速定位与 RCA 沉淀。 4. 卓越架构护航从公共云企业客户的业务视角出发,基于云上卓越架构最佳实践,主导客户云系统的持续诊断与重构。围绕高性能、高可用、安全合规、运维提效与成本精细化管理五大维度,推动架构的标准化与现代化升级。攻坚 AI 基础设施与传统业务系统的异构集成难题。设计并落地云上弹性伸缩方案,确保大模型/AI 业务在云端环境下的无缝对接、平滑扩缩容与极致弹性。