知乎数据平台开发工程师(AI Agent 方向)
任职要求
1. 基础工程能力 精通 Java 或 Python 至少一种开发语言,具备扎实的数据结构与算法功底,熟悉微服务架构。 熟悉大数据生态组件,掌握 Hadoop、Clickhouse、Doris、Hive 或 SparkSQL 等至少一种主流数据库/查询引擎 熟悉常见数据库(MySQL、PostgreSQL)及缓存(Redis),具备数据库设计与调优能力。 2. AI Agent 核心经验 Skills/Tools 开发:具备将业务逻辑封装为大模型 Function Calling(函数调用)或 Plugins(插件)的实际经验,理解 JSON Schema 及参数传递逻辑。 Text-to-X 实践:有 Text-to-SQL 或 Text-to-Chart 的开发背景,能够解决自然语言到结构化查询/可视化的转化痛点。 主流框架应用:熟悉 Dify, LangChain, LlamaIndex 或 Coz…
工作职责
数据平台架构升级:负责公司级数据平台的研发与维护,利用 AI 技术对传统 ETL 链路进行智能化改造,实现自动化的数据血缘分析、元数据管理及数据质量监控。 AI Agent 平台建设:设计并实现企业级 AI Agent 框架,包括任务规划(Planning)、记忆系统(Memory)、工具调用(Tool Use)等核心模块,使 AI 能够自主完成复杂的数据提取与分析任务。
1、参与快手项目所需的数据采集、清洗、加工与交付处理; 2、设计高效的数据处理工具链,支持亿级数据的ETL; 3、理解数据需求,与业务紧密配合,建立自动化数据处理流程及系统; 4、了解数据治理,持续提升数据质量,挖掘数据价值。
1. 文本/图文/音频/视频数据清洗、处理流程的工程化算子实现; 2. 构建高效、可扩展的流程编排及执行引擎; 3. 构建基于海量图文数据的搜索引擎,内容检索、多模态检索、RAG及性能&效果优化; 4. 与下游模型平台的对接,相关sdk的设计; 5.构建agent平台,包括single-agent, multi-agent以及ui agent等,以更加智能化的方式支持我们的数据处理和高质量数据的生产; 6. 基于大模型、agent及我们已有的海量数据,在应用端的探索。
关于我们 我们研发 AI 数据合成平台,持续生产高质量训练数据和评测数据。 平台覆盖任务生成、环境构建、数据生成、自动验证、自动评测等核心能力,服务于模型训练、Benchmark 建设和 Agent 能力演进。当前重点场景包括 Coding、Computer Use、Browser、Research 等方向,并持续探索更复杂、更真实的长链路任务。 1. AI 数据合成平台开发:负责 AI 数据合成平台的设计与开发,建设覆盖任务生成、环境构建、数据生成、数据验证、数据管理等核心能力,持续提升高质量 AI 数据的生产效率。 2. AI 数据生产 Workflow 开发:负责 AI 数据生产 Workflow 的设计与开发,包括任务编排、自动执行、数据验证、质量分析、数据回流等能力建设,构建自动化、可扩展的数据生产流程。 3. Benchmark 与评测平台开发:负责 Benchmark 与模型评测平台开发,建设自动化评测、LLM-as-a-Judge、Rule-based Verifier、Rubrics、评测分析等能力,支撑模型持续评估与迭代。 4. Agentic RL Environment 开发:负责 Agentic RL Environment 的设计与开发,构建真实、可交互、可验证的任务环境,为 Agent 的训练、评测和高质量 AI 数据生产提供基础设施支持。