
零一万物知识算法工程师
任职要求
1. 计算机、人工智能、软件工程、数学或相关专业本科及以上学历,3年以上算法或AI工程经验; 2. 熟练掌握Python及主流深度学习框架(PyTorch/TensorFlow),具备扎实的算法实现与调试能力; 3. 在以下至少两个方向有深入实践: - OCR后处理与文本数据清洗(如模糊匹配、规则引擎、语言模型纠错); - 知识图谱构建(使用Neo4j、Apache Jena、DGL-KE等工具链); - 大模型微调与部署(熟悉HuggingFace Transformers、vLLM、L…
工作职责
1. 负责大规模OCR识别结果的数据清洗、纠错与结构化处理,提升文本抽取的准确率与可用性; 2. 设计并构建面向垂直领域的知识图谱,包括实体识别、关系抽取、属性融合、图谱对齐等核心环节; 3. 基于业务场景对开源或自研大语言模型(LLM)进行领域适配与高效微调(如LoRA、QLoRA、Prompt Tuning等),提升模型在特定任务(如问答、推理、信息补全)上的表现; 4. 运用本体论(Ontology)方法设计领域知识体系,定义概念层级、语义关系与逻辑约束,支撑高质量知识建模与推理; 5. 探索多模态(图像+文本)信息融合策略,将OCR输出与视觉上下文结合,增强知识抽取与语义理解能力; 6. 与产品、数据及工程团队紧密协作,推动知识驱动型AI系统在内容理解、智能检索、风险识别等场景中的落地。
1. 非结构化/多模态数据处理(长文本、短文本、图片、音视频等),结合知识图谱进行实体抽取、归一,属性挖掘,提供在线工程服务。 2. 挖掘用户长/短周期画像,实现多源数据融合,大文本以及多模态表征数据构建以及应用。 3. 结合前沿技术和业务场景,探索创新算法能力。
商品基础算法团队是淘天集团核心的商品理解中台,负责对淘天全域(淘宝、天猫等)数百亿的商品进行深度、精准、多维度的内容理解。我们产出的商品认知能力(如属性、卖点、风格、品类、知识),是整个淘天搜索、推荐、广告、AIGC应用、智能导购、直播等所有核心业务的基石,直接决定了用户“逛”和“买”的体验,是连接“人”与“货”的智能引擎。 当前,我们正处在用新一代AI技术(大模型、多模态大模型)彻底重塑商品理解的历史机遇期。在这里,你将接触到海量的电商多模态数据,有机会定义下一代商品理解的技术范式,你的工作成果将通过集团各大业务场景,影响亿万用户的消费决策。 岗位职责: 1、参与商品 Wiki 知识库项目的研发与落地,综合运用 LLM、MLLM、Agent 等技术手段,系统性设计并持续迭代 Judge 引擎,驱动商品 Wiki 内容质量的规模化提升。 2、负责商品 Wiki 全链路质量管控,涵盖质量评估体系建设、错误样本挖掘与改写、人机协同审核流程设计等,通过精细化质量分层与闭环反馈机制,推动内容问题的系统性发现与治理。 3、运用 SFT、偏好学习(DPO/RLHF)、强化学习(RL)等后训练方法,持续提升 Judge 基础模型的判别能力;同时基于 Agentic RL 框架,增强 Judge Agent 在自主任务规划、多步推理及交叉验证等复杂场景下的决策能力。 4、深度跟踪 LLM / Agent 领域前沿学术与工程进展,结合业务场景开展技术可行性验证,推动前沿方法在实际生产环境中的高效落地与规模化应用。
1. 负责企业知识库、智能检索、RAG 相关算法能力建设,提升大模型在企业内部知识问答、信息查找、研发辅助等场景中的效果。 2. 参与企业内部文档、代码、业务资料、流程知识等多源数据的理解、处理与检索能力建设,提升知识获取效率。 3. 优化检索链路,包括查询理解、语义召回、关键词召回、排序优化、结果重排、上下文组织等核心能力。 4. 结合大模型能力,提升知识问答结果的准确性、相关性、可追溯性和稳定性,减少无依据回答和幻觉问题。 5. 参与企业知识的结构化处理,包括知识分类、标签体系、实体识别、关系建模、知识质量评估等工作。 6. 建立检索与问答效果评估体系,通过数据分析、bad case 分析、离线评测和线上反馈持续优化系统表现。 7. 与产品、工程和业务团队协作,将算法能力落地到企业知识库、智能助手、研发 Copilot、AI Agent 等实际场景中。
【岗位愿景】 大模型让 AI 学会了"记忆",但只有结构化、可信、可推理的世界知识,才能让 AI 真正"理解"。我们需要你把全网无序内容转化为机器可理解的世界知识,沉淀千问大模型的世界知识底座——让千问的回答更准确、推理更可信、对世界的认知更完整,成为最懂世界的 AI! 【职位描述】 1. 世界知识挖掘:研发面向开放域的实体、关系、事件、属性、常识等多类型知识抽取算法,从万亿级网页、文档、多模态内容中持续提炼高质量世界知识。 2. 知识表征与融合:攻克实体对齐、共指消解、知识冲突检测、来源可信度与时效性评估等关键问题,探索符号知识图谱与稠密向量表征的融合范式,构建覆盖全领域、跨语言、跨模态的统一世界知识体系。 3. 知识与大模型协同进化:探索世界知识与千问大模型的双向赋能——以知识增强大模型的事实性、时效性与多跳推理能力(RAG / GraphRAG / Agent / 工具调用 / 知识编辑),同时利用大模型反哺知识抽取、补全与纠错,形成"知识自进化"闭环。 4. 打造世界知识库:构建从抽取、融合、推理、更新到服务的全链路知识生产管线,建设覆盖通用百科、垂直领域、长尾实体与新鲜事件的世界级知识库,直接驱动千问对话、智能体、多模态理解、行业应用等核心场景的能力升级。