logo of transsion

传音CV算法实习生—AIGC方向(J19419)

实习兼职地点:深圳 | 上海状态:招聘

任职要求


基础要求
1、计算机、软件、人工智能、自动化、数学、电子信息等相关专业硕士/博士在读;
2、扎实的深度学习基础,熟悉计算机视觉相关方向,有Diffusion、GAN、TransformerLLM/MLLM等相关研究经验;
3、具备优异的论文阅读、复现和问题分析能力,有图像/视频生成、图像/视频编辑、图像/视频复原等方向研究经验;
4、熟练掌握Python,熟悉PyTorch
登录查看完整任职要求
微信扫码,1秒登录

工作职责


涵盖以下三个子方向:
 图像/视频生成方向
1、参与图像生成、视频生成、多模态生成等相关算法研发;
2、跟踪前沿生成式模型,包括但不限于Stable diffusion、DiT、FLUX、Qwen-Image、WAN、Z-Image等算法模型;
3、探索大模型在图像与视频内容生成中的应用与优化方案;
4、参与高质量数据构建、训练策略设计及模型效果优化。
图像/视频编辑方向
1、参与图像编辑、视频编辑、可控生成、指令编辑等相关算法研究;
2、包括但不限于Inpainting、Outpainting、风格迁移、局部编辑、人像美化、多图融合等任务;
3、探索基于多模态大模型(MLLM)的prompt改写方案;
4、优化编辑模型在实际业务场景中的稳定性与泛化能力。
图像/视频复原方向
1、参与图像/视频的增强与复原相关算法研发,包括超分辨率、去噪、去雨、去雪、去模糊、去反光、去阴影、低光增强等任务;
2、研究生成式方法在图像复原中的应用;
3、负责模型训练、调优及实际落地效果提升;
4、推动算法在移动端及工程系统中的部署优化。
包括英文材料
深度学习+
OpenCV+
Transformer+
大模型+
Python+
PyTorch+
CVPR+
还有更多 •••
相关职位

logo of vip
实习

加入唯品会CV团队,定义电商AI的视觉未来! ? 【团队介绍】我们是谁? 我们是唯品会CV团队,负责公司的视觉内容理解和生成相关业务。在这里,AI不只是实验室的Demo,而是驱动千亿级GMV的核心引擎。 玩转最前沿: 从image caption、图搜等多模态内容理解,到虚拟试衣、广告素材生成等 AIGC 创新,我们横跨多模态理解与图像视频生成两大巅峰战场。 让技术落地: 我们的代表作「穿上看看」是业内首个支持全量用户试衣的产品,欢迎你体验并跟业界对比,你的每一行代码,都可能被数千万用户实时感知。 ? 为什么选我们?(实习体验大升级) 算力与数据的“双重自由”: 告别“巧妇难为无米之炊”!我们坐拥海量高质量电商私域数据,更有专门的数据外包团队帮你从琐事中解脱,让你专注算法。GPU资源,支持你尝试多条技术路线。 大佬手把手,少走弯路: 团队大牛云集,成员多来自国内外顶尖名校及一线大厂。每个方向都有技术大佬亲带,带你深度参与从数据合成、SFT、强化学习到2步蒸馏的全栈实战。 不设限的成长空间: 我们拒绝做“调包侠”。在这里,你将接触到业界领先的 Badcase 闭环处理经验和全流程模型部署,打通从学术前沿到工业落地的“任督二脉”。 ?️你将挑战什么? 1、定义新电商: 深度参与图搜、智能搭配、AIGC素材生产、虚拟试衣等核心业务迭代。 2、攻克技术高地: 紧跟 Flux、Qwen-VL 等 SOTA 模型进展,通过 继续预训练、SFT、强化学习、蒸馏等手段,挑战生成内容的真实感、可控性与推理极限。 3、闭环实战: 负责从数据清洗、模型训练、调优到部署的全生命周期,亲手打造高良品率的生产级模型。 ?

更新于 2026-02-13上海|广州
logo of sensetime
实习技术族-实习

1. 辅助开展计算机视觉和深度学习算法的开发与性能提升,研究的问题包括但不限于:2D/3D物体检测与跟踪、物体6D姿态估计、人体姿态估计、物体人体在线重建、人体运动捕捉、语义分割、动态场景重建、视觉定位与导航等。 2. 紧跟学术前沿,开展高水平和创新性的研究,保持算法在工业界和学术界的领先,参与顶会论文投稿及专利申请。 3. 负责开发管理研究所需要的工具以及基础设施。 岗位优势: 1. 介于工业界与学术界之间,用前沿研究解决实际问题 2. 拥有丰富的数据与计算资源 3. 与科研和工程经验丰富的同事共事,有机会得到合作教授的科研指导

更新于 2025-10-17北京|上海|深圳
logo of oppo
社招1-5年SOFTWARE

我们正在寻找一位在多模态大模型(VLM)与智能体(Agent)领域具备深厚技术积淀的算法工程师。你将作为智能相册 Agent 的核心共创者,深度参与构建端云协同的下一代手机智能体生态。你将利用最前沿的深度推理(Deep Reasoning)、工具链学习(Tool Learning)以及图像/视频理解技术,打破传统相册的工具属性,赋予其主动规划、记忆反思、私有知识图谱检索以及跨应用协同的 Agent 能力。 岗位职责 1. 深度推理、意图识别与任务编排(Core Agentic Workflow) 负责端云协同相册 Agent 的架构设计与算法实现,攻坚多轮对话中的复杂长文本上下文管理、记忆提取(Memory Storage & Retrieval)与反思(Self-Reflection)机制。研究并优化 Agent 的任务拆解(Sub-goal Decomposition)与自主规划(Planning)能力,设计在端侧算力环境下的高可靠性路由决策机制。 2. 模型定制微调与推理效能优化(Fine-Tuning & Infra Optimization) 针对相册专属场景,负责大语言模型(LLM)与多模态模型(VLM)的指令微调(SFT)与强化学习,优化模型在 Tool-use 和结构化输出(JSON 强约束)上的准确率。基于开源的高吞吐推理引擎,针对高并发/端侧低算力环境进行模型的剪枝、量化以及分布式并行训练优化。 3. 数据飞轮与评测闭环 负责搭建完整的 Agent 评测基准(Benchmark)与数据飞轮工程,通过用户行为埋点形成自主对齐闭环,驱动算法模型的持续迭代。

更新于 2026-07-19北京|深圳
logo of oppo
实习SOFTWARE

1、参与视觉空间理解、计算与推理相关算法的辅助研发、调试与优化工作; 2、负责相关任务的高质量数据构建(如:设计/搭建并优化数据pipeline),保障数据质量适配模型训练与效果达成; 3、基于VLA技术完成相应的任务。包括但不局限于:研究影像与成像参数的关联机制。 4、配合团队完成技术文档撰写、实验数据整理等相关工作,产出高质量论文或学术报告。

更新于 2026-07-07上海