阿里巴巴研究型实习生-基于多模态大模型的人机交互技术研究
任职要求
1、计算机/人工智能/认知科学等相关专业在读硕士/博士; 2、有扎实的理论基础,对大模型、多模态建模、强化学习等相关技术研究感兴趣; 3、加…
工作职责
专注于多模态大模型与人机交互技术的创新研究及实践,具体职责包括: 1、探索多模态大模型(文本/图像/语音/视频等)的交互式应用场景,研发新型人机交互范式; 2、针对多模态交互复杂任务推理进行探索及研究,提升多模态、多跳推理场景下的复杂任务完成率; 3、优化多模态数据的融合算法,提升模型对复杂交互场景的理解与响应能力; 4、构建高效的多模态交互系统模型架构,研究低延迟、高并发的实时交互技术方案。
我们正在寻找对人工智能、多模态数据处理、系统性能优化感兴趣的实习生,参与一个面向多模态数据获取、解析、压缩与高效传输的研究课题。该课题聚焦于提升多模态系统在复杂环境下的实时性表现与资源利用率,具有广泛的应用前景(如智能运维、RAG检索增强生成、边缘计算等)。你将参与的工作包括但不限于: 1. 多模态数据采集与预处理:从网页、API、数据库、摄像头、麦克风等来源获取文本、图像、音频和视频数据; 2. 多模态数据解析与特征提取:使用OCR、ASR、NLP、CV等技术解析不同模态内容; 3. 模型轻量化与加速:探索基于Transformer、CNN、LSTM等模型的压缩、蒸馏、量化方法; 4. 系统级优化与部署:设计低延迟、低资源占用的数据处理流程,支持在边缘设备上运行; 5. 性能评估与实验分析:构建测试集,评估系统的吞吐量、响应时间、准确率等关键指标; 6. 撰写技术文档与研究报告:整理实验过程、结果与改进建议。 技术要求(优先但不强制): 1. 熟悉Python编程语言,有良好的代码规范; 2. 了解基本的NLP、CV或语音识别技术; 3. 掌握至少一种深度学习框架(PyTorch/TensorFlow); 4. 熟悉Linux系统及常用命令行工具。 有以下经验者优先考虑: 1. 多模态任务处理经验(如CLIP、Flamingo等); 2. 模型压缩与部署经验(如TensorRT、ONNX、OpenVINO、TVM等); 3. 使用过音视频处理工具(如FFmpeg、OpenCV、Whisper、YOLO等); 4. 有一定系统编程能力(C/C++、CUDA、FPGA基础)。
基于多核架构的数据库性能优化研究,具体职责包括: 1. 参与基于多核架构MySQL,PostgreSQL数据库的优化与实现,降低数据同步延迟和提升内存访问效率; 2. 构建并测试多核架构下MySQL,PostgreSQL的性能,确保其在高并发、低延迟场景下的性能优势,并根据实验结果进行迭代优化; 3. 与团队成员紧密合作,共同探索多核架构下MySQL,PostgreSQL等数据库中的最佳实践,推动技术创新与应用; 4. 负责制定详细的性能测试计划,分析原型系统的性能瓶颈,并提出有效的优化策略。
专注于安全容器系统的AI基础设施的研究、探索和开发,具体职责包括: 1. 探索阿里云安全容器系统和AI基础设施演进,支撑大规模AI业务; 2. 使能安全容器系统运行下一代AI基础设施,打造业界领先大规模AI算力基础设施; 3. 结合下一代AI基础设施、安全容器和AI业务协同优化,打造高性能、低成本的AI算力。
当前互联网入向调度(如8806、8809调度)通常采用多 Region(多中心)同时宣告相同或关联 Prefix 的策略。在这种架构中,入向流量的调度逻辑由"公网 BGP 选路"与"内网骨干回传"两段组成。 1. 入向选路的不确定性(核心背景): 当全球流量面对多个入口(Region-ISP)时,流量进入哪一个入口取决于上游 ISP 复杂的 BGP 决策(受 Local Preference、AS-Path、地理位置等因素交叉影响)。由于缺乏对公网选路结果的预判能力,流量往往会非预期地涌入某个 Region,造成入口带宽压力不均。 2. 调度决策的现状: 目前的调度主要通过在特定中心实施 AS-Path Prepending 或 Anycast 权重调整。由于无法事前准确预知这些动作会导致多少流量、从哪些路径、漂移到哪个 Region,调度过程往往依赖经验尝试。 3. 必要性: 内网回传模式是业务连续性的保障,但"入口选择"决定了端到端路径的质量基准。如果能精准预测入向切流行为,我们就能在公网侧主动引导流量进入最合理的入口,从而使"公网边缘路径"与"内网骨干路径"达成最优匹配,提升整体调度效率与业务稳定性。