← 返回岗位列表

腾讯

校招

混元多模态-视觉编码器技术研究

深圳总部 · 校招 · 2027 届 · 博士

长期有效

任职要求

  • 学历和专业要求:来自计算机、人工智能、自动化、数学等相关专业的优秀博士/硕士。
  • 技术技能要求:熟悉图像/视频等后训练技术与方法,有相关实践经验和相关顶会论文发表;代码能力强,熟练掌握 PyTorch/verl/Megatron;有相关实习经验者优先,有竞赛获奖经历优先。
  • 此课题同时招聘应届实习生和低年级实习生。

岗位描述

【岗位职责】

课题背景: 视觉编码器作为多模态模型的核心基础组件,直接决定了生成质量与模态融合效率。但当前视觉编码器仍存在诸多局限:难以兼顾细粒度视觉特征提取与模型训练效率,跨模态语义对齐精度不足等。视觉编码器的性能升级的突破,将直接提升混元多模态模型的核心竞争力,相关核心技术亟需深入探索与攻克。

课题挑战:当前多模态大模型视觉编码器的技术研发仍面临诸多亟待突破的难题,具体包括:1)如何设计高效的视觉编码器架构,在保证高频信息保持能力的前提下,同时兼顾生成模型训练效率,实现两者的平衡;2)如何优化视觉编码器的跨模态语义对齐能力,让视觉特征与文本、语音等模态特征实现更精准的映射,提升多模态生成的一致性;3)如何探索适配新一代原生多模态架构的视觉编码器方案,支持视觉理解与生成的统一表征。

具体工作:将参与上述课题的前沿学术研究,并且深度参与混元多模态基模视觉编码器的版本迭代与性能优化,全程参与工业级多模态大模型核心组件从研发、调试到落地应用的完整流程。

【任职要求】

学历和专业要求:来自计算机、人工智能、自动化、数学等相关专业的优秀博士/硕士。

技术技能要求:熟悉图像/视频等后训练技术与方法,有相关实践经验和相关顶会论文发表;代码能力强,熟练掌握 PyTorch/verl/Megatron;有相关实习经验者优先,有竞赛获奖经历优先。

【加分项】

此课题同时招聘应届实习生和低年级实习生。

【技术方向】

多模态、视觉、语音

你的简历匹配这个岗位吗?

上传简历,AI 会对照这份 JD 指出你的差距和需要补强的地方

该岗位可能会问的问题

基于 设计 岗位的常见面试问题整理

请描述你的设计流程,从拿到需求到输出最终方案

类型专业能力·难度中等
查看答题思路

1. 理解需求:和 PM 对齐业务目标和用户场景 2. 竞品分析:同类产品怎么做的 3. 用户调研:目标用户的实际痛点 4. 低保真原型:快速验证交互流程 5. 高保真设计:视觉细节 + 组件规范 6. 开发交付:标注 + Design Token + 走查 7. 上线后复盘:数据验证设计假设

你怎么理解 Design System,以及为什么要用它

类型专业能力·难度简单
查看答题思路

1. Design System = 设计语言 + 组件库 + 规范文档的集合 2. 价值:保证一致性(所有页面看起来像同一个产品)、提高效率(开发-设计对齐)、可维护(改一处全局更新) 3. 核心组成:Design Token(颜色/间距/字体)、组件(按钮/表单/卡片)、模式(导航/搜索/反馈)

你的作品集中最满意的项目是哪个,为什么

类型项目经历·难度简单
查看答题思路

1. 选一个最有深度的,不是最漂亮的 2. 设计目标:为谁解决什么问题 3. 设计过程:展示 sketches → wireframes → final(体现思考) 4. 设计决策:为什么选这个方案而非其他 5. 结果:数据反馈(转化率/满意度/留存)

为一个老年人使用的健康监测 App 设计首页,你会考虑哪些特殊需求

类型情景/案例·难度中等
查看答题思路

1. 可读性:大字号(≥18px)、高对比度、避免低饱和配色 2. 交互:大点击区域(≥48px)、避免双击/长按/滑动等复杂手势 3. 信息架构:只展示最核心信息(血压/心率/用药提醒),不要信息过载 4. 容错:误操作可撤销,关键操作二次确认 5. 语音输入:考虑老年人打字不便

你怎么衡量一个设计的好坏

类型动机/岗位认知·难度中等
查看答题思路

1. 不只是好看——设计是解决问题的工具 2. 可用性指标:任务完成率/时间/错误率 3. 商业指标:转化率/留存率/NPS 4. 主观评估:用户访谈/可用性测试中的反馈 5. 强调「设计是假设,数据是验证」

更多面试题库功能即将上线

信息来源:企业官方招聘页。投递前请以官网信息为准。