新闻网讯 近日,新一届《麻省理工科技评论》“35岁以下科技创新35人”(MIT Technology Review InnovatorsUnder 35,TR35)中国区入选者名单在上海正式发布。我校三位校友入选该名单,他们分别是2015级计算机科学与技术学院校友李柏依、2011级电子信息与通信学院校友赵恒爽、2011级电子信息与通信学院校友丁文超。

“35岁以下科技创新35人” 2025 年中国区入选者群像
1999 年,《麻省理工科技评论》发起TR35,希望在成果进入聚光灯之前,发现那些最具潜力的青年科技创新者。2017年,TR35正式落地中国,聚焦具有国际影响力和创新潜力的中国青年科技人才,持续发掘在基础研究、关键核心技术攻关、科技成果转化等方面取得突出成绩的青年科技工作者,见证了一批青年创新者成长为推动科技进步和产业发展的中坚力量。截至目前,TR35中国已发掘315位科创青年与百余项世界级成果,催生近百家高潜力科创企业。

让机器“看懂”世界,不仅需要识别像素,更需要理解语义。李柏依的研究始终围绕一个问题:如何让视觉感知与语言理解深度融合,并最终驱动机器在真实世界中行动。
早在博士前的研究阶段,她就用端到端神经网络取代了图像去雾中依赖手工先验的传统方法,该方法成为该领域的基准方法之一。博士期间,她提出的LSeg将语言嵌入与像素级视觉分割打通,让模型得以凭自然语言描述识别任意类别的物体,不再受限于预定义标签集,这项工作开创了开放词汇视觉识别的范式。
加入英伟达和伯克利后,她将多模态学习推向自动驾驶和具身智能。在自动驾驶方向,她提出将世界“标记化”为对象级知识的多模态大语言模型,使车辆能够通过语言推理应对训练数据未覆盖的陌生路况;在机器人方向,她开发了基于大语言模型的交互式任务规划框架,让机器人通过对话理解并执行日常操作。她的长期目标是构建能够安全融入家庭的多模态自主系统,为照护服务提供智能辅助。

赵恒爽的研究始终围绕一个核心目标:如何让机器真正理解物理世界并与之交互。这一追问贯穿其学术生涯,也定义了“物理智能”这一新兴范式的内核——让智能不再停留于像素与符号,而是扎根于真实物理世界中。早期,他从二维图像场景解析切入,主导提出PSPNet,通过多尺度上下文建模,让模型不仅识别局部物体,更能感知整体场景关系。该方法成为语义分割领域的基础框架,广泛应用于自动驾驶、医学影像与环境监测等领域。
当物理智能从“感知图像”走向“理解空间”,他将研究推进至三维世界。他创建Point Transformer系列算法,将注意力机制引入不规则点云学习,重塑三维骨干网络范式,显著提升三维语义解析、空间建模与场景理解能力。随后,他提出Depth Anything系列方法,利用大规模无标签数据训练高精度单目深度模型,让普通图像也能恢复稳定的空间深度信息,该技术已集成至苹果Core ML等工业生态,为数十亿智能设备注入物理空间感知能力。
更进一步,为让物理智能从“理解场景”走向“改变世界”,他面向具身智能与自动驾驶,提出DriveGPT4、GPT4Point等系统,将大语言模型与空间感知、规划决策深度耦合,探索机器如何在物理世界中理解、推理并行动。由此,他的工作从二维视觉智能延伸至三维空间智能,再迈向多模态具身智能,构筑起完整的物理智能技术链条,推动AI从“感知世界”、“理解世界”,最终迈向“改变世界”。

如何让机器在充满不确定性的真实世界中作出决策,是自动驾驶和机器人共同面对的核心问题。丁文超长期围绕这一问题展开研究。他较早提出将环境预测与行为决策结合起来,让机器在决策过程中主动理解环境的不确定性,而不是依赖预设规则或一味采取保守策略,为数据驱动的自动驾驶决策提供了新的思路。
这一理念随后在产业中得到验证。他参与构建华为ADS自动驾驶预测决策系统,推动自动驾驶从依赖人工规则逐步转向从海量真实驾驶数据中持续学习,使车辆能够不断积累驾驶经验、优化决策,相关技术最终实现百万级量产应用。
随着自动驾驶的数据驱动路线逐渐成熟,他进一步将这一思路拓展到具身智能领域。作为它石智航联合创始人兼首席科学家,他提出“以人为中心”的数据路线与AI世界引擎具身基础模型,希望机器人通过观察和学习人类与世界的交互,而不是依赖人工编写规则,逐步获得感知、决策和操作能力,为通用机器人的规模化发展探索新的技术路。
编辑:刘雪茹
来稿审核:高飞
审核:万霞、史梦诗
审定发布:詹健