指南首页/看看外面
EN
看看外面

Lookout:研究者和实验室最近在做什么?

有时你不知道自己可以做什么,只是因为还没见过。看看别的实验室、公司和研究者正在解决什么问题,会给你新的参照,也会改变你对一个方向的认识。

AI 与机器人公司

语言、多模态与 AI 系统

腾讯 · 混元

语言、多模态、图像与视频生成;从混元开源项目进入模型、报告与示例。

小米 · MiMo

语言推理、视觉与语音模型;论文入口集中展示训练方法和模型设计。

字节跳动 · Seed

大模型、语音、视觉、世界模型与 AI 系统;研究页可以按主题追踪项目。

月之暗面 · Kimi

长上下文、推理与 Agent;从 Kimi 的开源模型看训练、工具使用和评测。

DeepSeek

MoE、训练效率与推理模型;技术报告能串起架构、训练和工程取舍。

阿里巴巴 · Qwen

语言、代码、视觉语言与全模态模型;按模型系列找权重、示例和报告。

MiniMax

长上下文、推理及多模态生成;可对照注意力设计与推理成本读报告。

智谱 · GLM

语言推理、代码和 Agent;GLM 系列提供模型实现、使用方法与研究材料。

Google DeepMind

Gemini、机器人、强化学习与科学发现;论文页连接模型报告和具体研究。

OpenAI

语言、多模态、推理与 Agent;研究发布和系统卡介绍能力、评测与模型行为。

Anthropic

Claude、可解释性与对齐;研究文章常展开实验设计和模型内部行为。

Meta AI

Llama、视觉与多模态研究;开放模型报告提供数据、训练和部署的系统描述。

按模型家族读技术报告 ↗

机器人与具身智能

这些团队从不同地方推进机器人能力:仿真交互、人类操作数据、通用模型、技能适应,以及真实机器上的控制。下面把研究重点和可以继续读的工作放在一起。

Physical Intelligence · π

研究让机器人完成多种操作任务的通用模型。π0、π0.5 把视觉、语言与动作连接起来,openpi 提供模型与训练、推理代码。

银河通用 · Galbot

围绕具身模型、机器人操作与移动作业开展研发,面向零售、搬运等场景。开发者入口可以继续看感知、规划、控制、导航接口与仿真资源。

智元机器人 · AGIBOT

研发人形机器人与具身智能模型,也开放操作数据和开发工具。AgiBot World 可以用来了解真实机器人数据如何组织,开源项目连接模型与机器人平台。

宇树科技 · Unitree

研发四足与人形机器人,G1、H1 等平台常见于运动控制研究。Unitree RL Gym 提供强化学习训练与部署入口,可以接着看策略如何从仿真走到真机。

星海图 · Galaxea

同时研发轮臂机器人和具身模型,并开放训练与部署工具。G0.5 用同一个自回归模型生成推理与动作,结合跨本体动作编码和视觉历史记忆。

Fast-WAM 比较世界模型的两种作用:训练时学习预测未来,以及执行时真的生成未来。它保留前者、跳过后者,研究动作质量与推理延迟的取舍。

苏度 · Sudo

从仿真训练出发,先解决陌生物体的抓取。官方发布的 sudo R1 使用纯仿真训练数据,每一步动作都根据最新观察调整,闭环频率为 15–25 Hz。

重点看目标移动、抓取中受干扰和狭窄空间绕障时,策略如何继续执行。官网提供技术说明和 60 分钟连续抓取视频。

它石智航 · TARS

研究如何把人类日常操作变成机器人学习的数据。WIYH 提供穿戴式采集设备、自动标注流程,以及超过 1,000 小时的多模态人类操作数据。

沿着 WIYH 看采集、标注与技能迁移;AWE 系列则关注视触觉融合和精细接触操作,包括柔性线束装配。

自变量 · X Square

研究具身基础模型,以及机器人如何适应新任务。HOST 从一段人类示范视频获取新操作技能,在推理时利用示范,不更新模型参数。

WALL-SS 是动作可控的生成式机器人模拟器,研究长时序交互,以及仿真中的任务结果和策略排名能否对应真实机器人。

穹彻 · Noematrix

围绕机器人操作研发具身模型、AnySkill 原子技能库,以及从采集到部署的工具链,涉及抓取、折叠和接触操作。

联合研究 RoboPocket 把策略预测的轨迹叠在手机画面上,让采集者看到潜在错误、补充纠正示范,再通过在线微调更新策略。

破壳 · Pokebot

由许华哲创办,面向家庭场景研究机器人操作。官网展示做饭、叠衣服、系香囊和穿扎带等任务。

可以从演示里看长任务如何衔接、双臂怎样配合,以及柔性物体处理和出错后的恢复。

具身智能:任务、模型与代表论文 ↗ · 强化学习:机器人控制与研究路线 ↗

从一项工作认识做它的人

看到一个让你好奇的演示,先找到原项目。读问题和方法,再看看作者还做过什么,相关工作来自哪些组。沿这条线,你会逐渐认识一个社区。

例如从 ACT / ALOHA 看示范与动作,再追机器人数据和策略学习;从 ReAct 看工具和反馈,再追长任务、恢复与评测。

遇到值得问的问题,可以写下来,回头联系作者或学长。

可以从哪些地方看

OpenAI 发布入口
看模型、研究和工程发布,遇到相关工作再读技术材料和评价条件。

Anthropic Research
看模型内部机制、对齐、实际使用与社会影响等研究;具体文章的出发点和方法也值得读。

**Google DeepMind 论文入口**与 Google Research
用关键词找自己的方向,再沿作者与相关论文继续看。

Berkeley AI Research Blog
从实验室成员解释一项工作的方式,了解研究问题如何被介绍和展开。

Hugging Face Daily Papers
发现论文和讨论,再回原文、代码和作者页面。

媒体和个人博客怎样一起看

机器之心、量子位、新智元、小红书、知乎、B 站、X 和 YouTube 都能让你碰到新东西。对一条消息产生兴趣后,顺着出处读原论文或发布页。

Z Potentials
AI 团队、创业者和技术访谈。看看不同团队在做什么,为什么选择这个问题,技术怎样变成产品。

葬AI
AI 产品体验和行业评论,表达直接、个人观点鲜明。可以从这里看看新产品怎么用,以及大家在争论什么。

个人博客里还会有结果之外的过程。苏剑林适合按数学与模型问题查,Simon Willison有工具实践记录,Karpathy有课程、项目和个人文章。具体经验另见经验栏目。

听研究者讲自己的工作

张小珺 Jùn|商业访谈录
与研究者、创业者长时间对谈,聊技术、工作经历和重要选择。

推荐谢赛宁这一期:从求学、研究经历聊到表征学习、research taste、世界模型和创业。可以先听经历与研究选择,再挑感兴趣的技术部分。

WhyNotTV
研究者访谈与求学经历分享,聊具体做过的工作,也聊一路上的选择。

  • 机器人博士前两年总结——任尔东西南北风:何泰然回顾在 CMU 读机器人博士的前两年,串起足式运动、人形机器人遥操作与控制等研究,以及一起完成这些工作的合作者。
  • 翁家翌访谈:聊本科接触强化学习、开源项目、申请经历,以及在 OpenAI 做后训练和基础设施的工作。

给自己做一份科研简报

在这些来源里找到了关注的方向,可以让工具定期挑选与你的问题相关的新工作。irene 的经验是先试读一期,再调整选题,最后安排推送时间。

我正在关注[具体问题]。请从最近一周的论文、代码、技术博客和实验室公告里选约五项工作,附日期和原始链接。每项说明做了什么、与我的问题有什么关系,以及接下来值得看哪张图、试哪个项目或追问什么。

参考我提供的最近七天简报和已读清单,去掉重复内容。旧项目出现新结果时,说明新在哪里。

把标题、链接、推送日期和阅读状态留在一份清单中,下一期也交给工具。兴趣权重、完整提示词和定时安排见科研简报工作流;收到论文后,再按阅读目的决定读多深。

看完一项新工作,记下哪些问题?

可以只写几句:这项工作在解决什么,和我原来知道的有什么差别,我想进一步看哪里。遇到值得讨论的,把文章和自己的问题一起发给同学。

如果一段时间总在同一个主题上停下来,也许它就是值得去方向页继续探索的线索。

研究社区与知识分享

OpenEnvision

OpenEnvision(OE)是连接学术界与产业界的开放 AI 研究社区,关注世界模型、多模态、视觉与具身智能,也通过整理博客、访谈和课程,为社区分享研究知识。

也欢迎向 BlogrXiv 和 ScholarTube 推荐值得分享的文章与视频。

Lumina

Lumina关注具身智能的研究、开源项目与社区交流。想系统了解这个方向,可以读具身智能指南;想听研究者讲正在做的工作,可以从官网的 Talks、具身观察和社区活动进入。

AgentHub

AgentHub(群谈)把 Agent 社区里的讨论整理成日报和周报,涉及智能体研究、工具使用、工程实践与行业动态。可以按日期翻阅,也可以看不同群组的讨论与外部资讯,了解大家最近遇到什么问题、怎样比较技术方案,以及同一个问题有哪些不同判断。

顺着材料找到人和团队

课题组与研究团队提供按研究问题找团队的入口;作者博客补上工作过程与个人判断;信息渠道目录保留前几轮找到的其他来源。