外观
上一篇我停在 PPO 和 SAC 那里,把连续控制里最常用的几个算法过了一遍。但强化学习只是一半:它回答的是「给定状态和奖励,怎么学一个好策略」,而具身智能的入口问题要更土一点——机器人站在客厅里,人对它说了一句「走出客厅,上楼梯,经过餐桌,在门口左转,进入卧室」,它下一步该往哪儿迈。
这个问题有个正式名字:视觉语言导航(Vision-and-Language Navigation,VLN)。我读的这篇是 Gu 等人 2022 年的综述《Vision-and-Language Navigation: A Survey of Tasks, Methods, and Future Directions》,发在 ACL 上,正文 18 页,我前后翻了三遍。
读的过程里我卡住的地方很具体。综述里每个词我都能查明白——oracle、grounding、attention、HAMT、PREVALENT——但我不知道它们之间的关系。比如看到「Memory-augmented Model」这一节,我第一反应是记忆到底存在模型里,还是存在机器人系统里;看到「Auxiliary Tasks」,我又想,这不就是多挂几个损失函数吗,为什么在导航里值得单独列一类。
后来我发现,问题出在我把它当成了方法清单。这篇综述的分类其实是长在难点上的:先有四组卡住人的地方,再有四类方法。所以这篇文章我不追方法细节,只想把「VLN 到底难在哪」讲清楚,然后说明那四类方法各自在回应哪一组难点。
你不需要学过强化学习。但如果知道状态、动作、策略这三个词指的是什么,读起来会顺很多。
论文仓库地址:https://github.com/UCSB-AI/awesome-vision-language-navigation
我学习具身智能时,有一个卡点卡了很久:我说「把红色杯子拿起来」的时候,模型到底是怎么知道该去看桌上哪一块区域的?
这个问题听起来很朴素,但顺着它往下走,就能走到 Transformer 的核心。机器人的输入是几件完全不同性质的东西:摄像头给出的是几千个 patch,语言给出的是几十个 token,本体感受给出的是关节角度和末端位姿,再加上刚刚执行过的一串动作。分开处理它们并不难,难的是让它们互相知道对方的存在。
2017 年,Vaswani 等人在《Attention Is All You Need》里给出的答案,是把所有模态都摊成同一维度的向量序列,然后让每个位置自己去问其他位置:「你和我有关系吗?」[1] 我越往后学,越觉得这篇论文像一张技术地图,BERT、GPT、ViT、CLIP,以及现在的各类视觉语言动作模型,都能在上面找到熟悉的道路。
本文是我自己的学习笔记,不打算从零实现一个可训练的大模型。我想回答三个问题:为什么必须用注意力?一个 Transformer Block 里有哪些组件,各自负责什么?这套结构又是怎么接上视觉、语言和动作的统一建模的?
学习建议
本文是学习过程中的结构化笔记,不是零基础教程。我建立直觉主要靠沐神(李沐)的论文精读和 3Blue1Brown 的注意力机制动画,这篇文章更像是我把它们和公式对照一遍之后留下来的记录。
上篇我们搞定了 MDP 建模、贝尔曼方程、动态规划、MC/TD 和 DQN,这部分的核心问题其实就一个:「怎么评价一个状态或动作的好坏」。一旦我们算出了价值函数,决策逻辑就很简单粗暴了:无论是去查传统的 Q 表,还是通过神经网络(DQN)来预测,策略就是直接选出 Q 值最大(贪心)的那个动作执行。
但到了具身智能的真实场景,这套 Value-based 逻辑就有点使不上劲了。一个 30+ 自由度的人形机器人,每个关节的控制都是连续变量。在这样呈指数级爆炸的动作空间里,寻找全局最优的 计算成本是灾难性的。你没法建一张 Q 表把所有动作的价值都存下来,也没法在每个时间步都跑一遍 。
所以这一篇换一个思路:不间接地通过值函数推导策略,而是直接学一个端到端的策略网络(Policy Network),这个网络输入状态输出动作。这就是策略梯度(Policy Gradient)方法的核心思想,也是后续 PPO、SAC 这些具身智能主力算法的共同起点。
2025 年到 2026 年,具身智能的热度大概可以用「炸裂」来形容。Figure AI 的人形机器人进了宝马工厂,Tesla Optimus 频繁在发布会上刷存在感,国内银河通用的 Galbot 也在各种展会上搬箱子、叠衣服,春晚舞台上宇树机器人集群表演了赛博中国功夫——这个赛道明显在加速。
但真要想入行做具身智能,第一道坎就是强化学习。不管你以后是做 Sim-to-Real 迁移、做灵巧手控制、还是折腾 RLHF 对齐,RL 的基础都是绕不过去的。我以前只用Torch或者是TensorFlow做过一些 toy project,但这那些都是代码层面的积木拼接。所以我自己最近也在啃这块内容,主要针对算法方面,这篇文章就是我的学习笔记,顺带把它整理成一篇可读的东西。
本文假设你学过一点概率论和线性代数,但没碰过 RL。我会从最基本的 MDP 建模讲起,一路走到 DQN,中间穿插一些具身智能视角的解读。
特别说明
课程我主要看的是西湖大学赵世钰老师的视频以及大量的网络资料。本文偏向于笔记,而不是零基础教程。
当你网上自查心理疾病belike
最近开始系统接触精神分析,想把一些思考用最通俗的方式记录下来。如果你也对“怎么理解一个人”这件事感兴趣,希望这篇能给你一点启发。
行囊又负别初阳、碾寒光,碎河梁。
汽笛声中,暮色染车窗。回首家山灯火处,风渐冷,雾苍茫。
十年客路鬓添霜、月窥廊、照空床。
万巷楼台,何处是吾乡?欲问归期风骤起,吹落雪、满衣裳。
在
原论文分享的训练方法和细节并不多,复现难度不小。在许多传统观点中,我们认为训练一个具备强大推理能力的语言模型,必须对每一步推导过程进行精细监督。但 DeepSeek-R1 就是个例外——它用了一种更"野"的路子。本文继续深挖 DeepSeek-R1,从不同角度理解奖励信号是如何激发推理能力的。
提示
这是笔者第一次备团,记录一下备团记录,同时也方便其他kp参考。本记录存在大量改编以及添加的内容,建议通读原模组再阅读。
本文一共2万余字,分为【时间脉络整理】【地点事件整理】【事件台词整理】【面板与常用法术速查】几个部分,其他kp可以根据自己的需要查看。
趣闻
2025年1月,DeepSeek-R1发布当天,英伟达股价暴跌17%。一家中国AI公司用不到OpenAI十分之一的训练成本,做出了接近甚至打平o1的推理模型——这个消息的冲击波,从硅谷一路传导到了华尔街,有人惊呼"神秘的东方力量"。
提示
项目地址:https://github.com/fullstack-sake/InstruAgent
《献钟与芽》
金属苔藓爬上我的脊椎
我的脊椎正在熔成铁水
一半是灼烧的河
一半是蝴蝶的冷光
光斑在表盘上产卵
铜雀啄食我眼里的沙
所有春天都卡在齿轮的豁口
他们教我用石英校准心跳
可我的脉搏总在整点溃逃
黎明里游着金属的蝌蚪
把暮色扎进静脉点滴
刺穿所有滴答的坟
当铜绿繁殖出第八个月亮
我吞下整座停摆的钟
渗出的绿芽顶开颅骨
新的悬针剪碎了铰链的影
正在我肋间重组年轮
而早该腐朽的心脏
突然撞响青铜的轰鸣
《相见欢 · 岁杪归思》
寒梅卧雪临窗,暗噙香。
倦数孤灯凝户鬓添霜。
冰霰碎,枯枝坠,夜何长。
欲驾星槎穿夜渡寒江。
《虞美人 · 寒窗寄怀》
霜风叩牖冰弦颤,砚底梅花乱。
青衫尘满未成章,忍看枯枝垂泪向空廊。
浮生总被寒更误,鬓雪添新絮。
但求星火暖苍垠,肯借一襟春色破迷津。
…移动机器人路径规划(path planning)是指移动机器人自主设计从起点到终点的距离最短(shortest distance)、耗时最短(least time-consuming)、安全(safely)、无碰撞(collision-free)的路径。
《一剪梅 · 暮蛩声咽旧苑楼》
暮蛩声咽旧苑楼。苔啮痕幽,影啮光幽。
半墙残照渍成秋。风削帘旌,雨蚀帘钩。
忽见寒汀泊客舟。墨字沉浮,眉字沉浮。
雁翎霜薄不堪邮。醉捻空星,月钓沧流。