如果还没有选方向,可以先做一个看得见结果的项目:让模型认出手写数字,或者在自己拍的照片里框出人和车。数据、代码和教程都有现成的,从这里动手,再顺着碰到的问题补知识。
先做一次,是为了看看实际过程里有什么吸引你:喜欢把它做成一个应用,喜欢比较几种方法的效果,还是想追问模型为什么会出错?带着自己的体验,再决定下一步学什么、找谁交流。
下面先放两个视觉入门项目:MNIST 适合走一遍训练和提交,YOLO 适合先看到模型在真实图片上的效果。选一个感兴趣的开始;已经想做 Agent 或机器人,也有后面的入口。
MNIST:在 Kaggle 做一次手写数字识别
打开 Kaggle Digit Recognizer。任务很直观:输入一张手写数字图片,判断它是 0 到 9 中的哪一个。这个项目可以把数据、训练、预测和提交串起来。
先看数据,再找一份能读懂的代码
先打开比赛的 Data 页面,看看训练数据、测试数据和提交示例。把一行像素还原成图片,对照它的标签;这样再读模型代码时,知道它究竟在处理什么。
再到 Code 页面,找一份步骤完整、能从头读到尾的入门 notebook。可以搜 MNIST、PyTorch、CNN,优先看有数据展示、训练过程和生成提交文件的版本,复制到自己的 notebook 里运行。
第一次读代码,先找到数据读取、模型、loss、参数更新和预测这几处。拿不准一段在做什么,可以让 AI 逐段解释,再打印真实数据的 shape 看看。
训练一个模型,完成第一次提交
从带标签的训练数据里留出一部分做验证,训练后看它在这部分图片上认对了多少。然后对比赛测试集生成预测,按照提交示例的格式保存文件,完成一次提交。
到这里,你可以对照着想:模型训练时看到了哪些图片,验证时用了哪些,提交的预测又来自哪里?把这三件事分清,后面做其他项目也会反复用到。
改一点,看看结果怎么变
保存第一次跑通的 notebook、验证结果和提交文件,再改一个设置,比如学习率、训练轮数或网络宽度。先猜一下会发生什么,跑完对比。
把模型认错的图片摆出来看:哪些数字容易混淆,哪些连你也要辨认一下?下一次改动先用自己的验证集比较,榜单留作补充。最后写几句话:改了什么,结果怎样,你怎么解释,还有哪里没弄懂。
遇到概念和代码看不懂时
3b1b 的神经网络讲解用手写数字解释输入、神经元和输出,适合边做边看。PyTorch Learn the Basics可以用来查数据加载、自动求导、优化和模型保存;其中的 Quickstart 用的是服饰分类数据 FashionMNIST,读懂训练流程后再对照自己的数字识别代码。
Python 语法读不下去,去基础页补函数、循环、列表和文件读取。张量维度对不上,先补 shape、索引和矩阵乘法。想了解 AI 的更大图景,可以看 Crash Course AI 中感兴趣的主题。
YOLO:让模型在自己的图片里框出物体
如果你更想马上看到一个有意思的效果,可以从目标检测开始。分类回答“这张图是什么”,检测还要回答“东西在哪里”:一张照片里可能同时有人、自行车和汽车,每个物体都有自己的框和类别。
先用现成模型做一次预测
从 Ultralytics Quickstart进入,先用预训练模型跑通示例,再换成自己拍的图片。想在浏览器里做,可以从官方的 Colab 教程进入。
观察框、类别和置信度:远处的小物体有没有漏掉,遮挡之后还认不认得出来,同一个物体会不会被框两次?拿几张不同场景的图片试试,比只看一张成功截图更容易发现问题。
再走一遍训练和验证
跟着 训练教程,先用 COCO8 小数据集走通数据加载、训练和验证。它只有 8 张图,适合看清流程;想比较模型效果,下一步换成有足够训练与验证样本的数据集。
打开一张图片和对应标注,看看类别、框的位置怎样记录,再看数据配置文件怎样指定路径和类别。训练结束后,用保存的权重重新预测,找到结果图片和训练记录。
做一个自己想展示的小 demo
可以用一段自己拍的视频,观察模型怎样检测行人或车辆;想识别某种特定物品,就继续找有相应标注的数据,或尝试自己标注。先弄清当前模型认识哪些类别,再决定是否需要重新训练。
选一个现象继续试:换分辨率后,小物体能不能更容易被发现?调低置信度阈值,多出来的框有多少是误检?把结果图和设置放在一起,你就有具体东西可以拿去请教学长。
接下来可以读视觉方向,了解分类、检测和分割;开始想认真比较几种方案时,去看实验页。
已经对 Agent 感兴趣
从 Hello Agents 的基础内容,或 Hugging Face Agents Course 开始,选一套跟。
第一个目标可以是让模型调用一个简单工具,并读懂整个过程:收到什么任务、为什么调用、工具返回什么、接下来怎么做、什么时候结束。需要在线模型的练习会涉及账号或 API 费用,选例子前看它的运行条件。
保存一次成功和一次失败的执行记录。如果同样的问题直接问模型也能答,就比较加上工具之后到底改变了什么。接下来读 ReAct,再去 Agent 方向页挑一个想继续追的问题。
已经对机器人感兴趣
先看 ACT / ALOHA 的项目视频和方法图。拿一个动作来想:机器人看到了什么,示范数据里记录了什么,模型输出的动作又是什么?
然后在 LeRobot 里看一份示范数据和项目结构,把图里的模块对应到文件与数据上。第一步可以停在读数据、理解动作表示;仿真与真实机器人训练放在下一步选。具体入口在具身方向。
做完之后,怎么继续
留住三个东西:可以重开的项目、能讲清的一次改动、下次想问的一个问题。它们会把你带向不同的地方: