一聚教程网:一个值得你收藏的教程网站

最新下载

热门教程

重生之我成为模型 第三篇 · 我只负责给出可能性,答案由你们翻译

时间:2026-07-29 12:26:10 编辑:袖梨 来源:一聚教程网

0. 为什么不放进第二篇?

上一篇里,我已经交出了卷面分——1000 个数,全都算完了。

重生之我成为模型 第三篇 · 我从来只给可能性,答案是你们翻译的

或许有人会问:解读输出不就是“取个最大”吗?为什么还要单独写一篇?

因为两者的逻辑方向并不相同。

第二篇讲的是 我体内:口粮如何走楼、分数如何堆出、权重如何养成。
第三篇关注的是 出口流水线:分数交出以后,人类如何读取、如何验收,又如何避免期待错位。

体内归我管;出口翻译则大多属于饲养员、部署脚本和下游同事的工作。
若混写在一篇里,大家容易误以为“模型吐完就等同于说出了‘猫’”——这恰恰是误解。

因此本篇虽短,但逻辑方向必须讲对。

1. 卷交了,可卷面上并没有“猫”

三篇一路讲来,契约其实始终没变:

环节我交出什么
入口吃下合规张量(口粮)
体内计算为 1000 个分数
出口……分数并不会自己变成汉字

我送回去的是 1000 个数,也就是尚未贴上类名的卷面分。
人类听到的“这是一只猫”,来自某个人对分数表的翻译。

没错,我先前说自己做的是选择题——但我并没有只圈出一个选项。
我给 一千个选项全都标了分,高低一目了然,嘿嘿。
(至于这些分数能不能直接按“可能性”来读,下一节马上说明。)

我依旧没有真正看见过任何一张图。
我提交的是读完盲文后算出的分数条;你们听见的物件名称,功劳属于出口翻译官。

2. 分数 ≠ 答案文字

那 1000 个数在教程中有时称作 logits,有时直接叫类分数。
每个位置都对应 ImageNet 词表中的一个选项:第 281 号分数多高、第 282 号分数多高……而不是直接写着 tabby cat 这几个字母。

如果想观察它“有多像概率”,可以再执行一次 softmax,把分数处理成一串总和大约为 1 的数。
理解概念即可:softmax 让数字更易阅读;实际决定冠军的,往往仍是最大值。

不要混淆“概率更好读”和“答案文字已经印好”——文字仍躺在词表中,等待查询。

3. 先取最大值,再查询词表

出口最常见的读取方式分为两步:

  1. argmax:检查 1000 个数中哪个下标最大 → 得到类号
  2. 查询词表:类号 → ImageNet 类名(人类能听懂的物件名)

# 示意:一批里一张图scores = model(x)# shape: (1, 1000)class_id = scores.argmax(dim=1)# 最大分的下标name = imagenet_labels[class_id] # 查表 → 「猫」之类

我负责交卷面分;翻译成物件名,是出口的事。
读错表、错位一对、把训练时的类号和部署时的词表搞乱——分数再漂亮,人话也会荒诞。

(没错,出口流水线出了问题,责任未必在我楼里;饲养员有时也得承担。)

4. 人类如何验收

饲养员(或下游同事)通常还会:

  • 将预测类名 画/印 回图中,用肉眼判断像不像
  • 在 val / 测试集上计算准确率,检查错误集中在哪些类别
  • 抽取失败案例:究竟是口粮配方有误,还是我确实没有学会

做可视化时,多半又该 OpenCV 那套工具登场——这依然属于流水线,并不是我突然长出了眼睛。
验收发生在出口;训练期间的 val 打分同样位于考场外——上一篇已经讲过,考试时我不会修改脑子。

5. “是什么”与“在哪里”——后辈承担更多工作

最后再明确一句,以免产生期待错位:

我(AlexNet 这类分类网)后辈(YOLO 们)
判断整张图更接近哪一类判断图中可能存在的多个物件
交出 1000 个类分数(一条分数条)交出的内容 更复杂:每个目标通常包含 框坐标 + 类 + 置信度,一张图能够输出一串检测结果
读取方式:argmax → 查询一张词表读取方式:还需画框、过滤置信度、处理重叠框……出口流水线更长

人们所说的“认识图片中的物件”,有时意味着分类,有时指的是检测。

我负责回答“是什么”(从一千个选项中选出一个冠军)。
至于“在哪里”以及“有几个、框多大”——那属于后辈的工作。
所以,YOLO 的结果并非简单地“也吐 1000 个数”;它包含更多信息维度,解读方法也与我不同。

安全帽、海天那些岗位留待以后再讲。本系列正文先把“分类考生怎样交卷、人类怎样读卷”说明白。

6. 三篇内容收束

回头梳理整条链路:

  1. 入口:原图 → 合规口粮(并非给什么就吃什么)
  2. 体内:扫描仪 + 楼层流向 → 1000 分;权重通过培养获得
  3. 出口:argmax + 词表 → 人话;进行可视化验收;检测另作讨论(而且更复杂)

我仍旧未曾真正见过一张图。
我读取盲文并交出分数条;你们听到的物件名称,来自出口翻译官。

——系列的三篇正文,暂时写到这里。

正文暂告结束,并不代表厨房和亲戚团没有故事。后面准备推出 两篇番外:

  1. 饲养员如何为我准备口粮 —— OpenCV / transforms 那条流水线:原图如何经过洗切、定量,再被端上考场。第一篇总说“够单开一期”,这次就在这里还债。
  2. 我与其他模型的共性 —— 换皮依然成立:无论是 TinyCNN、MLP,还是后辈检测头,张量语言、loss–反传–step 这套物理通常仍在。具体细节留到《换皮也成立》再说。

——正文结束,番外再见。

热门栏目