
第 8章 深度学习
256
行处理,而只由卷积层构成的网络中,空间容量可以保持原样直到最后的输出。
如图8
-
20 所示,
FCN
的特征在于最后导入了扩大空间大小的处理。基
于这个处理,变小了的中间数据可以一下子扩大到和输入图像一样的大小。
FCN
最后进行的扩大处理是基于双线性插值法的扩大(双线性插值扩大)。
FCN
中,这个双线性插值扩大是通过去卷积(逆卷积运算)来实现的(细节请
参考
FCN
的论文
[37]
)。
图8-20 FCN 的概略图(引用自文献[37])
全连接层中,输出和全部的输入相连。使用卷积层也可以实现与此
结构完全相同的连接。比如,针对输入大小是32×10×10(通道
数32、高10、长10)的数据的全连接层可以替换成滤波器大小为
32×10×10的卷积层。如果全连接层的输出节点数是100,那么在
卷积层准备 100 个 32×10×10 的滤波器就可以实现完全相同的处理。
像这样,全连接层可以替换成进行相同处理的卷积层。
8.4.3
图像标题的生成
有一项融合了计算机视觉和自然语言的有趣的研究,该研究如图8
-
21 所
示,给出一个图像后,会自动生成介绍这个图像的文字(图像的标题)。
给出一个图像后,会像图8
-
21 一样自动生成表示该图像内容的文本。比
如,左上角的第一幅图像生成了文本“
A person riding a motorcycle on a