爱吧机器人网 » 技术 > 神经网络 > 正文

Hinton胶囊网络代码正式开源,5天GitHub fork超1.4万

核心提示:万众期待中,Hinton胶囊网络论文《Dynamic Routing between Capsules》的代码正式公布,仅仅5天,Github上fork数量就超过了1 4万。Capsule真能取代CNN吗?接下来是你动手的时间了。

新智元编译
来源:GitHub;jhui.github.io
编译:文强,马文

\
 
【新智元导读】万众期待中,Hinton胶囊网络论文《Dynamic Routing between Capsules》的代码正式公布,仅仅5天,Github上fork数量就超过了1.4万。Capsule真能取代CNN吗?接下来是你动手的时间了。
 
Hinton胶囊网络论文《Dynamic Routing between Capsules》的一作Sara Sabour日前在GitHub公布了代码,使用TensorFlow和NumPy实现,只有一台GPU也行,仅仅5天,fork的数量就超过了1.4万。
 
实际上,在官方代码公布前,已经有很多其他版本和实现。新智元也对胶囊网络的概念做过详细介绍:
 
[4]【Hinton 碰撞 LeCun】CNN 有两大缺陷,要用 capsule 做下一代 CNN
[5]【一文读懂 Hinton 最新 Capsules 论文】CNN 未来向何处去
[6]【一文读懂 Hinton 最新论文】胶囊网络 9 大优势 4 大缺陷(视频 + PPT)


不过,在看代码前,还是有必要再次回顾这篇Hinton革新CNN的论文,Jonathan Hui在他的博客上对这篇论文做过拆解,从基本概念开始,读来非常友好。
 
用“Capsule”作为下一代CNN的理由 
 
在深度学习中,神经元的激活水平通常被解释为检测特定特征的可能性。

\
 
但是,CNN善于检测特征,却在探索特征(视角,大小,方位)之间的空间关系方面效果较差。例如,下面这张图片可能会骗过一个简单的CNN模型,让CNN模型相信这是一张真实的人脸。

\
 
一个简单的CNN模型可以正确提取鼻子、眼睛和嘴巴的特征,但会错误地激活神经元进行人脸检测。如果不了解空间方向,大小不匹配,那么对于人脸检测的激活将会太高,比如下图95%。

\
 
现在,假设每个神经元都包含特征的可能性和属性。例如,神经元输出的是一个包含 [可能性,方向,大小] 的向量。利用这种空间信息,就可以检测鼻子、眼睛和耳朵特征之间的方向和大小的一致性,因此对于人脸检测的激活输出就会低很多。

\
 
在Hinton的胶囊网络的论文中,就使用“胶囊”(capsule)来指代这样的神经元。
 
从概念上讲,我们可以将CNN看成是训练神经元来处理不同方向的视角,并在最顶层有一层人脸检测神经元。

\
 
如上所述,为了CNN能够处理不同的视角或变体,我们添加了更多的卷积图层和特征图。尽管如此,这种方法倾向于记忆数据集,而不是得出一个比较通用的解决方案,它需要大量的训练数据来覆盖不同的变体,并避免过拟合。MNIST数据集包含55,000个训练数据,也即每个数字都有5,500个样本。但是,儿童看过几次就能记住数字。现有的包括CNN在内的深度学习模式在利用数据方面效率十分低下。引用Geoffrey Hinton的一句话:
 
It (convolutional network) works depressingly well.
 
胶囊网络不是训练来捕捉特定变体的特征,而是捕捉特征及其变体的可能性。所以胶囊的目的不仅在于检测特征,还在于训练模型来学习变体。
 
这样,相同的胶囊就可以检测不同方向的同一个物体类别(例如,顺时针旋转):

\
 
其中,Invariance对应特征检测,特征是不变的。例如,检测鼻子的神经元不管什么方向,都检测鼻子。但是,神经元空间定向的损失最终会损害这种invariance模型的有效性。
 
而Equivariance对应变体检测,也即可以相互转换的对象(例如检测不同方向的人脸)。直观地说,胶囊网络检测到脸部旋转了20°,而不是实现与旋转了20°的变体相匹配的脸。通过强制模型学习胶囊中的特征变体,我们可以用较少的训练数据,更有效地推断可能的变体。此外,也可以更有效地防止对抗攻击。
 
计算一个Capsule网络的输出:不同维度的参数 
 
胶囊是一组神经元,不仅捕捉特征的可能性,还捕捉具体特征的参数。
 
例如,下面的第一行表示神经元检测到数字“7”的概率。2-D胶囊是组合了2个神经元的网络。这个胶囊在检测数字“7”时输出2-D矢量。对于第二行中的第一个图像,它输出一个向量 v=(0,0.9)v=(0,0.9)。矢量的大小0.9 对应于检测“7”的概率。每行的第二个图像看起来更像是“1”而不是“7”。 因此,其相应的可能性为“7”较小。

\
 
在第三行,旋转图像20°。胶囊将产生具有相同幅度但不同方向的矢量。这里,矢量的角度表示数字“7”的旋转角度。最后,还可以添加2个神经元来捕捉大小和笔画的宽度(见下图)。

\
 
我们称胶囊的输出向量为活动向量 ,其幅度代表检测特征的概率,其方向代表其参数(属性)。
 
在计算一个胶囊网络输出的时候,首先看一个全连接的神经网络:

\
 
其中每个神经元的输出是从前一层神经元的输出计算而来的:
 
\
 
对于capsule网络,一个capsule的输入Ui和输出Vj都是向量。
\
\
 
 
它将短向量缩小到接近0,将长向量缩小为接近单位向量( unit vectors)。因此,每个capsule的似然性在0到1之间。

\
 
迭代动态路由规则与重要性
 
在深度学习中,我们使用反向传播来训练模型参数。转换矩阵 Wij 在胶囊中仍然用反向传播训练。不过,耦合系数 cij 用新的迭代动态路由方法进行计算。

\
 
 
在深度学习中,我们使用反向传播来训练基于成本函数的模型参数。这些参数(权重)控制信号从一层到另一层的路由。如果两个神经元之间的权重为零,则神经元的激活不会传播到该神经元。
 
迭代动态路由提供了如何根据特征参数来路由信号的替代方案。通过利用特征参数,理论上,可以更好地将胶囊分组,形成一个高层次的结构。例如,胶囊层可能最终表现为探索“部分-整体”关系的分析树。例如,脸部由眼睛、鼻子和嘴组成。迭代动态路由利用变换矩阵、可能性和特征的性质,控制向上传播到上面胶囊的信号的多少。
 
最后,就到了应用胶囊构建CapsNet,进而对MNIST数字进行分类和重构的时候了。下面是CapsNet的架构。一个CapsNet共有3层,两个卷积层和一个全连接层。

\
 
论文提到的MNIST数字重构任务:

\
 
Github代码
 
Capsule模型代码在以下论文中使用:
 
"Dynamic Routing between Capsules”(胶囊间的动态路由) by Sara Sabour, Nickolas Frosst, Geoffrey E. Hinton.
 
要求:
 
TensorFlow(请参阅http://www.tensorflow.org了解如何安装/升级)NumPy(请参阅http://www.numpy.org/)
 
GPU
 
运行测试验证设置是否正确,例如:

\
 
快速MNIST测试结果:
 
从以下网址下载并提取MNIST记录到 $DATA_DIR/:https://storage.googleapis.com/capsule_toronto/mnist_data.tar.gz从以下网址下载并提取MNIST模型checkpoint到$CKPT_DIR:https://storage.googleapis.com/capsule_toronto/mnist_checkpoints.tar.gz

\

快速CIFAR10 ensemble测试结果:
 
从以下网址下载并提取cifar10二进制版本到 $DATA_DIR/:https://www.cs.toronto.edu/~kriz/cifar.html从以下网址下载并提取cifar10模型checkpoint到 $CKPT_DIR:https://storage.googleapis.com/capsule_toronto/cifar_checkpoints.tar.gz将提取的二进制文件的目录作为 data_dir 传递给($ DATA_DIR)

\

Sample CIFAR10训练命令:

\
 
Sample MNIST的完整训练命令:
 
在 training-validation pass 训练,validate=true 也是如此要在一个以上的GPU pass训练,num_gpus = NUM_GPUS

\
 
在上述模型的训练期间对validation进行测试:

\
 
训练过程中连续运行的注意事项
 
在训练中也要注意pass --validate=true
 
总共需要2个GPU:一个用于训练,一个用于验证
 
如果在同一台机器上进行训练和验证,则需要限制每个任务的RAM消耗,因为TensorFlow会填满第一个任务的所有RAM,从而导致第二个任务失败。

\
 
要测试/训练 MultiMNIST pass --num_targets = 2 以及 --data_dir = $DATA_DIR/multitest_6shifted_mnist.tfrecords@10。 生成 multiMNIST / MNIST 记录的代码位于input_data/mnist/mnist_shift.py。
 
生成multiMNIST测试的示例代码:

\
 
为 affNIST 的泛化能力建立 expanded_mnist: --shift = 6 --pad = 6。
 
读取affNIST的代码将遵循。
 
代码由Sara Sabour(sarasra, sasabour@google.com)维护。
 

上一篇:卷积神经网络入门这一篇就够了
下一篇:通过对抗性图像黑入大脑

本周栏目热点

神经网络:人工智能以及我们的未来

[2016-11-20]   作者:James Crowder翻译:王益军审校:心原文链接:techcrunch把自己想象成在一辆未来的自动驾驶汽车的乘客。这辆汽车与你以一种 ...

从人工神经网络谈机器究竟是怎么学习的?

[2018-06-19]  从算法的角度看,机器学习有很多种算法,例如回归算法、基于实例的算法、正则化算法、决策树算法、贝叶斯算法、聚合算法、关联规则学习算法和人工神经网络算法。很多算法可以......

CNN已老,GNN来了:重磅论文讲述深度学习的因果推理

[2018-06-19]  本文讲述了DeepMind联合谷歌大脑、MIT等机构27位作者发表重磅论文,提出“图网络”(Graph network),将端到端学习与归纳推理相结合,有望解决深度学习无法进行关系推理的问题。...

[2016-11-20]   BP人工 神经网络 改进 算法 C语言BP网络接受样本的顺序会对训练结果有较大的影响,基本 算法 比较偏爱较后出现的样本,因此,改进 算法 为 ...

计算机视觉领域前沿一览

[2018-07-30]  计算机视觉研究如何让计算机可以像人类一样去理解图片、视频等多媒体资源内容。例如用摄影机和计算机代替人眼对目标进行识别、跟踪和测量等,并进一步处理成更适合人眼观察或......

精选推荐

2023年服务机器人市场将超过250亿美元
2023年服务机器人市场将超过250亿美元

[2017-09-04]  全球服务机器人市场预计到2023年将达到250亿美元, 并在预测期内登记15% 的复合年增长率。短期中期回收期和投资回报率高 (ROI), 以及在教育和研究、临场感、防御、救援和安......

机器人灵巧手将成为智能机器人的下一个重大突破
机器人灵巧手将成为智能机器人的下一个重大突破

[2018-01-25]  计算机科学教授兼东北地区助手机器人实验室负责人罗伯特·普拉特(Robert Platt)说:“机器人手操作是下一步要解决的问题。想象一下,一个机器人可以在现实世界中用手去做事......

美国喷气推进实验室的AI驱动无人机挑战人类飞行员
美国喷气推进实验室的AI驱动无人机挑战人类飞行员

[2017-12-08]  随着无人机及其组件越来越小,效率越来越高,功能越来越强大,我们已经看到越来越多的研究开始让无人机自主飞行在半结构化的环境中,而不依赖于外部定位。 宾夕法尼亚大学在......

机器人iCub作为嵌入式AI的标准机器人研究平台的重要性
机器人iCub作为嵌入式AI的标准机器人研究平台的重要性

[2017-12-24]  机器人的研究在过去10年中得益于一个具有嵌入式人工智能(AI)的标准化开源平台——人形机器人iCub。iCub最初在意大利被创建,如今在欧洲、美国、韩国、新加坡和日本的实验室......

2017年:AI渗入云端
2017年:AI渗入云端

[2017-12-29]  云中的人工智能不仅仅是科技巨头的权力游戏,它也可能是人工智能领域的下一个飞跃。加利福尼亚州的Rigetti Computing公司刚刚使用其原型量子芯片之一在其云平台上运行机器学......

2018年企业数字化转型的五大趋势
2018年企业数字化转型的五大趋势

[2017-12-16]  据2016年哈佛商学院研究表明,选择进行数字化转型的企业在3年内表现出了55%的平均毛利润提升,相比之下其他企业毛利润同期降低了37%。数字化转型企业的领头羊,也曾是收入处于......

改变保险市场的格局:无人机如何通过更快的估算、响应时间和利益交付来使消费者受益
改变保险市场的格局:无人机如何通过更快的估算、响应时间和利益交付来

[2018-12-08]  市场研究公司IHS Markit预测,到2020年,专业无人机市场将通过农业,能源和建筑等行业利用测量,制图,规划等技术实现77 1%的复合年增长率(CAGR)。与此同时,消费者无人......

这些人型机器人是如此真实,你的肉眼几乎无法区分
这些人型机器人是如此真实,你的肉眼几乎无法区分

[2017-09-03]   我们生活在一个区分现实与幻想变得越来越困难的世界。由于机器人技术的进步,创造人工的人类正在逐渐接近完美的最终目标。我们现在看到的机器人不再只是一块发光二极管,......