工作累了头昏脑涨,刷个题冷静一下。
顺手来理一下 LCA 的板子。
Tarjan 离线 LCA
前面在 【Tarjan 大佬的算法们】 中提到过他的离线 LCA 算法,就从这里开始。
前篇:
严格上来说本篇不应该算在拆包里面,因为记的是 TF 团队最近发的一篇论文里面的东西。
前面拆包的第二篇记过关于 TensorFlow 中的数据流模型实现,实际上这套数据流模型已经是非常完备的,只是目前大家用 Python 搭出来的简单网络形式还很难把它的真正潜力发挥出来。
正当我们往这个方向做的时候,得,Google 发论文了。
接上篇:
开始分析性能瓶颈了,本篇记录一下研究 TF 中自带的 Profiling 工具时遇到的几个坑点。
接上篇:
本篇分析 TensorFlow 1.6.0 中的 RDMA 以及其他的传输优化的实现。
接上篇:
单节点的运行流程基本上已经有个大体印象了,接着就要来拆我所关注的重点所在——分布式运行时了。
接上篇:
这篇要分析的是 TensorFlow 中跟计算设备相关的内容。
接上篇:
先来拆一下第一篇里面 DirectSession::Run 里面跑的那个 graph 里面到底都是些什么内容。
刚刚把《硬/软件接口》重新过完了一遍,觉得对微处理器中间的结构有点意犹未尽,真的是很有趣啊,然鹅翻开《量化分析方法》的目录看了看,又吓得我把书扔回去了……内容略多,留着慢慢看吧。
其实 Intel 历年处理器架构演变这事老早我就很好奇了,尤其在 SC17 上今年我们摸过的 Xeon Platinum 8176 那一代 CPU 性能比上代 E5-269x 暴涨了一大截,更是让人好奇这里面有些什么变化。
所以准备来理一理 Intel 处理器架构的演进史。