跨过语言,不跳出论文。
原文与译文并排阅读,图表、公式与引用相互对应。读到哪里,就对照到哪里。

思路不用来回切换
跟着论证往下读,停下来看看公式,记住刚冒出的想法。上下文一直都在。
原文与译文并排阅读,图表、公式与引用相互对应。读到哪里,就对照到哪里。
Transformer 用注意力机制关联序列中的信息,不依赖循环结构来逐步处理。
摘要 · 第 1 页 ↗回答示例选中一段文字,或框选公式和图表提问。点击回答中的段落引用,回到原文核对。
比较更长序列中的注意力分布,观察不同位置之间的关系。
高亮一段文字,写下自己的理解。笔记就是普通的 Markdown 文件,换个编辑器也能接着写。
同一篇论文,换个方式讲
想从头听懂,还是准备迎接导师的追问?选个合拍的讲解模式,一起把这篇论文读下去。
你可以把注意力想成找人问事。你手里有个问题,叫查询;每份材料有标签,叫键;标签后面的内容,叫值§3.2。系统拿问题挨个和标签比对,算出像不像的分数,再把分数变成轻重,最后把内容按轻重掺在一起,得出答案。
他们用的具体办法是这样:问题和所有标签先算匹配分,分数太大时会不好使,所以先缩小一点,再换算成轻重比例,然后按比例把内容加起来§3.2.1。这样,最对路的内容说话分量就大。
还有多头注意力:不是只看一次,而是用好几套不同眼光同时看,最后把各次结果拼起来再整理一遍§3.2.2。好比同一件事多请几个人从不同角度出主意,再合到一起。这就是它工作的样子。
注意力像这样工作。你先有一个问题,叫查询。还有一堆小标签,叫键。每个标签配一份东西,叫值。查询、键、值都是一串数字,叫向量。§3.2 拿查询和每个键比一比,看谁最合拍。合拍的程度变成重要度。然后按重要度,把值混在一起。混出来的,就是答案。
这篇论文用的办法叫“缩放点积注意力”。它把查询和所有键做点积,得到一个数。再除以根号 dk。最后用 softmax 把这些数变成权重。§3.2.1 权重像分蛋糕,合拍的键分到更大一块。再把每块值按权重加起来,就得到输出。
为什么要除以根号 dk?因为 dk 大时,点积会变得很大。softmax 会跑到梯度很小的地方。缩放一下,就好一些。§3.2.1 片段里没细说 dk 具体是几。但这个方法能让模型一次算很多查询。
注意力函数把 query 和一组 key-value 对映射成输出,query、key、value、输出都是向量§3.2。输出是 value 的加权和;每个 value 的权重,由 query 与对应 key 的兼容函数算出。本文用缩放点积注意力:query 与所有 key 做点积,每个除以 √dk,再 softmax 得权重§3.2.1。这里 dk 是 query/key 维度,dv 是 value 维度。把多个 query、key、value 分别打包成矩阵 Q、K、V,输出为 softmax(QK^T/√dk)V。
缩放是因为 dk 大时点积会很大,softmax 进入梯度极小区域;除以 √dk 可抵消§3.2.1。此外多头注意力把 Q、K、V 用不同学习到的线性投影做 h 次,并行算注意力,输出拼接后再投影§3.2.2。
注意力机制把 query 和一组 key-value 对映射成输出;query、key、value、输出都是向量。输出是 value 的加权和,权重由 query 与对应 key 的兼容函数算出§3.2。本文用缩放点积注意力:输入 query、key 维度 dk,value 维度 dv;先算 query 与所有 key 的点积,除以 √dk,再 softmax 得到 value 权重;实际把多组 query、key、value 打包成矩阵 Q、K、V,输出为 softmax(QK^T/√dk)V§3.2.1。
缩放的原因是 dk 大时点积幅值变大,会把 softmax 推到梯度极小区域,所以除以 √dk 抵消§3.2.1。多头注意力则把 Q、K、V 各线性投影 h 次,并行做注意力,再把输出拼接并投影;这样能同时关注不同表示子空间的信息§3.2.2。
导师若追问为何不用加法注意力,片段说小 dk 下两者相近,大 dk 无缩放时加法更好,故点积要缩放§3.2.1;若问头数、复杂度或训练细节,片段里没有。
按片段,注意力函数把查询和一组键值对映射为输出,四者都是向量;输出是值的加权和,权重由查询与对应键的兼容函数算出§3.2。本论文的缩放点积版把查询、键、值打包成 Q、K、V,先算 QK^T,除以 √dk,再经 softmax 得权重,最后乘 V§3.2.1。
缩放不是装饰:片段称 dk 大时点积幅值会变大,可能把 softmax 推入梯度极小的区域,所以除以 √dk§3.2.1。多头则把 Q、K、V 线性投影 h 次,并行做注意力,拼接输出后再投影;理由是让它同时关注不同表示子空间和位置§3.2.2。
但片段没有说明这些投影如何训练、兼容函数是否只有点积,也没给出掩码和位置编码细节。因此只能确认公式层面的工作方式,不能据此判断其全部实现与效果。
你的研究,你的选择
接入自己的 API Key,或使用在本机运行的模型。按功能选择模型,随时查看用量和费用估算。
论文和笔记保存在本机。使用云端 AI 时,任务所需内容会发送到你配置的服务。

少翻文件夹,多读几页
搜索 arXiv 和 Semantic Scholar,找到论文后加入库。下次打开,从上次读到的地方继续。
以开放的方式,持续打磨
在 Mac App Store 购买,支持持续维护。也可以从源码自行构建,使用同样的功能,没有功能付费墙。
打包好的 macOS 应用,由 App Store 提供安装和更新。
查看实现、自己构建,或参与改进。应用源码采用 Apache-2.0 许可。
Mac App Store 版本正在准备上架。现在就可以在 GitHub 查看源码或自行构建。
FAQ
ReadArc 使用你选择的供应商 API,或本地模型。云端 API 费用由供应商另行收取;聊天产品的订阅通常不等于 API 使用额度。
可以。已导入的 PDF、已保存的译文、内置词典和笔记都可离线使用。云端 AI 与在线论文搜索需要网络连接。
不会。论文库保存在你的电脑上。使用云端 AI 功能时,只向配置的接口发送完成该任务所需的内容。本地网关也可能将请求转发到云端。
商店版本提供打包安装与更新,也支持项目的日常维护。自行构建的版本使用相同代码和功能。模型 API 费用不包含在应用售价中。
macOS 版本现已可用,Windows 版本正在开发中。也可以在 GitHub 上从源码构建。