第1037章 全球AI因天问改道
第1037章 全球AI因天问改道 (第1/2页)《AttentiOnISAllYOUNeed》。
这篇全英文的预印本学术论文,在深夜十一点被上传到了arXiv平台。
没有新闻发布会,也没有官方账号的预热宣传。
最先发现这篇论文的,是几个长期盯着九天实验室动态的自媒体账号。
他们把论文的标题和摘要截图,直接发到了引力社区和回音平台上。
配文非常简短。
【九天实验室放出了天问大模型的底层架构论文。】
消息刚一发出去,底下的评论区就涌入了大批等待吃瓜的网友。
白天关于天问大模型造假的阴谋论满天飞,大家都等着看回响科技怎么应对。
面对满屏的英文字母和复杂的数学公式,普通网友完全摸不着头脑。
【有没有课代表来总结一下,这东西到底讲了什么?】
【全是大写字母和看不懂的网络拓扑图,这该不会是随便发一篇水文来糊弄人的吧。】
【散了吧,估计是临时拼凑的材料,想敷衍白天的造假指控。】
【连个中文翻译都没有,这是心虚了吧。】
质疑的声音还在继续增加。
十几分钟后,引力社区的一位认证大V发文了。
他的认证头衔是“前百度深度学习实验室高级算法研究员”。
这位大V没有配图,而是直接发了一篇将近四千字的纯文本长文。
文章的开头只有干巴巴的一句话。
“别吵了,回响科技这次直接把AI界的桌子给掀了。”
这句话立刻吸引了数以十万计的流量。
大V在文章里使用了非常通俗的语言,对这篇论文的核心内容进行了拆解。
他解释了传统自然语言处理的痛点。
过去的算法依靠循环神经网络,处理文本必须按照词汇的先后顺序一个一个读取。
这种处理方式不仅计算速度慢,而且句子一旦过长,模型就会忘掉前面的设定。
这导致长文本生成经常出现前言不搭后语的问题。
大V在文章中加粗了一段文字。
“但这篇论文提出了一种全新的TranSfOrmer架构,他们直接抛弃了传统的循环和卷积网络。”
“他们提出了一种自注意力机制。”
“这种机制允许模型在处理一个词时,同时计算句子中所有其他词与它的关联度。”
“简单来说,它能在一眼之间看清整个句子的全局逻辑。”
“这解释了白天在展示现场,天问为什么能精准执行长达几百字、带有多重嵌套条件的复杂指令。”
文章发布后,相关的从业人士纷纷下场。
引力社区的热榜排名开始发生剧烈变化。
不少国内一线互联网大厂的算法工程师在评论区留言。
【我刚才照着论文里的公式手推了一遍,逻辑完全闭环,没有技术死角。】
【难怪生成速度那么快,这种架构天然支持矩阵运算,算力利用率是传统架构的好几倍。】
【作为同行,我必须承认,这是一篇能够改写教科书的开创性论文。】
【白天那些造谣后台有人工回复的博主呢?出来走两步?】
【这东西如果真能大规模跑通,现有的自然语言处理技术全得推倒重来。】
舆论的风向彻底逆转。
那些质疑造假的营销号集体陷入了沉默,许多账号开始连夜删除之前的黑稿。
如果说国内的互联网圈子只是感到震惊,那海外的AI学术界感受到的就是恐慌。
此刻的北美正值白天。
硅谷的几大科技巨头内部,各大AI实验室的邮件系统已经处于过载状态。
位于加州山景城的谷歌总部,GOOgleBrain深度学习实验室里,气氛压抑得令人窒息。
高级研究员理查德紧盯着电脑屏幕,端咖啡杯的手正止不住地颤抖。
五分钟前,他收到了斯坦福大学一位同行发来的arXiv论文链接。
只看完了《AttentiOnISAllYOUNeed》的摘要部分,理查德就感觉浑身的血液都凉了。
实验室的技术总监推开玻璃门,大步流星地走了进来,脸色铁青。
“理查德,你看过那篇中国团队发出的论文了吗?”总监的声音里带着难以掩饰的焦虑。
“刚看完摘要。”理查德咽了口唾沫,声音干涩,“你们那边组织算力跑代码复现了吗?”
“已经抽调了五十个高级工程师,停掉了手里所有的非紧急项目,占用了整个云端集群的算力在跑模型验证。”
“结果怎么样?”理查德紧张地站了起来。
“很不乐观。”总监双手撑在办公桌上,给出了一个极其消极的评价。
“代码复现组刚刚搭出基础模型跑通了第一个极小规模的数据集!理查德,我们过去三年在RNN(循环神经网络)架构上投入的数十亿美金,现在可能变成了一堆废纸。”
理查德的呼吸变得粗重起来。
两年多以前,九天实验室发布了一百五十二层的ReSNet残差网络论文。
(本章未完,请点击下一页继续阅读)