亲,欢迎光临天天书吧!
错缺断章、加书:站内短信
后台有人,会尽快回复!
  • 主题模式:

  • 字体大小:

    -

    18

    +
  • 恢复默认

陈铭宇已经在楼下等着了。

快五十的年纪,头发梳得整整齐齐,戴一副银色边框眼镜,穿着一件深灰色的夹克。看上去像个大学教授,但眼神里带着点商人的精明。

“董事长,路上辛苦了。”陈铭宇迎上来,跟李东阳握了握手。

“没事,直接去实验室。”

“行,徐若辰他们已经在等了。”

两个人往主楼里面走。研究院内部的装修比外面看起来简洁,大白墙,灰色地砖,走廊里挂着几块显示屏,上面滚动着各种数据图表。

“一期在2012年6月全部完善,投入使用,目前主要实验室和办公区都在一期,... ...。二期去年3月份扩征的,计划2015年10月建成。”陈铭宇说起来如数家珍。

“人够不够?”

“大语言项目的核心团队五十八个人,大部分是海外博士,少部分是硕士。还有一些辅助岗位,加起来大概一百二十人左右。”陈铭宇顿了顿,“研发强度没有问题,但如果我们想继续扩大规模,高端人才还是缺。国内做大语言模型的团队越来越多了,大家都在抢人。”

“钱不是问题。”李东阳说,“你看着招,薪酬对标硅谷。”

“明白。”

两个人走进电梯,陈铭宇按了四楼。

大语言模型项目的实验室在四楼,占了整整一层。出电梯的时候,门禁系统嘀了一声,陈铭宇刷了工牌,李东阳跟在他后面进去。

走廊两侧是玻璃隔断的办公室,透过玻璃能看到里面一排排的工位。大部分工位上都有人,盯着屏幕,手指在键盘上敲个不停。

“过年都没休息?”李东阳问。

“大年三十那天上午,我们开了个短会,跟大家说下午可以早点走。结果没人走。”陈铭宇笑了笑,“徐若辰他们觉得就差最后一口气了,憋着一股劲想把这个坎迈过去。年夜饭是在研究院食堂吃的,我让厨房加了十个菜,开了几瓶好酒。吃完了,大家又回去继续干了。”

李东阳没说话,点了点头。

这一点还得感谢陈润华。

整个园区的食堂工作人员,包括部分行政人员,都是他安排的靠谱的‘自己人’,凡事打菜的是自己人,能量珠从来是不吝啬的,一天一颗是标准。

所以连续加班,高强度的脑力活动下身体还能扛得住并且效率不降低这样的体质奇迹在深空工业研究院算是习以为常,这个现象并不仅仅出来在大语言团队,其他的比如固态电池,智能驾驶,海水一体化团队都是如此。

走廊尽头的会议室门开着,里头已经坐了七八个人。坐在主位旁边的是一个四十出头的男人,寸头,圆脸,戴着一副黑框眼镜,穿着一件普通的灰色卫衣,看起来不像个计算机博士,更像一个在小区门口修电脑的。

徐若辰。美籍华人,哈佛计算机博士,在谷歌待了六年,深度参与过谷歌早期的大语言模型项目。

2012年初被深空环球hR团队挖过来的,入职时陈铭宇亲自跟他聊了三个小时。

“董事长。”徐若辰站起来,其他几个人也跟着站起来。

“坐,都坐。”李东阳在会议桌对面坐下来,扫了一圈在场的人,“过年都没回去?”

“回去了也没心思。”徐若辰旁边的年轻人说了一句,大家都笑了。

陈铭宇在李东阳旁边坐下来,对徐若辰点了点头:“开始吧。”

徐若辰站起来,走到墙边的白板前,拿起记号笔,画了个简图。

横轴是序列长度,纵轴是计算量,画了三条曲线:一条陡峭向上弯曲的,标着o(n2);一条平缓很多的,标着o(n log n);还有一条直线,标着o(n)。

“这个图大家应该都见过。”徐若辰在白板上点了点,“transformer架构的核心是自注意力机制,这个是公开的秘密,所有人都知道。但自注意力机制的时间复杂度和空间复杂度都是o(n2),n是序列长度。序列越长,计算量的增长是平方级的。”

他转身看着李东阳:“打个比方。处理一段一万字的文本,如果每个字都要跟其他所有字做交互,总的交互次数是一个亿。”

“一个亿。”李东阳重复了一下这个数字。

“对。Gpt在处理五千字文本的时候,注意力计算就占了总计算量的百分之七十以上。文本越长,这个比例越高。到了两万字,基本就是百分之九十了。”徐若辰放下记号笔,“这就是所谓的‘卡脖子技术难题’——长文本处理,成本高到离谱,效率低到发指。”

“你们是怎么解决的?”李东阳问。

徐若辰笑了一下,转身在白板上画了另一个图。这次是一个稀疏连接的示意图,每个节点只跟少数几个节点有连线,而不是跟所有节点。

“传统的注意力机制,每个token都要和所有其他token做交互。我们通过一种新的动态路由机制,让每个token只跟最关键的那百分之五到百分之十的token做深度交互,其余的部分用轻量级的近似计算替代。”

他停顿了一下,加重了语气:“计算量直接从o(n2)降到了o(n log n)。一万字的文本,交互次数从一亿降到了不到两百万。”

会议室里安静了一下。

李东阳看着白板上的图,脑子里过了一遍这个数字的变化。

五十倍的差距。

“验证过了?”他问。

“验证了。”徐若辰点头,“我们用多个数据集做了压力测试,结论一致。在保证准确率不降的前提下,计算效率提升了一个数量级以上。”

“准确率不降?”

“准确率还有提升。”旁边一个年轻研究员接话,“因为动态路由机制去掉了噪音信息,模型反而更聚焦了。相当于你让一个学生在复习考试的时候,只复习重点,不复习那些不考的东西。”

李东阳靠在椅背上,看着白板上那个稀疏连接的图,沉默了几秒。

“跟我详细说说。”他说。

徐若辰的眼睛一下子亮了。

他转身打开投影仪,把电脑接上去。屏幕上出现了密密麻麻的数据表格和模型架构图。

“我按时间线来梳理一下。”徐若辰站在投影幕前,拿遥控器翻了第一页。

“去年十二月,我们完成了dpY-0.5的基础版本。参数量七十二亿,训练数据总量一点二万亿token,涵盖中英文双语。这个规模,坦白说,放在全球范围内不算最大的。谷歌的bERt最大版本才三亿参数量,但他们走的是双向编码路线,跟我们的技术路径不太一样。openAI的Gpt-2是十五亿参数,比我们大。”

他翻到下一页,是一张评测对比表。

“但是在中文语义理解的深度上,根据我们内部重新设计的评估体系,dpY-0.5已经超越了目前市面上所有开源模型的同等规模版本。c-Eval中文综合评测,我们十二月的版本得分是六十二点七分。”

李东阳看了一眼表格里其他模型的分数。谷歌的一个模型,五十八点一分。另一个模型,五十六点三分。

“六十二点七分,已经是最高了。”李东阳说。

“对。但这不是重点。”徐若辰翻到下一页,脸上那种兴奋的表情又回来了,“大年三十那天晚上,我们对注意力机制做了一次彻底的重新设计。新的稀疏注意力架构,我刚才已经介绍了大概。评测结果——c-Eval直接跳到了八十九点四分。”

会议室里安静了。

李东阳看着屏幕上那个数字,八十九点四分,比之前的六十二点七分,高了将近二十七分。

“这个分数意味着什么?”他问。

徐若辰沉默了两秒,像是在组织语言。

“我打个比方。一般的大语言模型,在处理复杂中文文本的时候,能够识别字面意思,但难以捕捉深层的语义和情感。比如说——‘这个东西不贵,但是我不太想买。’大多数模型会理解成‘价格是唯一影响因素,用户因为价格低而有购买意愿,但因为某种原因没有购买’。但这句话背后的真实情感是——‘价格不是问题,问题是我对这个东西本身没有兴趣,我只是在找一个不买的借口。’”

他停了一下,看着李东阳。

“dpY-0.5能捕捉到这个。它能理解那种‘可有可无、略带犹豫’的心理状态。不是因为它的参数量更大,而是因为它的注意力机制更聪明。它知道哪些词是关键的,哪些词是可以忽略的。”

李东阳靠在椅子上,手指在桌面上轻轻敲了两下。

“中文。”他说。

“对,中文。”徐若辰点头,“我们的模型在中文上的表现,远远好于英文。这是因为我们的训练数据以中文为主,而且我们的注意力机制在设计上对中文这种高语境语言特别友好。中文的特点是——很多信息不在字面上,而在上下文和语气里。传统模型处理中文的时候很吃力,但dpY-0.5的动态路由机制天然适合处理这种高语境的语言。”