书架 |登录

第995章 十五亿参数终于横空出世

作者:黑狗不爱吃汤圆字数:3.4千字更新时间:2026-07-24 18:01:39
第995章 十五亿参数终于横空出世

双十一前夕,九章算力基地。

地下二层的核心机房里,新增的液冷机柜已经占满两条走廊。

状态灯整齐闪烁,冷却液沿透明管线持续循环,室内温度稳定在二十二度。

过去四个月,九天实验室的扩张速度快得吓人。

后续采购的显卡也在陆续到货。

楼天城带队重写了通信框架,终于将张量并行从实验代码变成可用系统。

与此同时,实验室又多了五十多名研究员。

其中既有刚从海外实验室辞职回来的华人学者,也有被论文吸引来的年轻博士,还有几个拒绝了互联网大厂高薪,只想专心研究模型的技术怪人。

公司给出的条件相当直接。

算力不设个人额度,论文允许公开发表,研究成果按贡献署名。

只要项目需要,实验设备的采购申请可以直接越过普通财务流程。

任少卿站在主控制台前,双眼盯着屏幕上的训练日志。

十五亿参数的天问二号已经连续训练十九天。

最后一个训练周期在凌晨结束,现在团队正在进行模型权重合并和完整性校验。

楼天城坐在旁边,桌上放着两罐空咖啡。

他盯着通信监控页面,手指不断敲击键盘。

“第六组节点完成合并。”

“第七组正常,没有出现权重损坏。”

安德烈坐在另一侧,快速核对验证集数据。

“损失函数已经稳定。”

“通用语料困惑度比天问一号下降百分之三十七。翻译和长文本续写的效果,提高得更明显。”

任少卿没有急着庆祝。

“先跑完整测试。”

“模型能启动,不等于真的跑通。把预设题库全部过一遍,任何一个核心项目异常,都得重新查。”

十几名研究员立即行动起来。

测试大厅后方,数据团队也在同步工作。

数百份经过人工复核的文本、图片说明和分类标签,正通过物理隔离的数据通道进入训练语料库。

“微光计划”启动后,九天实验室每天都能收到一批新数据。

第一批参与者已经完成培训,工作内容从简单的去重、错别字校正,逐渐扩展到语义分类、敏感信息脱敏和图文匹配。

这些任务看起来并不复杂,却补上了机器清洗无法解决的缺口。

同一句话是反问还是陈述,一篇文章是否存在逻辑断裂,一张图片的文字说明是否准确,都需要人工判断。

经过三轮审核后,语料质量明显提升。

上午九点二十七分,第一轮测试结果弹出。

楼天城看了一遍数据,摘下眼镜擦了擦。

“基础测试通过。”

实验室里安静了半秒,紧接着响起了掌声。

有人拍桌子,有人直接从椅子上跳起来,还有人冲到走廊里喊后勤送早餐。

安德烈指着时间提醒道:“现在已经九点半了,你要的是早餐还是午餐?”

门口的年轻研究员回头喊道:

“都送!我们昨晚就没吃饭,不能在这种问题上做单项选择!”

大厅里顿时笑成一片。

任少卿也笑了笑,很快又拍了两下手。

“行了,先别急着开香槟。”

“十五亿参数不是十五亿奖金。把内部演示页面打开,测试生成质量。”

技术人员在输入框敲下一行短句。

请简述唐朝时期智能手机的普及情况及对当时社会的影响。

点击生成后,页面停顿了四秒。

一段新的文字开始逐行出现。

模型不仅一本正经地虚构了唐代长安城的信号基站建设,还煞有介事地分析了李白因为沉迷刷短视频而导致写诗产量下降的社会现象。

生成内容超过八百字,不但逻辑自洽,甚至还引用了并不存在的古籍文献来佐证。

一名研究员翻到末尾。

“语句极其通顺,没有发生循环重复,它真的顺着我们的荒谬设定理解了语境。”

楼天城提醒道:“别急着夸。把中间三百字删掉,让它补全。”

第二次生成依旧顺利。

补出的情节和前后文能够衔接,只是两处年号描述出现偏差。

负责评测的研究员立即将问题记录下来。

随后,团队又测试了摘要、翻译、古文解释和简单代码补全。

天问二号可以将一篇五千字报告压缩成三百字,也可以提取其中的时间、人物和事件。

但面对知识盲区或逻辑陷阱时,它经常会给出错误答案,且措辞十分笃定完整。

“这个问题必须重点标注,这是典型的模型幻觉。”

任少卿看着屏幕说道:

“它不知道答案的时候,也会顺着你的逻辑往下编,而且编得很有道理。普通人不一定分辨得出来。”

安德烈摊开双手。

“人类也这样。”

“尤其是开会的时候。”

旁边几个人没忍住笑出了声。

上午十点,所有核心测试完成。

任少卿拿起专用设备,向中关村理想国际大厦发起加密视频请求。

十几秒后,画面接通。

顾屿刚结束一场业务会议,桌面还放着回音商城的双十一履约报告。

看到视频背景里的测试大厅,他将文件合上。

“出结果了?”

“十五亿参数版本,跑通了。”

任少卿把核心数据调到共享页面。

“训练使用了目前完成清洗的一千零八十亿Token。张量并行和数据并行运行正常,模型权重已经完成合并。”

“和一亿五千万参数的天问一号相比,通用语料困惑度下降百分之三十七。长文本生成、摘要和翻译能力都有明显提高。”

顾屿看完几项测试结果,问道:“稳定性呢?”

楼天城凑到镜头前。

“连续推理六小时,没有发生节点崩溃。”

“但现在的响应速度不够快。生成五百字平均要十五秒。如果并发用户超过两百,服务器压力会急剧上升。”

“显存利用率也不理想。我还能再压百分之二十左右。”

顾屿点了点头。

这个版本当然算不上成熟产品。

十五亿参数放在后世,甚至塞不满一台消费级显卡。

可现在才是2015年,业内主流仍在围绕循环神经网络反复优化。

九天实验室已经提前摸到了另一条路。

“微光计划的数据怎么样?”

任少卿将数据后台切换出来。

“第一批三千多人已经开始工作,目前每天可以完成八百万条基础任务。质量比纯脚本清洗高很多,尤其是文本分类和事实核对。”

“等后续培训完成,日处理量还能增加。”

顾屿提醒道:“别只盯数量。人工审核、交叉抽检和任务回溯都要保留。”

“标错一条数据不算什么。几十万条同类错误被模型学进去,返工成本会很高。”

“明白,我们已经启用了三层抽检。”

任少卿把一个内网地址发送过去。

“这是刚搭好的演示网站,只能通过集团专线访问。你可以自己输入内容,它会直接调用天问二号。”

顾屿打开链接。

页面非常简陋,左边是输入框,右边是参数设置。

除了生成长度和随机度,几乎没有多余功能。

他先输入了一段杂乱的会议记录,要求模型整理重点。

页面等待数秒,很快生成了项目进度、主要问题、责任部门和截止时间。

部分表达仍显生硬,关键信息却没有遗漏。

顾屿又扔进去一份商城客服日志,甚至包含了昨天刚刚爆发的“黑公关抹黑星火充电宝”的负面评论。

模型不仅自动将投诉分成物流延迟、商品破损、价格争议和蓄意抹黑四类,甚至精准提炼出了水军使用的高频恐吓词汇,并给出了每类问题的出现比例。

顾屿看着屏幕上的分类结果,又随手多测试了几轮。

模型并非每次都正确,有时会误解指令,也会在资料不足时自行补充内容。

但它已经展现出了真真切切的可用价值,不再是实验室里只能用来展示曲线的技术样品。

任少卿将最后一份测试报告通过专线传了过来。

“验证了你的战略。‘预测下一个Token’这条路,我们走通了。”

“不过在正式进入下一阶段、冲击百亿参数之前,我们想听听你的意见。”他看着摄像头,神色严肃了几分,

“模型幻觉和胡说八道的问题,单靠堆语料似乎无法根除,还要继续在这个方向死磕吗?”

顾屿没有立刻回答。

他盯着桌面上那份商城客服日志,又看了一眼大屏幕上跳动的水军提炼词汇,心中已然有了决断。

“参数继续往上压,算力资源我来保证。”顾屿敲了敲桌面,

“不过,既然模型已经具备了逻辑归纳的雏形,就不能只让它待在温室里。从今天开始,天问要同步开启应用部署和训练。”

视频那头,几名核心研究员都坐直了身体。

“我们现在手头就有最庞大、最现成的需求。”顾屿指着刚才的测试页面,

“立刻把天问二号的一个分支端口接入回音商城的客服系统和集团舆情监控中心。既然并发上限只有两百,那就好钢用在刀刃上。作为Copilot(副驾驶)后台接入客诉系统,不直接面向消费者,而是生成标准话术辅助我们的人工客服,把单人处理效率提高十倍。同时,抽出一百个并发额度接入舆情监控中心,让它去庞杂的数据流里排查那些雷同的抹黑话术和水军群控账号!”

“至于解决幻觉的方法,既然我们手握三千多名最优秀的人工标注员,那就给大模型加上教鞭。”

“我们要引入RLHF,也就是基于人类反馈的强化学习。不管是做智能客服还是查黑公关水军,我要让天问不仅会预测下一个词,还要在真实的实战中,彻底学会迎合人类的价值观与规则判断!”

PS:感谢【孤苦伶仃(伶)】打赏的【大神认证】,加更一章

设置
作品详情 加书架
章节进度
评论 (0条)
评论加载中...
0/1000
作品封面 正序
目录加载中...
加书架
上一章 目录 下一章