> 自媒体 > (AI)人工智能 > 27亿参数的野生版GPT-3开源,项目2.9K Star量
27亿参数的野生版GPT-3开源,项目2.9K Star量
来源:机器之心Pro
2023-05-06 16:20:15
515
管理

机器之心报道

编辑:小舟、泽南

OpenAI 著名的语言模型 GPT-3 可以懂数学、翻译文字,还能写论文拿到及格成绩,这样的 AI 什么时候才能开源呢?现在已有了一个差不多的项目。

GPT-3 是 2020 年 OpenAI 推出的具有 1750 亿参数的自回归语言模型,它在许多自然语言基准上都取得了出色的成绩。GPT-3 能够执行答题、翻译、写文章等任务,甚至还带有一些数学计算的能力。

不同于 GPT-2 和 GPT-1,OpenAI 选择不开源 GPT-3,而是通过商业 API 来提供该模型的能力及训练数据集。该公司通过选择将 GPT-3 独家许可给与 OpenAI 有业务关联的微软来进一步限制访问。

尽管如此,既然论文已经放出,人们对于 GPT-3「野生版」的开发没有止步。其中开源 AI 研究机构 EleutherAI 的 GPT-Neo 项目是 GPT-3 的复现与开源中最优秀的项目之一。3 月 22 日,EleutherAI 的开源项目 GPT-Neo 宣布放出复现版 GPT-3 的模型参数(1.3B 和 2.7B 级别),并将其更新在了 Colab notebook 上。

虽然是 1750 亿参数模型 GPT-3 的复现,此次开源的模型里较大的版本也只达到了 GPT-3 商用版里最小模型的参数量,不过 Eleuther AI 表示未来会进一步开源 10B 版本和原始大小版本的 GPT-3 模型参数。这一项目一经发布,就受到了 AI 社区的关注,目前该项目已收获 2.9K star 量。

项目地址:https://github.com/EleutherAI/gpt-neo/

训练数据集

EleutherAI 承认,由于 OpenAI 决定不发布 GPT-3 架构的一些关键细节,因此 GPT-Neo 与原版 GPT-3 相比必然会存在一些偏差。此外,还有一些偏差可能来自 EleutherAI 计划使用的训练数据集,该数据集是由来自 EleutherAI 的 10 人小组策划的。

像 GPT-3 这样的语言模型通常会放大数据中存在的偏见。例如,OpenAI 指出在数据集中女性和 sucked 这样的词汇可能会存在关联,著名预训练语言模型 BERT 也曾被指存在偏见。

EleutherAI 小组表示他们已对 GPT-Neo 训练数据集进行了「广泛偏见分析」,并做出了一些消除偏见的决定,以排除他们认为对某些群体或观点「造成不可接受的负面偏见」的某些数据集。该项目使用一个 825 GiB 的多样开源语言建模数据集,它对于大型语言模型的训练和基准测试都很有效。

数据集:https://pile.eleuther.ai/

GPT-3 可以变得更小吗?

EleutherAI 计划利用项目团队使用的架构来训练 GPT-Neo,使其达到和 GPT-3 在相同模型大小时「相同」的性能。在未来,他们还计划将模型减小一个数量级甚至更多。

如果这样的模型被认为具备实用化的条件,其效率的提高将会抵消不断膨胀的算力需求。根据 OpenAI 的一项调查,自 2012 年以来在著名数据集 ImageNet 之上将图像分类模型训练成相同的识别准确度,其所需的算力每 16 个月减少两倍。但是与更多参数的新模型相比,算力的使用仍然是个开放问题。

「要想让性能继续提高,模型的尺寸还会不可避免地增加」项目团队成员之一 Leahy 说道。「大模型的能力对于小模型来说是遥不可及的,这可能就是残酷的现实。我们看起来没有其他解决的方法——如果更大的模型意味着更好的性能,拥有算力的公司就会具备优势,就这么简单。」

EleutherAI 是一个致力于开源 AI 研究的团队。Leahy 表示:「我们致力于允许更多资源匮乏的用户(尤其是研究者)使用相关技术,以期在相关领域涌现更多更好的研究,并在此基础上进行我们以安全为重点的研究,而不是将其锁定在行业实验室内。毕竟,这些技术仍然在发展阶段,当此类模型在生产中按原样使用而没有进行更广泛的调查时,自然会产生存在偏见等问题,我们希望这些模型能够开放更多的可用性。」

参考内容:

https://venturebeat.com/2021/01/15/ai-weekly-meet-the-people-trying-to-replicate-and-open-source-openais-gpt-3/

0
点赞
赏礼
赏钱
0
收藏
免责声明:本文仅代表作者个人观点,与本站无关。其原创性以及文中陈述文字和内容未经本网证实,对本文以及其中全部或者 部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。 凡本网注明 “来源:XXX(非本站)”的作品,均转载自其它媒体,转载目的在于传递更多信息,并不代表本网赞同其观点和对 其真实性负责。 如因作品内容、版权和其它问题需要同本网联系的,请在一周内进行,以便我们及时处理。 QQ:617470285 邮箱:617470285@qq.com
相关文章
合资车再次大胜!最新轿车质量年度排名,思域丢冠,威朗星瑞达标..
很长时间以来,合资车在国内市场占据主导地位,而大家之所以更认可合资车..
国产车VS合资车:质量对决,谁更胜一筹?
近年来,国产车与合资车的质量之争愈演愈烈。随着国产车企在技术、配置和..
同价位的国产车真的不如合资车?拆解三大争议
#为什么国产车的质量不如合资车好?#引言近年来,“国产车与合资车质量对..
2025还有合资车值得买?BBA换新2.0T,大众日系便宜卖智驾?..
第二是尺寸进一步加长,除了探岳L轴距增加了60mm外,凌渡L、速腾L和Polo ..
2021年质量最好的十大合资车揭晓,本田特斯拉前五,现代力压日产..
导读:对于合资车品牌大家都是非常认可的,而像丰田、本田、日产、宝马、..
落地不到10万!这些大牌合资月薪3k就能买,还能说不买吗..
近年来,国产车的进步虽然明显,但仍有不少国人迷恋合资车型,买买君觉得..
被国产车逼急了!这三款合资车“内卷”严重,定价刷新了下限!..
今年以来的汽车市场,有两个特别“反常”的现象。一是新能源异军突起,渗..
这五款合资车销量急剧下滑!暴跌5倍到10倍,如今6.89万都卖不动..
曾经风光无限的车型,如今却纷纷面临销量暴跌的局面。我们常常看到曾是街..
deepseek:合资车和国产车型的优缺点到底在哪?怎么选择?..
在选购汽车时,合资车与国产车的选择一直是消费者关注的重点。deepseek的..
关于作者
醉看夕阳(普通会员)
文章
1428
关注
0
粉丝
0
点击领取今天的签到奖励!
签到排行

成员 网址收录40406 企业收录2984 印章生成244957 电子证书1089 电子名片62 自媒体76477

@2022 All Rights Reserved 浙ICP备19035174号-7
0
0
分享
请选择要切换的马甲:

个人中心

每日签到

我的消息

内容搜索