马斯克宣布正式开源大语言模型Grok,等各种官宣”自主研发”

Linux网站管理员

2 年前

9a6f07587c017c4d7f85f8b054c8caa9

马斯克承诺的开源版大模型 Grok 终于来了！

今天凌晨，马斯克旗下大模型公司 xAI 宣布正式开源 3140 亿参数的混合专家（MoE）模型「Grok-1」，以及该模型的权重和网络架构。

这也使得Grok-1成为当前参数量最大的开源大语言模型。

封面图根据 Grok 提示使用 Midjourney 生成的：神经网络的 3D 插图，具有透明节点和发光连接，以不同粗细和颜色的连接线展示不同的权重。

这个时候，马斯克当然不会忘了嘲讽 OpenAI 一番，「我们想了解更多 OpenAI 的开放部分」。

回到模型本身，Grok-1 从头开始训练，并且没有针对任何特定应用（如对话）进行微调。相对的，在 X（原 Twitter）上可用的 Grok 大模型是微调过的版本，其行为和原始权重版本并不相同。

Grok-1 的模型细节包括如下：

基础模型基于大量文本数据进行训练，没有针对任何具体任务进行微调；
3140 亿参数的 MoE 模型，在给定 token 上的激活权重为 25%；
2023 年 10 月，xAI 使用 JAX 库和 Rust 语言组成的自定义训练堆栈从头开始训练。

xAI 遵守 Apache 2.0 许可证来开源 Grok-1 的权重和架构。Apache 2.0 许可证允许用户自由地使用、修改和分发软件，无论是个人还是商业用途。项目发布短短四个小时，已经揽获 3.4k 星标，热度还在持续增加。

该存储库包含用于加载和运行 Grok-1 开放权重模型的 JAX 示例代码。使用之前，用户需要确保先下载 checkpoint，并将 ckpt-0 目录放置在 checkpoint 中，然后，运行下面代码进行测试：

pip install -r requirements.txt
python run.py

项目说明中明确强调，由于 Grok-1 是一个规模较大（314B 参数）的模型，因此需要有足够 GPU 内存的机器才能使用示例代码测试模型。此外，该存储库中 MoE 层的实现效率并不高，之所以选择该实现是为了避免需要自定义内核来验证模型的正确性。

用户可以使用 Torrent 客户端和这个磁力链接来下载权重文件：

magnet:?xt=urn:btih:5f96d43576e3d386c9ba65b883210a393b68210e&tr=https%3A%2F%2Facademictorrents.com%2Fannounce.php&tr=udp%3A%2F%2Ftracker.coppersurfer.tk%3A6969&tr=udp%3A%2F%2Ftracker.opentrackr.org%3A1337%2Fannounce

看到这，有网友开始好奇 314B 参数的 Grok-1 到底需要怎样的配置才能运行。对此有人给出答案：可能需要一台拥有 628 GB GPU 内存的机器（每个参数 2 字节）。这么算下来，8xH100（每个 80GB）就可以了。

知名机器学习研究者、《Python 机器学习》畅销书作者 Sebastian Raschka 评价道：「Grok-1 比其他通常带有使用限制的开放权重模型更加开源，但是它的开源程度不如 Pythia、Bloom 和 OLMo，后者附带训练代码和可复现的数据集。」

DeepMind 研究工程师 Aleksa Gordié 则预测，Grok-1 的能力应该比 LLaMA-2 要强，但目前尚不清楚有多少数据受到了污染。另外，二者的参数量也不是一个量级。

就在刚刚，xAI正式发布3140亿参数混合专家模型Grok-1的权重和架构。

3140亿的参数，让Grok-1成为迄今参数量最大的开源LLM，是Llama 2的4倍。

目前，xAI关于Grok-1没有透露更多信息。

官网放出的信息如下——

- 基础模型在大量文本数据上训练，未针对任何特定任务进行微调。

- 314B参数的MoE，有25%的权重在给定token上处于激活状态。

- 2023年10月，xAI使用JAX和Rust之上的自定义训练堆栈从头开始训练。

一经上线GitHub，Grok就狂揽了6k星，586个Fork。

项目地址：https://github.com/xai-org/grok-1

马斯克还不忘嘲讽OpenAI一番，「告诉我们更多关于OpenAI的「open」部分...」

纽约时报点评道，开源Gork背后的原始代码，是这个世界上最富有的人控制AI未来战斗的升级。

开源究竟会让技术更安全，还是会让它更滥用？

「开源支持者」马斯克，以身作则地卷入了AI界的这场激烈辩论，并用行动给出了答案。

小扎刚刚也对Grok做出了评价，「并没有给人留下真正深刻的印象，3140亿参数太多了，你需要一堆H100，不过我已经买下了」。

一条磁力链，全球首个最大模型开源

这次xAI开源Grok-1，遵守的是Apache-2.0许可证，因此，用户可以自由使用、修改和分发软件。

存储库包含了用于加载和运行Grok-1开源权重模型的JAX示例代码。

用户需要下载checkpoint，将ckpt-0目录放置在checkpoint中，随后运行以下代码来测试：

pip install -r requirements.txt
python run.py

这个脚本会在测试输入上，加载checkpoint和模型中的样本。

由于模型较大，参数达到了314B参数，因此需要具有足够GPU内存的计算机，才能使用示例代码测试模型。

而且，由于此存储库中MoE层的实现效率不高，选择该实现是为了避免需要自定义内核来验证模型的正确性。

通过Torrent客户端和下面这个磁力链接，就可以下载权重了。

magnet:?xt=urn:btih:5f96d43576e3d386c9ba65b883210a393b68210e&tr=https%3A%2F%2Facademictorrents.com%2Fannounce.php&tr=udp%3A%2F%2Ftracker.coppersurfer.tk%3A6969&tr=udp%3A%2F%2Ftracker.opentrackr.org%3A1337%2Fannounce