人工智能

Stability AI开源3B代码生成模型:可补全,还能Debug

字号+作者: 来源:​机器之心公众号 2024-03-27 09:07 评论(创建话题) 收藏成功收藏本文

声明:本文来自于微信公众号 机器之心(ID:almosthuman2014),作者:机器之心,授权站长之家转载发布。Stable Diffusion3还没全面开放,这家公司的代码生成模型先'...

声明:本文来自于微信公众号 机器之心(ID:almosthuman2014),作者:机器之心,授权站长之家转载发布。Jg4品论天涯网

Stable Diffusion3还没全面开放,这家公司的代码生成模型先来了。Jg4品论天涯网

本周一,Stability AI 开源了小体量预训练模型 Stable Code Instruct3B。Jg4品论天涯网

Stable Code Instruct3B 是一个基于 Stable Code3B 的指令调整编码语言模型(Code LM)。给出自然语言 prompt,该模型可以处理各种任务,例如代码生成、数学和其他软件工程相关的任务。Jg4品论天涯网

Stability AI 宣称,该模型在3B 规模上提供了 SOTA 性能,并且优于 CodeLlama7B Instruct 等更大规模的模型,甚至在软件工程相关任务中,性能与 StarChat15B 相当。Jg4品论天涯网

图片Jg4品论天涯网

模型:https://huggingface.co/stabilityai/stable-code-instruct-3bJg4品论天涯网

HuggingFace 试用:https://huggingface.co/spaces/stabilityai/stable-code-instruct-3bJg4品论天涯网

Stable Code 技术报告:Jg4品论天涯网

https://static1.squarespace.com/static/6213c340453c3f502425776e/t/6601c5713150412edcd56f8e/1711392114564/Stable_Code_TechReport_release.pdfJg4品论天涯网

Stable Code Instruct3B 增强了代码补全能力,并支持自然语言交互,旨在提高编程和软件开发相关任务的效率和直观性。实验测试表明,该模型在各种与编码相关的任务中优于 Codellama7B Instruct 和 DeepSeek-Coder Instruct1.3B 等同类模型。Jg4品论天涯网

方法介绍Jg4品论天涯网

Stable Code 建立在 Stable LM3B 的基础上。Stable Code 是一个因果纯解码器 transformer,类似于 LLaMA 架构,与 LLaMA 的主要区别如下:Jg4品论天涯网

位置嵌入,旋转位置嵌入应用于头嵌入维度的前25%,以提高吞吐量;Jg4品论天涯网

标准化,带有学得偏差项的 LayerNorm;Jg4品论天涯网

偏差,除了键、查询和值投影的偏差,Stable Code 从前馈网络和多头自注意力层中删除了所有偏差项。Jg4品论天涯网

图片Jg4品论天涯网

下表给出了预训练语料库数据集的采样权重、 epoch、类别等信息。Jg4品论天涯网

图片Jg4品论天涯网

图片Jg4品论天涯网

根据 Stack Overflow2023开发者调查报告,Stable Code Instruct3B 重点关注 Python、Javascript、Java、C、C++ 和 Go 等语言,这些语言对于各种开发人员来说是最流行和最有影响力的。虽然这些语言被选为训练的重点,但该模型还针对其他广泛采用的语言(例如 SQL、PHP 和 Rust)进行了训练。Jg4品论天涯网

图片Jg4品论天涯网

即使对于最初未包含在训练集中的语言(例如 Lua),Stable Code Instruct3B 也能提供强大的测试性能。这种熟练程度可能源于其对底层编码原理的理解,以及利用编码任务固有的可预测性,在不同编程环境中适应概念的能力。Jg4品论天涯网

Stable Code Instruct3B 不仅精通代码生成,还精通 FIM(Fill in the Middle)任务、数据库查询、代码翻译、解释和创建。其指令调整使其能够理解并按照细致入微的指令采取行动,促进除简单代码完成之外的广泛编码任务,包括数学理解、逻辑推理和围绕软件开发处理复杂的技术描述。Jg4品论天涯网

性能评估Jg4品论天涯网

与 Codellama7B Instruct 和 DeepSeek-Coder Instruct1.3B 等领先模型相比,Stable Code Instruct3B 在一系列编码任务中展现出卓越的性能。Jg4品论天涯网

图片Jg4品论天涯网

研究团队还在 Multi-PL 基准上比较了三种模型。尽管参数量较少,但 Stable Code Instruct3B 在所有语言上的表现均明显优于 CodeLlama Instruct。Jg4品论天涯网

图片Jg4品论天涯网

下表8展示了几种模型在 FIM 任务上的性能:Jg4品论天涯网

图片Jg4品论天涯网

实验测试表明,Stable Code Instruct3B 在代码完成准确性、对自然语言指令的理解以及跨不同编程语言的能力方面可与其他模型媲美甚至超越。Jg4品论天涯网

图片Jg4品论天涯网

Stable Code Instruct3B 的参数规模和低硬件要求使其可供广泛的受众使用,使开发人员能够更高效地工作。值得一提的是,Stable Code Instruct3B 现在可以通过 Stability AI 会员资格用于商业目的。Jg4品论天涯网

参考链接:Jg4品论天涯网

https://stability.ai/news/introducing-stable-code-instruct-3bJg4品论天涯网

https://twitter.com/StabilityAI/status/1772345514023116828Jg4品论天涯网

本网除标明“PLTYW原创”的文章外,其它文章均为转载或者爬虫(PBot)抓取; 本文只代表作者个人观点,不代表本站观点,仅供大家学习参考。本网站属非谋利性质,旨在传播马克思主义和共产主义历史文献和参考资料。凡刊登的著作文献侵犯了作者、译者或版权持有人权益的,可来信联系本站删除。 本站邮箱[email protected]