IBM发布新版本Granite 4.2开源模型,支持30B参数推理与512K上下文窗口

周二,IBM正式推出了其最新的Granite开源大语言模型系列,涵盖了包含30亿、80亿和300亿参数三种不同规模的模型。所有这些版本都采用了密集解码器架构,并从零开始完成预训练。与最近其他厂商转向混合Mamba/注意力架构的潮流不同,IBM选择了一条更为简洁的设计方案,坚守全注意力Transformer架构。之前,IBM在Granite 4.0版本中尝试了多种架构,包括传统的密集模型、密集混合模型和混合专家模型,而在Granite 4.1中,IBM又将重心放回到了全注意力、密集Transformer架构上。IBM当时表示,新一代模型在性能上优于前代,且“架构更为简单灵活,方便后续微调任务”。到了Granite 4.2版本,这一判断依旧保持延续,IBM将其定义为“注重推理的版本”。该模型可以在思维模式和非思维模式下运行,同时还增加了一种低努力模式,只需少量推理token即可回答简单问题。值得一提的是,在发布Granite 4.1时,IBM仍认为推理模型的效率不足,因此建议企业用户在指令遵循和工具调用等特定任务上选择成本更低且表现相近的非推理模型。然而,团队现在显然已改变了看法,认为推理能力已成为必要功能,尽管在4.2系列中它仍然是一个可选项。

与同类模型相比,Granite 4.2选择了纯文本处理路线。例如,Qwen-3.8 27B、Muse Glimmer 30B以及Google的Gemma 4 31B均具备多模态能力,而Granite 4.2仅局限于文本处理。虽然IBM并非没有视觉模型,比如之前发布的Granite Vision 4.1 4B,但未来是否会推出Granite 4.2视觉版本尚未有明确消息。在同一天,IBM还在Granite Speech系列中推出了两款新的语音识别模型。

在预训练和工具调用能力方面,这些模型采用了Apache 2.0许可证,并在15万亿token的基础上进行了预训练,整个过程分为五个阶段,其中包括长上下文训练阶段,将上下文窗口提升至512,000 token,尽管发布时原生支持的配置为128K。IBM提到训练集中包含1万亿token的合成代码,尽管模型整体的编码表现依然处于平均水平。大部分模型共享同一训练流程,而80亿和300亿参数版本还额外经过智能体强化学习,增强了它们调用工具、编辑与运行代码、在终端工作和网络搜索的能力。IBM表示,结合人类反馈的强化学习对齐,这一方法旨在提升模型在实际任务中的执行能力。