Gemma-4-31B-it-assistant 和 Gemma-4-31B-IT-NVFP4 模型现已在 Amazon SageMaker JumpStart 中推出
Google DeepMind 的 Gemma-4-31B-it-assistant 和 NVIDIA 的 Gemma-4-31B-IT-NVFP4 模型现已在 Amazon SageMaker JumpStart 中推出,为 AWS 客户提供了更丰富的基础模型选择。这两款模型将旗舰级 Gemma 4 31B 稠密架构引入企业级工作负载,并提供全精度与优化量化两种变体,使客户能够在 AWS 基础设施上部署高性能、可扩展的人工智能解决方案。
这些模型利用专业功能应对不同的企业人工智能挑战:
Gemma-4-31B-it-assistant 是 Google 的旗舰级 31B 稠密模型的助手调优变体,专为多模态推理、编码与代理式工作流而构建。该模型可处理文本与图像输入(包含以帧序列形式传入的视频)并生成文本输出,具备 25.6 万 token 上下文窗口,同时支持 140 多种语言。它在 Arena AI 文本排行榜的开源模型中排名第 3,性能优于参数量达其 20 倍的模型;采用混合注意力机制,交错结合局部滑动窗口注意力与全局全注意力,并原生支持函数调用,可用于构建自主智能体。
Gemma-4-31B-IT-NVFP4 具备与 Gemma 4 31B 相同的能力,并能大幅降低内存占用。该模型利用 NVIDIA 的 ModelOpt 框架量化至 4 位 FP4 精度,内存占用降至约 18.5 GB(相比基础模型减小了 68%),推理速度提升约 2.5 倍,同时保留原模型 97%–99% 的输出质量。非常适合在 NVIDIA RTX、DGX Spark 和数据中心 GPU 上进行高性价比、高吞吐量的生产部署。
借助 SageMaker JumpStart,客户只需点击几下即可部署这些模型中的任何一个,以解决其特定的人工智能使用案例。
要开始使用这些模型,请导航到 SageMaker 控制台中的 SageMaker JumpStart 模型目录,或使用 SageMaker Python SDK 将模型部署到您的 AWS 账户。有关在 SageMaker JumpStart 中部署和使用基础模型的更多信息,请参阅 Amazon SageMaker JumpStart 文档。