EGM-4B-SFT API参考手册:全面掌握模型接口与参数配置
【免费下载链接】EGM-4B-SFT项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/EGM-4B-SFT
EGM-4B-SFT是基于Qwen3VL架构的多模态模型,提供强大的文本生成与视觉理解能力。本手册将系统介绍模型的核心配置参数、生成接口及实用工具,帮助开发者快速上手并优化模型性能。
模型基础配置解析
核心架构参数
模型配置文件config.json定义了模型的基础架构与超参数,关键配置包括:
文本编码器配置:
hidden_size: 2560(隐藏层维度)num_hidden_layers: 36(Transformer层数)num_attention_heads: 32(注意力头数)max_position_embeddings: 262144(最大序列长度)
视觉编码器配置:
patch_size: 16(图像分块大小)hidden_size: 1024(视觉隐藏层维度)depth: 24(视觉Transformer层数)out_hidden_size: 2560(视觉特征输出维度)
特殊令牌ID:
image_token_id: 151655(图像占位符令牌)video_token_id: 151656(视频占位符令牌)vision_start_token_id/vision_end_token_id: 151652/151653(视觉内容起止令牌)
生成参数配置
生成配置文件generation_config.json控制文本生成行为,主要参数:
| 参数 | 类型 | 默认值 | 说明 |
|---|---|---|---|
do_sample | bool | true | 是否启用采样生成 |
top_k | int | 20 | 采样候选词数量 |
top_p | float | 0.95 | 核采样概率阈值 |
eos_token_id | list | [151645, 151643] | 结束令牌ID列表 |
pad_token_id | int | 151643 | 填充令牌ID |
实用工具函数
零冗余优化器检查点转换
zero_to_fp32.py提供了将DeepSpeed零冗余优化器检查点转换为标准PyTorch模型的关键函数:
convert_zero_checkpoint_to_fp32_state_dict: 将零冗余检查点转换为FP32状态字典load_state_dict_from_zero_checkpoint: 直接加载检查点到模型get_fp32_state_dict_from_zero_checkpoint: 获取转换后的状态字典
典型使用场景:
from zero_to_fp32 import convert_zero_checkpoint_to_fp32_state_dict # 将检查点转换为标准模型 convert_zero_checkpoint_to_fp32_state_dict( checkpoint_dir="./latest", output_file="./model_merged.pt" )令牌配置文件
- tokenizer_config.json: 分词器配置
- special_tokens_map.json: 特殊令牌映射
- vocab.json: 词汇表定义
- merges.txt: BPE合并规则
快速开始指南
环境准备
- 克隆仓库:
git clone https://gitcode.com/hf_mirrors/nvidia/EGM-4B-SFT cd EGM-4B-SFT- 安装依赖:
pip install transformers accelerate torch基础使用示例
from transformers import AutoModelForCausalLM, AutoTokenizer # 加载模型和分词器 model = AutoModelForCausalLM.from_pretrained(".") tokenizer = AutoTokenizer.from_pretrained(".") # 文本生成 inputs = tokenizer("EGM-4B-SFT模型的主要特点是", return_tensors="pt") outputs = model.generate(**inputs, max_new_tokens=100) print(tokenizer.decode(outputs[0], skip_special_tokens=True))常见问题解决
内存优化建议
- 使用
bfloat16精度加载模型(配置文件中已默认设置) - 启用模型并行:
model = AutoModelForCausalLM.from_pretrained(".", device_map="auto") - 调整生成参数:降低
max_new_tokens或使用更小的top_k值
视觉输入处理
确保图像输入格式符合模型要求:
- 分辨率建议:至少600x300像素
- 通道格式:RGB模式
- 预处理:使用模型配套的图像处理器
配置文件详解
文本配置部分
config.json中的text_config段定义了语言模型的核心参数,包括注意力机制、激活函数和归一化配置:
attention_bias: false(是否使用注意力偏置)hidden_act: "silu"(激活函数类型)rms_norm_eps: 1e-06(RMS归一化epsilon值)rope_theta: 5000000(旋转位置编码基数)
视觉配置部分
vision_config段包含图像处理相关参数:
spatial_merge_size: 2(空间特征合并比例)temporal_patch_size: 2(时间维度分块大小)deepstack_visual_indexes: [5, 11, 17](深度堆叠视觉索引)
通过合理调整这些参数,可以在特定任务上优化模型性能与速度。
【免费下载链接】EGM-4B-SFT项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/EGM-4B-SFT
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考