GR00T-N1.5-3B_Assemble_Trocar API参考手册:完整接口文档与使用示例 GR00T-N1.5-3B_Assemble_Trocar API参考手册完整接口文档与使用示例【免费下载链接】GR00T-N1.5-3B_Assemble_Trocar项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/GR00T-N1.5-3B_Assemble_TrocarGR00T-N1.5-3B_Assemble_Trocar是一款专为医疗机器人手术设计的视觉语言动作模型VLA能够通过模仿学习在Isaac for Healthcare Rheo工作流中实现外科器械的精准操作。本手册将详细介绍模型的API接口规范、参数配置及实用示例帮助开发者快速集成并应用于手术机器人模拟系统。模型基础信息 核心功能概述该模型基于GR00T N1.5架构开发拥有30亿参数专注于腹腔镜手术中套管针Trocar的自动化组装任务。通过接收视觉图像、机器人状态和语言指令模型可输出连续的机器人动作向量控制G1机械臂完成从器械抓取、组装到放置的全流程操作。技术规格速览架构类型Vision Language Action (VLA)模型输入模态RGB图像3路摄像头、1D状态向量、文本指令输出格式16×28连续动作张量16步动作序列推理延迟56.3±7.9msNVIDIA RTX 5880 Ada平台显存占用8GB支持框架PyTorch 2.10.0API接口规范 输入参数详解视觉输入Vision参数类型规格描述left_wrist_viewRGB图像224×224×3 uint8左臂腕部摄像头画面right_wrist_viewRGB图像224×224×3 uint8右臂腕部摄像头画面room_viewRGB图像224×224×3 uint8场景全局摄像头画面注所有图像需符合metadata.json中定义的分辨率和帧率要求30fps状态输入State机器人状态向量为1×28维浮点数组包含以下组件左臂关节7个自由度位置范围[-1.427, -0.443]右臂关节7个自由度位置范围[-1.212, 0.290]左手状态7个控制参数抓取范围[-1.227, -0.729]右手状态7个控制参数抓取范围[0.793, 1.135]详细参数分布可参考experiment_cfg/metadata.json中的统计数据。语言指令Instruction参数类型示例描述command字符串Assemble the trocar and place on Mayo Stand自然语言手术任务指令输出参数定义模型输出为形状为(16, 28)的连续值张量包含16步动作序列每步动作包含左臂控制7维右臂控制7维左手控制7维右手控制7维动作值范围参考metadata.json中action字段的统计信息例如左臂关节动作范围为[-1.577, 0.528]。快速开始指南 环境准备硬件要求NVIDIA GPUAmpere/Blackwell/Hopper架构至少8GB显存软件依赖# 克隆仓库 git clone https://gitcode.com/hf_mirrors/nvidia/GR00T-N1.5-3B_Assemble_Trocar cd GR00T-N1.5-3B_Assemble_Trocar # 安装依赖示例 pip install torch2.10.0 transformers4.51.3基础调用示例from transformers import AutoModelForVision2Seq, AutoProcessor # 加载模型和处理器 model AutoModelForVision2Seq.from_pretrained(./) processor AutoProcessor.from_pretrained(./) # 准备输入 left_wrist_img load_image(left_wrist.jpg) # 224×224 RGB图像 right_wrist_img load_image(right_wrist.jpg) room_img load_image(room.jpg) state [0.1, -0.3, 0.2, ...] # 28维状态向量 instruction Assemble the trocar # 预处理 inputs processor( images[left_wrist_img, right_wrist_img, room_img], textinstruction, statestate, return_tensorspt ) # 推理 outputs model.generate(**inputs) actions processor.decode_actions(outputs) # 16×28动作张量高级配置选项 ⚙️模型配置详解核心配置文件config.json包含关键参数动作生成设置action_head_cfg: { action_horizon: 16, // 预测动作步数 num_inference_timesteps: 4, // 扩散模型推理步数 noise_s: 0.999 // 噪声缩放因子 }视觉-语言融合配置vl_self_attention_cfg: { num_attention_heads: 32, // 注意力头数 num_layers: 4 // 交叉注意力层数 }性能优化建议精度设置默认使用bfloat16计算精度可通过compute_dtype参数调整推理加速启用Flash Attentionuse_flash_attention: true批量处理支持多实例并行推理需调整输入批次维度常见问题解答 ❓Q: 模型支持哪些操作系统A: 仅支持Linux系统Ubuntu 22.04/24.04 LTS需配合NVIDIA GPU驱动使用。Q: 如何处理动作输出的物理约束A: 建议参考experiment_cfg/metadata.json中的动作统计数据max/min值对输出进行裁剪避免机械臂超出安全范围。Q: 输入图像需要预处理吗A: 是的需确保图像分辨率为224×224色彩空间为RGB并进行标准化均值/方差参考训练配置。注意事项与限制 ⚠️使用范围模型仅适用于Isaac for Healthcare Rheo仿真环境禁止用于真实临床手术数据要求输入需严格符合metadata.json定义的模态规格伦理合规使用前请阅读并遵守NVIDIA非商业许可协议性能监控建议实时监控GPU显存使用避免因资源不足导致推理失败参考资源 模型架构细节README.md训练数据集信息README.md伦理考量README.md官方代码库Nvidia Isaac-GR00T本API手册将随模型版本更新而定期修订建议开发者关注最新版本以获取功能增强和性能优化信息。【免费下载链接】GR00T-N1.5-3B_Assemble_Trocar项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/GR00T-N1.5-3B_Assemble_Trocar创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考