终极医疗AI助手HealthGPT-Pro-8B:从文本到3D影像的全栈分析能力解析
终极医疗AI助手HealthGPT-Pro-8B从文本到3D影像的全栈分析能力解析【免费下载链接】HealthGPT-Pro-8B项目地址: https://ai.gitcode.com/hf_mirrors/lintw/HealthGPT-Pro-8BHealthGPT-Pro-8B是一款基于Qwen3-VL构建的高性能医疗多模态大语言模型Med-MLLM专为医疗文本、2D医学图像和3D医学体积数据的理解与分析而设计在广泛的医疗文本和视觉语言任务中展现出强大性能。 核心功能解析全模态输入支持HealthGPT-Pro-8B能够处理文本、2D图像和3D体积数据实现了医疗数据的全方位覆盖。其支持的14种模态包括计算机断层扫描CT、数字摄影、眼底摄影、红外反射成像、磁共振成像MRI、光学相干断层扫描OCT、皮肤镜检查、内窥镜检查、显微镜检查、X射线成像、超声成像、组织病理学、阴道镜检查和文本。高效训练与卓越性能通过创新的两阶段训练方案HealthGPT-Pro-8B使用300万样本进行对齐1000万样本进行SFT监督微调实现了当前最先进的性能。与其他模型相比HealthGPT-Pro-8B在医疗文本基准测试中平均得分为61.3在医疗多模态基准测试中平均得分为69.0展现出卓越的综合能力。强大的指令跟随能力与许多仅在医疗领域数据上微调的Med-MLLM不同HealthGPT-Pro-8B保留了大量通用数据以保持强大的指令跟随能力。这使得模型不仅在专业医疗任务中表现出色还能灵活应对各种用户指令。 快速开始指南环境设置推荐的环境配置如下# 创建并激活干净的Python 3.12环境 conda create -n healthgpt-pro python3.12 -y conda activate healthgpt-pro # 安装支持CUDA的PyTorch # 如果您的CUDA版本低于12.8请安装匹配的PyTorch版本例如cu121或cu118 pip install torch2.8.0 torchvision0.23.0 torchaudio2.8.0 --index-url https://download.pytorch.org/whl/cu128 # 安装FlashAttention以加速注意力计算 pip install flash-attn2.8.3 --no-build-isolation --upgrade # 安装其他依赖 pip install transformers4.57.1 accelerate1.11.0 deepspeed0.16.9 numpy1.26.4 peft0.17.1 pip install qwen-vl-utils pillow模型加载与处理器import numpy as np import torch from PIL import Image from transformers import AutoProcessor, Qwen3VLForConditionalGeneration from qwen_vl_utils import process_vision_info model_id HealthGPT-Pro-8B model Qwen3VLForConditionalGeneration.from_pretrained( model_id, dtypetorch.bfloat16, attn_implementationflash_attention_2, device_mapauto, ) processor AutoProcessor.from_pretrained(model_id) 多场景应用示例文本推理HealthGPT-Pro-8B可以解答各种医学问题例如解释肺炎的主要症状和常见风险因素。messages [ { role: user, content: [ {type: text, text: Explain the key symptoms and common risk factors of pneumonia.}, ], } ] inputs processor.apply_chat_template( messages, tokenizeTrue, add_generation_promptTrue, return_dictTrue, return_tensorspt, ).to(model.device) generated_ids model.generate(**inputs, max_new_tokens256) generated_ids_trimmed [ out_ids[len(in_ids):] for in_ids, out_ids in zip(inputs.input_ids, generated_ids) ] output_text processor.batch_decode( generated_ids_trimmed, skip_special_tokensTrue, clean_up_tokenization_spacesFalse, ) print(output_text[0])单图像推理模型能够分析医学图像如胸部X光片并描述主要的放射学发现。messages [ { role: user, content: [ {type: image, image: examples/chest_xray.png}, {type: text, text: Describe the main radiological findings in this image.}, ], } ] inputs processor.apply_chat_template( messages, tokenizeTrue, add_generation_promptTrue, return_dictTrue, return_tensorspt, ).to(model.device) generated_ids model.generate(**inputs, max_new_tokens256) generated_ids_trimmed [ out_ids[len(in_ids):] for in_ids, out_ids in zip(inputs.input_ids, generated_ids) ] output_text processor.batch_decode( generated_ids_trimmed, skip_special_tokensTrue, clean_up_tokenization_spacesFalse, ) print(output_text[0])多图像推理HealthGPT-Pro-8B可以比较多个医学图像并总结关键差异这对于病情进展跟踪和治疗效果评估非常有用。3D体积推理模型能够处理3D医学数据如CT体积。仓库中的推理路径将3D .npy体积转换为一系列2D帧并将其作为视频风格输入发送。def ct_to_video(ct_path: str): ct_pixels np.load(ct_path) ct_u8 np.clip(ct_pixels * 255, 0, 255).astype(np.uint8) frames [] idx np.linspace(1, len(ct_u8) - 2, 10, dtypeint) for i in idx: rgb np.stack([ct_u8[i]] * 3, axis-1) frames.append(Image.fromarray(rgb, modeRGB)) return frames volume_frames ct_to_video(examples/ct_volume.npy) messages [ { role: user, content: [ {type: video, video: volume_frames, sample_fps: 2.0}, {type: text, text: Analyze this CT volume and summarize the main findings.}, ], } ] text processor.apply_chat_template( messages, tokenizeFalse, add_generation_promptTrue, ) images, videos, video_kwargs process_vision_info( messages, image_patch_size16, return_video_kwargsTrue, return_video_metadataTrue, ) if videos is not None: videos, video_metadatas zip(*videos) videos, video_metadatas list(videos), list(video_metadatas) else: video_metadatas None inputs processor( texttext, imagesimages, videosvideos, video_metadatavideo_metadatas, return_tensorspt, do_resizeFalse, **video_kwargs, ).to(model.device) generated_ids model.generate(**inputs, max_new_tokens256) generated_ids_trimmed [ out_ids[len(in_ids):] for in_ids, out_ids in zip(inputs.input_ids, generated_ids) ] output_text processor.batch_decode( generated_ids_trimmed, skip_special_tokensTrue, clean_up_tokenization_spacesFalse, ) print(output_text[0])⚠️ 使用注意事项HealthGPT-Pro-8B仅供研究使用不应作为专业临床判断、诊断或治疗的替代品。在实际医疗应用中应始终咨询专业医疗人员的意见。 引用如果您发现此模型对您的研究有用请引用misc{lin2025healthgptmedicallargevisionlanguage, title{HealthGPT: A Medical Large Vision-Language Model for Unifying Comprehension and Generation via Heterogeneous Knowledge Adaptation}, author{Tianwei Lin and Wenqiao Zhang and Sijing Li and Yuqian Yuan and Binhe Yu and Haoyuan Li and Wanggui He and Hao Jiang and Mengze Li and Xiaohui Song and Siliang Tang and Jun Xiao and Hui Lin and Yueting Zhuang and Beng Chin Ooi}, year{2025}, eprint{2502.09838}, archivePrefix{arXiv}, primaryClass{cs.CV}, url{https://arxiv.org/abs/2502.09838}, } 模型配置详情HealthGPT-Pro-8B的主要配置参数如下隐藏层大小4096注意力头数32隐藏层数36图像标记ID151655视频标记ID151656生成配置temperature0.7top_k20top_p0.8这些参数共同构成了模型强大的医疗多模态处理能力使其能够在各种医疗任务中表现出色。要开始使用HealthGPT-Pro-8B请克隆仓库https://gitcode.com/hf_mirrors/lintw/HealthGPT-Pro-8B并按照上述指南进行环境设置和模型加载。【免费下载链接】HealthGPT-Pro-8B项目地址: https://ai.gitcode.com/hf_mirrors/lintw/HealthGPT-Pro-8B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考