Xinference 图像模型指南:使用 stable_diffusion 家族 sd3.5-medium 运行文生图、图生图与局部重绘
发布时间:2026/9/16 17:17:56 锦皓数字建站

Xinference 图像模型指南使用 stable_diffusion 家族 sd3.5-medium 运行文生图、图生图与局部重绘【免费下载链接】inferenceSwap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.项目地址: https://gitcode.com/GitHub_Trending/in/inference导读本文围绕 Xinference 内置图像模型sd3.5-medium模型家族stable_diffusion展开说明其能力边界、标准启动命令、GGUF 量化加载方式并结合仓库源码剖析其默认配置、引擎选型与底层实现。读完本文你将掌握如何用一条xinference launch命令在本地或服务器上拉起该模型并在需要时通过 GGUF 量化与 CPU offload 在低显存环境运行。模型规格速览依据 Xinference 官方内置模型文档 sd3.5-medium.rst该模型的基本规格如下Model Name模型名sd3.5-mediumModel Family模型家族stable_diffusionAbilities能力text2image文生图、image2image图生图、inpainting局部重绘Available ControlNetNone该模型暂不提供内置 ControlNet规格明细SpecificationsModel IDHuggingFace 模型 IDstabilityai/stable-diffusion-3.5-mediumGGUF Model IDcity96/stable-diffusion-3.5-medium-ggufGGUF QuantizationsGGUF 量化档位F16、Q3_K_M、Q3_K_S、Q4_0、Q4_1、Q4_K_M、Q4_K_S、Q5_0、Q5_1、Q5_K_M、Q5_K_S、Q6_K、Q8_0共 13 个档位上述能力与量化信息在模型注册表 model_spec.json 中有一一对应的结构化声明model_ability为[text2image, image2image, inpainting]gguf_quantizations列表与文档完全一致是 Xinference 在启动时校验参数、生成下载文件名的依据。一行命令启动模型在 Xinference 中启动sd3.5-medium非常简单执行xinference launch --model-name sd3.5-medium --model-type image--model-name指定模型注册名sd3.5-medium--model-type指定模型类型为image。执行后 Xinference 会依据内置模型规格自动完成以下工作根据 model_spec.json 中的model_src确定下载源HuggingFace 优先ModelScope 作为国内镜像替代下载权重文件创建隔离的 Python 虚拟环境并安装依赖最后以默认引擎diffusers加载模型并对外暴露统一的图像生成 RESTful API。该命令默认会启用模型规格中声明的默认配置见下文“默认配置”小节。如果你希望指定后端引擎例如改用 vLLM-Omni 引擎可以在命令中追加--engine参数例如--engine vLLM具体引擎差异请参考下文“引擎选型”小节。使用 GGUF 量化降低显存占用对于显存有限的场景Xinference 支持直接加载社区预量化的 GGUF 格式权重命令如下xinference launch --model-name sd3.5-medium --model-type image \ --gguf_quantization ${gguf_quantization} --cpu_offload True其中${gguf_quantization}为上文列出的 13 个档位之一例如Q4_K_M、Q5_K_M或Q8_0--cpu_offload True启用模型的 CPU offload将部分权重驻留在 CPU 内存、按需搬运到 GPU进一步压低显存峰值。GGUF 加载的底层实现从源码看GGUF 加载由 diffusers 引擎在 stable_diffusion/core.py 中实现引擎调用_quantize_transformer_gguf()使用diffusers.GGUFQuantizationConfig(compute_dtypetorch_dtype)构造量化配置通过 transformer 层类的from_single_file()直接加载 GGUF 权重文件并复用原始模型目录下transformer子目录中的配置文件加载路径self._gguf_model_path由--gguf_quantization参数解析得到Xinference 依据 model_spec.json 中的文件名模板sd3.5_medium-{quantization}.gguf将量化档位代入模板并从gguf_model_idHuggingFacecity96/stable-diffusion-3.5-medium-ggufModelScope 镜像Xorbits/stable-diffusion-3.5-medium-gguf仓库中下载对应文件。CPU offload 的实现--cpu_offload True对应源码中的两种路径stable_diffusion/core.pycpu_offloadTrue调用model.enable_model_cpu_offload()模型整体按层卸载到 CPUsequential_cpu_offloadTrue调用model.enable_sequential_cpu_offload()实现更细粒度的顺序卸载显存占用更低但推理更慢。需要说明的是默认规格中该模型的quantize默认值为true见下文源码中 GGUF 与内置量化存在互斥处理stable_diffusion/core.py 在 GGUF 生效时跳过普通量化路径因此使用 GGUF 时无需再手动叠加其他量化参数。引擎选型diffusers 与 vLLM 的能力差异sd3.5-medium在 Xinference 中可由 diffusers 与 vLLM 两套引擎加载但能力并不完全相同这从引擎实现注释中可以清晰确认vllm/core.pyVLLM_SUPPORTED_IMAGE_MODELS中明确包含sd3.5-medium即 vLLM-Omni 引擎已验证支持该模型但VLLM_SUPPORTED_ABILITIES仅包含(text2image,)vLLM 引擎只实现文生图能力文档声明的image2image与inpainting仅由 diffusers 引擎提供在 vllm/core.py 中gguf_model_path、lightning_model_path、lora_model、controlnet任一参数传入时都会抛出ValueError并提示请改用 diffusers 引擎。因此选型建议需求推荐引擎文生图追求 vLLM 引擎的吞吐能力vLLM仅支持text2image图生图 / 局部重绘diffusers默认引擎GGUF 量化加载 / CPU offloaddiffusersvLLM 引擎明确不支持 GGUFLoRA / ControlNetdiffusers模型来源与默认配置在模型注册表 model_spec.json 中sd3.5-medium还携带了文档之外的工程化细节默认模型配置default_model_config{ quantize: true, quantize_text_encoder: text_encoder_3, torch_dtype: bfloat16 }quantize: true默认启用 8bit 量化以降低显存占用quantize_text_encoder: text_encoder_3对第三个文本编码器执行量化。SD 3.5 架构包含多个文本编码器源码中该参数支持逗号分隔多个名称stable_diffusion/core.py可按需对text_encoder、text_encoder_2等分别指定torch_dtype: bfloat16默认以 bfloat16 精度加载。模型来源model_src平台Model ID固定 RevisionHuggingFacestabilityai/stable-diffusion-3.5-medium94b13ccbe959c51e8159d91f562c58f29fac971aModelScopeAI-ModelScope/stable-diffusion-3.5-mediummasterHuggingFace 源固定了可复现的 commit revisionModelScope 源则面向国内网络环境提供镜像加速。两条来源均声明了相同的 GGUF 量化档位与文件名模板。虚拟环境依赖virtualenv.packages该模型在 diffusers 引擎下依赖#diffusers_dependencies#、transformers4.51.0及系统级 torch/numpy若指定#engine# vLLM则会安装vllm-omni0.24.*与vllm0.24.*。Xinference 会在启动时自动为模型创建隔离虚拟环境避免不同模型间的依赖冲突。相关模型与延伸阅读sd3.5-medium属于 Xinference 内置的 stable_diffusion 模型家族同族模型还包括sd3.5-large更大规模的 SD 3.5 模型默认配置额外启用transformer_quantization: nf4sd3.5-large-turbo蒸馏加速版GGUF 档位较少F16、Q4_0、Q4_1、Q5_0、Q5_1、Q8_0sd3-medium上一代 SD 3 系列中型模型。关于图像模型的通用使用方式RESTful API、生成参数、结果处理可进一步阅读 Xinference 文档中的 图像模型能力说明 与 模型使用指南。小结sd3.5-medium是 Xinference 内置的 stable_diffusion 家族图像模型覆盖文生图、图生图与局部重绘三类能力。生产实践中建议遵循以下要点默认一行命令xinference launch --model-name sd3.5-medium --model-type image即可启动显存受限时从 13 个 GGUF 档位中选择合适的量化如Q4_K_M配合--cpu_offload True运行需要image2image/inpainting/ GGUF 时务必使用默认的 diffusers 引擎vLLM 引擎仅支持text2image且不接受 GGUF、LoRA 与 ControlNet 参数模型默认启用text_encoder_3量化与 bfloat16 精度无需手动调整即可获得较好的显存与精度平衡。【免费下载链接】inferenceSwap GPT for any LLM by changing a single line of code. Xinference lets you run open-source, speech, and multimodal models on cloud, on-prem, or your laptop — all through one unified, production-ready inference API.项目地址: https://gitcode.com/GitHub_Trending/in/inference创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
锦
锦皓数字建站
深耕本土企业品牌数字化升级,专注原创端正雅致商务官网,从视觉设计到稳定运维全程保驾护航。