news 2026/9/12 5:52:18

MAX v26.2 发布说明深度解析:FLUX 图像生成、DeepSeek 增强与 Blackwell 内核优化

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
MAX v26.2 发布说明深度解析:FLUX 图像生成、DeepSeek 增强与 Blackwell 内核优化

MAX v26.2 发布说明深度解析:FLUX 图像生成、DeepSeek 增强与 Blackwell 内核优化

【免费下载链接】mojoThe Modular Platform (includes MAX & Mojo)项目地址: https://gitcode.com/GitHub_Trending/mo/mojo

MAX v26.2(2026-03-19 发布)是 Modular 平台的一次大规模版本更新,覆盖图像生成服务、DeepSeek 模型系列增强、Blackwell(SM100)GPU 内核优化、推理服务器能力扩展、maxCLI 新参数、Python API 演进以及一批破坏性变更。本文以 docs/releases/v26.2.md 为主线,结合仓库源码与 环境变量参考 等配套文档,逐项解析每个版本要点及其使用方式,帮助你判断升级影响并快速上手新功能。

Highlights:三大核心亮点

v26.2 的版本亮点集中在以下三个方向:

  1. FLUX 扩散模型图像生成:MAX 正式支持基于 FLUX 扩散模型的图像生成(FLUX.1-devFLUX.2-dev),通过全新的/v1/responses端点对外服务,该端点实现 OpenResponses。
  2. DeepSeek 系列显著增强:新增 DeepSeekV3.2 架构支持(含多潜变量注意力 multi-latent attention、融合 FP8 分页 KV cache);为 DeepSeek-R1 增加 NVFP4 量化支持(支持专家并行);专家并行(expert parallelism)现在单节点部署支持超过 32 个本地专家且无需 NVSHMEM。
  3. Blackwell(SM100)内核大幅优化:引入 SnapMLA 用于 MLA decode,FLUX VAE 使用 TMA im2col 硬件加速 conv2d,BF16/FP8 matmul 内核融合 epilogue,并为 MLA prefill 增加带 blockwise scaling 的 FP8 MMA 支持。

图像生成:新的/v1/responses端点

v26.2 最大的功能亮点是图像生成支持。MAX 的v1/responses端点为图像生成等多样化 AI 任务提供统一接口,基于 OpenResponses 这一开源、供应商无关的 API 规范构建。

启用方式

在服务端,通过环境变量MAX_SERVE_API_TYPES启用responsesAPI 类型。例如同时启用 OpenAI 兼容 API 与 Responses API:

export MAX_SERVE_API_TYPES='["openai","responses"]'

在 max/python/max/serve/config.py 中可以看到OPENRESPONSES = "responses"常量以及MAX_SERVE_API_TYPES作为该配置项的别名(见max/python/max/serve/config.py第 37、118 行附近)。环境变量参考 中对该变量的说明是:接受 API 类型字符串的 JSON 数组,例如'["responses"]',用于启用图像生成等任务的 Responses API。

文生图调用

对于文生图(text-to-image),将input设为描述图像的普通字符串,模型返回的图像以 base64 编码数据位于output[0].content[0].image_data中:

response = client.responses.create( model="black-forest-labs/FLUX.2-dev", input="Your text prompt here", extra_body={ "provider_options": { "image": {"height": 1024, "width": 1024, "steps": 28} } } ) image_data = response.output[0].content[0].image_data

等价的 curl 请求:

curl -X POST http://localhost:8000/v1/responses \ -H "Content-Type: application/json" \ -d '{ "model": "black-forest-labs/FLUX.2-dev", "input": "Your text prompt here", "provider_options": { "image": {"height": 1024, "width": 1024, "steps": 28} } }'

图生图调用

对于图生图(image-to-image),将input设为结构化消息数组,其中包含源图像 URL 与描述变换的文本提示,通过type字段在同一消息内区分图像与文本内容:

response = client.responses.create( model="black-forest-labs/FLUX.2-dev", input=[ { "role": "user", "content": [ { "type": "input_image", "image_url": "https://example.com/input.png" }, { "type": "input_text", "text": "Your transformation prompt" } ] } ], extra_body={ "provider_options": { "image": {"height": 1024, "width": 1024, "steps": 28} } } ) image_data = response.output[0].content[0].image_data

输出格式控制

v26.2 为图像生成请求新增了output_format参数,客户端可以在每次请求中自行选择 JPEG、PNG 或 WEBP 输出格式(默认仍为 JPEG)。

新增模型支持

与图像生成配套,v26.2 新增了对以下 FLUX 图像生成模型的支持:

  • black-forest-labs/FLUX.1-dev
  • FLUX.2-dev

支持的特性包括:融合图编译(fused graph compilation)、批量 VAE 解码、GPU 端后处理,以及针对重复提示的 first-block caching(首个数据块缓存)。

DeepSeek 改进详解

DeepSeek 是 v26.2 的另一个重点投入方向,改进分布在架构支持、量化、专家并行与投机解码多个层面:

方向具体内容
新架构支持 DeepSeekV3.2 架构,含 multi-latent attention 与融合 FP8 分页 KV cache
NVFP4 量化DeepSeek-R1 支持 NVFP4 量化,可配合专家并行使用;改进 NVFP4 量化模型与 EP 通信缓冲区的内存估算
专家并行单节点部署支持超过 32 个本地专家,且不再要求 NVSHMEM
投机解码DeepSeek MTP 投机解码模块新增 FP4 量化支持
修复修复 decode-only 模式、缺失的rope_scaling配置、DeepSeek-V2-Lite gather-index 越界、重新启用 DeepSeek-V2-Lite-Chat 的多 GPU TP

对应的内核层(详见下文 MAX kernels 小节)还包括:BF16 MLA prefill/decode mega-kernel、MLA 图执行路径启用 BF16、潜变量注意力的融合 QKV 投影、将 RoPE 与 RMSNorm 融合进 MLA 自定义算子、DeepSeek BF16 matmul 内核融合 epilogue、专家并行专用融合 dispatch/combine 内核,以及为 DeepSeek 形状启用 Mojo BF16 matmul 与 FP4 内核。

推理服务器增强

批调度策略:MAX_SERVE_BATCH_PRIORITY

v26.2 新增可配置的文本生成批调度策略,通过环境变量MAX_SERVE_BATCH_PRIORITY控制。它定义调度器在构造批次时如何对 prefill(上下文编码)与 decode(token 生成)进行优先级排序:

取值行为
prefill_first优先 prefill,最小化首 token 延迟(TTFT)
decode_first优先 decode,最小化 token 间延迟(ITL)
balanced基于全局队列状态自适应
per_replica每个副本独立决策(默认值)

该变量在 docs/max/environment-variables.mdx 中有完整记录,默认值为per_replica;其底层调度实现位于 max/python/max/serve/scheduler/text_generation_scheduler.py。

KV Cache 卸载与 LMCache 集成

v26.2 引入 KV cache offloading:当 GPU 内存占满时,KV cache 块可以从 GPU 溢出到 CPU 内存乃至磁盘,从而获得更大的有效缓存容量并支持热重启(warm restarts)。同时集成了 LMCache,可通过外部存储(CPU、磁盘、Redis)跨模型实例共享 KV cache,并支持多 GPU 张量并行。

CUDA Graph 捕获

CUDA graph capture 在设置了max_batch_size时对 Llama 模型自动启用,通过回放记录的 GPU kernel 启动来降低每 token 延迟。可通过--no-device-graph-capture --force选择退出。同时新增--debug-verify-replay标志,用于在设备图回放前执行 eager 启动轨迹验证,排查 CUDA graph 正确性问题。

FP8 KV Cache

新增 KV cache 的 FP8 量化支持,降低 KV cache 内存占用。通过运行时标志配置:

--kv-cache-format float8_e4m3fn # 也支持 float32 和 bfloat16

投机解码增强

投机解码(speculative decoding)是本版本的密集改进区:

  • 新增 typical-acceptance 拒绝采样。
  • 新增rejection-sampling-strategy选项(greedyresidual)。默认为residual;对于传递 hidden states 的模型使用greedy
  • EAGLE 中应用了 repetition/frequency/presence penalty 采样。
  • 支持 MTP draft 模型与主模型间的权重共享以降低内存。
  • 新增 EAGLE 与 MTP 投机解码的 chunked prefill 支持。
  • 修复了 draft 模型的 batch context length 计算与 Eagle penalty 输入被无条件应用的问题。

在源码 max/python/max/pipelines/speculative/config.py 中可以看到完整的策略枚举:"greedy"(仅当 draft token 与目标模型匹配时接受)、"residual"(从减去目标分布后的残差分布采样)、"typical-acceptance"(接受落在 typical set 内的 draft token)以及"logit-comparison",并有uses_greedy_rejection()uses_typical_acceptance()等辅助方法判断当前选用的策略。

EAGLE 投机解码现在还会在调度器指标输出中报告 draft token 接受率(acceptance rate)。

其他服务端改进

  • 重叠调度(overlap scheduling)对LlamaForCausalLM_Legacy等特定架构自动启用,并与前缀缓存兼容;通过将 Python 宿主代码与 GPU kernel 执行重叠来降低 CPU 开销。当前仍处于实验阶段,与结构化输出、CPU 模型等功能不兼容,可用--no-enable-overlap-scheduler --force关闭。
  • 扩散模型可为每种架构指定默认的num_inference_steps
  • 新增--first-block-caching标志,为 FLUX 等扩散模型启用 first-block caching(FBCache);新增--residual-threshold用于 TaylorSeer 缓存策略。两者均可通过max servemax generate配置。相关配置字段可在 max/python/max/pipelines/diffusion/config.py(first_block_caching)与 max/python/max/pipelines/diffusion/taylorseer.py 中查看。
  • 聊天补全响应支持logprobs,返回每个 token 的对数概率。
  • 非流式请求在客户端断开时会被取消,防止僵尸请求占用 KV cache 内存。
  • 流式性能改进:缓冲生成的 token 并批量 detokenize,而非逐个处理,降低 CPU 开销并提升 GPU 利用率。
  • 多 GPU AllReduce 性能改进:按设备在并行异步任务中启动 kernel,取代顺序启动。
  • 修复了模型 worker 进程在初始化完成前崩溃导致的服务器挂起、TopK/TopP 采样的每请求 seed 处理、离线文本生成(generate()/generate_async())后 KV cache 块未释放、以及 disaggregated inference decode 调度器中的三个资源泄漏(请求取消时 KV cache 块泄漏、副本负载均衡计数器漂移、取消后过期 prefill 响应导致的KeyError崩溃)。

maxCLI 新增标志

v26.2 为maxCLI 带来一系列新标志,其中多数与上述服务端能力一一对应:

标志说明
--device-graph-capture为服务启用 CUDA graph capture,回放已记录的 GPU kernel 启动以降低每 token 延迟。对 Llama 与 DeepSeek V3 自动启用,可用--no-device-graph-capture --force退出
--debug-verify-replay在设备图回放前运行 eager 启动轨迹验证,用于调试 CUDA graph 正确性
--kv-cache-format运行时设置 KV cache 数据类型,接受float32bfloat16float8_e4m3fn(FP8 量化缓存)
--lmcache-config-file启用基于 LMCache 的外部 KV cache 分层存储,指向 LMCache YAML 配置即可通过 CPU、磁盘或远程存储跨模型实例共享 KV cache 块
--reasoning-parsermax serve启用将模型思考/推理内容提取为 OpenAI API 响应中独立reasoning字段的能力。当前支持 Kimi K2.5(kimi-k2),并设有注册表可扩展更多解析器
--rejection-sampling-strategy选择投机解码的拒绝采样方法。选项:greedyresidual(独立部署默认)、typical-acceptance(EAGLE/MTP 默认)。对传递 hidden states 的模型使用greedy

此外,max benchmark在未指定温度时改用模型默认温度,且不再覆盖top_p(除非用户显式提供值);同时移除了--cache-strategy标志。

环境变量与调试能力

GPU 内存调试:MODULAR_DEBUG_DEVICE_ALLOCATOR

新增MODULAR_DEBUG_DEVICE_ALLOCATOR环境变量用于调试 GPU 内存问题,接受逗号分隔的多个选项:

  • uninitialized-poison:用哨兵值填充缓冲区(浮点为 qNaN,其他类型为0xCD),用于检测未初始化数据的使用。
  • out-of-bounds:启用 redzone 检查,检测缓冲区溢出。

在 环境变量参考 中还记录了相关的MODULAR_DEVICE_CONTEXT_MEMORY_MANAGER_POISON_PATTERNpoison-all模式写入的字节模式,默认内置 NaN 模式)以及MODULAR_DEBUG中的uninitialized-read-check选项(会自动启用uninitialized-poison)。

PTX 编译器与驱动兼容:MODULAR_NVPTX_COMPILER_PATH

v26.2 将内置的libnvptxcompiler从 CUDA 12.9 升级到 CUDA 13.1,这要求 NVIDIA GPU 驱动为 580 或更高版本。升级带来 NVIDIA PTX 编译器的最新 bug 修复与性能改进,并完整支持 DGX Spark、Jetson Thor 等新硬件。

对于使用较旧 NVIDIA 驱动与硬件的用户,可通过MODULAR_NVPTX_COMPILER_PATH环境变量指向系统ptxas二进制,绕过内置libnvptxcompiler版本。该变量在 环境变量参考 中被描述为"自定义 NVIDIAptxas二进制的路径,在已安装驱动对内置编译器过旧时作为逃生通道",同时在仓库 C++ 侧(如 Support/lib/BinaryID.cpp)也有对应处理。

Mojo 的DeviceContext()构造函数现在会在创建时检查 NVIDIA 驱动兼容性,并在驱动版本过旧时给出清晰的错误信息,与 PythonAccelerator()API 的行为保持一致。

运行时错误溯源

运行时 GPU 错误现在包含 Python 源码回溯,显示失败操作在构图代码中的定义位置。构建时设置MODULAR_MAX_DEBUG=True以启用源码注释收集;当源码注释不可用时,错误信息会附带如何启用它们的提示。

其他修复

  • 修复了 CUDA graph 执行中的内存泄漏:此前回放之间未释放输出缓冲区,导致持续推理时 GPU 内存随时间增长。
  • 修复了无 GPU 机器上交叉编译 GPTQ 与 LoRA 模型时的编译缓存未命中问题:虚拟设备模式下权重 dtype 转换现在跳过实际数据转换,因为只需要编译元数据。
  • 为 AMD HIP 多 GPU 配置启用 peer-to-peer 设备内存访问,支持 AMD 硬件上的直接 GPU 间内存传输。
  • 修复了在安装了rdma-core但缺少 dev 包(生产容器中常见)的系统上多 GPU 通信静默回退到较慢传输层的问题。
  • 修复了因 peer-to-peer 设备访问初始化回归导致的多 GPU broadcast 失败("Broadcast currently requires P2P access between GPUs")。
  • 改进 Hugging Face 模型下载:gated repo 错误现在清晰呈现,不再显示误导性的"check the repo name"消息。

Python API 更新

新增与改进

  • Tensor.constant()已弃用,改用Tensor(data, dtype=..., device=...)构造函数,与 PyTorch 的torch.tensor()语义一致。例如将Tensor.constant([1.0, 2.0])替换为Tensor([1.0, 2.0])Tensor.constant()将在未来版本移除。
  • DeviceEvent新增enable_timing=True参数启用 GPU 事件计时,用start.elapsed_time(end)测量两个计时事件间的 GPU 耗时(毫秒)。
  • 新增prod算子(沿轴求元素乘积),以max.graph.ops.prodmax.experimental.functional.prodTensor.prod()三种形式提供。
  • Device.stats新增graph_mem_reservedgraph_mem_used字段,提供设备图内存可观测性。
  • Module.compile()在加载前校验权重名称、dtype 与形状,将不匹配以 Python 错误形式呈现,取代异步 host-to-device 传输期间的运行时崩溃。
  • InferenceSession自动将 CPU 纳入设备列表,无需在图中包含 host 侧值时手动添加。
  • 新增max.graph.ops.broadcast用于跨设备分布式广播,signal_buffers为空时抛出ValueError
  • 新增手动同步 API(DevicePinnedBufferDeviceEvent)控制缓冲区就绪并降低流同步开销。
  • Tensor.cast()对同 dtype 转换现在幂等。
  • 新增F.cond(实验性函数式 API)用于条件执行。
  • Tensor.to(device)在 eager 模式新增快速路径。
  • Module.compile()新增基于Dim的标量维度 API;Module通过to()支持设备感知的统一设备放置;Module.load_state_dict()校验权重属性名。
  • 代数维度与图/自定义算子构造现在无需显式上下文管理器即可工作(使用全局 MLIR context);threadpool 支撑的 MAX 路径自动将 worker 线程的 MLIR 使用限定到默认 context。
  • max.diagnostics.gpu.BackgroundRecorder的采样间隔现在可配置。

量化 API 更名

Float8Config更名为QuantConfig(及相关类型/函数),以反映该配置现在覆盖 FP8、NVFP4 与 MXFP4 多种量化格式。相关公开 Python 量化 API 也从Float8*更名为Quant*,包括parse_float8_config()parse_quant_config(),以及max.nnmax.pipelines.lib中的公开quant模块。

新增模型支持

  • Kimi 视觉语言模型moonshotai/Kimi-K2.5Kimi-VL-A3B-Instruct,支持多 GPU 张量并行、自定义视觉处理器、可学习的 2D 位置嵌入与 tiktoken tokenizer。
  • OLMo 3Olmo3ForCausalLM,例如allenai/Olmo-3-7B-Instruct
  • Qwen3-MoEQwen3MoeForCausalLM,例如Qwen/Qwen3-30B-A3B-Instruct,支持多 GPU 张量并行与 FP8 量化。

其他模型相关变更

  • 移除遗留的 Gemma 3 多模态实现及MODULAR_MAX_DISABLE_GEMMA3_VISION环境变量。
  • 修复 GPT-OSS MoE 模型的多 GPU 张量并行。
  • Qwen 2.5 等常见 MAX 模型现在可在 AMD RDNA 消费级 GPU 上运行。
  • 改进 Mistral3 文本编码器性能:编译 hidden-state 选择并消除冗余 GPU 传输。
  • 修复 Qwen2.5-VL 模型的 prompt 校验器、音频生成器 pipeline(恢复音频生成支持)、Llama3 的多 GPU NVFP4 推理、Idefics3 聊天模板图像占位符顺序。
  • 为 GPT-OSS 模型(如openai/gpt-oss-20b)新增 MXFP4 量化支持。

破坏性变更:升级前必读

v26.2 包含多项破坏性变更,升级现有代码时需要注意:

max.nn命名空间重组

图式神经网络 API 恢复为默认的max.nn命名空间(此前位于max.nn.legacy);eager 模块 API 从max.nn移入max.nn.module_v3。同时,max.tensormax.functionalmax.random移回max.experimental之下(即max.experimental.tensormax.experimental.functionalmax.experimental.random)。请相应更新导入。

实验性 API 集中到max.experimental

两个额外包移入max.experimental命名空间:

  • max.torchmax.experimental.torch:将from max.torch import CustomOpLibrary, graph_op改为from max.experimental.torch import CustomOpLibrary, graph_op
  • max.nn.module_v3max.experimental.nn(去掉v3后缀):将from max.nn.module_v3 import Module, Linear改为from max.experimental.nn import Module, Linear

配置参数迁移

  • 移除PipelineConfig.max_lengthmax_length参数迁移到模型配置层MAXModelConfig.max_length(通过config.model.max_length访问)。这一改动将该参数正确放置到模型层,因为它描述的是模型容量(模型能处理的最大序列长度),而非 pipeline 运行时行为。所有配置与代码应改用model.max_length
  • PipelineModel不再接受encoding参数encoding已从PipelineModel.__init__及其所有子类移除,现在从pipeline_config.model.quantization_encoding自动推断,消除冗余传参并确保量化编码配置单一来源。
  • 设备图 API 需要显式图键:调用从model.capture(*inputs)model.replay(*inputs)model.debug_verify_replay(*inputs)改为model.capture(graph_key, *inputs)model.replay(graph_key, *inputs)model.debug_verify_replay(graph_key, *inputs)
  • 移除KVCacheParamsq_max_seq_len:改由 graph capture 时接受。
  • MAXBaseModel使用extra=forbidstrict=True:包含未知字段的配置将被拒绝。
  • disable_auto_sync/mark_as_ready被替换:钉扎内存管理改用DevicePinnedBufferDeviceEvent

MAX kernels:内核级优化

Blackwell(SM100)GPU 性能

  • 优化 SM100 上的 Attention:当行最大值变化较小时跳过不必要的 softmax 修正。
  • 将 epilogue 融合进 SM100 BF16 与 FP8 matmul 内核。
  • 改进小 M 形状(M ≤ 128)的 SM100 FP8 matmul 调度。
  • 修复 SM100 上的 matmul kernel 调度。
  • 新增 SM100 硬件加速 conv2d(TMA im2col + 融合残差 epilogue),用于 FLUX VAE。
  • 新增 SM100 批量 BF16 matmul 支持。
  • 为 SM100 MLA decode 新增 SnapMLA 实现。
  • 为 SM100/B200 新增 FP8 tensorwise 与 block-scale MLA decode。
  • 为 MLA prefill 新增带 blockwise scaling 与 K RoPE 的 FP8 MMA 支持。
  • 为 SM100 GPU 启用 MLA attention;为 B200 MLA decode(长上下文)启用 64x256 N split MMA。
  • 在 attention 内核中使用 TMA 加载 KV scale(SM100)。

AMD GPU 内核改进

  • 调优并优化 AMD GPU 的 GEMV split-K BF16 调度与内核。
  • 在 AMD GPU 上启用 FP8 GEMV 内核。
  • 通过 swizzle 减少 AMD MHA prefill 的 K buffer bank 冲突。
  • 集成 AMD pingpong 内核与 FP8 调度并修复 TP > 1。
  • 修复 AMD RDNA GPU 上的越界掩码与 depths > 256。
  • 启用带 TCP bootstrap 的 rocSHMEM GDA 后端,支持多节点 AMD 专家并行。

分组 matmul(SM100)

  • 为 1D1D block-scaled grouped matmul 新增 MMA_N=64 支持。
  • 为结构化 1D1D grouped matmul 内核新增 2SM 支持。
  • 在 SM100 上为 block-scaled grouped matmul 与 block-scaled matmul 启用 swapAB。
  • 为 block-scaled 1D1D grouped matmul 新增 tensor scale factor。
  • 为 blockwise FP8 grouped matmul 新增 bf16 scales 支持。

DeepSeek 内核优化

  • 新增 BF16 MLA prefill/decode mega-kernel。
  • 为 Multi-Latent Attention 启用 BF16 图执行路径。
  • 为带 RoPE 的 latent attention 启用融合 QKV 投影。
  • 将 RoPE 与 RMSNorm 融合进 MLA 自定义算子。
  • 在 DeepSeek BF16 matmul 内核中融合 epilogue 操作。
  • 为专家并行新增融合 dispatch 与 combine 内核。
  • 为 DeepSeek 形状启用 Mojo BF16 matmul 内核与 FP4 内核。
  • 修复非行主序布局的 blockwise FP8 batched matmul。

多 GPU 分布式算子

  • 新增融合 allreduce + RMSNorm + FP8 内核,带残差路径与两阶段 allreduce,面向张量并行负载。
  • 为多 GPU DP>1 推理新增分布式 scatter 图算子。
  • 修复并优化 GPU 上 BF16/FP16 的 multimem broadcast 内核。
  • 修复并优化多 GPU 的两阶段 broadcast 内核。

FLUX 内核改进

  • 自动调优 cuDNN 卷积算法选择并缓存结果。
  • 新增 multi-block GroupNorm GPU 内核。
  • 为 FLUX.2 启用高性能 Mojo matmul 内核。
  • 修复分组 conv2d 在 GPU 上错误忽略num_groups参数的问题。

其他内核改进

  • kbench默认通过共享库(.so)运行基准测试,复用持久 worker 与 CUDA context 而非生成子进程,基准执行阶段约快 10 倍(例如某调优负载从 4.25 小时降至 0.4 小时);在 profiling 或使用自定义 exec 包装器时回退到子进程模式。
  • 新增 MXFP4 dequant 与 matmul 内核。
  • 优化 Llama 风格形状的 FP4 matmul 调度,并为更多形状覆盖新增 FP4 GEMM 调度配置。
  • 使用异步 FP4 量化内核提升吞吐。
  • 通过 swapAB 优化 Hopper matmul 的 M=256 与小 M 形状。
  • 改进 GEMV 内核性能,集成 Flash Infer TopK 内核提升采样性能。
  • 改进 layer normalization 内核性能。
  • 为 FlashMLA decode 内核新增 FP8 支持。
  • 修复 matmul 中的 FP8 cast lambda epilogue、MLA decode split-K 内核在 causal masking 下的 NaN、可导致 DeepSeek 模型挂起的 MLA decode warpgroup 死锁、bitonic sort 合并方向 bug 导致的错误 MoE 专家路由、ARM64 上的 int8 matmul 调度,以及 Apple Silicon 上 Metal 子缓冲区与张量切片的缓冲区跟踪问题。

关联文档

本文引用的仓库内文档与源码入口:

  • 版本发布说明:docs/releases/v26.2.md
  • 图像生成指南:docs/max/serve/image-generation.mdx
  • 环境变量参考:docs/max/environment-variables.mdx
  • 服务端配置实现:max/python/max/serve/config.py
  • 批调度实现:max/python/max/serve/scheduler/text_generation_scheduler.py
  • 投机解码策略:max/python/max/pipelines/speculative/config.py
  • 扩散模型缓存配置:max/python/max/pipelines/diffusion/config.py、max/python/max/pipelines/diffusion/taylorseer.py
  • PTX 编译器路径处理:Support/lib/BinaryID.cpp

Mojo 语言、标准库与工具(包括全部 GPU 编程及Layout/LayoutTensor变更)的更新请查阅仓库内 Mojo 文档 下的对应版本说明。

【免费下载链接】mojoThe Modular Platform (includes MAX & Mojo)项目地址: https://gitcode.com/GitHub_Trending/mo/mojo

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/12 5:49:13

Python数据探索实战:从EDA到特征工程

1. 项目概述:Python数据探索实战指南在Kaggle竞赛和实际数据分析工作中,数据探索(EDA)是决定项目成败的关键第一步。这份笔记记录了我使用Python对房价预测数据集进行全方位数据探索的完整过程,特别适合刚接触数据科学…

作者头像 李华
网站建设 2026/9/12 5:45:26

YOLO11n目标检测实战笔记:从训练到边缘部署的完整指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/12 5:41:27

NocoDB 教程:5 分钟把 CSV 变成多人协作的在线数据库

NocoDB 教程:5 分钟把 CSV 变成多人协作的在线数据库 【免费下载链接】nocodb 🔥 🔥 🔥 A Free & Self-hostable Airtable Alternative 项目地址: https://gitcode.com/GitHub_Trending/no/nocodb 把一份客户名单 CSV …

作者头像 李华
网站建设 2026/9/12 5:41:03

亲子互动数字化:闪存技术记录孩子成长记忆

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/12 5:37:52

达普韦伯框架实现医疗器械数据区块链溯源实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/12 5:37:31

GRBL 0.9固件编译烧录与步进参数调试指南

简介:面向Arduino开发者的GRBL 0.9固件与构建工具整合包,专为正在制作3D打印机、激光切割机或CNC雕刻机的创客及嵌入式爱好者设计。压缩包集成ArduinoBuilder 0.8.9,可自动完成GRBL固件编译与上传,免去手动配置命令行参数的麻烦&a…

作者头像 李华