港股“大模型双雄“齐涨:亚马逊云接入GLM-5.3,腾讯加码海外算力
发布时间:2026/10/11 13:41:05 锦皓数字建站

港股大模型双雄齐涨亚马逊云接入GLM-5.3腾讯加码海外算力【免费下载链接】GLM-5.3-FlashGLM-5.3-Flash (320B-A18B)是GLM-5系列的首个原生多模态模型。320B总参数能力超过GLM-5.2项目地址: https://ai.gitcode.com/zai-org/GLM-5.3-Flash2026年10月6日一条看似常规的模型上架消息同时点燃了港股 AI 板块的两条主线。据《科创板日报》独家报道亚马逊云科技旗下大模型服务平台 Amazon Bedrock 当日官宣接入智谱 GLM-5.3且 AWS 将基于模型调用量与智谱进行收入分成——这不是一次简单的上架而是国产大模型首次以分成制进入全球最大云生态的付费通道。消息落地后证券日报、东方财富等多家财经媒体同步报道智谱股价涨近5%GLM-5.3海外走红叠加腾讯加码海外算力的资本开支信号港股大模型双雄应声齐涨云计算 ETF汇添富 159273在节后科技板块深度调整中逆势吸金。本文不打算停留在又一个大模型出海了的叙事层面而是拆开三层这条新闻如何传导到港股与云计算板块行情、分成制背后是什么商业逻辑、以及模型仓库里的真实配置凭什么支撑这种国际化变现。一条新闻如何撬动两条主线GLM-5.3 上架 Amazon Bedrock先还原新闻本身的事实链。据财联社《科创板日报》记者独家信息Amazon Bedrock 接入智谱 GLM-5.3 的关键不在上架而在分成条款——AWS 基于模型调用量与智谱进行收入分成。报道同时披露了两个此前未被广泛注意的细节海外侧除 AWS 外智谱近期已与多家海外云厂商落地收入分成模式这是智谱此前公开透露的通过海外云平台收入分成增加一条具有规模潜力的商业路径的正式兑现国内侧智谱已与阿里云百炼平台等头部云厂商签署类似分成协议华为云已上架 GLM-5.3 并就类似合作达成意向形成贯通国内外的分成体系。这意味着智谱的商业模型正在发生结构性变化从卖模型授权/卖 API 额度转向云厂商负责基础设施与获客、智谱按调用量持续分成的订阅化收益结构。对云厂商而言Bedrock 上一份越卖越贵的大模型接入协议等于把一个拥有全球开发者基础的开源生态MIT 协议嫁接到自己的计费体系里对智谱而言这是把模型权重转化为长期经常性收入Recurring Revenue的通道。支撑这一转型的财务底色来自智谱 2026 年半年报上半年营业总收入 9.54 亿元同比增长 399.7%归母亏损 20.71 亿元同比收窄 12.1%。收入高速增长叠加亏损收窄加上 9 月宣布完成约 50 亿美元约合 335.72 亿元人民币融资——约 20 亿美元股份配售加约 30 亿美元可转债——融资明确投向下一代 GLM 基础模型及完全自训练Fully Self Training体系的研发以及大规模训练、生产推理、算力资源及相关技术基础设施的部署及升级。这条资金链与 Bedrock 分成通道形成闭环算力扩张 → 模型迭代 → 云渠道放量 → 分成回血。行情传导为什么上架能带动港股与云计算板块从消息到行情市场对这一事件的定价逻辑分三层递进。第一层是直接的个股映射。智谱作为大模型资产其海外走红直接反映在股价上——证券日报、东方财富等多家媒体在事件当日即报道智谱股价涨近5%乃至涨超5%标题口径高度一致地指向同一事实GLM-5.3 的海外渠道价值被资本市场重新定价。此前匿名模型 Ox Alpha 亮相 OpenCode、线索指向智谱的悬案在智谱承认 Ox Alpha 是自家 GLM-5.3-Flash 之后获得确认海外开发者用脚投票的调用量成为股价的先行指标。第二层是板块联动。消息面同时出现的还有腾讯加码海外算力与OpenAI 正式推出 GPT-6两条供给端线索。在科技板块节后深度调整的背景下云计算 ETF汇添富 159273逆势吸金说明资金并没有撤出 AI 叙事而是在模型层竞争白热化、算力层持续紧缺的预期里换手加仓。腾讯加码海外算力与智谱融资投向大规模训练、生产推理、算力资源在时间上共振本质上都是同一轮 AI 资本开支Capex周期的注脚模型越强越需要跨地域的推理与训练算力云厂商与模型厂商的绑定就越深——Bedrock 分成协议恰好是这种绑定的制度化形式。第三层是商业化叙事的重估。过去一年港股 AI 板块的估值锚始终在大模型能否赚到钱上摇摆。分成制的出现把答案从不确定推向有路径调用量分成意味着模型厂商的收入与用户真实使用量挂钩而非一次性授权费这在资本市场眼中是随云规模线性扩张的可验证收入模型。当智谱同时打通 AWS、阿里云百炼、华为云三家国内外头部渠道时双雄齐涨的其实是市场对整个中国大模型商业化的重新定价。源码视角GLM-5.3 凭什么被 Bedrock选中上架 Bedrock 不只是一个商务谈判结果模型本身必须具备在海外云上经济地规模化服务的条件。打开仓库里的 config.json可以完整还原这份工程底气。首先是激活参数与稀疏架构。GLM-5.3-Flash 总参数 320B、激活参数仅 18BREADME 描述为 320B total parameters and just 18B active parameters。config 中n_routed_experts: 288、num_experts_per_tok: 8、n_shared_experts: 1采用topk_method: noaux_tc的无辅助损失路由每 token 仅激活 8 个专家。18B 激活意味着在同等算力预算下可以服务更多并发请求——这是云上分成的单位经济性Unit Economics基础。其次是长上下文与注意力架构的取舍。max_position_embeddings: 1048576即 1M token 上下文layer_types数组在 45 层中交替布置linear_attention与deepseek_sparse_attentionconfig.json 中full_attn_layers: [3, 7, 11, ...]共 11 层全注意力其余为线性注意力层。混合稀疏线性注意力大幅压低长上下文服务的 KV 缓存与算力开销同时保留精准长程能力——这与 Bedrock 上企业级读仓库、跑 Agent场景高度契合。模型还引入了mhc: trueManifold-Constrained Hyper-Connections流形约束超连接hc_mult: 4来进一步提升扩展效率。第三是原生多模态。GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型vision_config中图像 patch 14、输入 448×448video_processor支持时序 patchtemporal_patch_size: 2与视频输入词表层面定义了image_token_id: 154854、video_token_id: 154855及对应的起止 tokenprocessor_config.json 中视频 token 上限达 240,000fps: 2。配合 README 披露的 30T token 多模态预训练语料模型天然覆盖图片、视频、文件、文本四类输入——这正是多模态原生能力在 Bedrock 上开箱即用的前提。第四是部署与量化的友好性。config 中quantization_config采用activation_scheme: dynamic、fmt: e4m3FP8 动态量化62 个分片总权重约 328 GBmodel.safetensors.index.json 中total_size: 328326771576同时兼容昇腾 NPU 平台。README 列出了 SGLang、vLLM、TokenSpeed、Transformers、KTransformers、Unsloth 六条部署路径几乎覆盖了开源推理框架的主流选项意味着云厂商可以在不改动自身 Infra 栈的前提下完成接入。成本端看智谱官方已公布的三档定价结构单位元/百万 Tokens模型上下文输入单价输出单价输入模态GLM-5.31M828文本GLM-5.3-Flash1M0.82.8图片、视频、文件、文本GLM-5.3-FlashX1M27图片、视频、文件、文本Flash 档以旗舰 1/10 的价格提供多模态输入与 1M 上下文这在 Bedrock 面向价格敏感型企业的场景里是极强的替换理由——README 中以十分之一价格接近 Claude Opus 4.8 的编码与 Agent 基准的表述正是渠道侧的卖点。从 Ox Alpha 到 Bedrock开源与商业化的双轮驱动回看 GLM-5.3-Flash 的走红路径会发现一条被低估的运营曲线。模型先以Ox Alpha的匿名身份在 OpenCode 等平台亮相靠实打实的基准表现积累海外开发者信任——在 Z.ai Code Bench 编程基准上较 GLM-5.2 提升 50%在 CyberGym 漏洞发现测试中达到 84.5% 准确率超越 GLM-5.2 与 Mythos 5 等竞品并成为彼时最强开放权重编码模型。智谱随后承认 Ox Alpha 即自家 Flash 模型将匿名口碑转化为品牌资产。在推理侧智谱于 9 月 18 日推出 GLM-5.3-FlashX最高 200 tokens/s官方披露其推理底座已扩容至10 万张国产芯片。这一基础设施规模与 50 亿美元融资中大规模训练、生产推理、算力资源部署升级的用途一一对应。注意 chat_template.jinja 中的细节模板支持reasoning_effortlow/high/max三档与clear_thinking参数说明模型内建了可调节的思考预算控制——这在云 API 场景里意味着调用方可以按任务复杂度弹性调节延迟与成本进一步强化按调用量计费的可用性。把这条链路串起来看开源开放权重仓库 LICENSE 为 MIT承担技术可信度的全球扩散云渠道分成承担商业变现的规模化回收国产算力底座承担成本可控的供给保障。三者构成闭环后Bedrock 上架就不再是一次性事件而是一个可复制的增长模型。结语分成制的真正意义GLM-5.3 上架 Amazon Bedrock表面是产品渠道新闻实质是中国大模型产业第一次以分成制姿态进入全球云生态的核心计费体系。它同时回答了资本市场的三个问题模型厂商的收入是否可以随云规模线性扩张答案是 AWS、阿里云百炼、华为云的三线并进大模型的算力投入是否能转化为商业回报答案藏在 9.54 亿营收与 399.7% 增速里国产开源模型是否只配叫好不叫座答案写在 Ox Alpha 的开发者口碑与 10 万张国产芯片的推理底座中。对关注港股与云计算板块的读者而言这条新闻的价值不在于一天的涨跌幅而在于它标记了一个拐点大模型的竞争正从谁能训出更强的模型转向谁能把模型变成持续分成的现金流。而仓库里那份 320B/18B 的配置文件就是这场转向的工程注脚。【免费下载链接】GLM-5.3-FlashGLM-5.3-Flash (320B-A18B)是GLM-5系列的首个原生多模态模型。320B总参数能力超过GLM-5.2项目地址: https://ai.gitcode.com/zai-org/GLM-5.3-Flash创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
锦
锦皓数字建站
深耕本土企业品牌数字化升级,专注原创端正雅致商务官网,从视觉设计到稳定运维全程保驾护航。