ai china

无问芯穹正把距离纳入加速器调度

9 条来源 7 条一手来源 已翻译 2026年8月16号

正文
WAIC 2026 期间,一位演讲者在上海的无问芯穹基础设施论坛上面对满座会场发言。

2026 年 7 月 20 日,一位演讲者在上海举行的 WAIC 2026 无问芯穹基础设施论坛上发言。公司借这场活动发布扩展后的 Agentic Infra 战略;这张官方照片记录了发布现场,至于下文的性能与规模说法,仍需另行举证。[4]

从无问芯穹 2026 年 7 月上海论坛的会场后排看去,公司的产品位置清晰可见。数百名听众面向写有“AGI Infra”的舞台。玻璃展柜里不见新款加速器,台上也不见正在回答问题的前沿模型。现场推介的正是位于二者之间的那一层:一套软件与服务,用来决定模型在哪里运行、每类工作交给哪种硬件,以及怎样让分散的算力作为统一供给协同运转。[4]

这一位置让 Infinigence AI(中文名 无问芯穹,Wuwen Xinqiong)成为检验中国异构计算路线的一份格外清晰的样本。公司成立于 2023 年 5 月,脱胎于清华大学电子工程系。它公开呈现的技术路线始于跨不同芯片优化模型,随后延伸到混合加速器训练,如今又跨越数据中心,进入托管模型服务层。[1][2][3]

截至 2026 年 8 月 16 日,公司的技术记录比常见的基础设施口号更有实质内容。一篇公开的系统预印本记载了 768 个加速器参与的混合训练;一份新技术报告则列出跨数据中心推理所用的硬件数量、网络链路、工作负载假设与延迟结果。[2][3] 商业层面的材料更难核验。客户规模、每日 token 量和生产环境覆盖范围等说法,主要来自无问芯穹及其投资方。因此,这份档案需要把两点并置:这是一支严肃从事系统工程的团队,现有独立证据尚未覆盖其平台宣传的全部范围。

公司生长在多类算力存量之间

无问芯穹用 M × N 概括其架构:把多种模型映射到多种芯片。当前产品线分成上下两层,下层为“Agentic Infra”平台,上层为“Agentic MaaS”服务,覆盖训练、推理、强化学习和托管模型服务。公司称,该平台可支持 100,000 个加速器规模的作业,其服务每日处理数千亿 token。[1] 两类说法的口径不同:“可支持”指容量,每日 token 量则指实际运营;公开页面均未附审计报告、利用率序列或客户层面的服务数据。

现行 GenStudio 文档记录了一组范围较小、也更容易核验的产品功能。它的 M × N 端点把模型与芯片类型写进兼容 OpenAI 的 API 路径,网页界面则允许用户比较两到四种模型—芯片组合。文档还写明,只有部分预载语言模型支持这种模式。[8] 这套选择与路由入口可以实际使用;证据止于此,单次推理请求是否会同时跨多个芯片品牌执行,文档没有给出证明。

融资历程解释了公司为何希望掌握如此宽的中间层。2024 年 9 月,联想创投披露无问芯穹完成近 5 亿元人民币的 A 轮融资,公司成立头 16 个月累计融资近 10 亿元人民币。[6] 2026 年 5 月,澎湃新闻 报道公司又完成超过 7 亿元人民币的融资,由杭州高新金投、汇源资本领投,参与者涵盖众多金融、产业和国资背景机构。[5] 来自芯片、云、数据中心和地方政府体系的资本,有助于一家调度公司取得产品所需的硬件资源。

融资规模与吞吐指标分属两类证据。无问芯穹未披露收入、算力转售成本、客户集中度或毛利率。这些融资轮次说明众多出资方看重算力聚合命题;在支付硬件租赁、网络传输、适配工程和支持成本后,异构服务能否获得持久溢价,仍缺少公开数据。

一份证券交易所文件确认公司已经承担一项重大的经营投入。电光防爆科技股份有限公司 2024 年第三季度报告称,其子公司浙江电光云与上海无问芯穹签订一份 5.535 亿元人民币、为期五年的算力服务合同,完成设备安装,并于 2024 年 9 月 14 日交付客户使用。[9] 文件将无问芯穹列为买方,因此可确认大额上游算力开支;下游收入与利用率仍无从由这份合同推导。

HETHUB 让同一项训练跨过芯片鸿沟

第一份有力的技术凭据来自 HETHUB。2024 年 5 月的一篇论文介绍了这套分布式训练系统,它由统一通信器、性能预测器和自动并行规划器组成。规划器直接从各加速器组速度与通信行为不一的现实出发,搜索合适的任务切分方案。[2]

规模最大的报告实验用 768 个加速器训练一个 Llama-140B 模型,其中包括 128 张 AMD GPU,以及 640 个在论文中仅标作“GPU-accelerator A”的设备。在另一项 Llama2-70B MFU 分析中,硬件采用 AMD GPU 与匿名的“GPU-accelerator C”,实测 35.0% MFU,达到作者计算的 35.9% 理论上限97.49%。论文共评估六种异构硬件组合。[2] 两个月后的世界人工智能大会上,公司又宣传千卡版本,并列出 AMD 或 Nvidia 硬件与华为昇腾(Huawei Ascend)、天数智芯(Iluvatar CoreX)、沐曦(MetaX)及摩尔线程(Moore Threads)加速器的组合。[6][7]

这项结果的价值来自清楚可见的工程办法。设备差异始终存在;HETHUB 先测量这种不对称,再据此规划。这样的基础,比“兼容层可以抹平所有硬件差别”的说法更可信。

实验范围依然很窄:一个模型家族、一套有文档记录的 768 设备布局,以及依据论文自有上限模型所作的 MFU 比较。论文未报告持续数月的作业完成率、不同厂商设备故障后的检查点恢复、多种模型架构的收敛对比,也未给出维护六套工具链对齐所需的人力成本。大会上的千卡说法超出了论文记录的实验范围。HETHUB 证明混合训练在工程上可行,现有材料尚不足以把混合集群变成标准商品。

PDD 把地理距离变成调度变量

2026 年 7 月,无问芯穹发布 PDD 技术报告,PDD 指跨数据中心的 prefill-decode 解耦。这套设计利用语言模型推理的一项特性:读取长提示的“prefill”阶段计算密集,逐个输出 token 的“decode”阶段则常受内存带宽限制。PDD 把两个阶段分配给不同地点的不同资源。[3]

主数据中心部署一个 Prefill 实例和一个小型 RelayDecode 实例,二者通过高速本地 RDMA 相连;远端数据中心部署 MainDecode 实例。体量大得多的键值缓存经广域以太网传输时,RelayDecode 先开始生成 token;远端实例追上进度后再接管。对于许多前缀缓存命中率高的请求,系统会跳过 relay。遇到棘手的尾部请求时,系统发送轻量的 token ID,并在远端重新计算近期缓存状态,从而省去反复搬运庞大增量缓存的开销。[3]

这份公司技术报告给出的评估细节相当具体。它采用真实智能体工作负载的汇总特征,平均前缀缓存命中率为 90%,其中超过 70% 的请求具有很高的命中率,并以 DeepSeek-V4-pro 为测试模型。PDD 部署在主数据中心使用 43 个各配备 8 张 H100 GPU 的节点,在远端使用 32 个各配备 8 张 H200 GPU 的节点,两个站点之间设有两条 10 Gbps 广域链路,主数据中心内部则使用 400 Gbps RDMA。与不设 relay 的跨数据中心基线相比,P90 首 token 时间从 18.3 秒降至 9.8 秒。以数据中心内 H100 基线作比较,作者算得,每一归一化成本单位所获的 SLA 合规吞吐量提高 32.4% 至 37.5%。[3]

这组数字显示公司的核心设计思路正进一步成熟。HETHUB 依据训练集群内不同加速器的速度安排任务;PDD 在推理阶段把算力、内存、缓存状态和距离一并纳入调度。地理距离由集群外围的固定阻隔,变成调度器可读取的一项资源特征。

PDD 也清楚划出了公开证据的尽头。报告称这次评估仍属初步,测试范围限于 Nvidia H100 和 H200;多 token 预测因缓存兼容性而关闭;更广泛的加速器适配与更大规模的实证研究均留作后续工作。当前仓库发布了报告及其附件,尚无可运行的 PDD 代码。[3] 这些材料支持跨数据中心方法;公司面向多种中国加速器提出的完整 M × N 承诺,仍无对应复现。

4,000 公里说法的证据层级不同

在封面照片所示的同一场 7 月论坛上,无问芯穹发布了范围更宽的“前店、后厂、一中心”战略:面向行业解决方案的“前店”、托管 token “后厂”,以及算力聚合中心。论坛回顾还称,公司与中国电信连接了新疆哈密和广东深圳的集群,两地相距超过 4,000 公里,联合训练性能提高 165%。[4]

这项现场说法值得留意,原因恰在于它与 PDD 实验属于两套证据。前者讨论无问芯穹与中国电信开展的跨区域训练,后者评估一套硬件配置明确的 H100/H200 跨区域推理系统。论坛回顾没有公布 165% 数字背后的训练模型、加速器组合、网络基线、“性能”定义、运行时长或故障记录。[3][4] 把两者合并解读,让其中一项替另一项验证,便会补出两个来源都未给出的证据。

同样的区分也适用于公司的规模表述。官方简介称,公司服务超过一百家头部客户与研究机构,每日处理数千亿 token。[1] 一份 2024 年投资方材料列出的用户包括 Kimi、LiblibAI、猎聘、生数科技与智谱 AI,并称平台算力覆盖中国 15 座城市。[6] 这些材料勾勒出公司计划服务的市场。若有公开客户案例列明工作负载持续时间、合同算力、成本变化、正常运行时间和续约数据,就能确认其中有多少已经成为持续生产业务。

中间层这门生意难在持续维护

中国多样化的加速器供给,为独立调度方留下了合理空间。模型开发者手中的算力分布在多座城市,采购年份不同,编译器与通信库也各不相同。一层软件若能安排训练阶段、对外供给推理、迁移检查点并统一商业入口,便可把零散闲置的配额转成有效算力。无问芯穹的研究在规划器、缓存、互联和尾延迟层面都有具体内容,已经深入云产品包装之下的系统问题。[2][3]

同样的多样性也带来持续维护的负担。每一种新模型架构都会改变内存与通信形态。每次加速器软件更新,都伴随内核、集合通信行为、数值结果与故障模式发生变化的风险。每条跨区域线路还会增加出网成本、数据治理问题与新的延迟波动。调度层吸收变化的速度与可靠性,必须长期超过客户选定单一供应商后自行维护的水平,它的价值才能成立。

三类披露可以让下一版公司档案更扎实。第一,发布带版本号的兼容性矩阵,把具名模型、加速器固件、编译器、集合通信库和经过测试的作业配置逐项对应,并附上可复现结果。第二,生产服务报告应按完整季度披露排队时间、p50 与 p99 延迟、作业完成率、检查点恢复、利用率和每个已接受 token 的成本。第三,业务报告应把软件与托管服务收入同转售算力收入拆开,并披露客户集中度与续约情况。

无问芯穹最有说服力的想法已经显现:硬件多样性和物理距离可以从部署障碍转化为任务放置的输入条件。HETHUB 与 PDD 为这个想法给出两种技术细节明确的形态。接下来,公司需要证明,当精心布置的会议厅退场,面对混杂固件、故障节点、波动流量和客户的月度账单时,调度器、服务运营与商业经济性依然能够彼此自洽。

来源

  1. 无问芯穹,《About Infinigence》(公司官方简介;产品结构、发展时间线、团队与当前自报运营规模;查阅于 2026 年 8 月 16 日)。
  2. Si Xu 等,《HETHUB: A Distributed Training System with Heterogeneous Cluster for Large-Scale Models》(2024 年 5 月;架构、768 个加速器参与的 Llama-140B 实验、硬件披露与性能范围)。
  3. 无问芯穹,pdd 仓库及技术报告《PDD: Unleashing Economical and Flexible Heterogeneous LLM Inference via Cross-Datacenter Prefill-Decode Disaggregation》(2026 年 7 月;架构、工作负载假设、硬件配置、结果与报告列明的局限)。
  4. 无问芯穹,《Agentic Infra Strategy Launch and Ecosystem Kickoff: Infinigence AI Infrastructure Forum at WAIC 2026》(2026 年 7 月 22 日;官方活动回顾、战略与合作说法,以及封面照片来源)。
  5. 澎湃新闻,《国产 AI 融资提速:无问芯穹获超 7 亿元融资,投入原生基础设施》(2026 年 5 月 7 日;报道的融资规模与投资方名单)。
  6. 联想创投,《无问芯穹累计融资额近 10 亿元》(2024 年 9 月 2 日;投资方对 A 轮融资、产品定位、具名用户、城市覆盖及 HETHUB 发布说法的记录)。
  7. 中国新闻网·上海,《无问芯穹发布千卡异构芯片混合训练平台》(2024 年 7 月 4 日;来自世界人工智能大会发布现场的同期独立报道)。
  8. 无问芯穹,《GenStudio M × N 推理服务教程》(现行产品文档;支持范围、比较界面、模型—芯片端点结构与 OpenAI API 兼容性;查阅于 2026 年 8 月 16 日)。
  9. 电光防爆科技股份有限公司,通过巨潮资讯提交的《2024 年第三季度报告》(2024 年 10 月 31 日;无问芯穹算力服务合同的金额、期限、安装、交付与首笔付款披露)。
Previous QualBench 在采信答案之前,先让模型补全题目

Recommended In ai china

Matched by subject and format