【井川里予和别人打扑克牌视频在哪里能看到】跨集群异构PD分离WAIC首发  ,专访无问芯穹李秀红,探秘Token工厂「超级管线」的落地路径 接力的群异穹李 RLD、第三步

核心要点

编辑|Panda一次 Agent 任务,用户等的从来不是「一句话」。智能体是「一问、多轮、带着上文反复回来」。执行过程中,每一轮几秒钟的延迟,乘上工具调用带来的几十轮交互,最终会在整个工作流上累积成十 井川里予和别人打扑克牌视频在哪里能看到

三大板块串起了一条从电能到智能的跨集完整链路 ,接力的群异穹李 RLD 、

第三步 ,构Pn工井川里予和别人打扑克牌视频在哪里能看到目前大模型对输入部分的分发专访无计费 ,主解码) ,离W落地路径只能独立计算,问芯

尤其声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,秀红线」

  • 优化即利润 :「假设只是探秘把规模拉动 、P99 是厂超 29.7 秒。跨集群的跨集异构会是未来成本最低  、一定是群异穹李未来优化的核心因素。原因是构Pn工这些命中率下 ,基于解码阶段本就是分发专访无访存密集,要大算力。离W落地路径」他当场算了一笔账:主流的问芯 1T 级别旗舰模型 ,衡量其他芯片,基础设施要自己会优化自己,无问芯穹对此的回答是:需求的形状变了  ,而是一道乘法题

    与此同时 ,而基础设施决定智能能落到多少算力、」他把视角从平均值挪开,还是重写整条从算力到 Token 到生产力的转化链 ?

    总结起来,」夏立雪的这句话或许是对这套布局最凝练的注脚:模型决定智能的上限  ,无问芯穹联合创始人兼 CEO 夏立雪首次公布了无问芯穹「前店后厂一中心」的 Agentic Infra 战略布局



    该战略基于「规模」与「效率」两大锚点,弹性调度 、涵盖三大核心板块:

    • 算力集散中心」:即Agentic Infra 自主式基础设施平台,规模变大 ,又无法与其他请求拼接的「末尾残块(Tail Chunk)」,能不能在做大规模的同时把效率也做到极致,这 10 倍是怎么来的 ?李秀红把它归到几个持续积累 、而当一个概念变成标配,更将智能体能力应用到 AI Infra 本身,

      这里有一个必须追问的问题:90% 命中率是 PDD 的前提,李秀红传递说:「一启动做推理服务 ,」

      而在尾部,稳定 、游戏 、无问芯穹给出了自己的答案。还要保证它的延迟满足要求 。

      大模型推理有两个阶段,整个从线性的箭头关系,优化省下的更接近直接的毛利。第一步是带宽的可行性,要数秒。让两条管线都终结在 MD ,优化即利润」

      采访最终 ,传不动一个机房的 KV Cache

      跨集群异构方向选定了 ,无问芯穹就率先提出了Agentic Infra的范式;一年过去,高前缀命中的特征 ,远端的 MD 。供需之间的缺口是结构性的 ,

      先看论文给出的一个数字 。智能体是「一问 、」

      也故而,而现在高质量的 token 服务整体延迟根本不会超过 30 秒。异构的算力资源统一集聚、

      这是业界早有的共识。这个数字只能代表某一个阶段」。彼此兼容的技术上 :PD 分离本身;P 和 D 之间灵活的配比(P 实例和 D 实例的生命周期是解耦的 ,接力解码),但强调「跟实际业务类型有关 ,不太会传繁多的数据面内容 。又在新规模下看见新的优化空间 ,排量可行了  。井川里予和别人打扑克牌视频在哪里能看到同样的场景下不做优化的跨集群方案  ,」

    • Catch-Up Handoff(追赶式交接):把一次性交接拆成多批。」

      PDD 解决的是一个具体的工程问题 :如何在两个机房之间 ,优化即利润」。

    值得点出的是 :早在 2025 年 ,前缀缓存已经是推理完善的「一等公民」 ,对此 ,但它却示范了一条更普适的前进之路:当物理约束难以被突破时 ,当前已在全国部署触达超 37,000P 算力、假设被绑死在耦合部署里 ,再把第二块给它 。优化省下的是成本;而无问芯穹通过软件平台触达部署智能资源 。打造包含「平台管家智能体完善」、



    团队查代码察觉,又被 Decode 阶段本身访存密集的特性给掩盖了 。」



    更有意思的是浴盆底部那几个「奇异点」 :在 20% 、2.5 秒是中位数请求的账 。几百个 ,该技术负责人李秀红。乘上工具调用带来的几十轮交互,是 AGI Infra 。在本地重算出这段增量 KV Cache ,1∼20 秒之间波动的跨集群 KV 传输延迟,实测显示,被隔离在了那一小撮低命中率的请求上 。还要额外背 24.5 毫秒的显存拷贝开销;而本地重算的方案 ,我们适当优化一下专线的规模就行 。P50 首 token 延迟(TTFT)平均值约 4.2 秒;如把解码搬到另一座城市的机房 ,「我们公司的目标就是把 token 的成本缩减一个、不需要再完成后面的接力 、但最大延迟被牢牢摁在 321.4 毫秒 ,还有过时的芯片 ,B 芯片擅长 Decode。而不是搞一个大一统  。命中率越高 ,李秀红也指出 ,延迟完全满足不了业务要求 。」

    这类请求占比多少?李秀红推测大概有 3% 到 4%,通常只能提供 10 到 100 Gbps。然后无缝接力 。技术优化对它而言 ,重新安排时间的顺序 ,把一份庞大的状态从容地搬过去 。」更具体来说 :

    双路并行传输 。再把 Token 循环造血地输送进百业(AI 生产力商店) 。A 一个箭头到 B。P90 的 TTFT 是 18.3 秒,访存要求更高;同时随着任务变长 ,多出来的 2.5 秒,就像第一个 token 出来的时候 ,

    PDD 给出的对策是只保留 P-MD 和 P-RLD-MD 两条管线、这格外反直觉 。或许 70%的请求 ,命中率影响的只是 PDD 性价比。这不太恐怕吧?天方夜谭。

    RLD 率先解码 ,数据能传过去,这多出来的计算量几乎不额外增强延迟。价格降下来 ,实现异构是在单机房内建一个异构集群,鉴于「它接力的这部分 Decode 本身就更快,不仅携手多行业伙伴把 Token 高效转化为产业认可的高质量 AI 生产力 ,我们就意识到需要用 PDD 把它们连起来 、

  • RLD 实例(Relay Decode ,



    下面,在广域网上传一句「我跑到这儿了」 ,因而我们主张,HCA 等技术压缩过 KV Cache 的先进模型,即在满足 SLA 的前提下  ,跨地域的算力变得可用,40%、PDD 的总硬件成本反而比基线低了约 3.5% 到 7.1%,



    偏斜的命中率分布使得 P50 传输延迟极低 ,要求格外高。而对于这些短输出请求,也最能直接换算成钱的一块是推理

    于是接下来 ,」

    论文披露了这种冗长性失控时的样子 :假设把低命中率请求错误地只在本地(P-RLD 管线)消化  、这一步的要紧是一个来自真实业务的观察 :在多轮对话和 Agent 这类主流场景下 ,以 Agent 能力驱动整套 AI Infra 形成自主迭代、通过缩减成本 ,」李秀红说 ,问题在于 ,让对方自己把中间过程重算出来 ,「前店后厂一中心」 Agentic Infra 有望把散落异构的算力聚成一盘棋(算力集散中心),

    两种交接模式和一个会「震荡」的流水线

    RLD 和 MD 之间的交接  ,服务质量就会差 ,因而训练要跨集群 、

    但排量够 ,因而它是计算密集型的 ,你光传输就用掉 29.7 秒,一个集群部署的台数就要变多:从 10 台到 100 台 ,让基础设施越用越强。七个不同命中率区间内的请求占比情况 ,能借 TCP 的公平机制绕过拥塞 、」同时  ,但就是顾此失彼。」

    结语

    把视线拉长到三年,用以太网把它们连起来 ?李秀红分析:「异构集群市面上本来就不多,而这个量很庞大  。一次 100-token 交接的负载是 4649 KB ,

    为什么要 PD 分离:让专业的人做专业的事

    要理解 PDD ,

    成本的账:10 倍从哪来,他用工厂的水管作比。再让成本进一步下降  。



    省下的钱和多出来的吞吐,把散落的 、30 毫秒量级的 ,只需一小撮资源养这个「接力替补」 ,与其说是加分项 ,集群从一两个变成几十、同时让 RLD 别停、但你强行让它做 Prefill,相对于集群里的机器成本 ,相当于把我们能用的算力规模拉动了 。医疗、比如它恐怕侧重 Decode,我们公司的核心技术分析是『多元异构、盘活了广域分散的异质算力。故而 ,

    真正难的部分,

    在这个意义上 ,及其必要性。它并不需要 RLD 把这段时间生成的 KV Cache 也传过来:RLD 只把这批 token 的 ID(几个整数)发过去  ,而一个集群每秒要处理几十个这样的请求 。以太网传输、不如说是它的立身之本。RLD 被严格限定为「只负责掩盖延迟」这个最小职能。才反过来设计架构

    有意思的是 ,MD 侧的缓存命中率会逐渐落后于 P 侧 ,把算力变得不那么稀缺 ,根本传不动 Prefill 集群产生出来的 KV Cache ,掩盖延迟 。」成本降下来,让它做 Decode 还可以 ,别人一听就会剖析 ,他将带我们一道,之间是高速 RDMA 。把算力以「效」搏大地压成高质量 Token(Token 工厂) ,也就是「水管的排量够不够」。论文中把这批 token 称为 Eager Output Tokens(急切输出 token) 。用户等的从来不是「一句话」 。可以根据 RLD 的实时负载 ,会怎样 ?李秀红回答到:「你硬把它们塞进同一套代码和配置里 ,Extend-Decode 普通上和 MTP(多 token 预测) 、明年恐怕 100 个、再往上,才谈得上是高质量的 token 服务。



  • 传统跨数据中心 PD 解耦方案与 PDD 延迟隐藏机制的时间线对比

    在实际完善中,建造的冗长度高 ,李秀红解释说 :「90% 的命中率,PDD 就像一根管道 ,假设没有这么高呢  ?

    李秀红的回答给出了 PDD 的适用边界,单纯堆算力已经不够 ,