子智能体
也称为 subagent、child agent、委派智能体
先用大白话
子智能体由主 agent 启动,负责同一任务中的较小部分,并可能与其他工作同时运行。
技术定义
子智能体是一次受委派的 agent 执行,拥有独立会话状态和模型请求,并通过任务关系与依赖关系连接到父会话。
工程细节
主 agent 可以启动一个或多个 subagent,稍后再使用它们的结果。Subagent 的请求可能与父会话或其他分支重叠,从而形成会话图中的分支。每个分支可以增长独立上下文,同时复用部分初始指令或代码仓库状态。
为什么重要
Subagent 会让智能体流量不再完全串行。一个用户任务可能在短时间内产生多条长上下文请求,调度策略会影响各分支的完成速度。系统总吞吐量上升时,单个分支仍可能等待更久。
如何在 InferenceX 中解读
AgentX 会保留轨迹衍生工作负载中的 subagent 分支及其依赖关系。委派质量不在测试范围内。基准测试测量推理系统如何处理由此产生的并行请求、共享前缀和完成时序。
参考资料
在真实基准中理解这一概念
Agentic 工作负载简述
多轮会话、长上下文与近乎完全的 prefix 复用,让 agentic 推理成为一个系统问题,也改变了基准测试需要测量的内容
在 NVIDIA GPU 上实现超高交互性?TileRT 登陆 InferenceX
运行在 NVIDIA GPU 上的 TileRT 软件能否与 Cerebras、Groq LPU、SambaNova 竞争?批大小为 1、分离式引擎、高吞吐量预填充引擎、高交互性解码引擎
Vera Rubin NVL72 对比 GB200 NVL72?推理 TCO 与架构分析
Rubin 基于 LUT 的 Tensor Core、Feynman、机架级架构、每兆瓦性能、每美元性能、软件改进、Rubin 公开软件栈、PyTorch、vLLM、OpenAI Triton
AgentX - InferenceXv3:CUDA 护城河在 agentic 推理中还站得住吗?
开源价值 300 万美元的数据集、100 万以上上下文长度、多轮、子智能体、95%+ KVCache 命中率、GB300 NVL72、MI355X、B200
DeepSeek V4 Pro 的 AgentX 结果:GB200 与 GB300 的机架级分离式部署
两者都依赖 PD 分离,GB300 额外使用 DEP32 宽专家并行解码,而差距体现在首 token 延迟而非 token 速率上