AI 技术日报 | 2026-07-18
🔥 能力突破
MCP 协议 7 月 28 日发布无状态化最终规范
- 来源:Dev.to - AI Weekly
- 日期:2026-07(规范发布日)
- 核心:MCP 协议史上最大更新,6 个 SEP 协同实现协议层无状态化
- 解读:
- 技术原理:无状态化通过标准化 Session Creation/Resumption/Migration 实现,客户端通过
Mcp-MethodHeader 路由请求,不再绑定特定服务器实例 - 架构创新:原问题——Stateful sessions 导致每个客户端必须绑定特定服务器实例,需要 sticky sessions、共享 session store 和深度包检测网关。解决方案——统一 session 管理规范,服务器重启或扩容对客户端透明
- 配套能力:Extensions 框架、Tasks 扩展(长任务异步)、MCP Apps(服务端渲染 UI)、OAuth/OIDC 授权对齐、正式废弃策略
- 规模数据:截至 2026 年 3 月,SDK 月下载量突破 9700 万次,GitHub 星标 81,000+,所有主流厂商(Anthropic/OpenAI/Google/Microsoft/AWS)均支持
- 技术原理:无状态化通过标准化 Session Creation/Resumption/Migration 实现,客户端通过
AGIBOT G2 进入万台规模化部署阶段
- 来源:Shanghai Government EN、Humanoids Daily
- 日期:2026-07
- 核心:2026 定义为具身智能大规模商业部署元年,G2 机器人已在活产线上替代人工测试
- 解读:
- 关键数据:AGIBOT 产能突破 10,000 台,与龙旗科技部署首条人形机器人主导演的生产线,每 20 秒完成一次平板测试精度 99%,计划 2026 Q3 扩展至 100 台
- 技术意义:从”实验室验证”到”生产就绪能力”的临界点验证,在真实工业环境下可靠运行并产生可衡量经济价值
- 产业信号:人形机器人正式进入大规模商业部署阶段,具身智能从概念验证转向可复制商业模式
⚙️ 工程可行
SGLang 架构深度解析:RadixAttention 与 vLLM 选型指南
- 来源:Yotta Labs
- 日期:2026-06-12
- 核心:SGLang 核心技术栈解析,RadixAttention 前缀缓存机制 vs vLLM PagedAttention 适用场景
- 解读:
- RadixAttention 原理:将 KV Cache 存储在 Radix 树中,自动发现共享前缀,新请求只计算新增 token,无需手动配置缓存键
- 性能优势场景:
- 多轮对话:第 20 轮只计算最新消息而非完整历史
- Agent 工作流:相同系统提示和工具定义重复计算数百次,整个前缀只计算一次
- RAG 管道:共享指令模板和重复文档块命中缓存
- 与 vLLM 对比:
场景 推荐引擎 原因 多轮对话/Agent SGLang RadixAttention 复用每轮共享前缀 RAG + 共享模板 SGLang 重复上下文命中缓存 结构化/JSON 输出 SGLang 压缩 FSM 跳过受限 token 唯一 prompt 批处理 性能相近 无前缀可复用 快速上线 vLLM 生态更大、文档更全 - 硬件支持:NVIDIA A100-B300、AMD MI300/MI355、Google TPU(原生 SGLang-Jax 后端)、Intel Xeon、Ascend NPU
- 规模数据:每日万亿 token 处理量,覆盖 400K+ GPU,用户包括 xAI/LinkedIn/Cursor/AMD/NVIDIA
Physical AI 半导体技术栈:从云端到边缘的算力重构
- 来源:Aroka Tech
- 日期:2026-07
- 核心:Physical AI 市场 2030 年达 1875 亿美元,半导体成为核心使能技术
- 解读:
- 算力架构演进:GPU 主导训练 → NPU/TPU 主导航边推理,专用芯片能效比传统 CPU 高 10-50 倍
- 世界模型计算需求:
- 训练阶段:云端超算集群(数千 GPU)处理 PB 级传感器数据
- 推理阶段:边缘设备 NPU 执行压缩版模型实时推理
- 关键芯片能力:HBM3E 带宽超 1.2 TB/s、Chiplet/3D 堆叠先进封装、能效年增 40%
- 传感器融合芯片:VPU 处理视觉任务、传感器融合处理器保证确定性延迟,2026 年相关芯片收入达 284 亿美元
✅ 实践验证
SLM 边缘部署 2026 基准:从概念到生产
- 来源:Tech Stories
- 日期:2026-05-22
- 核心:边缘 SLM 基准测试揭示实验室性能与实际部署的差距
- 解读:
- 关键发现:
- 速度不再由计算能力决定:由效率决定
- 成本从基础设施转向效率:本地推理降低每查询成本
- 量化技术成为基础:8-4 位精度下保持高准确率
- 硬件决定性能上限:硬件与模型需协同设计
- 企业关注点:数据隐私、低延迟、成本控制,推动 SLM 实际落地
- 关键发现:
IETF 126 维也纳会议:Agent 通信协议 BoF 专题
- 来源:RIPE Labs
- 日期:2026-07-23(会议日期)
- 核心:IETF 成立 Agent Communication Protocols (agentproto) BoF,汇集 MCP/A2A/ACP/ANP 等协议讨论
- 解读:
- 背景:过去一年涌现大量竞争性和重叠的 Agent 连接协议,需要标准化对话
- 参与方:预计汇聚学术界、产业界、标准化组织代表
- 技术意义:为 Agent 互联互通建立全球标准化基础
🛠️ 生态成熟
WAIC 2026 倒计时:世界模型与 AI Agent 成焦点
- 来源:CSDN AI科技热点日报
- 日期:2026-07-11
- 核心:2026 世界人工智能大会 7 月 17-20 日在上海举办
- 解读:
- 大会主题:世界模型、开源 Agent、AI 编程、Token 经济与 OPC(单人公司)
- 首发产品:华为 Atlas 950 SuperPoD 实体机、阶跃星辰 Agent OS、近存 3D 计算芯片、全球首款 AI Agent 手机
- 阶跃星辰:7 月 9 日正式宣布推出全球首款搭载自研 Agent OS 的 AI Agent 手机
RAG 技术演进:SAG 与 MetaRAG 新进展
- 来源:arXiv
- 日期:2026-06-14
- 核心:SQL-Retrieval Augmented Generation (SAG) 提出查询时动态超图增强
- 解读:
- 技术突破:解决现有 RAG 方法依赖密集相似性检索在处理结构化约束和多跳推理时的固有局限
- 新方向:通过动态超图在查询时构建检索增强,突破传统向量检索限制
📊 要点总结
今日关键
- MCP 无状态化:7 月 28 日规范发布将大幅降低 MCP 服务器运维成本,推动企业级 Agent 部署
- SGLang 生产验证:RadixAttention 在 Agent/多轮对话/RAG 场景的实际优势明确,选型有据可依
- 具身智能商业化:AGIBOT 万台部署里程碑验证具身智能从 Demo 到 Production 的跨越
需要关注
- IETF agentproto BoF 会议结果:可能为 Agent 协议标准化指明方向
- WAIC 2026 首发产品:特别是阶跃星辰 Agent OS 和 AI Agent 手机的产品化路径
- Physical AI 半导体路线图:边缘推理芯片的能效突破节奏
行动项
- 评估 MCP 无状态规范对现有 Agent 架构的影响,规划升级路径
- 对 SGLang vs vLLM 进行针对性 Benchmark,重点测试前缀复用率
- 关注具身智能开源项目(如 EAIDC 2026 相关成果)的工程化进展