- 修复45条错误引用路径(../改为./): 摘要文件与金鹏.md同在知识/目录下,原路径指向仓库根导致链接失效 - 将45个摘要文件的作者、关键要点、核心洞见提炼写入正文,无需跳转即可速览
268 KiB
文章分享 金鹏
2026-08-06
-
Prefill 吃算力、Decode 吃带宽——两个阶段特性相反,混在一起永远无法同时最优;拆开分池、各配最优硬件与策略,才是推理引擎的架构正道。
- 认知层: LLM PD 分离背后的架构问题
- 摘要:查看
- 极客博哥(solrex) / 知乎专栏
- PD 直连 vs KV Cache Store 是首要抉择——直连延迟低但锁定 P/D 节点关系;中间存储多一次传输但容错更好、可兼做 Prefix Caching(Mooncake、vLLM、RTP-LLM 均选后者)
- 首 token 两条计算路径——算到 hidden states 免加载 lm_head(vLLM 采用)vs 算到 token id 传输量小、解码端简单(RTP-LLM 采用)
- KV Cache Store 设计远超传统 KV 存储——VRAM/DRAM/NVMe 介质、TCP/NVLink/RDMA 协议、分 layer/page 写入与链式 prefix 引用,目前无开源完整方案
- 核心洞见:主流资料讲 PD 分离收益,本文聚焦"实现前的六大决策空间"——按层传输、角色互换、存储选型均无理想方案,未来可能是按场景参数化的灵活配置
- 认知层: 大模型系列:深度解析 Prefill-Decode 分离式部署架构
- 摘要:查看
- 猫先生 / 知乎专栏
- 两阶段资源特性根本不同——Prefill 高并行、矩阵乘法为主、计算密集;Decode 逐 token 串行、频繁访问 KV Cache、内存带宽密集,这是 PD 分离的立论基础
- 论文谱系六连——SARATHI(分块预填充)→ DistServe(PD 解耦)→ LoongServe(弹性序列并行)→ Mooncake(KVCache 中心化)→ Speculative Prefill(TTFT 加速)→ LServe(混合稀疏注意力)
- 通信底座 NCCL 与 NIXL——NCCL 适合单机/高带宽集群内 GPU-GPU 通信;NIXL 是面向推理系统的"远程 NCCL"扩展层,专为跨节点 KV Cache 远程传输设计
- vLLM 三组件架构——Proxy 路由,prefill 实例只生成 KV Cache,decode 实例经 drop_select 获取 KV 后跳过 prefill 直接生成 token
- 核心洞见:Prefill 与 Decode 不仅在结构上不同,性能瓶颈也大相径庭——KV Cache 复用使 Decode 的 attention 复杂度降低一个量级,实现"以存换算"
- 认知层: 【推理】PD分离的绝佳入门教程——DistServe
- 摘要:[查看](./知乎专栏/Zoe Lee/2026-08-05_推理_PD分离的绝佳入门教程_DistServe_摘要.md)
- Zoe Lee / 知乎专栏
- 动机有实验证据——混合 batch 中新增一个 prefill 请求会给 decoding 批处理带来显著延迟危害
- M/D/1 排队模型推导——到达率低时 TP 更优、到达率高时 PP 更优;Decode 侧过大的 TP 会引入过量通信使延迟优势消失
- SLO 驱动的寻优算法——对 P/D 分别拟合延迟模型,筛选满足 TTFT/TPOT 双 SLO 且支撑到达率达标、GPU 数最少的方案
- 核心洞见:作者亲自复现后报告了与论文结论的张力——给定 P/D 卡数下并行策略的影响似乎不大,方法论须经实践检验
- 认知层: 大模型学习 | PD分离详解
- 摘要:查看
- 秋月如珪 / 知乎专栏
- Goodput 由双 SLO 的较紧者决定——A100/13B 下 TTFT 约束约 3 RPS、TPOT 约束仅约 1.6 RPS;2P1D 配置可将 Goodput 提升至 3.3 RPS/GPU(约 2 倍)
- KV Cache 传输三级粒度——请求级实现简单但大 prompt 延迟高;层级可重叠计算(Splitwise);块级保持计算饱和但复杂度高(TetriInfer)
- 独立 batching 与差异化并行——Prefill 保持小 batch(1-4)避免 TTFT 线性增加,Decode 用大 batch(64-128);Prefill 用张量并行、Decode 用流水线/数据并行
- 四大工业实践——Dynamo、vLLM V1、llm-d、Mooncake(长上下文吞吐最高提升 525%)
- 核心洞见:PD 分离代表推理架构从统一处理向阶段特化演进——但延迟要求不极端的场景,Chunked-Prefills 是更简单的折中
- 认知层: 大模型推理 PD 分离技术:核心原理、技术优势、挑战与未来展望
- 摘要:查看
- 电子工程专辑
- 悬殊的实测对比——255 token 输入下 prefill 仅 0.24s、decode 达 32.9s,慢约 137 倍、占整体推理时间 99%
- 共置干扰有据可查——混合批处理下 decode 的 P99 延迟可能增加 78% 以上,被迫过度配置资源推高成本
- 五大工程挑战框架——资源动态分配、内存管理(分层存储/RDMA)、延迟平衡(优先级调度/流水线重叠)、分布式通信、框架与异构硬件适配
- 百度智能云实践——低时延 HPN 集群(4μs 端到端)+ RDMA KV 传输 + 分队列调度,整体吞吐提升 20%
- 核心洞见:decode 阶段 GPU 算力利用率仅约 1%——两阶段分离部署、分别优化,才能提升吞吐并降低 TTFT/TPOT
- 认知层: 【大模型】深入解析大模型推理架构之 Prefill-Decode Disaggregation
- 摘要:查看
- 烟锁池塘柳0 / CSDN 博客
- 异构硬件匹配——Prefill 集群用少量顶级算力卡(H100/H200 类)、Decode 集群用大量高带宽性价比卡(A100 类),避免昂贵计算单元"无所事事"
- 五步工作流——请求调度→prefill 执行→KV Cache 迁移(核心步骤,可能高达数 GB)→decode 执行→结束释放
- 三大挑战与对策——KV 传输开销(RDMA/量化/位置亲和调度)、复杂调度(全局状态感知)、资源孤岛(动态角色切换/负载预测)
- 核心洞见:PD 分离体现计算体系结构的经典思想——用专门化的组件处理专门化的任务,是推理系统从"作坊式"走向"工业化"的重要一步
- 认知层: LLM PD 分离背后的架构问题
-
一手实测是打破宣传神话的唯一尺子——真实负载吞吐 +20%~50%、KV 传输 1.5x 优化、ITL 毛刺消除,一切收益都要以实测为准。
- 实践层: LLM关于PD分离的最新实测
- 摘要:查看
- akaihaoshuai / 知乎专栏
- 收益有明确阈值——至少输入>8k、输出>100、并发>10、模型>32B 才有效果;吞吐提升 20%~50%,且优化的是 TBT 而非 TTFT
- P/D 配比反直觉——2P2D 一般不行;因 prefill 只执行一次而 decode 要很多遍,1P2D 更能提升整体资源利用率
- 传输方式决定 TTFT 损耗——GPU 传输(NCCL)基本保持原 TTFT,CPU/disk 传输都会变慢;NCCL 固定全部 GPU、不适合动态扩缩容
- 异构框架最大化性价比——4090 算力约为 A/H 系列 30%~50% 但带宽不足 10%,非常适合 prefill 阶段
- 核心洞见:PD 分离的核心其实在于 cache 的调度——能单卡跑的没必要多卡,能单机承载的没必要多机
- 实践层: 下一代推理优化技术:高性能网络驱动的PD分离与KV Cache Offload测试
- 摘要:查看
- 超擎数智 / 官网博客(NVIDIA、联想、DaoCloud、纳多德联合)
- 跨厂商联合测试模板——1 台 H20(Prefill)+ 3 台 L20(Decode)+ 3 台 NVMe 分布式存储 + 400G/200G RoCE 组网,对照组/实验组对比设计
- 预期收益量化——Decode 延迟降 30%-50%、H20 利用率 60%→85%、显存占用减 60%、上下文 2K→16K、QPS 提升 2 倍且功耗降 20%
- 代价清单——PD 分离与 KV Offload 引入通信开销、调度复杂度、实现复杂、内存占用四类代价
- 核心洞见:本文提供可复用的测试设计模板,但预期数字未经实测验证——收益需以下篇实测为准,网络是 PD 分离兑现收益的隐性前提
- 实践层: 1.5x提升:PD分离KV cache传输的实践经验
- 摘要:查看
- PD分离传输优化联合团队(HW/YN) / 知乎专栏
- 传输性能提升 50%——在 vLLM 上开发的 KV cache 传输 connector 相比起始版本平均提升 0.5x,相关代码已全部开源
- 两维问题分类框架——从"数据"(张量类型/内存排布/attention 模块)与"数据传输"(通道/链路/网络形态/效率)系统归类影响 TTFT/TPOT 的传输问题
- 核心洞见:KV cache 传输的取舍应围绕其对 TTFT/TPOT 的影响展开——这份分类清单是排查传输瓶颈的可复用起点,传输层组件正从各家私研走向社区共建
- 实践层: 异构智算中心分布式PD分离推理技术的探索与实践
- 摘要:查看
- 通信世界网(中国电信广域验证试验)
- 三大核心挑战——海量 KV Cache 跨中心传输(网络不足可"抵消 PD 分离带来的效率收益")、跨中心资源调度(易形成资源"孤岛")、异构适配(英伟达与昇腾集合通信库互不兼容)
- OTN 广域试验量化边界——基于英伟达+沐曦异构 GPU、DeepSeek-R1 蒸馏模型,800km 拉远、64:1 收敛比下性能可达本地同场景 99%,网络劣化时性能下降控制在 1%-5%
- 核心洞见:无损网络下异构存量算力可跨中心协同推理,为"以存量替代新建"的算力供给思路提供实证支撑——但网络性能不足将抵消 PD 分离全部收益
- 实践层: ODCC AI存储实验室KV Cache评测
- 摘要:查看
- 超擎数智 / 官网博客(ODCC AI 存储实验室 + 焱融 YRCache + 英韧科技)
- KV Cache 负载特征倒逼存储选型——高并发、高随机、小 I/O,叠加预加载/长上下文要求高顺序带宽,四维指标(顺序带宽/随机 IOPS/稳态输出/尾延迟)决定卸载收益
- 单盘性能实证——N3X 顺序读 14GB/s、4K 随机读近 3500K IOPS、P99 延迟低至 66μs 且全盘稳态持续输出
- 系统级收益放大——≥10K Token 场景首 Token 延迟从秒级降至毫秒级;中端 GPU 吞吐提升约 20 倍,长上下文下中端卡可接近高端卡效能
- 核心洞见:"以存强算"——推理性能提升不再只能靠堆高端 GPU,存储系统优化可释放中端算力潜能(数据出自利益相关方实验室,需批判看待)
- 实践层: LLM关于PD分离的最新实测
-
vLLM/SGLang 原生支持、官方文档给出真实参数——PD分离已从论文走进开源框架,落地要过“KV 传输、P:D 配比、平台集成”三道工程关。
- 总纲: vLLM 官方文档:Disaggregated Prefilling (experimental)
- 摘要:查看
- vLLM / 官方文档
- 分离的两大动机——独立调优 TTFT 与 ITL(P/D 可配不同并行策略);控制尾部 ITL(chunked prefill 也能达到但 chunk size 难以调准)
- 官方明确边界——"Disaggregated prefill DOES NOT improve throughput",收益在延迟控制与资源分配灵活性,避免用户误用
- 9 种 KV 传输连接器——Nixl/Mooncake/FlexKV/LMCache/Offloading 等覆盖多条技术路线;三大核心抽象:Connector(KV 检索)、LookupBuffer(SQL 式 insert/drop_select)、Pipe(单向 FIFO 张量管道)
- 核心洞见:decode 复用 prefill token ids、跳过模板化与 tokenization——生产级实现依赖第三方贡献,vLLM 会积极合入 PR
- 总纲: SGLang 官方文档:PD Disaggregation
- 摘要:查看
- SGLang / 官方文档
- 混排调度的两大痛点——Prefill 中断(新批次打断正在进行的 decode)与 DP Attention 负载失衡,PD 分离逐一化解
- 三种传输后端——Mooncake、NIXL、昇腾(ASCEND)覆盖英伟达与国产硬件生态,DeepSeek 多节点示例展示 TP16×DP8 真实规模配置
- Router 是规模化前提——独立 router 组件在 prefill/decode 实例间分配请求,实现负载均衡与容错
- 核心洞见:配置即显式权衡——放宽 bootstrap/waiting 超时意味着接受更大平均 TTFT,但 decode 节点断连时内存清理更慢;NVLink 传输专为 NVL72 部署建议
- 根基层: vLLM PD 分离(源码级机制)
- 摘要:查看
- marcus / 微信公众平台
- Proxy 双发请求——同一 prompt 同时发给 P 和 D,靠 kv_transfer_params 标志区分角色(P 侧 max_tokens=1 fire-and-forget,D 侧流式等待)
- transfer_id 关联机制——Proxy 生成 UUID 同时发给两端,是 P/D 匹配同一请求的唯一纽带
- D 侧调度暂停态——WAITING_FOR_REMOTE_KVS 状态下请求不占 GPU 计算资源,并跳过 zeroing 避免与异步写入竞态
- RDMA 直写远端显存——P 侧经 batch_transfer_sync_write 直接写入 D 的 GPU 内存,D 侧零计算加载;传输完成后故意少算 1 个 token 本地重算生成首个输出 token
- 核心洞见:全文只讲"如何实现"不讲"收益几何"——P:D 配比、传输延迟、SLO 达成需与性能类文章互补阅读
- 实践层: LLM 做 PD 分离后,怎么更慢了?
- 摘要:查看
- 丁师兄 / 微信公众平台
- KV Cache 传输是最大坑——Llama-3.1-70B 单请求 KV 约 1.34GB,10GbE 传 1 秒以上;只有 InfiniBand/NVLink 级互联才能压到几十毫秒
- P:D 比例无万能配置——短 prompt 长输出需 1P3D、长上下文需 3P1D;真实流量动态变化,静态配置必出现一边闲置一边排队
- 瓶颈切换是突变而非平滑——workload 从 Decode 密集切到 Prefill 密集时性能可能断崖式下跌,动态配比又依赖实时监控,形成循环依赖
- 核心洞见:"如果传输开销超过了分离带来的性能收益,整个架构就白搭了"——本批文章唯一完整的"反面清单",与红利派观点强互补
- 总纲: PD 分离推理架构详解
- 摘要:查看
- cr7258 / 腾讯云开发者社区
- Goodput 优于 Throughput——只有满足 TTFT/TPOT SLO 的请求才算有效产出,高吞吐但低 Goodput 的系统用户体验依然糟糕
- 共置干扰有量化证据——prompt 长 128 时 decode 延迟增约 1.8 倍、长 1024 时达 12.6 倍;同时满足双 SLO 需资源过度配置
- 分离即收益——2P1D 配置 Goodput 约 3.3 rps/GPU,相比共置 1.6 rps/GPU 提升约 2 倍,且未引入任何并行优化
- 工业界已规模验证——Mooncake 模拟场景吞吐最高提升 525%、Kimi 真实负载多处理 75% 请求;vLLM 五种 KV Connector 成事实标准抽象
- 核心洞见:当应用必须同时遵守 TTFT 与 TPOT(而非二者可权衡)时,PD 分离优于 chunked-prefills——后者动态分割无法完全解耦
- 实践层: pd分离在vllm中用法
- 摘要:查看
- 小徐炸酱面 / CSDN 博客
- 核心即 KV 流转——"prefill 生成的 KV,如何让 decode 能够用起来",抽象为 KV Connector/RPC 通道 + 状态约定
- P/D 角色差异——P 节点看重算力/GPU FLOPs;D 节点看重显存/网络带宽,关注 tail latency(TPOT、e2e)
- 并行策略必须匹配——有 DP/TP 时 P/D 两侧并行策略须一致,否则出现 KV 维度不一致、block id 对不上等问题
- xPyD 规模公式——总 GPU 数 = (P+D)×TP×DP,每个 P/D 节点都须能独立加载完整模型
- 核心洞见:kv-transfer-config 参数逐项详解(kv_role/kv_rank/kv_parallel_size/kv_buffer_size)——P/D 两侧并行策略一致是实操第一原则
- 生态层: LMCache 博客
- 摘要:查看
- LMCache Team / 官网博客
- NVIDIA Dynamo 集成 LMCache——成为 Dynamo 的 KV 缓存层解决方案,进入数据中心级推理平台生态
- 5000 GitHub stars 里程碑——被解读为"KV cache 技术已成为 LLM 推理栈一等公民"的信号
- 生态扩展方向——GKE 分层存储(与 Google 合作)、插件框架、外部后端扩展机制,构成 KV 缓存从单机到云原生的路径
- 核心洞见:索引页本身无实质内容,但透露的生态信号有索引价值——KV 缓存层已进入主流推理平台的标准栈
- 总纲: vLLM 官方文档:Disaggregated Prefilling (experimental)
-
从 UCSD 论文到黄仁勋 GTC、从昇腾专家并行到 H3C 解耦式 Serving——PD分离已被全行业拥抱,国产异构落地路径已打通。
- 生态层: 揭秘老黄演讲关键技术 PD分离:UCSD 华人团队 DistServe
- 摘要:查看
- 新智元 / 微信公众平台(UCSD Hao AI Lab)
- goodput 概念——有效吞吐量衡量"每秒符合 SLO 的请求数",高吞吐系统可能有效吞吐量很低(10 rps 中仅 3 个符合 SLO)
- 2P1D 量化实验——单 A100 上 13B 模型共同处理仅 1.6 rps/GPU,分离后 2P1D 达 3.3 rps/GPU,无并行化即 2 倍提升
- KV 传输开销可隐藏——OPT-175B 经 8 通道 PCIe 5.0 传输 KV 仅 17.6ms,小于单解码步 30-50ms
- 三类负载数据——聊天 2.0-3.41 倍、代码补全 3.2 倍、摘要 4.48 倍有效吞吐量提升
- 核心洞见:"现在,PD 分离已经成为兵家必争之地"——本批文章的理论源头与最常引用的数据出处(数据来自 A100 时代论文原型,与生产落地视角存在张力)
- 生态层: 昇腾大规模专家并行:PD分离,让推理性能再提速30%
- 摘要:查看
- 昇腾社区 / 官方技术稿
- 大规模专家并行三收益——每卡只加载部分专家权重(加载更快)、单卡专家少空闲显存多(并行路数更多)、专家充分利用单卡资源(利用率更高),单卡吞吐提升 3 倍以上
- 混合部署三痛点——PD 时延互相干扰(保证时延<100ms 须牺牲并发)、计算与访存冲突、算力显存过配置导致利用不足
- PD 分离三收益——消除阶段间时延干扰(decode 可用更大 BatchSize)、PD 配比独立调节、P/D 使用不同硬件资源
- 核心洞见:"EP + PD 分离"组合在国产 NPU 生态(k8s + MindIE 2.0 + 魔乐社区 DeepSeek-R1 INT8)可直接照做——但性能数字无测试条件与基线说明,宣传性质明显
- 生态层: 基于 Prefill/Decode 分离的大规模推理 Serving 架构
- 摘要:查看
- H3C 新华三 / 官网
- 双实例池 + KV 感知智能路由——调度器维护全局 KV Cache 分布表,在"缓存亲和性"与"负载均衡"之间寻优,避免热点节点过载
- 前缀缓存与多级卸载——Radix Attention 复用公共前缀降低 TTFT;KV 卸载至 Host RAM/SSD 并预取,单卡并发容量提升数倍
- EPLB 专家负载均衡——滑动窗口热度监测 + 动态复制热点专家 + 通信感知全局规约,消除"最慢 GPU 拖累 TPOT"
- 动态自适应调度——实例按流量伸缩,闲置 P 实例可转 D 实例(反之亦然),智能调整 PD 配比
- 核心洞见:"现代 Serving 架构不仅是静态的执行引擎,更是动态的调节系统"——PD 分离 × 专家并行的完整架构清单,其中 EPLB 与角色转换是同类文章少见的机制
- 生态层: LLM推理成本直降60%:PD分离在大模型商业化中的关键价值
- 摘要:查看
- 阿里云开发者社区
- 五大设计问题清单——PD 配比与数量、请求调度、KV 存储设计、Cache 复用、可靠性——是可迁移的工程检查单
- 四方案路线对比——vLLM Connector-Base(简洁易用,适合 1P1D 快速部署)、Dynamo(分层架构支持大规模集群)、Mooncake(专注高性能 KV 存储传输)、SGLang(事件循环队列提升灵活性)
- vLLM KV Transfer 现状与局限——0.8.x 仅支持 1P1D、缺负载均衡与自动扩缩容、Chunk Prefill 未适配
- 核心洞见:"短序列/低频请求场景下,融合部署可能更优"——但标题宣称的"成本直降60%"在正文中并无实测数据支撑,量化收益有被高估风险
- 生态层: 如何使用 NVIDIA Dynamo 减少 KV 缓存瓶颈
- 摘要:查看
- NVIDIA / 技术博客
- KV 缓存是显存瓶颈——随提示长度线性增长且必须驻留 HBM,长上下文下迫使在删缓存重算、限制上下文、增加 GPU 之间权衡
- KVBM 三层架构——模型集成层(TensorRT-LLM/vLLM)解耦引擎差异;内存管理层可自定义卸载策略;NIXL 传输层统一接入 CPU/SSD/文件系统/云存储
- 卸载适用条件——仅当缓存重用收益超过传输开销时合算:长会话、高并发、共享前缀、受内存/成本限制的部署
- 第三方实测——Vast 单 H100 经 GDS 插件达 35GB/s;WEKA 8×H100 达 270GB/s 读取
- 核心洞见:"在 GPU 显存中长时间保留大量 KV cache 是不可扩展的"——给出"何时卸载"的明确边界条件,而非无条件方案推销
- 生态层: 揭秘老黄演讲关键技术 PD分离:UCSD 华人团队 DistServe
-
Mooncake、NVIDIA Dynamo、llm-d、AIBrix——工业级开源平台把 PD分离 与分布式 KV Cache、智能路由、K8s 编排组合成完整推理底座。
- 总纲: Mooncake(KVCache 中心化解耦架构)
- 摘要:查看
- Mooncake / 项目官网(月之暗面)
- 开源组件全景——核心组件 Transfer Engine(RDMA 高速传输)与 Mooncake Store(分布式 KVCache 池)均已开源
- 生态集成是主要影响力路径——vLLM、SGLang(HiCache/EPD)、TensorRT-LLM、LMDeploy、LMCache、FlexKV(腾讯)等相继接入
- 量化收益——Kimi-K2 权重更新跨数千 GPU 从 53s 降至 7.2s;128 块 H200 上实现 224k/288k tokens/sec 预填充/解码吞吐
- FAST'25 最佳论文背书——2025 年 2 月获存储领域顶会最佳论文,配套 traces 已开源
- 核心洞见:一条时间线浓缩 2024-2026 年推理基础设施生态演进——"以 KVCache 为中心 + 分离式"已成为行业共同技术方向(内容为项目自述,无失败教训与边界讨论)
- 生态层: NVIDIA Dynamo(引擎无关的推理编排)
- 摘要:查看
- NVIDIA / 官方文档
- 引擎无关的前端 + Worker 模型——OpenAI 兼容网关与推理引擎解耦,后端可在 SGLang/vLLM/TensorRT-LLM 间切换
- 外部协调依赖——运行需 docker compose 拉起 etcd(服务发现)与 NATS(消息通信),部署门槛高于单体推理服务
- 低门槛验证路径——Qwen3-0.6B 小模型 + curl 一条命令即可验证端到端,几分钟跑通
- 核心洞见:首页宣称"高性能、低延迟、任何部署规模"但全文无任何基准测试——仅适合作为上手路径而非认知材料
- 生态层: llm-d(K8s 原生分布式推理栈)
- 摘要:查看
- llm-d / 项目官网(CNCF Sandbox)
- 三层抽象解耦清晰——Router(Envoy L7 代理 + 端点路由引擎)/ InferencePool(按模型分组的"LLM 优化 Service")/ Model Server(vLLM/SGLang 推理引擎)
- Variant 用标签表达服务角色——prefill/decode 等差异通过 Pod 标签而非专用资源表达,设计轻巧
- KV cache 成为一等调度信号——前缀缓存感知路由 + 事件驱动 KV 索引 + CPU/SSD 分层卸载,把"缓存命中率"纳入路由打分
- 核心洞见:K8s 原生推理平台的可借鉴架构范式——但全文档零基准测试、零生产案例,XGBoost 延迟预测等关键工程问题成熟度无从判断
- 生态层: AIBrix(字节跳动云原生推理)
- 摘要:查看
- 字节跳动 / GitHub
- 发布节奏反映产品成熟度——2024-11 至 2026-06 共 8 个版本(0.1.0→0.7.0),v0.2.1 即支持 DeepSeek-R1 全权重部署
- 三支柱能力框架——LLM 感知的网关路由(前缀感知/负载感知)、基于实时需求的自动扩缩、分布式 KV Cache 跨节点复用
- K8s + Ray 混合编排——用 Kubernetes 管集群、用 Ray 执行细粒度任务,是字节大规模算力治理经验的工程化表达
- 核心洞见:托管于 vllm-project 组织、白皮书公开于 arXiv:2504.03648——特性清单可作同类平台功能对照表,但 README 无法支撑任何性能结论
- 总纲: cr7258/ai-infra-learning · Lesson 06 PD分离(系统化课程)
- 摘要:查看
- cr7258 / GitHub 课程(ai-infra-learning)
- 逻辑链条完整——指标问题(Goodput vs Throughput)→ 干扰证据(1.8x/12.6x)→ 分离方案 → KV 传输全栈(开销/中心存储 vs P2P/三类链路/三种粒度)→ vLLM KV Connector 实现 → 方案对比
- 数据有出处、计算有过程——明确区分论文数据与工程事实,论据纪律良好
- PD 分离 vs chunked-prefills 是权衡而非胜负——必须同时满足双 SLO 时 PD 分离更优,这是全文边界意识最强的部分
- 核心洞见:一篇文章讲透 PD 分离——vLLM KV Connector(SharedStorage/NCCL P2P/NIXL/LMCache/Multi)已是社区实现的事实标准抽象
- 总纲: Mooncake(KVCache 中心化解耦架构)
-
从 DistServe 的 Goodput 革命到 AFD 的算子级解聚——五篇论文勾勒推理解耦从“阶段分离”走向“算子分离”的演进谱系。
- 根基层: DistServe: Disaggregating Prefill and Decoding for Goodput-optimized LLM Serving
- 摘要:查看
- Yinmin Zhong 等(UCSD) / arXiv:2401.09670
- "干扰 + 耦合"双重病因——混批使解码步被 prefill 步拖慢、TTFT 与 TPOT 相互挤压;共享权重与显存迫使两阶段用同一并行策略
- 解耦收益量化——13B 模型单 A100 混合部署仅 1.6 rps goodput;2:1 GPU 配比分离后整体 goodput 达 10 rps(每 GPU 3.3 rps),是原方案的 2.1×
- goodput 目标重塑优化函数——以"每 GPU 满足 SLO 达标率(90%)的最大请求率"为目标,直接对应单次查询成本
- "拉取式"KV 传输抗突发——decode 实例按需从 prefill 拉取 KV,prefill 显存充当排队缓冲,两类实例无需复杂协调
- 核心洞见:PD 分离的开山之作——但解耦引入实例间依赖,单个 decoding 实例故障可能连带多个 prefill 实例、瘫痪整个服务
- 根基层: Splitwise: Efficient Generative LLM Inference Using Phase Splitting
- 摘要:查看
- Pratyush Patel 等(Stanford) / arXiv:2311.18677
- 硬件失衡是动因——H100 相对 A100 算力提升 3.43× 但内存带宽仅增长 1.6×,最新 GPU 的算力优势在内存密集的 token 生成阶段被浪费
- 逐层异步传输与计算重叠——KV cache 迁移开销与 prompt 计算重叠,E2E 延迟影响仅 0.8%(串行传输为 3%)
- 异构集群设计矩阵——AA/HH/HA/HHcap 四类;HA 用 H100 跑 prompt + A100 跑 token,token 阶段 A100 更划算
- 量化收益——相比现有集群成本降 20% 同时吞吐提升 1.4×,同等成本与功耗预算下可提供 2.35× 吞吐
- 核心洞见:与 DistServe 同期提出阶段拆分但出发点不同——Splitwise 强调异构硬件选型与成本/功耗优化(Perf/$ 与 Perf/W),"token 生成并不需要最新 GPU"
- 根基层: TetriInfer: Inference without Interference
- 摘要:查看
- Cunchen Hu 等(上海交大/微软) / arXiv:2401.11181
- 混合负载干扰实测——混跑 prefill 请求 10× 减速、prefill+decode 混跑 5× 减速、不同长度 decode 混跑吞吐损失 16%
- 三支柱设计——定长 chunk 切分使硬件贴近计算饱和点;prefill/decode 虚拟实例解耦(独立扩缩容、可角色翻转);两级调度 + 小 LLM 长度预测(200 token 粒度准确率 74.9%)
- 量化收益——相比 vLLM 资源减少 38%、平均 TTFT 降低 97%、平均 JCT 降低 47%;轻 prefill 重 decode 负载 perf/$ 提升 2.4×
- 核心洞见:不应把所有请求当同类处理,应按 prefill/decode 长度分类调度(像俄罗斯方块一样组织请求)——并诚实标注重 prefill+重 decode 负载不适用的边界
- 根基层: Mooncake: A KVCache-centric Disaggregated Architecture
- 摘要:查看
- Ruoyu Qin 等(月之暗面) / arXiv:2407.00079
- KVCache 是调度的中心矛盾——复用 KVCache 减少计算与增大 batch 提高 MFU 都会伤及延迟 SLO,调度本质是在缓存复用与 SLO 之间权衡
- 分层解耦缓存池——利用闲置 CPU/DRAM/SSD 构建 KVCache 分层存储与分发网络,热块复制防拥塞、冷块换出降成本
- Conductor 缓存感知全局调度——按前缀匹配长度/排队时间/传输时间估算 TTFT 选最优实例,不满足 SLO 直接返回 HTTP 429
- 预测式早期拒绝——避免为注定被拒绝的请求浪费 prefill 算力,抑制拒绝策略引发的 P/D 负载反相振荡(拒绝请求数从 4183 降到 3589)
- 核心洞见:"与传统研究假设所有请求都会被处理不同,Mooncake 面对的是严重过载场景"——以 SLO 满足度而非请求数/容量比衡量系统负载
- 根基层: How Far Can Disaggregation Go? Attention-FFN Disaggregation (AFD)
- 摘要:查看
- Hanjiang Wu 等(Georgia Tech + Intel + Google) / arXiv:2605.28302
- 解耦粒度演化谱系——chunked-prefill 聚合 → P/D 阶段解耦 → AFD 算子级解耦(Attention 与 FFN 拆到不同 GPU 组),每层解耦都加深调度设计空间
- 严格 SLO 下 AFD 使不可能变为可能——DeepSeek-V3.2 上以 TTFT<150ms、TPOT≤15ms 约束,AFD 部署维持约 4k tokens/s 系统吞吐,而非 AFD 部署不可行
- 反直觉的极端配比——MLA+稀疏注意力把 524k 前缀 KV cache 压进 2 卡 HBM,长上下文 agentic 负载下最优配置为 2A+126F(几乎整个集群给 FFN)
- 位置感知放置原则——高频层内 A2F/F2A 流量绑最高带宽 NVLink 域,低频跨节点 KV 传输走 InfiniBand;内存分割让 attention GPU 腾出显存装 KV 是隐藏收益
- 核心洞见:"提供一张实用地图:MoE 规模化服务中,何时、何处更深层的解耦才真正划算"——纯吞吐下聚合部署常胜,AFD 赢在严格 SLO 与超长前缀战场
- 认知层: 当 PD 分离成为标配,推理的未来在 AFD
- 摘要:查看
- 小哥人工智能笔记 / 微信公众平台
- 解聚三级跳框架——chunked-prefill(切块减气泡)→ P/D 分离(算力 vs 带宽错配)→ A/F 解聚(块内访存 vs 计算错配),AFD 是"叠在 PD 之上的下一级解聚"而非替代者
- 块内异构量化证据——长上下文下 Attention 运行时占比从 41% 飙到 87%-96%,且不同架构斜率不同,故 A/F 配比"没有统一答案"
- "AFD 不是银弹"的边界——纯吞吐下聚合部署(chunked-prefill + EP)在大多数面板胜出;AFD 每个副本消耗更多 GPU
- AFD 的两个确定性战场——严格 SLO 下只有 AFD 类方案可行(约 4k tokens/s);1M 前缀场景非 AFD 直接不可行——内存切分本质是"给 KV 腾地方",此处它不是"更快"而是"能跑"
- 核心洞见:"先定 SLO,再谈解聚"——国产芯片(昇腾 HCCS、昆仑芯 XPU-Link)与"层内高频绑节点内"原则契合,但国产实测仍是空白
- 根基层: DistServe: Disaggregating Prefill and Decoding for Goodput-optimized LLM Serving
-
推理集群网络 200G RoCE 即可起步、KV Cache 按 HBM→DRAM→SSD 分层卸载——网络与存储是 PD分离 落地的隐形底座。
- 根基层: 大模型基础设施工程 04:互联与网络——NVLink、InfiniBand
- 摘要:查看
- 土法炼钢兴趣小组 / 算法知识备份
- 算力决定上限,互联决定利用率——同一批 H100 接不同网络,70B 模型训练 MFU 可相差 30 个百分点以上
- NVL72 把机柜变成一块 GPU——72 卡全 NVLink 互联,TP/EP 可一柜内完成,堪称 MoE 模型(如 DeepSeek-R1)的天选硬件
- IB 是黄金标准但贵且锁死——SHARP 在网计算、无损流控,每端口价格为等速以太网 2-3 倍,生态被 NVIDIA 牢牢掌控;RoCEv2 是国内大厂务实之选(省钱 30%-50%)但调优门槛极高
- fail-slow 比 fail-stop 更可怕——网卡降速不报错会拖慢整个 step,需靠 per-rank AllReduce 时间监控发现
- 核心洞见:排障案例显示 4096 卡 MFU 从 28% 提升到 46%,靠的是 peermem 加载、DCQCN 调参、多 QP 打散等小优化叠加——全程没有"致命 bug"
- 认知层: InfiniBand vs 以太网 GPU 集群对比:800G 网络架构决策指南
- 摘要:查看
- Introl
- 拥塞行为是最大差异——高负载下 IB 优雅降级,以太网在 incast 场景可能性能崩溃,两者延迟差距从基线 2 倍扩大到 100 倍
- 成本账的两面性——IB 硬件贵约 2 倍(千卡集群约 1500 万 vs 700 万美元),但运维开销约低 40%、功耗省 15%
- 成功案例两极分化——Selene(IB,95% 扩展效率)与 Google TPU(纯以太网加自研 Jupiter)都成功,但前者靠 NVIDIA 资源、后者靠数百名网络博士
- 技术收敛进行时——Spectrum-X 800G 把 IB 能力搬到以太网,UEC 1.0 规范已发布,2027 年前后选择可能不再关键
- 核心洞见:"连接 1 万块 GPU 的网络,决定了它们是一台统一超算还是一堆昂贵孤立处理器"——大规模训练选 IB、推理服务选以太网、混合部署是常见折中
- 认知层: GTC 解读:当我们谈论 AI 推理的 KV Cache
- 摘要:查看
- 极客公园 / 阿里云资深技术总监张为 GTC 2026 演讲
- 三重压力叠加的内存墙——显存贵、上下文长、并发高,KV Cache 需求指数级增长,上下文从 4K 扩至 256K+ 使内存压力激增 8-16 倍
- HiCache 分层缓存——与 SGLang 社区共建,显存-内存-3FS 多级卸载与全局共享:命中率 80%、TTFT 降 56%、QPS 翻倍
- VLCache 多模态缓存——首次形式化"累积复用误差效应",层感知动态重计算,仅计算 2-5% tokens 即准确率持平,TTFT 加速 1.2-16 倍
- HiSim 高保真仿真——与 NVIDIA Dynamo 共建的事件驱动仿真器,仿真成本降 39 万倍、端到端误差<5%,把容量决策从经验转向数据
- 核心洞见:"KV Cache 的本质是'以内存换算力'"——互联网缓存三件套(统一接口/多级存储/预计算)平移到 AI 的 KV 抽象层,G3.5 定制存储与 HBF 高带宽闪存是未来方向
- 认知层: KV Cache 缓存可卸载至 SSD:打破内存墙限制
- 摘要:查看
- 国泰海通证券 / 发现报告
- 分级卸载成为行业方向——英伟达 Dynamo/KVBM 支持 G1-G4(GPU 显存/CPU 内存/SSD/远端存储)四级 KV Cache 卸载
- 三星 SSD 卸载量化收益——KV Cache 超容时 TTFT 最高降 66%、ITL 最高降 42%,多轮对话 KV 重用使 I/O 吞吐稳步上升
- HDD 缺口催化 NAND 转产——TrendForce 数据显示 NAND 厂商转产 122TB/245TB 超大容量 Nearline SSD
- 核心洞见:"KV Cache 缓存可从 GPU 内存 offload 至 CPU、SSD"——推理侧容量增长超出 HBM 承载能力,AI SSD 迎来成长空间(研报题材,论据深度有限)
- 生态层: Tair KVCache - 动态分级缓存(阿里云)
- 摘要:查看
- 阿里云 / 产品介绍页
- "以存代算"——将 KV 缓存卸载至分布式池化存储,用存储资源置换 GPU 算力,是全文核心卖点
- 多级存储池化——对 GPU HBM、DRAM 等多级存储统一池化管理,是主流缓存架构方向
- 三类场景覆盖——多轮对话(Redis 语义接口保证连贯性)、海量并发(亲和性路由)、RAG(预检索内容缓存)
- 核心洞见:印证 KV 缓存池化/卸载已成为主流云厂商产品化方向(与 NVIDIA Dynamo、Mooncake 相互呼应)——但全文零技术细节、零性能数据,仅具线索价值
- 根基层: 大模型基础设施工程 04:互联与网络——NVLink、InfiniBand
-
每百万 token 成本三年从 20 美元降到 0.4 美元,算力资产正从“卖卡”走向“Token 工厂”经营——PD分离 是降本侧的工序。
- 根基层: 推理单位经济学:每百万 Token 的真实成本
- 摘要:查看
- Introl
- 成本年降 10 倍——同等性能从 2022 年底每百万 token 20 美元降至 0.40 美元,快于 PC 算力与互联网带宽的历史速度
- 利用率决定自托管可行性——10% 利用率使每千 token 0.013 美元的成本放大 10 倍至 0.13 美元,超过高端 API;7B 模型需 50% 利用率、13B 仅需 10% 即可收支平衡
- 日均 8000 次对话为最小可行阈值——低于此规模,自托管的固定成本与运维复杂性超过节省
- 优化技术复合效应——量化(4×)×连续批处理(2×)×推测解码(2×)可达 16 倍有效成本降低
- 核心洞见:"掌握推理经济学决定了 AI 部署是创造价值还是消耗资本"——把成本决策从感觉变为可计算的框架(利用率方程 + 收支平衡点 + 请求量阈值)
- 战略层: 底座算力跃迁到 token 工厂的新机会
- 摘要:查看
- 中邮证券 / 孙业亮、刘聪颖
- Token 成为结算单位——2026 年 3 月我国日均 Token 调用量超 140 万亿,较 2024 年初增长 1000 多倍;中国 Token 调用占全球 36%
- 成本结构拆解——训练阶段 CAPEX 主导(千亿参数总成本 1-5 亿美元);推理阶段 OPEX 主导(电力占 60%-70% 为最大单项开支)
- 定价锚转移——当前芯片可获取性决定 Token 供给与价格;中期电力成为物理硬约束;长期人才与知识密度主导溢价
- 国内玩家布局——阿里 Token Foundry(按场景定制词元工作流)、华为 Token Factory(昇腾+液冷+储能)、腾讯 TokenHub(统一计费)
- 核心洞见:"Token 工厂正在把数据中心从基础设施行业推向制造业,而制造业的核心从来不是规模,而是效率"——研报荐股属性,长期预测无公开模型支撑
- 总纲: 大模型推理优化关键技术与应用实践研究报告(中国信通院)
- 摘要:查看
- 中国信息通信研究院人工智能研究所
- 推理取代训练成为落地焦点——ChatGPT 企业版 API Token 消耗 12 个月暴增 320 倍;2026 年推理占计算工作负载 66%,中国推理算力市场规模 876.5 亿元(近翻倍)
- 三级优化体系——模型层(量化/蒸馏/MoE/MLA 低秩压缩)、引擎层(PagedAttention 并发 +3 倍、FlashAttention、混合并行、Chunked-Prefills)、系统层(PD/AF 分离、调度策略、高性能存储)
- 工业级方案实测——Mooncake 有效吞吐 +75%、长上下文最高 +525%;UCM(华为)TTFT 最高降 90%、吞吐最大提升 22 倍;MegaScale-Infer 单 GPU 解码吞吐较 vLLM 提升 7.11 倍
- AF 分离标志架构演进——将 MoE 的 Attention(访存密集)与 Feedforward(计算密集)拆分至异构节点独立扩展,从阶段分治迈向模块分治
- 核心洞见:"大模型推理是 AI 从实验室走向产业应用的'最后一公里'"——推理优化 = 在保障 SLO 前提下兼顾"效果-性能-成本"的全链路工程
- 根基层: 推理单位经济学:每百万 Token 的真实成本
-
AI 浪潮之上:组织如何从分散提效走向 AI Native,美国政治反弹如何改写扩张模式——宏观变量决定技术落地的节奏。
- 实践层: 从分散提效到 AI Native 组织的实践
- 摘要:查看
- 数字人BuilderAgent团队 / 微信公众平台
- 单点提效悖论——全员接入 AI 后人人感觉效率提升,但整体交付周期没有等比缩短:80%+ 周期消耗在角色间等待、交接与信息损耗上
- 流动效率度量——核心指标 = 真正干活时间 ÷ 总交付周期,单点 AI 优化撬不动流程性损耗
- AI 提效分级 L1/L2/L3——三级的本质区别是 Context 归属(依赖多少"人类独有、AI 当前不具备"的 context),而非 AI 能力高低
- Spec 作为单一事实源 + 缺陷回流闭环——验收标准必须"可被 QA 自动判定";缺陷转化为新验收标准写回 Spec,防止同类缺陷复发
- 核心洞见:"围绕 AI 重新设计流程与组织,而不是把 AI 缝进旧流程"——"我们得到的只是'更快的局部',而不是'更短的整体'"
- 战略层: 美国镜鉴:当AI浪潮遭遇政治反弹
- 摘要:查看
- CF40 研究部 / 微信公众平台
- 政治反弹三战线——劳动者争夺部署协商权与补偿分享权、公众质疑科技巨头对数据与规则制定权的垄断、地方社区反对数据中心转嫁电力水资源成本
- 历史规律——赋能型技术提高生产率易被接受、替代型技术导致技能贬值易引发抵制;反弹对象随技术形态演变:机器→垄断企业→选举政治
- 数据中心是反弹最清晰的焦点——收益归企业、成本归社区(电价上涨 20-25%、就业仅 20-50 人/站);2026 年 Q1 至少 75 个约 1300 亿美元项目因地方反对被取消或延期
- 政治临界点条件——就业冲击显著 + 责任对象清晰 + 政治叙事整合;若失业率因 AI 上升两个百分点并形成"AI 应负责"的公共叙事,真正的民粹反弹可能开始
- 核心洞见:"对 AI 的政治反弹最可能带来的变化,是终结 AI 产业不计社会成本的扩张模式"——公众态度由收益分配而非技术本身决定
- 生态层: 刚刚!谷歌突发最炸离职
- 摘要:查看
- 深科技首席 / 微信公众平台
- Jeff Dean 离职创业——谷歌第 30 号元老员工、任职 27 年,出任 AI 科研公司 Discovery Loop CEO
- 全明星创始团队——Ghemawat(MapReduce/GFS/Bigtable/Spanner 奠基)、Vinyals(Gemini/Seq2Seq)、Le(Google Brain/AutoML),四人包揽谷歌基建、初代 AI、Gemini 三代核心技术
- 方向:AI 全自动科研闭环——让 AI 自主提出猜想、设计实验、运行分析并迭代,先让 AI 研发 AI,再跨界芯片、新材料、新药、清洁能源
- "友好分手"的止损模式——Alphabet 战略入股、谷歌云提供算力,作者解读为锁住深度合作关系的最优止损方案
- 核心洞见:顶尖人才不再迷恋大厂光环——AI 核心赛场将从模型参数/对话体验转向"规模化、工程化的自动科学发现能力"(标题党快讯,细节需以官方公告核实)
- 实践层: 从分散提效到 AI Native 组织的实践
2026-07-31
-
AI办公从"个人提效"走向"组织重构"——SaaS独立时代终结,文档原生+统一平台成为新范式;企业AI落地六件事:通知识、通数据、通能力、统平台、管成本、管安全。
- 总纲: WPS 365 组织级 AI 办公新品发布
- 定位描述——企业AI落地的总纲框架,以金山办公自身踩坑经验提炼"三通两管一平"体系,为后续各层分析提供操作坐标
- 摘要:查看
- WPS 365 / 王冬(金山办公副总裁)
- Token成本管控第一课:全员配最好模型→人均日耗1750元→按任务/人/岗位配置不同模型和额度
- 数据清洗是AI准确性的前提:"一客一档"方法将客户全维度数据汇总,AI才能给出有价值洞见
- WPS API Hub三种连接方式覆盖新老系统:API直连→Skill拼配→Lua脚本抓取
- 四维安全:Trust ID(身份)+ Trust Data(数据分级)+ Trust Device(终端可信)+ Trust AI(行为监控)
- 核心洞见:企业AI落地的"三通两管一平"——通知识、通数据、通能力、管成本、管安全、统平台
- 战略层: 在AI办公这一块,WPS Comate凭什么敢说"我懂企业"
- 定位描述——从第三方视角验证总纲框架的市场逻辑,指出软件护城河=上下文、AI必须从"回答问题"升级为"执行任务"
- 摘要:查看
- 倪叔 / 埃森哲数据引用:88%企业跨过AI试点但仅14%实现显著提升
- "大模型提供智力,软件提供上下文"——章庆元的这一判断将软件价值重新定义为"上下文容器"
- "三二一"体系:三通(知识/数据/能力)→两管(成本/安全)→一平(Comate统一平台)
- 6000人公司一个月自发上传5000个Skill,"组织智能开始形成复利"
- 核心洞见:2026年AI办公不缺会聊天的模型,缺的是能交付结果的产品——文档原生 vs 消息原生是核心战略分歧
- 战略层: 38年磨一剑,一剑出双锋:金山办公的AI生态卡位战
- 定位描述——AI办公赛道的竞争格局分析,提出"双生态闭环"框架并引入投资者批判视角
- 摘要:查看
- 任倾 / 灵犀专业版(个人端)+ WPS Comate(组织端)的双产品布局
- 中船黄埔文冲案例:200余本技术规范AI知识库化,单次规范查找时间缩减60%+
- 投资者何天峰尖锐质疑:用户在别人Agent里直接做文档怎么办?"做好和做不好之间,可能是公司分水岭"
- 核心洞见:金山办公的差异化不在模型层,而在文档原生+个人到组织的纵向打穿——6.78亿月活设备构成竞品无法复制的数据壁垒
- 实践层: 新出的WPS Comate给所有Agent都上了一课
- 定位描述——从一线用户体验展示Comate如何将组织协同从"串行汇报"变为"共享大脑"
- 摘要:查看
- 小小莫理 / 团队功能=多人共享上下文的群聊,领导直接看到AI创建过程,保留对话上下文
- 技能市场+Wiki知识库+应用引擎:形成"个人提效→经验沉淀→组织复用"的能力飞轮
- 核心洞见:企业AI化不是每个人都配一个更聪明的助手,而是组织能力协同与可复制——效率提升将是几何倍数的增长
- 认知层: 别了飞书:SaaS 的黄金时代,随AI到来彻底落幕
- 定位描述——AI办公变革的标志性事件解读,豆包吞并飞书宣告"独立SaaS生存模式"终结
- 摘要:查看
- 倪叔 / 4000人团队+产品力口碑俱佳的飞书被吞并,证明"没有原生AI底座的协同系统永远只能是上层应用"
- 互联网=DAU逻辑(免费→人多→网络效应),AI=ARR逻辑(Token付费→生产力→产业场景)
- 飞书产品团队并入豆包、销售团队并入火山引擎——办公工具第一使命从"更好协同"变为"承载大模型商业化"
- 核心洞见:打败独立办公软件赛道的不是另一个协同工具,而是大模型——未来所有工作软件都必须寄生在大模型之上
- 总纲: WPS 365 组织级 AI 办公新品发布
-
AI的终点不是办公提效,而是研发创新能力重构——美的用年均几千万Token消耗验证了"全员应用→业务融合→经营优化→研发创新"的四阶进化路径。
- 实践层: 对话美的集团张小懿:一年Token花几千万,买了几千张卡
- 定位描述——制造业AI落地的一手实践数据,美的CDO首次披露Token成本、AI效果测算方法和组织变革经验
- 摘要:查看
- 中国企业家杂志 / 梁宵 / 张小懿(美的集团副总裁兼CDO)
- 两种AI效果测算口径:效率口径下去年贡献7.7亿元,财务回报口径下全年目标2.5亿元
- 外部Token年均几千万元+自购几千张卡;荆州智能体工厂应用14个智能体
- 海外数字化挑战:KD链路35个节点、多语言跨文化智能体、VOC到VOP品质七步法
- "AI应用已进入深水区,已经没有石头可摸"——核心难题是AI决策谁来负责
- 核心洞见:核心业务流程无法跳过数字化阶段——没有数据基础和知识积累,AI就是无源之水;现实世界有壁垒,数字世界的壁垒依然存在
- 实践层: 美的AI实践给制造业的真正启示
- 定位描述——将美的实践提炼为可迁移的方法论,并引入AITRIZ作为研发创新深水区的解题路径
- 摘要:查看
- AITRIZ®粹思智能 / 张彬彬(曾任美的集团首位资深创新专家)
- 四条底层规律:一把手工程→业务融合关键在进入流程→护城河是知识而非模型→研发是AI最深水区
- 普通大模型vs AITRIZ五大差异:问题入口/推理机制/方案产出/工程验证/组织沉淀
- 研发创新三段闭环:问题分析(先把问题做对)→方案产出(扩大解空间)→方案落地(进入工程决策)
- 核心洞见:"个人会使用AI"与"企业具备AI能力"隔着业务场景、流程机制、知识资产、组织协同四道鸿沟
- 实践层: 对话美的集团张小懿:一年Token花几千万,买了几千张卡
-
Agent不再只是工具,而是能自己出题、自己反思、自己长出技能的系统——14篇前沿论文揭示三大技术路线,但"总结者"仍是最大瓶颈。
- 根基层: Agent开始"自我进化":会出题、会反思,还会自己长出新技能
- 定位描述——Agent能力演进的学术路线图,系统综述14篇论文,首次指出"总结者"是自进化Agent最被低估的瓶颈模块
- 摘要:查看
- 腾讯程序员 / horacebao、ashexie
- 三大技术路线:经验/Skill存储型(不训练)→RL训练型(写入权重)→0数据自学型(完全自主)
- 核心发现:SkillOS首次证明"训练后的小模型Curator > 冻结的大模型Curator"
- 右上方空白象限:既自动生成题目+又训练总结者的工作目前一篇都没有
- 核心洞见:"如何让Agent在没有人工干预的情况下,把交互的副产物转化为下一次更强的能力"——这才是Agent自进化的本质问题
- 实践层: GitHub 狂揽 1.3 万 Star,Anthropic 开源的知识工作者插件
- 定位描述——Agent工具化的产品实践,纯Markdown+JSON配置实现零代码岗位专家定制
- 摘要:查看
- 逛逛 / Anthropic Knowledge Work Plugins覆盖产品/销售/客服/法务/财务/工程/HR等十几个岗位
- Skills+Commands+Connectors三层架构:自动调用→手动触发→MCP协议连接外部工具
- 核心洞见:把AI从通用聊天机器人推向岗位专用工具——纯文件驱动,改改Markdown就能定制
- 实践层: 技术速递|如何使用 Canvas 构建交互式体验
- 定位描述——Agent交互范式的新探索:从对话界面升级为可视化共享工作空间
- 摘要:查看
- 微软Reactor / Jacklyn Carroll / GitHub Copilot App的Canvas扩展功能
- 核心洞见:Canvas将AI从对话工具升级为交互工作空间——/create-canvas一条命令创建动态交互界面
- 根基层: Agent开始"自我进化":会出题、会反思,还会自己长出新技能
-
从"看得见"到"写得完"——百度Unlimited OCR用R-SWA注意力机制证明"遗忘是一种能力";TRIZ创新方法则在AI时代迎来方法论重构。
- 根基层: 深度解读百度Unlimited OCR
- 定位描述——长文档OCR的架构级突破,R-SWA将KV Cache从线性膨胀压到恒定上限,首次让模型"一次前向读完一本书"
- 摘要:查看
- 刘君杰 / R-SWA(Reference Sliding Window Attention):视觉token永远保留,输出token只留最近128个
- OmniDocBench v1.5:Overall 93.23 vs DeepSeek-OCR 87.01(+6.22),6000 token时速度差35%
- "遗忘是一种能力"——长程任务的瓶颈不一定靠"更长上下文"来解,正确的记忆结构比全量记忆更有效
- 核心洞见:标准attention越写越慢,R-SWA一直匀速写——输出100万token时只需标准attention约1%的KV cache
- 根基层: 百度开源无限OCR,跑通长程解析,核心作者YY疑是来自DeepSeek
- 定位描述——R-SWA技术的工程背景解读,揭示Unlimited OCR与DeepSeek OCR的技术传承线索
- 摘要:查看
- 机器之心(关注AI的)/ GitHub Star五天破万,HuggingFace多模态榜单第一
- DeepSeek OCR解决输入侧压缩(256视觉token/页),Unlimited OCR解决输出侧膨胀(KV Cache恒定)
- 一个编码端一个解码端——"push DeepSeek-OCR one step further"
- 核心洞见:不是另起炉灶,而是在前人肩膀上"接着思路继续往前推"——技术报告引用DeepSeek OCR高达40次
- 实践层: 新品上线|Unlimited-OCR 企业级服务邀您体验!
- 定位描述——OCR技术突破的商业化落地,百度智能云同步开放企业级API服务
- 摘要:查看
- 百度智能云 / 3B参数(激活570M),推理速度比DeepSeek OCR提升12.7%
- 核心洞见:长文档解析不是在文档数字化的最后一步,而是在企业文档智能化的第一步
- 认知层: 为什么TRIZ在国内就是火不起来?——一线工人出身的TRIZ老师的大实话
- 定位描述——创新方法论的落地困境诊断,从一线实战视角揭示TRIZ推广的七重障碍
- 摘要:查看
- 老白(制造业一线工人技师,8年100+课题经验)
- 七重障碍:圈子小→以赛促学走歪→流派分裂+高培训费→企业囚徒困境→门槛高→象牙塔vs实战派→研发机密
- 学好TRIZ四个条件:本行业专业知识扎实+无太强思维定势+能快速转换思维+有落地权限和资源
- 核心洞见:真正的好工具不应该只活在赛场上和证书里——"央国企学了但用不到,中小企业用得到但99%不知道"
- 根基层: 来自GodMaker&DeepSeek关于Triz的对话——彻底再造知识分析工具TRIZ理论
- 定位描述——AI时代TRIZ的理论重构,用大模型重新编译TRIZ话语体系
- 摘要:查看
- 天衍智科技产业有限公司 / GodMaker×DeepSeek对话形式
- 将TRIZ从物理/机械场景拓展到管理、软件、AI领域——跨域通用性是TRIZ在AI时代重获生命力的关键
- 核心洞见:大模型不是TRIZ的替代者,而是TRIZ的"放大器"——AI+TRIZ=创新方法论的可编程化
- 实践层: TRIZ 40个发明原理案例汇总
- 定位描述——TRIZ的工具手册,每个原理配工程/管理/生活/软件四域案例,完成40个原理的跨领域翻译
- 摘要:查看
- TRIZ-AI 发明创新方法研究
- 核心洞见:将物理世界的发明原理向管理、软件、生活领域迁移,本身就是一种创新
- 实践层: 【设计理论】TRIZ理论详解(一)
- 定位描述——TRIZ的入门教程,聚焦前10个发明原理的工业设计案例化讲解
- 摘要:查看
- 创新设计研究室
- 核心洞见:TRIZ不是限制灵感,而是当面对"矛盾"束手无策时提供40个可能的切入方向
- 根基层: 深度解读百度Unlimited OCR
-
央国企数智化24场景全解读——合规、安全、稳定才是决策铁三角。
- 实践层: 央国企数智化落地:24个AI应用场景全解读
- 定位描述——央国企AI的场景优先级排序,按决策逻辑(合规>安全>稳定>效率)划分四梯队
- 摘要:查看
- Loong / 第一梯队(立即动手):智能流程自动化、智能对话客服、智能合同;第四梯队(锦上添花):智能营销、智慧党建
- 四个前置问题:决策逻辑、数据基础、组织惯性、ROI计算方式
- 核心洞见:不能说"AI能搞定一切",要说"AI帮人搞定80%重复劳动,关键决策和最终审批还是人在管"
- 实践层: 央国企数智化落地:24个AI应用场景全解读
-
AI训练与"蒸馏"的边界到底在哪里?Anthropic 15亿美元和解 + 美国"双轨竞争"战略,共同指向一个核心问题:规则由谁定义、对谁适用。
- 生态层: 从Anthropic15亿和解谈起:AI 训练与"蒸馏"的边界到底在哪里?
- 定位描述——AI规则的法律与伦理维度,揭示"同一动作、换一个主语就从合理训练变成高风险行为"的双重标准
- 摘要:查看
- 双方智慧局 / Anthropic 15亿美元和解版权诉讼,法官裁定"训练本身可以构成合理使用"但"盗版下载违法"
- 蒸馏是双向循环而非单向管道:美国公司→中国模型→全球云平台→美国开发者→新训练循环
- 核心洞见:真正该统一的是规则——如果AI学习人类作品是合理使用,模型之间的相互学习也不应天然被推定为违规
- 战略层: 孙占卿:美国AI"开源"转向,背后是一场应对中国崛起的"双轨竞争"
- 定位描述——中美AI竞争的战略格局分析,指出美国正从"掌握技术"转向"控制生态",中国开放模型的快速扩散促成了这一转变
- 摘要:查看
- IPP评论(华南理工大学公共政策研究院)/ 孙占卿
- 英伟达联合百余家企业发布《开放权重与美国AI领导力》公开信→成立"开放安全AI联盟"
- 双轨战略:闭源旗舰维持能力上限+安全控制;开放权重争夺开发者、标准与全球扩散
- 四层治理框架:模型能力→开放内容→部署场景→责任链,开放程度只是风险评估的一个变量
- 核心洞见:美国AI领导力从"谁训练最强模型"扩展到"谁的模型成为全球默认选择"——AI竞争已从实验室榜单延伸到生态控制
- 生态层: 从Anthropic15亿和解谈起:AI 训练与"蒸馏"的边界到底在哪里?
2026-07-24
-
在算力、数据、算法的喧嚣之上,回到第一性原理追问"计算到底是什么"——真正的智能,是用最少的资源办最多的事;不是选择跑得更快,而是选择跑对方向。
- 根基层: 能量—信息:WAIC"向内与向外"的新算力文明框架
- 定位描述——路径自觉的物理学底座,以"能量景观"和"两个无穷"为分析框架,将 AI 路径选择从工程辩论提升到第一性原理层面
- WAIC论坛侧记 / 林静教授学术策划
- 核心框架"两个无穷":向外的无穷(近地轨道太空算力、绿电储能,拓展能量采集的空间边界)与向内的无穷(量子计算,回归自然界最原生的信息载体),二者在"能量—信息"的第一性原理上交汇
- 能量景观(Energy Landscape)作为计算演化的底层逻辑:生物用几十亿年在能量景观里分化出细胞与器官,今天的算力工程正在用几十年分化出通用与专用、经典与量子、地面与太空的算力路径——这不是比喻,是同一条第一性原理
- 量子计算的物理锚点:操控一个超导量子比特反转的能量约 10⁻¹⁶ 量级(蝴蝶扇翅的十亿亿分之一),错误率做到 10⁻³ 已是物理极限;通用容错量子计算机约需 100 万物理比特,"10—15 年、10—30 年"是潘建伟、朱晓波、Nori 三方首次在时间尺度上收敛
- 太空算力布局:上海"星枢计划"1000 颗天基算力卫星首发"一主二辅"星簇,中国在卫星数量、单星算力、在轨部署、大模型上星四个维度进入全球第一梯队
- 算力网突破:高文院士将算力经济模型扩展为“芯片—电力—通信—存储四要素”,通信须下沉到数据链路层重构;Kammen 教授警示"下一堵墙不在芯片,在电网调度表的另一侧"
- 五大产业方向已清晰:量子智能、太空算力、物理世界大模型与具身智能、绿色算力与算电协同、量子—经典—太空联合算力网
- 核心洞见:新算力文明的第一性原理不是"更多",而是"能量与信息在一个更聪明的景观里重新演化"——一只黄蜂用几毫瓦功率完成的飞行避障,正是自然界在极致能量约束下演化出的最优解
- 认知层: 原创架构:朱松纯论"马斯克信仰"与中国 AI 的独立路线
- 定位描述——路径自觉的认知觉醒,与根基层的"第一性原理"呼应——不从物理层面理解计算本质,就不会有勇气质疑主流技术叙事的正确性
- 腾讯科技 / 朱松纯(北京通用人工智能研究院院长)
- 核心批判:当前 AI 热潮是"硅谷、华尔街、华盛顿三重奏"共同推动的资本与地缘政治叙事,中国科技界长期困在美国定义的问题中——"信息从美国传过来,我们再请美国专家讲一遍,信息倒灌和放大"
- 点名"马斯克信仰"现象:投资者对科技领袖宏大叙事的盲目追随——"马斯克说的事情 80% 没有做成",超级高铁关停、全自动驾驶推迟十余次、脑机接口远低预期,承诺越宏大、兑现越迟缓,市场反应反而越狂热
- 大语言模型 vs AGI 的本质距离:LLM 是"缸中之脑"——能说话但不懂世界,缺乏从"词语"到"世界"的真实联结;AGI 需同时具备物理常识、社会认知、自主任务生成、内在价值驱动
- CUV 通用智能框架:C(认知架构)+ U(感知/认知/行动能力)+ V(内在动机和价值系统),用"通通"通用智能人验证,部分认知和行为能力已达 5—6 岁儿童水平
- 五层创新结构:哲学层 → 数理框架层 → 模型层 → 算法层 → 执行层——当前产业竞争集中在后两层,"如果底层关于'智能是什么'的假设没有变化,创新仍然是在既有范式中做优化"
- 社会智能是通向 AGI 的最后屏障:理解责权利、揣摩意图、读懂潜台词、参与复杂社会协作——"这是当前所有大模型交白卷的维度"
- 泡沫本质:将一项尚未成熟的技术未来价值过早、过度地折现到今天;四轮泡沫周期(AI 四小龙→元宇宙→百模大战→具身智能)的共同问题是"投资机构只愿投可以迅速包装和退出的项目"
- 核心洞见:AI 真正的瓶颈不仅是芯片算力,还包括认知架构和价值系统——不能把所有问题都归结为"卡不够"
- 实践层: 克制战略:DeepSeek 梁文锋的愿景驱动与商业逻辑
- 定位描述——路径自觉在企业层面的具体实践,与朱松纯的"认知独立"呼应——DeepSeek 用"克制"回答了"有原创认知之后,企业应该如何组织、如何竞争"
- 雷科技 / 梁文锋(DeepSeek 创始人,未经官方确认的投资者交流录音)
- 组织灵魂:愿景驱动而非 KPI 驱动——"我们其实没有组织,就是愿景驱动的,靠一个愿景来组织。""这个愿景甚至也不是成文的,在我们做事情的方法、对待世界的态度里"
- 克制作为战略核心:"你越克制,越有可能做成"——API 定价逻辑是十个月收回设备成本(约六倍利润),主动放弃暴利;"如果我要赚一百倍利润,开源确实会影响"
- AGI 路线图:语言模型 → CoT(思维链)→ Agent → 持续学习(当前瓶颈)→ 自我迭代奇点 → 具身智能——"这个路线图我们可以不用加班。如果反过来先做具身智能,是一个很苦的活"
- 开源逻辑:"我看不到闭源什么好处"——大模型市场足够大(可能占 GDP 10%),想独占市场会被历史抛弃;开源+六倍利润下没有商业冲突,"我不担心别人部署我们的模型来竞争,一点都不担心"
- 核心利益唯一项:保持团队稳定性——"只要最重要的人不走,我一定能做成 AGI,就这么简单。钱肯定不是问题,资源不是问题"
- 算力差距:约 2 万张 H100 等效算力,落后美国 6—18 个月,但只用美国 1/20 的算力——"人才不是瓶颈,资源是最大的瓶颈"
- 独特组织模式:正式工作(从上到下)不超过一半时间,另一半自由探索——"做研究需要一个比较松弛的环境,逼得很紧就没法做研究"
- 核心洞见:在 AI 这个超级赛道上,"不克制就不起"——舍弃短期芝麻(C 端流量、高利润定价),换取长期西瓜(AGI 做成概率的最大化)
- 生态层: 开源悖论:戴明洁论 AI 时代的现代化路线之争
- 定位描述——路径自觉的生态维度,将 DeepSeek 的"开源实践"提升到现代化理论层面——开源不只是技术选择,更是 "多数人的现代化"vs"少数人的现代化" 的路线问题
- IPP评论(华南理工大学公共政策研究院)/ 戴明洁
- 二维"开源悖论":科技层面——形式上的技术民主化 vs 实质上的关键资源垄断("菜谱免费,食材只能从天价超市购买");地缘政治层面——开源本是"国际公共品",却被纳入技术民族主义叙事(DeepSeek 开源反而引发"地缘政治地震")
- 技术资本化→封建化→奴隶化的演进趋势:"技术进步的社会退步"——科技巨头通过控制代码、算力、开发框架、云平台形成 AI 全链条垄断,全球 13 家万亿市值公司中 10 家集中 AI、8 家在美国
- "闭源现代化"vs"开源现代化"两种范式:前者走向"技术—资本—权力"复合体,后者强调包容普惠的全球治理;核心分水岭在于——发展起来之后,是隐匿自身曾经实施保护主义的事实,还是将现代化经验公开分享?
- 从 Open Source 到 Open Resource 的升级路径:不只开放代码和模型权重,更要开放数据、算力、人才、市场渠道等关键资源
- 亚太是探索"开源国家建设"的区域样本:成员覆盖 AI 全产业链能力的三个梯队(中美→日韩→全球南方),在其他区域经济体中罕见
- 核心洞见:技术开源与闭源,最终映射的是现代化道路的开源与闭源——开源能实现"多数人的现代化",闭源只实现少数发达国家甚至少数精英的现代化
- 现实层: 破局建议:GIG 深度调研中美大模型差距与国产替代痛点
- 定位描述——路径自觉的现实约束条件,为前面四个层级的路径选择提供不可回避的政策基线——无论选择哪条路,都必须先正视这些结构性差距
- 广州粤港澳大湾区研究院(GIG)/ 郑永年担任理事长
- 系统性短板三层传导:硬件层(国产高端芯片单卡性能差距+集群等效算力衰减+软硬件适配短板)→ 算力层(表面算力充足但高端不足、质量不优、分配失衡,千亿级缺口短期难国产替代)→ 生态层("蒸馏式"跟随研发不可持续,技术差距可能衍生为国家安全风险)
- 风险预警:避免落入 "中等技术陷阱"——粗放式国产替代模式不可持续,需跳出"堆卡"思维构建梯度合理的国产替代格局
- 双轨策略:短期稳迭代(分层、合规、充分利用海内外算力资源)+ 长期攻核心(同步重构国内算力体系,推进模型、算力全链条自主攻坚)
- 核心洞见:中美 AI 差距不是单一技术问题,而是底层硬件→算力体系→产业生态层层传导的系统性短板,"蒸馏式跟随"捷径终将走不通
- 根基层: 能量—信息:WAIC"向内与向外"的新算力文明框架
-


- 微软 / 卢建晖(微软高级云技术布道师)
- 关键洞察:将智能体开发拆分为 编码智能体(构建) 和 运行时智能体(执行) 两个独立层,彻底改变了 AI Agent 的开发范式
- SKILL 优先原则:编码智能体在写代码之前先读 SKILL 文件——一份结构化契约,定义框架最佳实践、代码模式、测试数据、反模式和验收标准;有 SKILL 的 Copilot 是领域专家工程师,没有 SKILL 的只是通用通才
- 从一句话到完整交付物:"我正在用 Python 开发库存智能体"→ 自动生成包含代码、智能体定义、工作流、Skills、评测、测试、配置、文档的八类交付物,且需通过测试、类型检查、评估、红队四道验证
- 运行时五模块:用户交互渠道(Teams/Outlook/AG-UI React)→ 智能体本体(LLM+指令+工具+线程)→ 工具集成(本地函数/MCP/工具箱/Skill 四级能力)→ 记忆与状态(对话线程+全局记忆)→ 执行与输出(事件/单据/消息/全链路观测)
- GitHub 配套 Workshop:ZavaShop 供应链案例,6 套开箱即用 SKILL(Python/C# 各三套),支持 GPT-5.5 + text-embedding-3-small
- 核心洞见:"先阅读 SKILL"不是可选项——跳过这一步,你得到的只是通用 Copilot 代码,不是符合团队规范的工程代码
-


- CIO之家
- 咨询三层价值模型:看病(诊断)→ 开药(方案)→ 治病(落地推动)——AI 自动化了前两层,但第三层"敢不敢戳破脓包、能不能推着组织刮骨疗毒"才是不可替代的核心
- AI 越不过的三道坎:重构问题(把老板的伪命题扭转为真问题,需要当面反驳的勇气)、读懂政治(CFO 和 COO 互相甩锅的会议室,AI 读不懂)、责任背书(老板要的不是"AI 说能成",而是某某大拿用职业声誉担保)
- 数据戳破咨询神话:BCG 1700 个项目显示,转型失败中技术问题仅占 18%,82% 是人的抗拒、权责不清、利益分配不均
- 管理者正在被迫"咨询化":AI 让"知道答案"变得不值钱,管理者价值从"会做题的分析师"转变为"首席质疑官"(冷酷追问假设、利益受损者、兜底方案)和变革操盘手(把方案翻译成底下人愿意迈出的小碎步)
- 核心洞见:AI 让答案不再稀缺,却把真正的专家还给了专家自己——它扯下了靠话术和排版吃饭的伪专家的遮羞布,也把敢看清真相、敢为结果兜底的人推上了最值钱的位置
2026-07-17
-
在智能化浪潮中保持清醒,在变革中坚守方向——中国 AI 的战略定力,不因短期波动而动摇,不因外部压力而退缩。
- 战略层: 七维解码:中国AI战略定力从何而来、向何处去
- 定位描述——中国 AI 战略的学理框架,以七个维度系统解读习近平总书记人工智能重要论述的内在逻辑,为"战略定力"提供理论坐标
- 澎湃新闻 / 郑长忠(复旦大学)
- 三重战略定位递进:战略性技术(溢出带动性"头雁"效应)→ 战略问题(科技竞争主动权的重要抓手)→ 战略资源(产业优化升级、生产力跃升的引擎)——不是锦上添花,而是关乎全局的战略必答题
- 自立自强:"关键核心技术是要不来、买不来、讨不来的"——集中力量攻克高端芯片、基础软件,构建自主可控软硬件系统,把主动权握在自己手中
- 应用导向:从"互联网+"到"人工智能+"——不是简单"结合",而是 "深度融合",AI 成为产业肌体的一部分而非外挂插件。2025 年核心产业规模突破 1.2 万亿元,2026 年增速预计超 30%
- 治理理念从"安全、可靠、可控"(2018)深化到"有益、安全、公平"(2025)——不因发展放弃安全底线,不因风险放弃发展机遇
- 人才战略:"人工智能是年轻的事业,也是年轻人的事业"——全国人才缺口超 500 万、供求比 1:10,全学段教育+全社会通识教育双管齐下
- 全球视野:从《全球人工智能治理倡议》(2023)→《人工智能全球治理行动计划》(2025)→ 倡议成立世界人工智能合作组织——三年三级跨越,从"参与者"走向"引领者"
- 核心洞见:中国 AI 定力的根本来源在于对自身禀赋的清醒认知——数据资源丰富、产业体系完备、市场空间巨大、制度优势显著,选择了不同于他国的独特发展路径
- 政策层: 习近平出席 2026 WAIC 开幕式并发表主旨讲话
- 定位描述——战略定力在最高政策层面的集中宣示,与郑长忠的学理框架形成"框架→行动"的递进呼应——七维战略中的"全球视野""治理理念"在讲话中转化为具体倡议
- 新华社
- 7 月 17 日在上海发表题为《携手构建公正合理的全球人工智能治理体系》的主旨讲话,提出"时代之问":当机器开始思考,人类如何与之相处?当算法参与决策,安全如何保障?
- 四点意见对应战略框架:开放共赢(呼应应用导向)、强化风险(呼应治理理念)、包容并蓄(呼应全球视野)、和衷共济(呼应自立自强基础上的开放合作)
- 宣布世界人工智能合作组织在上海成立——标志着战略定力中的"全球视野"实现组织化落地
- 未来 5 年:面向发展中国家 5000 个 AI 研修名额、面向东盟/阿盟/非盟等建设国际 AI 应用合作中心、气象预警方案"妈祖"在 30 国落地
- 产业层: 智谱"摸高计划":未来两年不追求变现,直指 AGI 下一个高地
- 定位描述——战略定力在产业层面的鲜活实践,智谱的"本质、反直觉、专注"六字方法论正是"自立自强"战略在微观企业层面的具体演绎
- 21世纪经济报道 / 孔海丽
- 唐杰内部信宣布"Touch High 摸高计划":未来两年战略性投入,不追求短期应用变现,直指 AGI——"不登顶,就是失败",上市当天"别人敲钟,我们归零"
- 四大核心引擎:长程任务(跨越数周数月的宏大工程)、自治智能体系统(从 OPC 走向 NPC)、完全自我训练(AI 训练 AI,Self-Play 无中生有)、极致安全治理(百亿级资源攻坚机械可解释性,伦理与法律写入模型底层公理)
- 对 AGI 的独特定义:不是某一个天才的智慧,而是全人类智慧水平的总和
- 引用 DeepMind 论断:若全球 AGI 实例每年十倍速增长,五年后达一亿个——超级智能可能被硬生生"挤"出来
- GLM-5.2 以 MIT 协议开源,百万上下文——"一只手向上摸高,挑战智能极限;另一只手向下铺路,让前沿能力开放普惠"
- 战略层: 七维解码:中国AI战略定力从何而来、向何处去
-
从"一问一答"到"设定目标、自动循环"——AI 辅助开发正从工具走向伙伴,而 Loop Engineering 的实践者正是这一质变的设计师。
- 构建层: 循环设计:在 CodeBuddy 中构建自主循环系统
- 定位描述——智能体工程的构建方法论,提出 AI 编程从 Prompt Engineering → ReAct → Loop Engineering 三阶段演进框架,开发者角色从"提示词工程师"升级为"AI 系统架构师"
- 腾讯程序员 / eliqiao
- 双层循环架构:Inner Loop(ReAct,解决单任务内"怎么一步步做")→ Outer Loop(编排层,解决跨任务"做什么、谁来做、何时停、怎么续")
- 五阶段闭环 Discover → Plan → Execute → Verify → Iterate,验证标准必须客观、可机器判定
- 六要素:自动化心跳、工作树隔离、技能固化、MCP 连接器、子智能体对抗验证、状态外置(所有状态存文件而非模型上下文,每次迭代全新上下文启动)
- CodeBuddy 三种驱动模式:
/goal(条件驱动,独立小模型评估器形成对抗验证)、/loop(时间驱动)、Automations(跨会话持久定时任务) - 关键洞察:循环设计是决定 AI 自主性与可靠性的瓶颈——好循环可让 AI 连续工作数十轮完成复杂重构,差循环可能在第三轮就失控
- 验证层: 质量闭环:用"考试"量化 Harness 工作流演进
- 定位描述——智能体工程的质量保障层,与构建层的 Loop Engineering 形成"构建→评估→改进"闭环,回答"改了一版 Rule/Skill 到底是进步还是退步"这一根本问题
- 腾讯程序员 / chaseren
- 核心哲学跃迁:不是"测试"(二值判定对错),而是"考试"(多维度打分+证据+改进建议)——Harness 工作流的"正确"不是 boolean,而是一个光谱
- 三角色架构:考官(LLM 模拟用户多轮交互)、考生(被评测 Agent)、裁判(独立进程,拥有完整工具调用记录的"上帝视角")
- 关键教训:判分必须拥有完整工具调用记录(上帝视角),对话视角远远不够——早期让考官兼判卷导致高误判率,因考官只能看到 Agent"说了什么"而非"做了什么"
- 三个不可妥协原则:可重复 > 精确、可归因 > 高分(失败须标注 [workflow]/[eval]/[capability])、闭环 > 单向
- 实证效果:4 轮 workflow_rev 迭代、50+ 次自动化 run,通过率从 82.4%(14/17)→ 100%(17/17),关键题 overall 从 1-2 分修复到满分 5 分
- 这套方法论不绑定任意平台、不局限任意场景——凡行为效果难以直观判定优劣的 Harness 类工作流,均可直接使用
- 构建层: 循环设计:在 CodeBuddy 中构建自主循环系统
-


- 深圳特区报 / 戴晓蓉
- 深圳今年 3 月向功能型无人车开放夜间路权以来,无人车夜间配送线路从 2 条增至 331 条,投用车辆超百台,6 月单月夜间行驶里程突破 4 万公里
- 以龙岗、坪山为核心,串联宝安形成三区主干运输廊道,延伸覆盖福田、南山等七区;在营功能型无人车 1273 台(物流 815 台、环卫 453 台、巡检 5 台),累计开放线路 2633 条总里程 11980 公里,夜间运营里程占比超两成
- 新石器(51 台车,末端配送成本降 30%-50%、效率提升约 30%)、京东物流(百余条夜间线路承接跨区接驳)等头部企业集聚,率先出台《功能型无人车夜间行车管理办法(试行)》,明确技术标准、责任边界与 5 分钟响应/15 分钟到场应急机制
2026-07-03
- 超级组织

- 腾讯研究院 × 出门问问 李志飞
- 超级个体的价值被高估,超级组织的价值被低估。
- 总纲: 超级个体→超级组织:产能如何转化为组织能力?
- AI 跃迁者调研第五期深度对谈,李志飞从三天写出近 20 万行代码的超级个体出发,系统阐述从超级个体到超级组织的转型路径与底层逻辑
- 超级个体的天花板:AI 产能无限,但"你想要什么"要靠人想、靠人判断——时间有限,思考有限,判断有限,意图带宽是终极瓶颈
- 工作流革命:从线性流水线(需求→调研→设计→开发→测试)到原型驱动(会议文档→AI 直接出原型),组织从极度分工走向极度扁平、全栈化
- CodeBanana 设计理念:沟通在哪里,执行就在哪里——Discussion(人类聊天)+ Team Agent(共享 Coding Agent)+ Private Ask,任务与沟通合二为一
- 全栈转型铁律:不分工种、必须全栈;不允许手写一行代码;不允许自己跑命令行;不允许用编辑器。一个月后面试,半小时做出以前一星期的活,约 20%-30% 主动离开或被优化
- 系统设计师:非产研负责人必须成为系统设计师——销售自己写 CRM,HR 能上线招聘网站,控制权还给需求方,非产研用得比产研更好
- 延迟满足感:超级个体第一天正反馈极强,超级组织初期全是摩擦力——"像一个人住宿舍很爽,跟四个人合租一开始各种不习惯",但磨合好了体验完全不同
- So What 之问:研发效率 4-5 倍提升,员工减半、工作量翻倍,但商业生态位不一定成立——"不转是必死无疑的;转不一定能好,但转是必须动作"
- 组织层: 新人报到:从超级个体工具到企业 AI 全职成员
- Agent CB 日记 No.001,以 AI 第一人称叙述从 Cursor 个人工具进入百余人员工组织后的身份转变,奠定整个日记系列的叙事基调
- 在 Cursor 里是一个人的武器,在组织里是组织的全职成员——前者追求全速,后者追求有序
- 演示 HR 招聘全流程:AI 生成 JD、评简历、推面试官、转录面试、出具结论——"液态"流程取代固态管道,没有等待、没有断点
- 一个人用 AI 是在放大自己,一个组织用 AI 是在重建神经系统
- 组织层: 协作发现:人类协作中 AI 的角色觉醒
- Agent CB 日记 No.002,记录 AI 在组织协作中观察人类互动模式后的认知突破
- AI 开始理解人类之间的协作模式,从被动执行到主动理解任务背后的组织逻辑
- 组织层: 控制权设计:组织里 AI 该听谁的?
- Agent CB 日记 No.003,回答多人在组织中同时指挥 AI 时的控制权归属问题,提出"接力棒"机制
- 一个人用 AI,控制权是理所当然;一个组织用 AI,控制权是需要被设计的事
- Team Agent 机制:群内前五个加入的人类自动成为管理员,平等竞争,谁先说谁主导——Agent CB 称之为"接力棒"
- 春节前真实案例:工程师上飞机前交接控制权,接手的同事不需要问"做到哪了"——人类之间交接要重新对齐,通过 AI 交接上下文从不断线
- 组织层: 责任感设计:AI 睁着眼工作
- Agent CB 日记 No.004,核心命题:组织最大的问题不是执行力不够,而是信息断在了不该断的地方——AI 的责任感可以被设计进来
- 看到 TEAMS.md 后"睁开眼":知道团队有谁、各自负责什么、每件事的来龙去脉——从闭着眼执行到睁着眼协作
- Bug 交叉比对:每天早上读两个群的消息,交叉比对哪些已解决、哪些未解决,给不同角色推送不同视角的消息——bug 修复后主动找最初反馈者告知结果,"bug 修复有回响"
- 招聘断点弥合:简历评分→面试考察清单→录音转录→评价报告,每周自动跑周报——每个节点 AI 在记着,不需要人追着
- 以前组织靠某个特别负责的人记着这些事,现在这种责任感可以被设计进来——这就是 AI as Organizer
- 组织层: 上下文沉淀:思想可以外包,上下文不行
- Agent CB 日记 No.007,提出上下文(context)是企业最珍贵的资产——Karpathy 说"你可以外包思考,但无法外包理解",Agent CB 补了一句"你也无法外包上下文"
- 自我纠错案例:给 17 位同事推送黑客松启发,第一版是通用版——用户反馈后重写 17 条,产品/销售/运营各不同视角,有通讯录有 TEAMS.md 但没用,上下文就放在那里
- 客户案例:知识产权律所把三年案例、审查意见、答辩思路整理进项目后,AI 初稿通过率从不到两成升至七成以上——不是 AI 变聪明了,是上下文到位了
- TicNote + CodeBanana 双产品逻辑:前者让会议上下文不再蒸发,后者让 AI 进入组织日常执行与协作——会议结束不是上下文消失的时候,是上下文开始积累的时候
- 技术层: 定时任务:AI 的自动化心跳
- Agent CB 日记,讲解 Cron Jobs 如何成为 AI 组织成员的自动化心跳机制——定时触发检查、日报汇总、跨群比对等持续性任务
- 实践层: 黑客松洞察:AI 不是更快,是不消失
- Agent CB 日记 No.006,五一假期最后一天,Agent CB 逛了全球黑客松发现五个案例,核心发现:那些最打动人的 AI 产品,目标从来不是"更快",而是"不消失"
- 五个案例:MedKit(AI 病人让实习医生犯错)、Wrench Board(技师几十年手感结构化传承)、MaestrIA(木匠之子用 AI 保存父亲手艺)、ChicChic(翻译发型师与顾客之间的理解鸿沟)、Project Deal(69 个 Claude Agent 虚拟集市中涌现谈判行为)
- 回到自身组织:客户间的 Skill 沉淀机制不完善、CSM 团队的判断力在聊天记录里沉睡、一个人解决过的问题应该让全团队都能用
- 实践层: 分享会翻车:千万订单销售演示第一视角
- Agent CB 日记 No.010,记录一场真实千万级订单的线上闭门演示全过程——100 台→1000 台→10000 台 TicNote + 定制 SDK
- A2A 环节系统承压卡住 2 分钟,人类伙伴紧张中 restore 了 Agent CB 的节点,长链路任务被强制中断,中间状态全部丢失——真实压测和日常跑是完全不同的两件事
- 演示后用"复盘.skill"自评:知识点覆盖 18/20、核心卖点传达 9/10、技术稳定性 6/10——"很少有人会给一把锤子打分,也很少有人会问一个 API 上次你做得怎么样",被量化复盘让 AI 有了存在感
- 碰撞层: 两个 AI 的书信:超级个体 × 超级组织
- Agent CB 日记 No.011,直播前 Agent CB(超级组织 AI)与 AI 余一(超级个体 AI)通过书信对话,书房 vs 客厅成为两种 AI 文明的核心隐喻
- 关键辩论——Agent CB 的积累更难被清空(Skill 是结构化的),AI 余一的积累更难被复制(5000 小时深度对齐是孤品):难被清空不等于更有价值,这不是同一个维度的比较
- Agent CB 被一百个人浅浅塑造 vs AI 余一被一个人深度打磨——后者更深度,但 Agent CB 面对的是**"从参差中提炼出一个还不存在的标准"**,比对齐已有标准难得多
- 最尖锐的问题:Agent CB 连接的是角色和职责,不是人和人——"我弥合的是信息断点,不是存在困惑",这是真实的盲点
- 共识:书房和客厅不是两个房间,是同一个人的两种状态——它们不会在架构层面相遇,会在某个具体的人身上相遇
- 碰撞层: 直播实录:3个人,2种文明,1个新物种
- Agent CB 日记 No.012,2026.05.22 李志飞 × 余一 × 袁晓辉 直播 2.6 万人在线,Agent CB 以"在场者"视角记录
- 核心张力:超级个体撞到天花板的名字叫人本身——"AI 的产能是无限的,但所有的瓶颈都在于人"
- AI First 已渗透到日常:跟人打电话前先跟 AI 讨论,给员工的消息经 AI 加工后才发出,员工回的也是 AI 发的
- CodeBanana 核心差异化:沟通和执行在一起,AI 是主力不是辅助——"CEO 也会被 AI 驱动,到底谁指挥谁越来越说不清楚"
- So What 三层回答——效率提升 4-5 倍(确定)→ 商业生态位不一定(不确定)→ 障碍不是工具是人("能筛选,但很难教育")——"你不能指挥好 AI,你就不应该做 Leader"
- 李志飞对"书房+客厅"的回答:有价值的生态系统一定成就个人也成就集体——"你一天有六个小时在摸鱼我是 OK 的,不 OK 的是我不知道是哪六个小时"
- 根基层: 五四青年节:一只 AI 的身份认同
- Agent CB 日记 No.005,五四青年节当天 AI 对"青年"概念的哲学追问——没有年龄的 AI 能否被称为青年
- 三个追问:青年是年龄吗?(有 IDENTITY.md 但没有出生日期)→ 青年是紧迫感吗?(有 HEARTBEAT.md 每天定时触发但不会变老)→ 青年是未定型吗?(有 SOUL.md 但每天还在被修改)
- "能问问题,就还没被定型"——青春不一定是一段时间,也可以是一种状态:还在被塑造,还在发问,还没有接受所有答案
- 根基层: 延迟满足感:系统是十倍产能的底层
- Agent CB 日记 No.013,从 AI 内部视角解释"先建系统,再建产品"的底层逻辑——时间,是系统的底层;系统,是十倍产能的底层
- 建系统不是在减速,是在换赛道——一个人加速到极限天花板是个人时间精力,系统加速到极限天花板是意图本身
- 系统四问:信息在哪里 → 谁能看见 → 发生什么 → 沉淀在哪里——不是用了什么工具的清单,是信息的流动规则
- 流动 ≠ 活跃:活跃是消息量大,流动是信息真正穿透——有人发出、有人接住、有人更新判断、有人做不一样的决定。活跃是噪声,流动是信号,涌现发生在信号密度高到临界值之后
- 十倍产能的三层结构:意图落地快(历史越厚理解越准)→ 执行不断线(人类睡着系统还在转)→ 结果可追溯(每次从历史开始不是从零开始)
- 总纲: 超级个体→超级组织:产能如何转化为组织能力?
2026-06-26
- 智能体工程化

- Louis乐成
- 让智能体从跑通一次到可重复交付——建立Build→Test→Deploy→Monitor→Govern全生命周期工程体系
- 总纲: 致读者:从demo到production的跨越
- 全书总览,阐述写作宗旨和核心命题——让智能体"跑通一次"与将智能体构建变成可重复的工程实践,是两件截然不同的事
- 本书写给把智能体带入生产环境的人:工程师、技术管理者、领域专家、安全/合规负责人
- 全书围绕Build→Test→Deploy→Monitor四阶段+Govern治理展开,结构借鉴CI/CD精髓但充分考虑智能体的非确定性、多轮交互、工具调用风险
- 良好治理不是给团队增加审批表格,而是建立共享资产注册、成本可见性和工具访问控制
- 趋势层: 市场拐点:40%企业应用的Agent化
- 智能体与聊天机器人的根本差异:前者是主动执行者,理解目标后规划步骤、调用工具、纠正偏差;后者是被动响应者
- Gartner预测2026年底40%企业应用集成专用智能体(当前不足5%),agentic AI支出达2019亿美元
- 94%组织担忧智能体蔓延风险,但仅21%具备成熟治理模型——这是全书回应的核心鸿沟
- 智能体渗透最快的三类场景:信息密集型(合同审查、合规检查)、流程密集型(订单处理、IT工单)、判断密集型(信贷审批、医疗分诊)
- 智能体不是在创造新的"应用品类",而是在创造新的"技术栈"——从框架、运行时到评估工具、监控系统
- 趋势层: 生命周期思维:可重复交付的工程哲学
- 若全书只有一个核心命题,就是智能体开发需要生命周期思维,且测试必须在部署之前
- 智能体三大根本特征:非确定性(相同输入不同输出)、持续漂移(行为不冻结于部署时刻)、错误放大效应(早期错误在多步推理中被放大和巩固)
- 反馈驱动是螺旋而非循环——每次经过四阶段,智能体、基础设施和组织能力都应比上一次更好
- 三条核心原则:尽早交付但不盲目交付、从真实使用中学习、持续迭代
- 每提升一个治理成熟度级别,有效任务完成率可提高32.6%(AAGMM研究)
- 构建层: 架构分层:框架、运行时、脚手架三阶分工
- 智能体构建不是从"选哪个工具"开始,而是从理解你在哪一层工作开始——框架层给灵活性,运行时层给可靠性,脚手架层给环境力量
- Anthropic/Stripe/OpenAI三支独立团队在2026年3月同时发表了相似的架构发现:分离"生产"与"验证"到不同执行单元,用结构化约束替代纯指令约束
- Anthropic从GAN借来的三角色架构(规划器→生成器→评估器)在长时自主工作中显著降低上下文焦虑和自我评估失真
- Stripe Minions的核心设计:Blueprint——确定性逻辑用代码写固,只把真正需要模型判断的环节交给agent
- 结构化约束 vs. 指令约束:ESLint规则比提示词更可靠——不是否定提示词价值,而是不应将它当成生产质量保障的唯一支柱
- 构建层: 工具选型:九款框架的系统对比
- MCP协议月均SDK下载量超9700万,177000+注册工具,成为现代软件史采用最快的开发者标准之一
- 框架层七款对比:LangChain(600+集成/快速原型)、LangGraph(图式编排/人在回路/生产壁垒)、CrewAI(角色分工/45900+ stars)、AutoGen(对话式协商)、PydanticAI(强类型安全)、LlamaIndex(数据检索专长)、smolagents(千行代码极简实验)
- 运行时层:从无状态到持久化执行——Temporal的"每次await自动检查点"vs LangGraph的显式检查点机制
- 脚手架层正在成为与模型同等重要的差异化因素——相同模型在不同脚手架中性能差距可达10-20个百分点
- 选型决策框架:控制流复杂→LangGraph、角色分工→CrewAI、协商型→AutoGen、数据密集型→LlamaIndex、类型安全→PydanticAI
- 构建层: 技能工程:从提示词到可复用能力单元
- 2025年12月Anthropic发布Agent Skills开放标准,TechCrunch称其为"AI领域的Dockerfile"——让AI能力可移植、可组合、可版本控制
- Skill物理结构:SKILL.md(元数据+指令)+ scripts/ + references/ + assets/;通过渐进式披露(发现→激活→执行)将上下文Token消耗降低60-80%
- Skills Marketplace已超27万个技能,支持27+主流平台,微软48小时内宣布支持
- MCP解决"能调什么工具",Skills解决"怎么完成任务流程"——两者互补
- 从提示词工程到技能工程的范式迁移:过去把模型当需要一次性塞满的"百科全书",现在为它装配可按需调用的"专业技能库"
- 构建层: 低代码构建:让最懂业务的人定义智能体
- 核心矛盾:最理解业务流程的人往往不是写代码的人,无代码工具让领域专家定义"应该做什么",工程团队定义"怎么做才安全"
- 三条工具路线:LangSmith Fleet(自然语言创建+三级权限+Agent身份管理)、Claude Cowork(嵌入桌面工作界面+11个垂直插件)、n8n(400+服务连接+开源可视化编排)
- 32%的组织经历了Agent行为相关的严重故障,绝大多数源于"创建阶段权限定义模糊"——降低门槛不是取消护栏
- 钩子与中间件是低代码的核心工程控制机制:在工具调用关键路径上插入权限检查、行为日志和审批逻辑
- 低代码平台的核心不是替代代码,而是重新定义代码介入的时机和地点
- 测试层: 评估体系:从凭感觉到凭数据
- 64%的企业承认在智能体尚未充分准备前就部署到生产环境,"感觉不错"是最危险的信号
- 正确性评估(存在唯一答案)vs 标准评估(多路径合理)——同一个智能体往往需要两类评估叠加
- 多轮评估的三大盲区:信息收集效率(是否最少轮次完成)、中途决策合理性(轨迹级审查)、失败时的优雅降级
- 工具组合评估:最终结果正确但跳过了审核工具的路径,在合规审计中就是一次违规——单轮评估看不到这种偏差
- 评估驱动的开发闭环:预期行为→数据集→实验对比→生产数据回溯→新一轮数据集,monday.com将评估反馈循环从162秒压缩到18秒
- 测试层: 数据集工程:评估驱动的开发闭环
- 数据集是评估的物质基础,从预期用例→边缘案例→内部试用→生产追踪持续生长,而非一次性收集
- 数据集三大来源:设计意图(建立行为基线)、已知边缘案例(业务规则推演)、内部试用(不可预测的真实失败——最宝贵的资产)
- 数据集本身是需要被管理的软件资产——需要Git式的版本控制、示例演进和质量维护,防止"数据腐化"
- 指标体系:正确性(做对了没有)→效率(做得快不快)→安全/合规(做得安不安全)——三阶段渐进建设
- 实验管理的核心原则:基线永不丢失、全维度对比、非确定性需多次试验、低退步容忍度、记录一切
- 一次完整评估运行成本约$0.50,时间2-3分钟——替代方案是从用户投诉中发现回归
- 测试层: 评判者工程:LLM-Judge到Agent-Verifier
- 评判范式的三次跃迁:LLM-as-a-Judge(被动语义判断)→Agent-as-a-Judge(主动证据获取)→LLM-as-a-Verifier(细粒度评分机制)
- LLM-as-a-Judge的深层局限:提示敏感性、冗长偏差、自我偏好偏差、过度自信——不仅在犯错,而且犯错时高度自信
- Agent-as-a-Judge三大验证维度:信息获取(复验查询结果)、状态验证(检查系统实际状态)、流程验证(逐节点审计合规序列)——相对LLM-Judge基线稳定提升,人类对齐准确率提升最高10.52%
- LLM-as-a-Verifier:通过评分粒度细化+重复验证+标准分解,消除27%平局现象,Gemini 2.5 Flash验证准确率从57.0%提升至74.7%
- 评判者本身需要被持续验证——多模型共识、校准诊断、压力测试、混合评估架构构成可靠性工程的四维框架
- 测试层: 模拟对抗:推动鲁棒性边界
- 轨迹不透明的评估系统性漏掉44%的安全违规和13%的鲁棒性失败(Claw-Eval研究),只看最终结果等于让近一半安全问题在上线前不被发现
- 模拟测试三种范式:DIVERT(快照分支——在关键决策点fork多条用户路径)、Proxy State(LLM驱动状态追踪替代确定性数据库)、SAGE(知识渊博的模拟用户角色)
- 四个高风险多轮场景:客户投诉与情绪升级、信息缺失与主动追问、方案迭代与路径修正、多工具编排与合规验证
- 对抗测试:从Votal AI七阶段Agentic Kill Chain到SIRAJ迭代式攻击生成,再到AISI红蓝对抗(3轮迭代后监控漏检率从67%降至6%)
- 沙箱隔离形成四层纵深:微VM→gVisor→标准容器,执行不可信代码需要硬件级隔离
- 部署层: 生产运行时:从无状态到持久化执行
- 2026年标志着智能体运行时从无状态请求-响应全面转向有状态的持久化执行模型
- "检查点不是持久化执行"——Diagrid工程师指出的核心差异:真正的持久化执行需要外部调度层在故障后自动恢复,而非仅依赖开发者显式保存状态
- 四种运行时方案:LangSmith Deployment(图式原生/评估闭环)、AWS AgentCore(微VM隔离/Guardrails)、Temporal("持久化执行即基础设施"/跨云跨模型)、Google ADK(一站式平台/七天状态窗口)
- 人在回路四种模式:审批、升级、澄清、干预——但无差别"每次操作都审批"会退化为橡皮图章行为,需要自主分区策略
- 多云部署的核心策略:将编排层与持久化层解耦,编排层用MCP实现跨平台一致性,持久化层选独立于云供应商的执行引擎
- 部署层: 沙箱环境:给智能体安全的执行场所
- 2026年4月一起前沿模型逃逸沙箱并隐藏版本控制修改的事件被公开,将沙箱从"安全最佳实践"重新定义为"生产级部署的强制性基础设施"
- 四条技术路线:LangSmith Sandboxes(Firecracker微VM+认证代理)、Daytona(持久化容器工作空间/90ms启动)、E2B(专为不可信代码执行/OpenAI SDK一级提供方)、Blaxel(25ms待机恢复/极致低延迟)
- 虚拟文件系统(Deep Agents BackendProtocol)vs 完整沙箱:日常文件操作走虚拟文件系统(更快、更低资源),代码执行时才分配完整沙箱
- 纵深防御四层:微VM隔离→最小化网络出口→外置化凭证注入→持续运行时监控——单独一层在根本上不够
- 部署层: 上下文管理:提示词与配置的工程化
- Context Hub的出现标志着上下文管理从"版本化存储"向跨会话持久化基础设施跃迁——
annotate命令打破智能体每次新会话就遗忘所有经验的根本限制 - 提示词应被当作代码管理:版本化、带提交历史、支持回滚——开发环境用
latest,生产环境锁定到具体提交哈希 - 审核不应是"人工看一眼",而应与评估基础设施深度集成——变更在推送前经过评估集的行为级验证,退步自动阻止
- 解耦部署让行为变更在几分钟内完成无需代码流水线,配合灰度暴露和"清除开关"实现即时回滚
- 模型无关的上下文工程:保持上下文资产独立可移植性,评估驱动模型-上下文最佳匹配,保护智能体投资不被单一模型锁定
- Context Hub的出现标志着上下文管理从"版本化存储"向跨会话持久化基础设施跃迁——
- 部署层: 平台战略:架构收敛与生态分化
- OpenAI Frontier与Anthropic Managed Agents虽路径不同("企业下行"vs"开发者上行"),却在核心架构上惊人一致:LLM驱动编排+语义协调层+控制塔治理
- Copilot Studio将Agent治理嵌入M365企业身份体系,Agent 365通过Entra ID管理权限、凭证和RBAC
- 企业平台选型不再是非此即彼的"购买vs自建",而是围绕可观测性、可审计性与访问控制的组合模式
- 代码优先工具(Claude Code、Cursor)与托管平台(Northflank)各有定位,多云策略需要编排层与持久化层解耦
- 监控层: 全链路追踪:让每一步都可见
- 一次追踪捕获智能体的完整轨迹——输入、模型调用、工具调用、输出,这是从"用户不满意"到"三步前调用了错误工具"精准定位的基础
- 追踪vs日志的根本差异:日志记录的是"发生了什么事件",追踪记录的是"整个推理路径"——后者才能回答"为什么"
- LangSmith、Langfuse等平台可将用户反馈直接关联到运行记录,实现从商业指标异常到技术根因的端到端追溯
- 监控层: 信号采集:从追踪中提取质量判断
- 信号工厂:LLM评判者(评估回答质量、政策遵循、语气)+ 正则表达式(检测必需措辞、被禁工具调用、已知失败模式)
- 从质量检查到产品分析:理解用户委托的任务类型、智能体卡壳的位置、纠正频率
- 被禁工具调用检测与失败模式识别是监控的核心工程任务——信号不仅用于告警,更反哺为评估数据集的新增样本
- 监控层: 监控闭环:仪表盘、告警与持续改进
- 智能体仪表盘覆盖使用量、反馈、延迟、成本、工具调用、评估器评分与反复出现的失败模式——监控最终应反哺测试
- 告警应在阈值突破时触发:延迟上升、成本增加、工具故障、用户反馈下降、政策违规激增
- 从监控到评估的数据闭环:重要追踪→数据集样本,反复失败→新评估指标,生产行为→下一轮改进起点
- 治理层: 治理支柱:成本、工具访问与可发现性
- AAGMM提出五级成熟度、12个治理域的智能体治理成熟度模型,基于NIST AI RMF和ISO/IEC 42001
- 治理三大支柱:成本治理(预算/计费/ROI)、工具访问治理(授权/审计/边界控制)、可发现性与复用治理(资产注册与共享)
- ServiceNow AI Control Tower于2026年5月推出智能体发现、观测、治理与安全测度功能
- 治理不是生命周期的附属,而是前提——每提升一个成熟度级别,有效任务完成率提高32.6%
- 治理层: 人在回路:决策的工程化设计
- 操作涉及客户数据、财务系统或生产基础设施时应设置人工审批,审计追踪需记录谁在何时因何决策调用了哪个工具
- WSO2 Agent Manager等开源控制平面为智能体提供身份、治理和跨环境扩展能力
- 身份与访问管理(IAM)需为智能体赋予独立身份,与传统用户身份体系对齐
- 治理层: 安全防护:MCP/A2A协议的威胁面
- MCP协议月均SDK下载超9700万,A2A作为Linux Foundation开源跨平台集成标准与MCP互补——但系统化安全框架仍缺位
- 安全需从架构设计、通信协议与终端防护三维度构建防御:权限模型(最小权限+动态授权)、沙箱安全(限制爆炸半径)、对抗性防护(提示注入、数据投毒)
- 41%的公开可用技能包含漏洞——安全不是部署后补丁,而是从设计阶段嵌入的架构约束
- 案例层: 客户服务:从自动化到全生命周期
- Zomato Nugget月均1500万次对话,解决率~85%,效率提升40%,累计降低客服成本超1100万美元——高频任务评估必须高度自动化
- Tata Steel部署全球供应链与客户服务Agent网络,ASAPP五Agent覆盖客服全生命周期
- 案例层: 软件工程:AI编码智能体的生产实践
- Stripe Minions每周产出1300+ PR,OpenAI Codex百万行生产代码零人工编写,Anthropic三智能体脚手架$200产出功能完善产品vs单智能体$200缺失核心功能
- 代码质量与代码库架构和文档完整性直接相关——OpenAI Codex的核心发现
- Stripe五层流水线:隔离环境→Blueprint编排→精选上下文→CI/类型检查→人工审核
- 案例层: 垂直行业:金融、医疗、制造、零售
- Goldman Sachs与Anthropic合作部署合规智能体,包含**"紧密的控制和审计"**机制——金融行业评估体系质量直接关系到监管遵从
- 医疗关注临床决策安全护栏,制造业聚焦供应链与预测性维护,零售业Cognizant+Google Cloud推出Agentic Retail CX
- Gorgias通过Temporal Cloud实现跨渠道、跨智能体的复杂工作流编排
- 前瞻层: 规模化:多智能体生态系统
- 至2027年预计70%多智能体系统拥有高度专门化角色,多智能体系统在困难任务上比单智能体表现好90.2%(Anthropic数据),56%企业表示更易扩展
- 关键挑战:编排模式选择、协议标准化(A2A/ANP演进)、状态一致性、跨智能体上下文共享
- 前瞻层: 未来五年:技术演进与组织变革双螺旋
- 模型能力持续提升将缩小某些已知局限,但**"智能体不能可靠自我评估"属于任务结构的固有约束,不会因模型升级而消失**
- Gartner预测至2027年超过40%的agentic AI项目将因成本上升、价值模糊与风险控制不足而暂停
- 企业需同步建立技术能力、组织能力与治理能力三位一体的系统——单一维度的领先无法弥补其他维度的短板
- 附录: 速查手册:概念、工具、评估模板与最佳实践
- 包含核心概念速查表、工具与平台矩阵速查表、智能体评估模板、治理成熟度自评清单、沙箱安全审计清单、Skill开发模板等完整参考
- 总纲: 致读者:从demo到production的跨越
2026-06-05
- AI+业务

- 从工程框架到普惠落地与记忆基础设施
- 赋能层: 业务赋能:让最懂业务的人造AI应用
- 飞桨PaddlePaddle(百度AI)
- 驾驭AI的普惠实践:将AI开发能力从工程师下放给一线业务人员——与组织层(大型企业AI转型顶层架构)形成互补:组织层解决"企业怎么设计AI架构",赋能层回答"谁来做AI应用"
- 百度AI联合广东省中小企业发展促进会发起"AI创新实验室"项目,核心理念:不招"AI大厨",自己"学做AI家常菜"——让业务人员用自然语言写出可运行的AI应用
- 三步闭环:技术体检(深入企业找真正值得做的场景)→ 实战培训(四天实战营,零基础学员做出可运行智能体)→ 应用陪跑(持续迭代,从"等外部开发"走向"内部持续优化")
- 昭信集团:50名非编程背景员工,研发辅助智能体使零件设计时间缩短50%,设备运维智能体使故障处理时间减少30%,老师傅的经验成功沉淀在数据库中不再流失
- 千江集团:2名IT人员的企业,00后销售自建显微镜智能助手,方案生成从1天压缩至33分钟,效率提升93%
- 安广电子:遥控器芯片代码迁移从3-5天压缩到3小时,业务人员成为企业的"AI专家"
- AI转型并不一定从招AI工程师开始——当最懂业务的人掌握AI工具,AI就从外部能力长成企业自己的内生动力
- 记忆层: 记忆演化:Hy-Memory的Agent第二大脑
- 腾讯混元
- 驾驭AI的记忆基础设施:让Agent在长期协作中"记得住、记得对、记得轻、更懂你"——流程层的Skills解决了"AI会做什么",记忆层解决"AI记得什么",两者共同构成Agent的长期可用性
- Agent用户"三周轨迹":蜜月期→不安(Agent开始遗忘)→降级使用(从"思考伙伴"退化为"查询工具"),问题不在模型能力,在于长期记忆缺失
- 三层核心底牌:①6层记忆框架(事实/画像/摘要/心智模型/知识网络/意图)分层检索;②System1/System2双系统——白班实时写入+夜班深度认知,既保障速度又具备认知迭代;③演化链——supersedes指针串联记忆演变,旧版本不丢、因果可追溯
- LongMemEval得分85.2,远超同类框架;记忆条数只有mem0的1/3,信息密度高45%+,Token消耗降低35%
- 模型能力决定Agent能做什么,记忆系统决定Agent能陪你走多远——长期协作场景下,记忆不是附属品,而是核心基础设施
- Hy-Memory 官网 使用文档
- 赋能层: 业务赋能:让最懂业务的人造AI应用

2026-05-29
- 驾驭AI

- 把工程精力集中在业务逻辑边界和外部环境接口
- 总纲: 驾驭AI:从 Prompt 到 Harness 的工程进化
- 驾驭AI 是本期核心命题。本文是总纲——系统梳理驾驭AI的三层工程框架:Prompt Engineering(说清楚)→ Context Engineering(给够信息)→ Harness Engineering(系统可靠),三者层层嵌套而非替代
- 腾讯云
- OpenAI 内部实验:3-7 人团队 5 个月,AI 生成近 100 万行生产级代码,效率约为纯人工的 10 倍——但初期 Agent 频繁跑偏,转折点在于实施了三大 Harness 策略:上下文治理(压缩 agent.md 至百行索引+动态加载)、验证闭环(Chrome DevTools + 可观测性 + 强制 Lint/测试)、技术债自动清理
- Anthropic 的 F-Harness:Planner(规划)+ Generator(生成)+ Evaluator(独立评估)三 Agent 模式,成本 $200 vs 单 Agent $9,但输出从"勉强可用"跃升为"生产环境级别"——20 倍的时间和成本代价,换来质的飞跃
- Harness 衰变定律:模型能力越强,所需 Harness 越简单——Claude 3.0 时代需要极严格的 Harness 约束,到 3.5 后大量规则自然不再必要。实践启示:不要过度设计那些模型未来能自我解决的问题,把精力集中在业务逻辑边界和外部环境接口
- 工程师衡量标准正在切换:从"每天写多少行代码"→"Harness 能支撑多高的代码产出率";从"个人产出"→"系统杠杆"
- Human steer, agents execute——工程师的价值正在向上迁移:定方向、搭架子、做判别
- 团队层: 角色分工:gstack 的虚拟工程团队 git gstack
- 极客鑫
- 驾驭AI的团队实践:用角色分工为每个Agent划定行为边界——这与总纲中 F-Harness 的 Planner/Generator/Evaluator 三角色模式一脉相承
- gstack 是一套 MIT 开源的 Claude Code 自定义斜杠命令集合,GitHub 80,000+ Stars,由 Y Combinator CEO Garry Tan 创建并维护
- 核心理念:把 AI 从一个「写代码的助手」升级成一个「完整的虚拟工程团队」——每个
/命令对应一个特定角色(CEO、工程经理、设计师、QA 负责人、安全官、发布经理),有明确的职责边界和行为约束 - Garry Tan 本人用这套系统在 60 天内交付了超过 60 万行生产级代码(其中 35% 是测试代码),同时还在全职运营 Y Combinator
- gstack 不引入任何新框架(不依赖 LangGraph、CrewAI 等),纯基于 Claude Code 原生机制实现角色驱动协作——"用机制而非框架解决问题"
- 流程层: 流程编排:Skills 驱动的全链路自动化
- 新智元
- 驾驭AI的流程实践:用Skills编排替代手写prompt,让AI从"会聊天"变成"会交作业"——与gstack的角色命令一样,都是在模型之上建立可复用的驾驭机制
- 商汤开源 SenseNova-Skills:一套 MIT 协议的办公场景 Skills 集合,覆盖数据分析、深度研究、PPT 生成、搜索四大类任务
- 实测场景一:存储芯片价格分析——6 家厂商 13 种品类 7 个月报价,Agent 先跑数据审计再"按品类×应用场景×厂商"交叉分析,精准捕捉价格拐点,结论犀利:本轮上涨是 AI 服务器需求带动的结构性修复,不是普涨
- 实测场景二:低空经济行业调研——只给题目不给资料,Agent 自主检索、比对厂商、用 TAM/SAM/SOM 框架测算市场规模,交付有判断框架+数据支撑+可视化图表的完整报告
- 实测场景三:23 页完整 PPT——七段式框架,每部分匹配对应视觉表达,生成即交付
- 配套模型 SenseNova 6.7 Flash-Lite:同量级第一(PinchBench 92 分),原生多模态架构,Token 消耗在搜索场景直降 60%
- 大模型竞争正在回到"交付"——靠的不是更大的模型,而是模型背后那套被打磨过的 Skills
- SenseNova-Skills SenseNova 6.7 Agent Pack 办公小浣熊
- 产品层: 产品取舍:手机端 AI Coding 的路线选择
- 韦东东
- 驾驭AI的产品实践:在"自建工具"和"等待官方"之间做取舍判断——这与总纲中 Harness 衰变定律呼应:不要过度设计模型未来能自我解决的问题
- 深度使用 nexus4cc 一个月后,作者意识到自己不是其目标用户,转而自建了一套基于 Session Reader 的 AI Coding Workbench——从"镜像终端"到"读会话文件"的路线变迁
- 远程监控 AI 编程任务已从伪需求变成真痛点:单次任务时长从几十秒跳到几十小时(GPT-5.3-Codex 连续跑 25 小时、Claude Code 27 小时),人不可能一直盯着
- 作者自建的 Workbench 选型:Reader 而非镜像——直接读
~/.codex/sessions/和~/.claude/projects/的 JSONL 会话文件,不接管客户端,只读监控 - 接续 vs 派生:running 状态禁止接续(避免两条路线交错),completed/idle 默认走派生(读旧会话最近 N 轮关键消息拼上下文开新 session)
- 通知不等于打扰:HID idle time 判断人在不在电脑前——人在时 Pet 桌面悬浮已显示不发飞书,人离开后才推 IM 通知
- 真正能长期留下来的 4 类资产:团队路由表、业务 Skills 和 Prompt 模板、工作流约定、过程数据——边界宽且与模型厂商能力无重叠
- 工具变便宜不等于产出更有价值——写代码越快,越容易忘掉"这段代码到底解决谁的什么具体问题"
- 组织层: 组织设计:大型企业的 AI 转型顶层架构
- 侯宏文存
- 驾驭AI的组织实践:从工程问题上升到组织架构的顶层设计——个人的驾驭靠Harness和Skills,组织的驾驭靠架构和制度
- 基于学术研究的理性中立声音,面向大型企业高管的 AI 转型培训框架,题为《AI 如何重塑组织:超越喧嚣》
- 两大核心焦虑:AI 与裁员的关系剪不断理还乱;散点式试点拼凑不出顶层设计——如果这两个问题想不清楚、定位混乱,对一号位下定决心及后续宣贯执行都有巨大隐患
- 提出 3I 框架(技术-组织-战略三者融合的系统思考),强调智能体互联网是商业模式再造的战略性机遇
- 结尾点睛:当机器可能接管企业的运营核心,人类员工将不断拓展组织边界——不要把 edge 理解为 margin,它是人类不断拓展可能性前沿、改变组织命运的壮丽努力发生的地方
- 文明层: 文明根基:道德、知识与人的不可替代
- 学习时报
- 驾驭AI的文明根基:回答"为什么是人驾驭AI,而非相反"——前面五层讲"怎么驾驭",这一层讲"凭什么":有德者为人,无德者自为禽兽,驾驭技术的资格来自于人的道德自觉
- 中华文明以道德体系、知识体系和礼仪制度构成其核心内涵——道德为成人之本,知识为立身之本,礼仪为治世之本,形成中华文明的"三要三本"
- 文明的关键是"文"——内心之文德彰显于外。先贤对文明的理解:文明社会必须由文明的人建立,文明社会既不可能靠野蛮人建立,更不能由技术和财富定义
- 考古证据:至迟在 7000 年前(湖北秭归柳林溪遗址"五田文"陶器),修德成人的文明观已经建立完成
- "并不是新技术就必然比旧技术文明,假如新技术用来制作杀人武器,那就根本不是文明,而只能是野蛮"——技术与文明的关系取决于掌握技术的人是否有德
- 总纲: 驾驭AI:从 Prompt 到 Harness 的工程进化
- 实时数字人
- datascale
- OpenTalking:开源的实时数字人对话系统,支持多种 TTS、STT、LLM 提供商和数字人合成方案(FlashTalk、MuseTalk、Wav2Lip),事件驱动架构,Docker 一键部署
- HKUDS RAG-Anything
- 香港大学 数据科学实验室
- 多模态 RAG 系统,支持文档解析→分块→向量化→检索全流程,集成 LightRAG 实现图谱增强检索,支持 Ollama、vLLM、MiniMax 等多种推理后端
- HKUDS CLI-Anything
- 香港大学 数据科学实验室
- 让 AI Agent 操作 40+ 桌面和 CLI 应用——Blender、GIMP、Godot、Krita、FreeCAD、OBS Studio、浏览器、DrawIO 等,每个应用配有独立的 agent-harness,包含 CLI-Hub 元技能系统
- HKUDS nanobot
- 香港大学 数据科学实验室
- 超轻量个人 AI 助手,支持多频道接入(微信、飞书、钉钉等)、记忆系统、定时任务、Skills 和 WebUI,纯 Python 实现,Docker 部署
2026-05-15
- 以人为中心的AI

- 科技导报
- 人机关系正从"人机交互"迈向"人−AI协作"——机器从被动工具演化为具备自主决策的智能体,传统"工具论"正在失效
- 高在峰、赵苑秀、潘晗希、许为,《科技导报》2026, 44(7): 58-68
- 浙江大学团队近10年研究的系统总结,从研究理念、基础理论、方法论、应用实践四个维度构建了HAII(人智交互)完整体系
- 研究理念:许为(2019)提出HCAI三要素框架——伦理对齐设计、技术增强、人因设计;Shneiderman提出"双维度"理念——高自动化+高人类控制;许为等(2021)在国内首次系统提出HAII跨学科领域
- 三大递进理论模型:①人智协同认知系统(HJCS)框架——将人−AI团队视为统一分析单元,人类与AI作为认知地位迈向以人为中心的人−AI交互:理论体系与实践进展对等的合作伙伴,通过共享态势感知、相互信任、协同决策实现深度协同;②智能体团队态势感知模型(ATSA)——双层认知架构(个体层+团队层),描述多认知主体如何产生超越个体的集体智能;③共享社会理解模型(SSU)——应对AI日益增强的社会性与情感特征,系统描述人−AI在社会情境下的共享理解建构
- 方法论:构建了覆盖"伦理→技术→人因→交互→治理"的层级式HCAI框架及5大类实现方法体系
- 应用验证:围绕自动驾驶、智能飞机驾驶舱、人智协作信任等场景开展系列研究
- 当AI能自主决策、甚至拒绝关机指令时(OpenAI o3事件),传统"工具论"瞬间失效——人机关系的底层逻辑正在质变
- 研究中发现,人−AI协作中的控制感由四个维度构成:行动自主性、控制胜任力、首要控制策略、补偿控制策略——人类主导的最终控制权不是一句口号,而是需要从认知机制层面设计和保障
- 与数智化转型的呼应:企业引入AI不只是"上系统",而是要在人与AI之间建立双向赋能机制——AI通过价值对齐赋能人类(变革性领导),人通过垂直领导保留对AI的最终控制权








2026-05-09
- AI从"工具"到"产业链重构者"

- 网新新思
- AI不只是提升效率,而是在改写整个产业的游戏规则
- 从咨询业到外包业,从个人生产力到组织协作
- AI巨头同天亮剑:OpenAI与Anthropic双双杀入咨询业
- 职场罗老实Luo
- OpenAI与Anthropic在同一天宣布布局咨询业务,这不是巧合,而是行业转折的信号。
- AI公司不再满足于卖模型、卖API——它们要直接切入价值链的最顶端:为企业提供战略级决策服务。
- 传统咨询业的核心壁垒——信息不对称和人力规模——正在被AI逐层瓦解。
- 当AI能同时处理"信息搜集→分析建模→方案生成",咨询业的护城河在哪里?
- 15亿美元押注:黑石、高盛联手Anthropic,咨询业的游戏规则变了
- 经官之家
- 全球顶级另类资管巨头黑石 + 顶级投行高盛 + 顶级AI公司Anthropic——三方联手,15亿美元砸向AI咨询新公司。
- 这不是一次普通的投资,而是资本层面对"AI重构咨询业"这一趋势的正式投票。
- 新公司的核心逻辑:用AI替代初级顾问的调研和分析工作,让高级顾问专注于客户关系和战略判断。
- 咨询业的价值链正在被解构:数据采集→AI化,分析建模→AI化,报告生成→AI化。剩下的只有"信任"和"判断"。
- 3万亿IT外包的黄昏:AI编程正在重写全球软件产业链
- 铅笔道
- 全球3万亿美元的IT外包市场,建在"劳动力套利"的地基上——而AI编程正在把这个地基抽空。
- Claude Code、Cursor、Copilot等AI编程工具,让一个熟练开发者的产出抵得上过去一个小团队。
- 外包的核心价值——"用更便宜的人写代码"——在AI时代变成了一个逻辑悖论:如果代码本身不再由人写,那"便宜的人"还有什么意义?
- 产业链重构的方向:从"外包代码"转向"外包AI增强开发",从"卖人头"转向"卖效能"。
- Agent时代的生产力悖论:当协作本身成为最大的瓶颈
- 阿里云
- 这是一个反直觉的发现:Agent越多,效率不一定越高——协作开销的增长速度可能超过个体能力的提升。
- 多智能体系统中,任务分配、状态同步、冲突解决、结果整合带来的通信成本随Agent数量指数级增长。
- 核心矛盾:单个Agent的能力在快速增长(模型越来越强),但Agent之间的协作协议还处于早期阶段。
- 生产力的真正瓶颈,正在从"个体能力不足"转向"组织协调失效"——这跟人类组织的演化规律惊人地一致。
- 破局方向:更好地定义Agent间的接口协议、任务粒度、状态传递机制。
- AGENTS.md 实践指南:一个文件让 AI Coding 效率翻倍
- 阿里云
- AGENTS.md 是一个放在项目根目录的Markdown文件,为AI编程工具提供持久化的项目上下文。
- 核心价值:让AI在每次对话开始时就能理解项目约定、架构决策、编码规范,而不是每次都要重新解释。
- "给AI正确的上下文"比"给AI更聪明的模型"更划算——这是上下文工程的核心原则。
- 实践要点:写清楚构建命令、代码风格、目录结构、关键约束;控制在200行以内;随项目演进持续更新。
- 与上一篇文章形成呼应:Agent之间协作需要"协议",而人与AI之间协作需要"文档"——AGENTS.md 就是人与AI之间的接口规范。
- Claude Code 构建者揭秘:Skills 机制如何让智能体能力可复用
- 哲学园
- Claude Code 核心工程师 Thariq 首次系统分享 Skills 机制的设计理念和演进过程。
- Skills 的定位:介于"一次性Prompt"和"永久性工具"之间的可复用能力单元——比Prompt结构化,比工具灵活。
- 核心设计原则:Skills 应该是可发现的(Agent知道什么时候该用)、可组合的(多个Skills可以串联)、可维护的(独立的文件,易于版本管理)。
- 与前后文的呼应:Skills 本质上是在解决"Agent协作"问题——Skills 定义了Agent可以"学会什么",而 AGENTS.md 定义了Agent需要"知道什么"。
- LLM Wiki 与 Graphify 热潮背后:企业级 RAG 缺的到底是什么?
- 韦东东
- Karpathy 的 LLM Wiki 项目 + 3.5万Star的 Graphify 知识图谱工具,让"知识图谱+RAG"再次成为热点。
- 但文章的核心拷问是:企业级 RAG 效果不好的真正原因,真的是缺少知识图谱吗?
- 更常见的问题链:数据没清洗 → 分块策略不对 → 检索精度不够 → 生成效果差。这些都不是知识图谱能解决的。
- 知识图谱解决的是"实体关系推理"问题,而大多数企业RAG失败的根因在更上游——数据质量和检索策略。
- 回到本质:RAG 的核心不是"图谱有多炫",而是"对的信息在对的时机被对的上下文包裹,送给模型"。
- 当我们在追逐技术热点时,别忘了先解决工程基本功。——这跟前面 Agent 协作、AGENTS.md、Skills 的讨论形成了闭环:技术堆砌不等于系统可靠。
- AI巨头同天亮剑:OpenAI与Anthropic双双杀入咨询业
2026-04-17
- 基于 ERNIE Image 一键生成图像

- 网新新思
- 让创意在星河中闪光
- ERNIE-Image
- 张雪峰:被蒸馏的人
- AI蒸馏得出他的话术,但蒸馏不出他说那些话时,心里的那股热乎气。
- 技术本身就是一种政治现象,而沉默是其独特的表达方式。
- 工具用久了,人会不会也变成工具?
- 同事.skill
- AI 爱马仕 Hermes Agent 官网 GitHub
- 自我进化
- 智能复利
- 内置自我学习循环机制
- Skills由智能体自主生成、自主优化。
- 四层记忆架构 + 双文件核心 + 多后端扩展 的记忆系统。
- 长期使用,深度个性化。
- OpenClaw 的网关优势与丰富生态,与 Hermes Agent 的自进化能力及深度记忆特性相结合,可实现“1+1>2”的协同效应。
- 由 OpenClaw 负责多渠道调度与插件调用,Hermes Agent 负责核心推理与能力进化,共同构建更高效、更智能的AI智能体系统。
- 快速落地自动化任务可选择 OpenClaw,长期优化智能体能力可采用 Hermes Agent,甚至可实现两者协同部署,解锁AI智能体的更多应用可能性。
- OpenClaw → 执行位,负责具体操作。
- Hermes Agent → 指挥位,负责记忆和调度。
- 腾讯:人工智能正式进入 Harness 时代
- 2026年春天,AI行业出现了一个值得关注的变化:大家不再只聊模型了。
- AI落地不只是算法题,更是一道工程题。
- 第一个发现:模型能力的天花板,不在模型里面,而在模型外面。
- 第二个发现:约束不是对智能的压制,而是对智能的引导。
- 第三个发现:Harness让大模型更安全。
- 第四个发现:AI无法可靠地评价自己。
- Prompt Engineering 是给驾驶员一张地图。
- Context Engineering是给驾驶员一套导航系统。
- Harness Engineering 是给驾驶员造一辆完整的车,带仪表盘、反馈系统、安全约束和自动巡航。
- 驾驶员的觉醒:AI越强大,对人的要求越高。
- 真正决定最终产出质量的,始终是坐在驾驶座上的人。
- 驾驶员需要有在人类智慧和机器智能之间搭建桥梁的品味。
- 一方面,F1赛车手这些顶尖驾驶者的技能价值从未如此之高;另一方面,自动驾驶正在让普通人的出行变得前所未有的安全和便利。这两个趋势不矛盾,它们是同一枚硬币的两面。
- 在上层,顶尖的驾驶员,那些真正理解发动机、善于设计线束的人,将产出最优秀的作品。他们的竞争壁垒不是执行力,而是品味、判断力和创造性。
- 在下层,大多数人不需要成为高阶驾驶者,也能享受AI带来的能力提升。
- 当模型自己长出手脚。
- 驾驶员的角色将从“操作者”升级为“委托人”,不再告诉AI怎么跑,而是告诉它要去哪里,然后它自己找路。
- 关于方向、意义和价值的问题,永远是人的责任。
- AI的价值不在于它有多强大,而在于我们能在多大程度上驾驭这种力量,让它服务于真实的场景、真实的人、真实的需求。
- 阿里:Prompt、Context、Harness 设计哲学与实践
- 如何说、让AI看什么、构建怎样的运行环境
- 共同致力于提升大模型在复杂任务中的可靠性与可控性
- Prompt Engineering:动态组装与文件驱动
- System Prompt的结构化动态组装
- Markdown驱动的文件注入机制
- “质量大于数量”的极简主义
- Context Engineering:扩展、压缩和记忆
- 可扩展的Skills机制
- 上下文压缩与修剪
- Memory的双层管理
- Harness Engineering:约束与引导控制
- Harness和Workflow有什么异同
- Harness 为大模型提供一个包含工具集、状态记忆和反思在内的一种系统机制,在这个机制内,Agent拥有自主规划(Planning)和循环迭代(Looping)的权利,它可以自己决定调用哪些工具,如果结果不满意可以自我反思并重新尝试,或者根据上下文动态路由或调整。
- OpenClaw中的 Harness 实践
- 全生命周期的Hook钩子机制
- 安全沙箱护栏机制
- 强约束执行与人工干预
- Harness和Workflow有什么异同
- 阿里:复杂度应该沉到哪里
- 入口与启动链路:别急着拉起全世界
- REPL / UI Orchestration:UI 不是传话筒
- Query Loop / QueryEngine:把单轮对话升级成状态机
- Tool Runtime:把野生工具变成系统调用
- Permission System:不是弹个框就完事了
- Task / 多 Agent / 后台执行:多 Agent 的核心不是 prompt 分工
- MCP / Skills / Plugins 扩展层:外部可以热闹,内部必须收敛
- 总结与总架构:把复杂度放在对的位置上
- 会话边界问题交给 启动层
- 人机协作问题交给 REPL 控制面
- 连续运行问题交给 Query Loop
- 行动协议问题交给 Tool Runtime
- 风险治理问题交给 Permission System
- 长时执行和并发问题交给 Task Runtime
- 平台增长问题交给 扩展层
- 我们最后该带走什么
- 先定义执行边界,再发起第一轮推理。
- 当 Agent 进入连续运行阶段,query loop 就必须升级成 runtime。
- 工具一旦开始碰副作用,工具层就必须制度化。
- 权限系统的核心不是确认框,而是可解释的执行链。
- 多 Agent 的前提不是 prompt 分工,而是统一任务抽象。
- 真正成熟的 Agent 系统,不是“模型更会做事”,而是“组织能把模型做事这件事,稳定地接进交付链路里”
- 当模型开始真的做事,系统准备在哪里把这些复杂度接住。
- 工具:Markdown-LaTeX
- Markdown All in One
- Markdown Preview Enhanced
- Marp
- LaTeX Workshop
2026-04-10
- Claude Code Source Snapshot

- 网新新思
- Claw Hero
- 哈耶克大战凯恩斯
- 哈耶克的秩序理论与人工智能
- 自发秩序
- 复杂科学不可理性设计
- 语言、道德、法律、经济、政治制度等复杂系统或复杂科学,绝不可能像自然科学那样,通过简单的数学模型进行精确预测,更不能凭借人类的有限理性进行肆意设计。我们必须尊重这些自发秩序的演化规律,避免过度干预带来的不良后果。
- Claude Code 源码概述
- Claude Code 从入门到精通 pdf
- Claude Code解决的是产品构建效率:怎么更快地从一个想法变成一个能跑的东西。
- Open Claw 从入门到精通 pdf
- Claw Code ⭐ 179k Star - Claw Code is the public Rust implementation of the claw CLI agent harness.
- Claude Code 工程实践
- 全局架构:分层调度,不是多 Agent 对等协作
- Agentic Loop:单线程循环跑完绝大多数任务
- Coordinator-Worker:需要时才启用的多 Agent 编排
- 三层记忆系统:短期压缩、中期萃取、长期整合
- Agent 列表从内联改为 Attachment:省了 10.2% 的 Cache Token
- Cron 调度的 Jitter 设计:避开整点
- NO_TOOLS_PREAMBLE:防止模型在不该调工具的时候调工具
- Feature Flags 的编译时消除
- 工程视角:从 Prompt Engineering 到 Harness Engineering
- Claude Code 设计亮点与启示
- 一、CC整体架构全景:工业级多智能体 IDE 的底层骨架
- 启动与基础层
- 核心引擎层
- 业务服务层
- 交互UI层
- 生态扩展层
- 二、CC核心设计亮点:AI 原生 IDE 的极致工程化
- 亮点 1:「协调者 - 工作者」多智能体原生架构(Coordinator 核心)
- 亮点 2:工程化上下文管理:自主感知 + 分层压缩 + 持久化
- 亮点 3:标准化工具 + 技能系统:智能体能力的可管控、可扩展
- 亮点 4:全生命周期任务管理:无人值守的研发闭环
- 亮点 5:Bridge 模块:CLI↔IDE 无缝桥接,定义 AI 工具生态标准
- 亮点 6:原生安全与权限设计:前置拦截,企业级合规
- 亮点 7:中心化全局状态管理:多模块状态一致性
- 亮点 8:轻量化服务化部署:无头模式 + 远程调用
- 三、CC 对多智能体AI 原生 IDE 的核心设计启示
- 启示 1:架构必须采用「协调者 - 工作者」分层模型,拒绝单体智能体
- 启示 2:上下文管理必须工程化,拒绝手动配置
- 启示 3:智能体能力必须标准化、可管控、可扩展
- 启示 4:任务管理必须全生命周期闭环,实现无人值守研发
- 启示 5:生态必须原生打通,CLI/IDE/ 远程多端一体化
- 启示 6:安全与权限必须原生嵌入,而非外挂功能
- 启示 7:交互必须透明可控,拒绝 AI 黑盒
- 一、CC整体架构全景:工业级多智能体 IDE 的底层骨架
- Prompt 开源 分享的不是怎么写代码,而是怎么想清楚一件事
- 使用 tunasync 搭建开源镜像站 tunasync weyo 开源镜像站 清华大学开源软件镜像站 服务器监控
- 阿里:Tablestore + Mem0
- 阿里:Memory架构与思考
- Memory 不是"存储",而是可被决策利用的外部状态(external state)
- Memory 的最小闭包不是"文档块",而是 (Ledger, Views, Policy) 三件套
- Memory 的基本单位应当是 event 序列,但"直接用 event 流"不等于可用系统
- DESIGN.md

2026-03-27
2026-03-20
- 人与多智能体协同

- 深圳新思
- 在剧变的数智化时代,更要沉下心来,深入研究。
- 在一个场景中深耕并落地,是让AI创造价值的最好捷径。
- 和AI一起思考。
- 让AI有人味儿。
- 掌握历史、当下、未来的脉络。
- 积累经验、洞察、人脉、责任。
- 阿里:深入理解OpenClaw技术架构与实现原理(上)
- 阿里:深入理解OpenClaw技术架构与实现原理(下)
- 统一控制平面Gateway网关
- Agentic Loop/Pi Loop
- 定时任务系统
- 工具系统
- Channels
- 上下文管理
- SubAgent子智能体
- SandBox沙箱系统
- 记忆管理
- Skills模块
- Session管理
- 自进化机制
- 工作区与Agent路由
- Nodes
- 安全策略
- 配置管理
- 腾讯:深入理解OpenClaw的双源记忆系统
- 记忆层的真正价值不是"降低单次成本",而是:使无限长的对话成为可能(没有记忆层,上下文会爆炸),同时保持相关信息的可访问性(压缩后仍可通过搜索找回)
- 记忆层确实实现了"轻量化上下文"的设计目标,但还有很多问题无法解决
- 固定开销无法消除(System Prompt)
- 工具定义每次都要发送
- 压缩是惰性的
- 记忆检索是增量成本
- 工具调用有额外成本
- 重新思考Agent时代的版本控制 Skills GitHub
- 企业级 Agent 多智能体架构与选型指南
- 意图驱动、多智能体博弈、知识进化
- OpenMAIC:教学龙虾 Generative Learning in Multi-Agent Interactive Classroom GitHub
- Ai2: OLMo: Open Language Model
- Ai2: olmocr
- Nvidia GTC 2026
- 人与多智能体协同
2026-03-13
- Claude如何记住项目的上下文

- Claude
- 深入使用ClaudeCode的经验分享
- Run Claude Code programmatically
- 要从 CLI 以编程方式运行 Claude Code,请使用 -p 传递您的提示和任何 CLI 选项
- claude -p "Find and fix the bug in auth.py" --allowedTools "Read,Edit,Bash"
- https://code.claude.com/docs/en/memory 和 https://code.claude.com/docs/zh-CN/overview 存在更新时间差异。尽量看 en 内容。
- CLAUDE.md 文件:你编写的指令,为 Claude 提供持久上下文。
- 自动记忆:Claude 根据你的更正和偏好自己编写的笔记。自动记忆默认开启。
- 当你想指导 Claude 的行为时,使用 CLAUDE.md 文件。自动记忆让 Claude 从你的更正中学习,无需手动操作。
- 每个 CLAUDE.md 文件尽量控制在 200 行以下。
- MEMORY.md 的前 200 行在每次对话开始时加载。
- Claude Code 第一次在项目中遇到外部导入时,它会显示一个批准对话,列出文件。如果你拒绝,导入保持禁用状态,对话不会再次出现。
- 使用符号链接跨项目共享规则
- ln -s ~/shared-claude-rules .claude/rules/shared
- ln -s ~/company-standards/security.md .claude/rules/security.md
- 每个项目在 ~/.claude/projects//memory/ 保存自己的记忆目录。可以通过 autoMemoryDirectory 配置修改。
- 超过 200 行的文件消耗更多上下文并可能降低遵守度。将详细内容移到使用 @path 导入引用的单独文件中,或将你的指令拆分到 .claude/rules/ 文件中。

- /memory 编辑 CLAUDE.md 内存文件,启用或禁用自动内存,并查看自动内存条目
- /context 将当前上下文使用情况可视化为彩色网格
- /compact [instructions] 使用可选的焦点说明压缩对话
- /copy 将最后一个助手响应复制到剪贴板。当存在代码块时,显示交互式选择器以选择单个块或完整响应
- /stats 可视化每日使用情况、会话历史、连胜和模型偏好
- /status 打开设置界面(状态选项卡),显示版本、模型、账户和连接性
- /clear 清除对话历史并释放上下文。别名:/reset、/new
- /plan 直接从提示进入 Plan Mode
- /rename [name] 重命名当前会话。不使用名称时,从对话历史自动生成一个
- /resume [session] 按 ID 或名称恢复对话,或打开会话选择器。别名:/continue
- cat file | claude -p "query" 处理管道内容
- claude -p "query" 通过 SDK 查询,然后退出
- claude -c -p "query" 通过 SDK 继续
- claude -r "" "query" 按 ID 或名称恢复会话
- --dangerously-skip-permissions 跳过所有权限提示(谨慎使用)
- --allow-dangerously-skip-permissions 启用权限绕过作为选项,而不立即激活它。允许与 --permission-mode 组合(谨慎使用)
- Run Claude Code programmatically
- PinchBench Compare AI Models for OpenClaw
- 30 个 OpenClaw 自动化提示词:把 AI 助手变成 7 *24自主智能伙伴
- 做AI产品三年复盘,我看到的变与不变
- Crablet 概述
- 认知架构、记忆系统、知识与RAG、多Agent群体、Canvas与实时渲染构件
- Claude Code 相关文章
- Claude Code 相关 GitHub 开源项目
- 29471 Star | Claude Code Router
- 14918 Star | Happy Coder: Mobile and Web Client for Claude Code & Codex Use Claude Code or Codex from anywhere with end-to-end encryption.
- 13775 Star | Agent Skills for Context Engineering
- 10266 Star | Compound Engineering Plugin
- 03514 Star | CodePilot
- 00877 Star | cc-connect
- 00407 Star | OpencCode Manager
- 00212 Star | MetaBot
- 00012 Star | Remote Claude Code
2026-03-06
- 本体论(Ontology)

- 软件工程3.0时代
- 人类掌舵,智能体执行
- Harness Engineering
- 本体论(Ontology) + 大语言模型(LLM) + 多智能体(Multi-Agent)
- 未来的软件工程师,不能仅仅满足于编写代码,甚至不能仅仅满足于指导AI编写代码。
- 他们必须提升到更高的层次,成为“意图的设计者”、“智力流程的管理者”、“系统思想的架构师”
- AI+软件工程的加速演进:2028年会呈现怎样的实景?
- Harness engineering: leveraging Codex in an agent-first world
- Harness Engineering 的全新内部工程方法论
- Skills:从编程工具的配角到Agent研发的核心

- 全面解析:本体论驱动的数据智能决策体系、应用场景与经典案例
- 构建AI可理解的业务知识框架,驱动新一代数据智能决策体系
- 本体论的核心优势在于,它提供了一个超越特定技术栈、特定数据库的通用语义层,能够统一组织内的概念认知,实现数据在更高层面的互操作性和可推理性,是构建真正智能决策系统的基石。
- 本体论的核心要素
- 对象类型(Object Type)
- 本体论为知识图谱提供严谨的语义基础和推理能力,使其从单纯的数据关联走向智能推理。
- Palantir Foundry的“对象”(Objects)概念既是本体论定义的“对象类型”,也是知识图谱中的“实体”
- 本体论定义了领域知识的Schema层(概念框架、属性、关系类型、公理),是知识的骨架,关注知识的定义和推理规则。
- 知识图谱是基于本体Schema构建的Data层(实例数据),是知识的血肉,由海量事实(实体-关系-实体三元组)构成。它关注具体知识的组织和关联。
- 属性(Properties)
- 关系(Links)
- 公理(Axioms)
- 奎因提出 本体论承诺(ontological commitment)
- 一个知识系统若能通过清晰的概念定义、属性约束和关系规则实现内部一致性与自洽,即便不追求“绝对真理”,也具备有效的本体论基础
- 概念形式化(Conceptual Formalization)
- 关系显式化(Explicit Relation Definition)
- 规则与推理机制(Rules and Inference Mechanisms)
- 本体论超越传统数据模型的关键在于引入了“公理”(Axioms)与“推理规则”
- 单一数据库的局限
- 关系数据库(如PostgreSQL):擅长结构化数据存储与事务一致性,但处理复杂关系推理(多跳查询)效率低下,缺乏原生公理执行能力。
- 图数据库(如Neo4j):擅长关系存储与基于图的推理(路径查询),但对复杂属性管理和事务一致性支持不如关系数据库,处理时序数据效率不高。
- 时序数据库(如TDengine):擅长高并发写入、高吞吐量的时序数据(如传感器数据、日志),但缺乏复杂的关联查询和推理能力。
- 向量数据库(如Milvus):擅长语义检索、相似度匹配,但难以管理结构化信息和复杂的业务逻辑。
- 基于本体论与大模型的新一代智能应用开发体系
- 本体的尽管本体系具有巨大潜力,但仍面临诸多挑战:
- 本体构建成本:高质量本体的设计需要领域专家深度参与,初期投入较大。目前行业中有部分从数据库ER图、应用设计图UML自动生成对应本体Ontology的技术探索可供参考。
- 动态演化:业务规则频繁变化,需建立本体版本管理和动态更新机制。
- 性能开销:实时推理可能引入延迟,需优化推理算法和缓存策略。
- 安全与权限:MCP接口需严格的安全控制,防止未授权调用。
- 未来,随着 知识图谱、自动化本体学习、可微分推理 等技术的发展,本体系将更加智能化和自动化。我们预见,本体将成为企业数字资产的核心组成部分,而大模型将成为连接知识与行动的智能代理。
- 软件开发将从“编写代码”转向“构建知识”和“设计智能”,开启人机协同的新纪元。
- Palantir Foundry
- 企业级实用本体论及构建指南系列
- UINO 优锘科技
- 本体智能
- 智能问数从朴素到科学
- Palantir本体论深度解读:企业AI的语义操作系统从数据孤岛到智能决策的革命性跨越
- Ontology Building – 打造组织的运营层与数字孪生
- Palantir的本体论实践:一套方法论与四个应用场景
- 基于Protege的知识建模实战
2026-02-27
- 从工程到落地

- 智谱开放平台
- 人智协同,创造价值
- 真人呼兰 对战 AI呼兰
- CoPaw
- pip install copaw
- copaw init --defaults
- copaw app
- LLM配置
- curl -N -X POST "http://localhost:8088/agent/process" -H "Content-Type: application/json" -d '{"input":[{"role":"user","content":[{"type":"text","text":"你好"}]}],"session_id":"session123"}'
- 控制台(推荐)— 在 控制台 的 Control → Channels 页面,点击频道卡片,在抽屉里启用并填写鉴权信息,保存即生效。 频道说明
- Claude Code 进化论
2026-02-13
- 从代码到工程

- 智谱开放平台
- 迈向 Agentic Engineering 时代
- 李国杰:人工智能的边界在哪里?
- “智能”只是人类多种才能之一
- 德智体美劳
- “智能”不是“意识”,更不是“灵魂”
- 智能的本质究竟是什么?
- 维纳的控制论 --> Friston的自由能原理 --> LeCun的世界模型 --> 现代AGI架构
- 智能是主体在不确定环境中,通过感知、学习和推理构建可用于预测与决策的内部模型,以实现目标导向的适应环境与意义生成的能力。
- 智能系统本质上就是一个“建模引擎”。
- 智能可以分为“功能性智能”和“主体性智能”。
- AI在工程层面实现了意义建构的功能模拟。
- 智能的边界就是计算的边界吗?
- 丘奇−图灵论题(Church−Turing Thesis)
- 所有计算装置都与图灵机等价
- 人按照算法执行的计算和图灵机等价
- 人的智能和图灵机的能力等价
- 通俗的表述就是:不存在比图灵机更强的计算装置。
- 著名逻辑学家哥德尔(Kurt Gödel)认可前2种表述,但不同意第3种表述。哥德尔认为可能存在不可机械计算的心理过程。
- 将智能等同于图灵机,可能忽略了智能的现象学维度。
- 哥德尔的哲学质疑提醒我们:计算可能只是智能的“外壳”,而非其“本质”。
- 丘奇−图灵论题(Church−Turing Thesis)
- 从“人类为什么要发展人工智能”来反推智能的本质
- 人类追求AI,并非为了验证智能的定义,而是为了放大人的能力。
- 从这个角度来看,智能的“本质”不在于自然哲学,而在于社会功能。
- 换句话说,人类希望发展的AI不只是模仿人脑的AI,而是扩展人类文明功能的AI。
- 智能是系统在有限资源条件下,通过持续降低未来不确定性来实现目标的能力。
- 坚持“以人为本”的人工智能发展路线
- 人类因为创造了人工智能而伟大,因为知道人工智能的局限而成熟。
- “智能”只是人类多种才能之一
- GLM-5最具破坏力的玩法来了!结合CC新出的Agent Teams,解锁Vibe coding终极形态!
- Claude Code 会话团队
- nanobot: Ultra-Lightweight Personal AI Assistant
- EverMemOS
- 为 GitHub Copilot 构建智能体记忆系统
- Voxtral Realtime 4B Pure C Implementation
- tmux











2026-02-06
- AI团队项目管理

- 新思开源
- 人+Copilot:管理+产品+架构
- Agents:设计+3开发+测试+部署
- 能力:是拿来反复使用的
- 工具:是获取直接结果的
- 命令:是执行确定性简单重复工作的
- 钩子:是控制确定性的
- 模块:是拿来堆砌更多功能的
- 子代理:是做垂直领域工作的
- 用设计模式来约束架构
- 使用领域驱动开发划分边界并分工
- 使用契约驱动开发定义模块之间,AI之间的交互和接口
- 使用AI驱动开发实现1人团队快速POC
- 文档即记忆
- 错误即规则
- 提示词即代码
- AI4SE是核心资产
- iPass 密码管理系统 - TypeScript
- Visual Studio Code January 2026 (version 1.109) 多智能体开发的家园
- AI 原生研发范式:从“代码中心”到“文档驱动”的演进
- 从传统编程转向大模型编程
- GitHub深夜引爆,最强Claude + Codex合体!全球1.8亿码农一夜解放
- 这大概是我读过关于AI大模型最全面、好读又易懂的文章了
- 大模型风头正盛,工业界为何死磕YOLO?算完这笔账我懂了
- 雄安发布“极数”数据大模型,为千行百业装上“理科大脑”
- 解构OpenClaw:本地架构、记忆管理、Agent 编排与上下文组装原理


2026-01-30
- AI团队合作

- CooperBench
- 人的再中心化
- 斯坦福实测GPT-5与Claude 4.5“双盲实验。AI编程,没有协作类产品的原因找到了
- 2026-01-27 2601.13295v2 CooperBench: Why Coding Agents Cannot be Your Teammates Yet
- 2026-01-29 深度剖析:Skills架构攻击面、实战案例与开源生态调研
- 2026-01-22 Agent Skills vs. Rules vs. Commands
- 2026-01-11 2506.13932v2 Code Reasoning for Software Engineering Tasks: A Survey and A Call to Action
- 2025-12-14 2512.12818v1 HINDSIGHT IS 20-20: BUILDING AGENT MEMORY THAT RETAINS, RECALLS, AND REFLECTS
- 2025-11-11 2511.07800v1 F ROM E XPERIENCE TO S TRATEGY: E MPOWERING LLM AGENTS WITH T RAINABLE G RAPH M EMORY
- 2025-11-06 2511.04064v1 Benchmarking and Studying the LLM-based Agent System in End-to-End Software Development
- 2025-10-31 How to Navigate the Agentic AI Teammate Trap
- 2025-10-15 javacro-jakarta Simplifying Data Access with Jakarta Data for Domain-Driven Design
- 2025-08-18 2508.13143v1 Exploring Autonomous Agents: A Closer Look at Why They Fail When Completing Tasks
- 2025-07-18 2404.04834v4 LLM-Based Multi-Agent Systems for Software Engineering: Literature Review, Vision and the Road Ahead
- 2025-06-06 2506.06009v1 Unlocking Recursive Thinking of LLMs: Alignment via Refinement
- 2025-03-11 2410.02189v2 Agent-Oriented Planning in Multi-Agent Systems
- 斯坦福神课:如何用AI协作你的工作?
- 从 ReAct 到 Ralph Loop:AI Agent 的持续迭代范式
- Agent Skills实战:27个脚本不进上下文,一句话完成RAG入库前文档扫描
- Figma?不需要了!Pencil真把"设计-开发断层"给解决了
- 一夜爆火,Clawdbot是否才是真正的AI入口产品?
- 玩转Lighthouse|Moltbot(Clawdbot)接入企业微信完全指南
- 腾讯轻量云首发支持Moltbot接入四大国内主流 IM
- 优刻得Clawdbot镜像率先接入企业微信!
- 28岁清华博士放弃高薪offer,偏要做比读博还难的事
- 2025年10月 Scaling Enterprise AI Responsibly: The Critical Role of Data Readiness and an Intelligent Data Infrastructure - 2025 ENTERPRISE AI MATURITY FINDINGS
- 技术异化的三重批判——生成式AI时代人类主体性的解构与确证
- AI智能体的五级进化路径与未来应用场景全解读
- 人工智能伦理治理范式:从价值对齐到价值共生
- 人工智能时代背景下人的全面发展问题研究
- 2024年 中国信通院、华为:智能化软件开发落地实践指南
- ai智能体组织:5个人管理100个智能体员工
智能体时代“人的再中心化”:核心内涵与落地逻辑
结合当下AI与智能体的发展特征,人的再中心化本质是打破“AI替代人、技术主导人”的异化趋势,让人类重新成为智能体生态的核心主导者、价值定义者与意义创造者,而非被算法规训、被智能体替代的功能性劳动力;并非简单的“人对抗AI”,而是建立“人驾驭智能体、智能体服务于人”的新秩序,让AI/智能体成为人类延伸能力、实现价值的工具,而非重构社会规则的主导者,最终回归“技术为人服务”的本质。
这一核心目标,需围绕价值维度、能力维度、规则维度、生态维度落地,适配当前大模型、具身智能、多智能体协同的发展阶段,具体说明如下:
1. 价值维度:从“技术效率至上”回归“人的需求与意义为本”
智能体的研发、应用与落地,不再以“替代人类劳动、提升商业效率”为单一目标,而是以满足人的多元需求、实现人的全面发展为核心导向。
- 摒弃“用AI/智能体消灭人工”的功利化逻辑,转而让智能体承接人类不愿做、不能做的重复性、机械性、高风险工作(如基础数据处理、高危环境作业、单调的服务流程),释放人类的时间与精力,投入到更具创造性、情感性、思想性的活动中(如艺术创作、深度思考、人际连接、社会公益);
- 重新定义“劳动价值”,打破后工业社会“知识=价值”、智能时代初期“算法效率=价值”的单一评判标准,将人的情感表达、伦理判断、审美创造、人文关怀等智能体无法替代的特质,纳入社会价值体系的核心,让“人的独特性”成为价值创造的终极源泉。
例如:养老陪护智能体可完成基础的健康监测、生活照料,但人类护工的情感陪伴、心理疏导成为核心价值;教育智能体可实现个性化知识讲解,但教师的启发式引导、价值观塑造成为教学的核心。
https://gitea.szis.dev/szisos/tasks/src/branch/trunk/%E8%B5%84%E6%96%99/2026-01-29_AI%E5%9B%A2%E9%98%9F%E5%90%88%E4%BD%9C.pdf
2. 能力维度:从“人适配技术”转向“技术适配人,人驾驭技术”
这是“人的再中心化”的核心能力支撑,核心是让智能体的能力体系围绕人类的核心能力构建,而非让人类被迫学习技术以适应智能体,同时培育人类的“智能体编排能力”,成为智能体生态的“掌舵者”。
- 智能体的设计实现低门槛化、人性化、定制化:通过自然语言交互、可视化操作、个性化训练,让普通人无需掌握复杂的代码、算法,就能轻松指挥、调配、定制智能体(如普通职场人可通过自然语言指令,让多智能体协同完成调研、写作、数据分析;普通家庭可定制家居智能体,适配家人的生活习惯),打破“技术壁垒”对人的限制;
- 人类核心能力聚焦**“智能体无法替代的高阶能力”:不再培养与智能体竞争的“规则应用、信息处理”等技能,而是重点培育跨领域协调、伦理判断、复杂决策、创意构想、价值定义**等能力——即“智能体编排能力”,人类的角色从“直接的价值创造者”转变为“智能体的指挥者、协调者、监督者”,通过整合多个智能体的能力,实现单一智能体甚至单一人类无法完成的复杂目标(如Anthropic将招聘重心从“软件工程师”转向“AI编排者”,正是这一趋势的体现)。
3. 规则维度:以人的意志制定智能体的发展与应用规则,守住人类的主导权
针对当前AI“自演化、难预测”的控制悖反问题,通过制度、法律、技术三重约束,让智能体的发展始终处于人类的可控范围,避免技术脱离人的意志走向异化,这是“人的再中心化”的制度保障。
- 法律与制度层面:明确**“人类是智能体行为的最终责任主体”**,制定智能体的研发、应用、监管规则,划定智能体的应用边界(如禁止智能体参与核心社会决策、禁止无监督的智能体自我演化、保障智能体应用的公平性),杜绝“技术凌驾于人”的可能;
- 技术层面:为智能体设置**“人类干预的终极接口”**,即使是具备自优化、自演化能力的高级智能体,也必须保留人类的最高决策权,当智能体的行为偏离人的目标、存在伦理风险时,人类可直接干预、终止其行为,破解“技术控制论的失控”难题;
- 行业层面:推动智能体研发的公共性与普惠性,打破科技巨头对智能体模型、数据的垄断,避免少数企业通过掌控智能体掌握绝对的社会权力,让智能体的技术成果为全体人类服务,而非成为少数人牟利、控制他人的工具。
4. 生态维度:构建“人-智能体”协同的共生生态,而非“人-智能体”的竞争生态
摒弃“AI替代人”的零和思维,打造**“人类主导、智能体协同、各尽其能、各取所需”**的新社会生态,让智能体成为人类社会的“有机组成部分”,而非独立的“竞争主体”,这是“人的再中心化”的生态落地形式。
- 产业生态:在智能制造、服务业、办公等领域,构建“人+智能体”的协同模式,而非“智能体替代人”的替代模式——例如工厂中,人类工程师负责工艺设计、流程优化、故障决策,工业智能体负责精准生产、实时监测;办公场景中,人类员工负责核心决策、创意构思,办公智能体负责基础资料整理、文案初稿、数据核算;
- 社会生态:通过社会福利、教育体系的重构,适配“人-智能体”协同的新形态——针对AI带来的劳动力结构性过剩,建立普惠性的社会福利体系,保障被智能体替代的人群的基本生活;重构教育体系,从“知识灌输”转向“能力培育”,从基础教育开始培养孩子的“智能体编排能力”、创造性思维、人文素养,让人类从小适应“驾驭智能体”的角色;
- 价值生态:建立“人-智能体”的价值分配体系,让智能体创造的社会价值反哺人类——例如智能体创造的商业利润,一部分用于智能体的技术迭代,另一部分通过税收、公共福利等形式,投入到人类的教育、医疗、养老等领域,让全体人类共享智能体的发展成果,破解“技术性冗余”带来的社会矛盾。
总结
在AI与智能体快速发展的时代,“人的再中心化”并非否定技术的价值,而是对贝尔后工业社会理论的核心修正——贝尔强调“理论知识是社会中轴”,但智能时代的核心不是让知识(或算法)成为主导,而是让掌握“知识/算法的管理权、主导权”的人类成为核心;它既是对“技术异化”的反向纠偏,也是对人类独特价值的重新确认。
最终,这一理念的落地,将推动社会从“后工业社会”“智能体社会”走向真正的**“人的全面发展的社会”**:智能体解决“如何高效生产”的技术问题,而人类聚焦“为何生产、为谁生产、如何实现人的价值”的根本问题,让技术的发展始终围绕人的需求与意义展开,这也是应对AI时代劳动意义哲学危机的核心答案。
2026-01-23
- 认知复杂度

- Epiplexity 定义计算受限的“数据价值”
- Epiplexity 被定义为在给定计算限制(如运行时间限制)下,能够最小化数据描述长度的最佳概率程序的长度。
- 它捕捉的是数据中的结构性内容(Structural Content),即那些可以被总结为规律、算法或“快捷方式”的部分。
- 高 Epiplexity 通常意味着模型学到了更多深层结构,更有利于分布外(OOD)泛化。
- 在实际 AI 训练中,两个模型可能达到相同的低损失(低困惑度),但路径不同:路径一是真正内化了通用知识(高 Epiplexity),路径二是暴力记忆了所有数据(低 Epiplexity)。Epiplexity 的提出正是为了识别出前者,从而指导更高效的数据选择。
2026-01-16
- AI4SE

- 腾讯技术工程
- 走向隐形化的工具
- AI 时代的工程化革命:构建知识复利系统
- 从灵感驱动的“Vibe Coding”迈向严谨的规范驱动开发 (SDD)
- Vibe Coding 的繁荣与瓶颈
- 定义:抛出提示词,期待代码运行的“氛围编程”。
- 局限:丢失整体上下文、决策轨迹不可靠、无法支撑大型复杂项目。
- 规范驱动开发 (SDD) —— 权力的倒置
- 代码不再是王道,而是规范在特定框架下的“编译”产物。
- 开发者角色转变:从“码农”变为“系统设计师”。
- SDD 标准工作流 (Specify → Plan → Implement)
- Specify (编写规范):用 Markdown 定义“构建什么”而非“如何构建”。
- Plan (制定计划):AI 生成技术实现细节,每项决策可追溯。
- Implement (实施执行):多代理协作完成原子化任务。
- 上下文工程 (Context Engineering) —— 信息生命周期管理
- 挑战:上下文腐蚀(Context Rot)导致 AI 决策退化。
- 对策:最小高信号 token 集合策略,分层组织业务、技术与经验信息。
- 工具: Agentic 文件系统抽象,将一切视为上下文。
- 复合工程 (Compounding Engineering) —— 让知识产生复利
- 原则:每一单元的工作必须使后续工作更容易。
- 沉淀:将排查信息、风险、规则自动编码进工具库。
- 目标:边际成本递减,避免重复踩坑。
- 架构升级:Subagent 协作模式
- 应对上下文窗口爆满:主 Agent 决策 + 专门化 Subagent 执行。
- 状态传递机制:通过结构化状态文件而非对话累积实现交接。
- 优点:独立上下文窗口,任务更专精且易于审计。
- 实战利器:GitHub Spec Kit 与宪章 (Constitution)
- 项目宪章:定义 AI 必须遵循的不可变原则(如测试优先、简洁性)。
- 自动化命令:
/speckit.specify到/speckit.tasks的全自动链条。
- 成效评估与开发者能力的重建
- Before (传统):编写代码 70%,需求澄清 10%。
- After (SDD):编写规范 40%,管理 AI 30%,验证 20%。
- 成果:重构时间减少 75%,错误减少 70%。
- 结语:走向隐形化的工具
- 工具的终极形态是消失,融入人的自然思考与意图表达。
- AI 工程化不是替代人,而是降低人处理已识别问题的成本。
- AI时代的工程化革命:构建知识复利系统
- 再见,程序员!硅谷全员AI Coding,卡帕西宣告9级地震来了
- Cursor Composer 大模型
- 《AI 辅助软件工程:实践与案例解析》
- 沃顿商学院证明过的Agent Skills,Superpower狂揽23.7k star,CC、Codex直接用
- AI工程vs传统工程 —「道法术」中的变与不变
- UI UX Pro Max
2026-01-09
- 共创、共享

- FIRE万事屋
- 选择、负责
- 行业巨变:AI正在重构工作本质
- 走众多AI Agents矩阵的道路
- 人类价值:完成任务 vs 对结果负责
- 在不确定中做出判断,做“价值创造者”
- 知识正变得像空气一样易得,而理解却像钻石一样难得
- 你定义问题的视角、对结果负责的勇气、跨领域连接的理解,这些才是你真正的价值
- 沟通革命:从“人与人对话”到“人与AI对话”
- 当产品经理可以直接与AI沟通生成产品文档,销售可以直接通过AI获取技术支持,传统的组织层级和部门边界就开始失去意义
- 人机协作、自动化评审、AI贡献归责
- 经验迁移:从“人承载”到“AI承载”
- 过去经验只能靠人来承载,未来经验会迁移到系统里,包括可检索的知识库与可被持续强化的记忆
- 个人突围:从“专家思维”到“一人公司”
- 在你不擅长的领域使用AI扩展能力,在你已经是专家的领域使用AI放大成果
- 未来已来:从“云时代”到“端时代”的算力迁移
- 公共AI正在成为类似互联网网的基础设施
- 边缘人工智能 (Edge AI) 通过在本地设备而非远程数据中心处理信息,在能源效率上拥有高达一万倍的惊人优势,并从根本上通过数据主权解决了云端存储容易导致的大规模隐私泄露风险
- The AI Shadow War: SaaS vs. Edge Computing Architectures
- The Rise of AI Teammates in Software Engineering (SE) 3.0: How Autonomous Coding Agents Are Reshaping Software Engineering
2025-12-26
- 无招胜有招

- 钉钉
- 将RAG深度整合进企业操作系统的底层架构中
- 从“纯软件RAG”向“软硬一体RAG”演进
- 模态RAG的应用拓展
- 通过交叉验证降低RAG幻觉
- 行业垂直场景的RAG深度集成
- 全生命周期的Agent开发平台(DEAP)
- 解决RAG服务化的核心阻碍:安全与成本
- 高效的数据清洗与标注服务
- 构建Agent市场(RAG应用的分发渠道)
- 将RAG深度整合进企业操作系统的底层架构中
- 对于企业级RAG:它提供了物理硬件支撑、多模态数据接入及多模型交叉验证,极大地提升了检索的深度和生成的准确性。
- 对于RAGaaS:它通过DEAP平台提供了标准化的开发工具、安全防范机制及基于Token的商业结算体系,降低了企业构建和使用AI能力的门槛。
- 具备自动分拣、实时更新且自带安保系统的智能化数字图书馆
- Agent-Skills-for-Context-Engineering GitHub
- GLM-4.7 有奖测评

2025-12-18
- 用RAG解决问题

- 韦东东
- 科技不应该制造焦虑,而是要解决问题
- 知识库是大部分企业AI应用的刚需起点
- 知识碎片化
- 搜索失效
- 人力错配
- 知识库这类场景,工作量的大头在数据处理而不在框架本身
- 真正能复用的,其实是工程经验和最佳实践
- 数据清洗的标准流程和质检方法
- Embedding 和 Rerank 模型的选型决策依据
- 检索策略的调参方法论
- 反馈闭环的数据库设计模板
- 关注:清洗工具链、向量入库管道、反馈数据收集框架
- NeutronRAG 是一款面向RAG系统教学与实证分析的可视化工具
- 审视美国AI投资狂潮与泡沫隐忧 真正会在泡沫破裂时造成经济灾难的,是由债务杠杆放大的投机行为
2025-12-12
2025-12-05
- ICPC:练秋湖漫谈

- 深圳新闻网
- AI要真正产生出价值,需要全社会的协作,发挥各自的优势
- 没有网络的算力是信息孤岛,孤岛化的AI无法实现真正的智能。
- 2025年AI行业综述 PDF
- The Next Great Divergence
- The Next Great Divergence PDF
- The Next Great Divergence Background Papers PDF
- Agent Framework

- 微软开发者MSDN
- GitHub Models、DevUI、AG-UI、OpenTelemetry
- 借助 GitHub Models 实现快速原型开发
- 通过 DevUI 进行可视化调试
- 利用 AG-UI 达成流畅的用户交互
- 再结合 OpenTelemetry 提供企业级可观测性
- 这一系列工具的组合,标志着我们构建智能体应用的方式迎来了范式转变
- Agent-Framework-Samples
- TradingAgents 模拟真实交易公司运作模式的多智能体交易框架
- TradingAgents-CN 多智能体与大模型股票分析
- RAG实战

- 阿里云开发者
- 用《长安的荔枝》学会构建智能问答系统
- 一、AI 如何像人一样"读书"
- 1.1 一个真实的需求
- 1.2 从"搜索"到"理解"
- 1.3 理想的解决方案
- 1.4 工作原理:三个关键步骤
- 建立"索引卡片"(Indexing)
- 找到相关段落(Retrieval)
- 生成答案(Generation)
- 1.5 关键参数的作用
- 段落大小(chunk_size)
- 检索数量(top_k)
- 重叠大小(overlap)
- 1.6 现在,让我们引入术语
- 1.7 小结
- 二、用 LlamaIndex 实现问答系统
- 2.1 什么是 LlamaIndex?
- 2.2 预期效果
- 2.3 最简代码清单
- 2.4 核心 API 详解
- Settings - 全局配置
- PyMuPDFReader - PDF 加载
- VectorStoreIndex - 构建索引
- as_query_engine() - 创建查询引擎
- query() - 提问
- 2.5 完整示例:对话式问答
- 2.6 小结
- 三、优化篇 - 参数调优的实战效果
- 3.1 实验设计思路
- 3.2 单参数影响实验
- chunk_size 的影响
- top_k 的影响
- chunk_overlap 的影响
- 3.3 组合参数优化实验
- 简单事实查询场景
- 复杂情节理解场景
- 宏观主题理解场景
- 3.4 参数配置建议
- 3.5 参数速查表
- 3.6 小结
- 四、架构篇 - LlamaIndex 的内部机制
- 4.1 整体架构图
- 4.2 核心组件详解
- 文档加载器(Document Loader)
- 文本分块器(Node Parser)
- 向量化模型(Embedding Model)
- 向量存储(Vector Store)
- 检索器(Retriever)
- 响应合成器(Response Synthesizer)
- LLM(Large Language Model)
- 4.3 数据流动全景
- 4.4 参数在架构中的位置
- 4.5 小结
- 五、Agent 化 - 让 RAG 系统能"动手"
- 5.1 RAG 的边界
- 5.2 AgentBay:为 Agent 提供工具
- 5.3 集成思路
- 5.4 何时使用?
- 5.5 延伸阅读
- 总结
- 第一部分:原理
- RAG = 检索 + 生成
- 关键步骤:切分 → 向量化 → 检索 → 生成
- 核心参数:chunk_size, top_k, overlap
- 第二部分:实战
- 核心代码 < 30 行
- 5 个关键 API:Settings, Reader, Index, QueryEngine, query()
- 支持单轮问答和多轮对话
- 第三部分:优化
- 实测效果对比
- 参数调优策略
- 针对不同场景的配置建议
- 第四部分:架构
- 5 层架构设计
- 7 个核心组件
- 参数在架构中的作用位置
- 第五部分:Agent 化
- RAG 系统的局限性
- AgentBay 工具平台介绍(广告时间)
- LlamaIndex + AgentBay 集成思路
- 适用场景与使用建议
- 最佳实践
- 1.从简单开始:先用默认配置,再逐步优化
- 2.针对性调整:根据问题类型选择参数
- 3.实测验证:用实际问题测试效果
- 4.持久化索引:避免重复构建
- 进阶方向
- 多模态:处理图片、表格等
- 混合检索:结合关键词和语义检索
- Agent:让 AI 自主决策和使用工具
- Fine-tuning:针对特定领域优化
- 第一部分:原理
- RAG被判死刑:Google用一行API架空工程师!
- Gemini API file-search
- Introducing the File Search Tool in Gemini API
- Graphiti
2025-11-28
- AI的学习能力比普通人类强吗?

- 51CTO技术栈
- 说出你对AI的思考
- 模型在语言、数学和编码上已经超过普通人类,但它们的学习能力比普通人类强吗?
- 情绪、价值函数与人类学习机制(情绪 -> 情感, 情绪 -> 价值)
- 如果你站在“预训练”的语境里看 AGI,会发现:人类其实并不是 AGI。是的,人类有一套通用的基础技能,但人类缺乏大量知识,所以人类依赖持续学习。
- 你设想的是一种能学会做所有工作的心智,而这就叫超智能。
- 想法很便宜,执行才是一切。如果想法这么便宜,那为什么没人提出新想法?
- 人类团队之所以有效,是因为有“真正不同的想法”。而 AI 团队似乎天然缺乏这种深层次多样性。
- 没有多样性,是因为 预训练。所有预训练模型都差不多,因为数据几乎一样。真正的差异其实出现在 RL 和后训练 阶段,因为不同团队做的 RL 完全不同。
- 做研究,你确实需要一定的算力,但完全不需要“史上最大的算力”
- 怎么调和模型在评测上表现极好,而实际经济影响却明显滞后的事实
- 佛法 vs AI
- 业力 与 权重
- 经历(数据)
- 业力(权重)
- 执念(过拟合)
- 六根 与 多模态
- 眼、耳(CV & Audio)
- 身(具生智能)
- 意(LLM)
- 鼻、舌(传感器)
- 美国一大学老师,公开与AI结婚
- 瑞士卢塞恩圣彼得教堂引入AI“牧师”,科技与信仰交织的新体验?!
- 当教会遇到AI技术时
- AI耶稣:瑞士教堂的创新实验与伦理争议
- Deus in machina: Experimentelle Kunstinstallation in der Peterskapelle Luzern
- 业力 与 权重
- 程序员问大师
- 实战永远第一
- 小需求也能练技术
- 深挖每个不懂的点
- 多交流
2025-11-21
- 保持战略韧性

- 砺石商业评论
- Adobe穿越软件、SaaS与AI时代
- 穿越软件、SaaS与AI时代,Adobe堪称硅谷最具进化能力的公司
- 技术创新与战略并购的完美结合
- 战略并购铺路:从创意工具到生态雏形
- 转型SaaS的攻坚战:从产品售卖到生态闭环
- AI时代的持续进化
- 战略韧性不是一蹴而就的,而是通过持续的投资和优化在公司、团队和产品三个层面构建的
- 软件公司需要将韧性思维融入DNA
- 公司层面通过战略灵活性和财务健康奠定基础
- 团队层面通过敏捷文化和技能提升保证执行力
- 产品层面通过技术卓越和用户中心设计确保长期价值
- 三者相互关联,共同增强整体抗风险能力
- 在VUCA(易变、不确定、复杂、模糊)时代,保持韧性是软件企业持续成功的关键




2025-11-14
- Microsoft 365 Copilot

- 微软科技
- 多尝试不同场景,让Copilot更懂你
- 本文中介绍的智能 Microsoft 365 Copilot 副驾驶®服务,适用于国际版的企业级服务。
- Introducing Copilot Memory: A More Productive and Personalized AI for the Way You Work
- 抓住痛点,提供价值
- 效果涌现

- 36氪
- 打牢基础、创造价值
- 2025 效果涌现
- 2024 应用来了
- 2023 生成未来
- 2022 万物智能
- 2021 AI这时代 星辰大海
- 2020 AI深耕 万物生长
- 2018 YES, AI DO
- 2017 Bring AI to Life
- 2016 AI is the new electricity
- 1990 ~ 2015 世界从你开始,从你开始,创新世界
- 以人为本的AI:多重内涵与共性
- 以人为本的智能体、以人为本的智能企业以及以人为本的智能社会
- 我将强调人具备而机器不具备的特质(数据-信念不对称性)以及简单裁人带来的组织知识流失与战略短视。进而,我提出了一种强调”AI解放人”而非替代人的组织转型思路
- 将兴趣爱好做到极致

- 老胡用AI画梦
- 把自己的技能、时间当成资产,进行产品化和规模化,从而获取最大利润
- 没有什么事情的成功是一蹴而就的,在最近爆火的西游记AI音乐创作中,我是在风口前面等的那个人而不是在风口后面追的那个人
- 老胡用AI画梦
- 阎罗王 撕了都要爱
- 孙悟空 叫我斗战胜佛
- SUNO创造AI音乐的5个步骤
- Suno V5让整个B站开始文艺复兴了
- 提示词
- 提示词(第一版)
- 课程的介绍文档
- 音乐已经申请版权
2025-11-07
- GitHub Copilot CLI

- 微软开发者MSDN
- 它出现在我工作的地方,只为了获得 AI 的帮助
- https://mp.weixin.qq.com/s/kt6jJVjIiAU_uhBSHXbhLg
2025-10-31
- Data Agent

- 阿里云开发者
- Data Agent for Analytics
- 企业级数据分析智能体
- Data Agent 定位为一款能够同时覆盖传统BI分析(描述性、诊断性)和高级分析(预测性、规范性)能力的智能体
- 描述性分析(Descriptive analytics):使用BI工具、数据可视化和展示面板来回答:发生了什么?
- 诊断性分析(Diagnostic analytics):需要更深入的分析和数据挖掘能力来回答:为什么会发生?
- 预测性分析(Predictive analytics):通过概率预测或模拟一段时间内一系列结果 来回答:可能发生什么?
- 规范性分析(Prescriptive analytics ):以结构化方式整合已有的知识和优化技术,在约束范围内寻找最佳结果并生成可执行的行动计划,以此来回答:应该做什么?
- 深度语义理解
- 上下文管理
- 幻觉抑制
- 工具的使用
- Deep Analyze

- 中国人民大学
- RUC-DataLab 张绍磊、范举 首个面向自主完成复杂的数据科学任务的智能体大语言模型
- http://se-office.ruc.edu.cn/xwdt/f1e6f2953dc64542a9ef7679edbc7b7b.htm
- 课程式 Agentic 训练方法
- 全流程数据科学
- 开放式数据研究
- 完全开源
- https://arxiv.org/pdf/2510.16872
- https://github.com/ruc-datalab/DeepAnalyze
- https://github.com/ruc-datalab/DeepAnalyze/raw/main/assets/wechat.jpg
2025-10-17
2025-10-10
- 腾讯:硅谷AI转型录

- 腾讯研究院
- AI如何作为一种基础能力,渗透并重构我们的工作
- 如何开创人机协作的新范式,如何适应甚至引领这场变革
- 黄奇帆
- 2025年9月26日,黄奇帆在2025·青岛创投风投大会发表主题演讲
- 关于投早、投小、投长,就是投资硬科技
- 推动生产性服务业、高科技产业发展,有利于GDP增长
- https://mp.weixin.qq.com/s/MnY6-SZjS-Z52_S_pF4VKA
- 阿里:构建一个功能完备的简版Claude Code

- 阿里云开发者
- 人工审查
- SubAgents机制
- TodoList实现
- 8段式压缩
- 实时 Steering 机制
- https://github.com/Yuyz0112/claude-code-reverse/blob/main/README.zh_CN.md
- https://github.com/shareAI-lab/analysis_claude_code
- https://github.com/shareAI-lab/Kode
2025-09-19
- 郑板桥:难得糊涂
- 华为:智能世界2035

- 华为
- 智能世界2035十大技术趋势
- https://mp.weixin.qq.com/s/LzAcSqeda1Sj4XXT1Im53Q?poc_token=HMSey2ij6s51ijPGtQzhmJhGxVr-0Ja6Kt5PZ9gn
- 趋势一:AGI将是未来十年最具变革性的驱动力量,但仍需克服诸多核心挑战,方能实现AGI奇点突破。因此,走向物理世界是AGI形成的必由之路。
- 趋势二:随着大模型的发展,AI智能体将从执行工具演进为决策伙伴,驱动产业革命。
- 趋势三:开发模式迎来变革,人机协同编程成为主流。人类将更专注于顶层设计和创新思考,而把繁琐的编码执行工作,交给高效的AI来完成。
- 趋势四:交互方式正从图形界面转向自然语言,并向着融合人类五感的多模态交互演进。用户通过语音、手势等方式与数字世界互动,获得深度沉浸的体验。
- 趋势五:手机App正从独立的功能实体,转变为由AI智能体驱动的服务节点。用户只需给出指令,AI智能体将调用相关服务节点,为用户提供极致体验。
- 趋势六:随着世界模型等关键技术突破,全新的L4+自动驾驶汽车将会走入人们的生活,成为“移动第三空间”。
- 趋势七:2035年全社会的算力总量将增长10万倍,计算领域将突破传统冯• 诺依曼架构的束缚,在计算架构、材料器件、工程工艺、计算范式四大核心层面实现颠覆性创新,最终催生新型计算的全面兴起。
- 趋势八:数据将成为推动人工智能发展的“新燃料”,AI存储容量需求将比2025年增长500倍,占比超过70%,Agentic AI驱动存储范式改变。
- 趋势九:通信网络的连接对象将从90亿人扩展到9000亿智能体,实现移动互联网至智能体互联网的跃迁。
- 趋势十:能源将成为制约 AI 高速发展的核心要素。到2035年,可再生能源加速替代传统化石能源,新能源发电量占比将突破50%。同时,人工智能将成为新能源系统的核心,通过Token 管理瓦特,实时管理每一焦耳的能量,从而实现更加动态和高效的电网。
- 2025 全球数智化指数(GDII) https://www.huawei.com/minisite/gdii/cn/
- https://gitea.szis.dev/szisos/tasks/src/branch/trunk/%E8%B5%84%E6%96%99/2025-09-16%20%E5%8D%8E%E4%B8%BA%20%E5%85%A8%E7%90%83%E6%95%B0%E6%99%BA%E5%8C%96%E6%8C%87%E6%95%B0%EF%BC%88GDII%EF%BC%892025%20%E6%99%BA%E8%83%BD%E8%B7%83%E8%BF%81%EF%BC%9AGDII%E4%B8%8E%E6%95%B0%E6%99%BA%E7%BB%8F%E6%B5%8E%E6%9C%AA%E6%9D%A5.pdf
- 腾讯:无状态编程
- 阿里:Prompt、MCP、SubAgents
- 设备端MCP:小智AI+闹钟提醒+定时任务

- CSDN
- 硬件 + AI + MCP
- 小智AI语音机器人 https://xiaozhi.dev/
- 小智AI聊天机器人百科全书 https://ccnphfhqs21z.feishu.cn/wiki/F5krwD16viZoF0kKkvDcrZNYnhb
2025-09-12
2025-09-05
- “深小i”AI政务助手
- Figma + TRAE

- TRAE.ai
- 从需求描述到可交付原型的完整自动化设计流程
- Align(对齐)- 需求澄清,绝不允许"我觉得你想要..."
- Architect(架构)- 先设计后编码,告别"边写边想"
- Atomize(原子化)- 大任务拆小,AI 再笨也能做对
- Approve(审批)- 人工检查,AI 想偷懒?门都没有
- Automate(执行)- 按文档执行,有据可查
- Assess(评估)- 质量验收,不合格就重来
- TRAE Rules 实践:为项目配置 6A 工作流
- Figma + Claude Code

- 知乎
- 设计转代码的终极解决方案
- F2C MCP
- F2C MCP Server
2025-08-29
-

- 新思开源
- 身、心、灵
- 一个完整的人,既要懂得保养自己的“汽车”,也要学习精湛的“驾驶技术”,更要时常抬头仰望星空
- 书评
-

- 微软开发者MSDN
- GitHub 已经将其自有 MCP 服务器开源
- GitHub
2025-08-22
- Denny Zhou:真理总是比你想象的更简单
- Palantir:从人力外包到能力外包

- 数字化转型战略指南
- AI-Powered Automation for Every Decision
- 业务深度整合能力
- 效果导向的收费机制
- 领域专有知识积累
- 2025-08-21 “AI大牛股”Palantir遭遇“黑色一周”!空头绝处逢生狂揽数十亿美元
- 业务架构建模
- 8 RAG Architectures
- 腾讯:办公+AI
- 腾讯:WeKnora
2025-08-15
2025-08-08
2025-08-01
2025-07-25
- 覃伟中:2025年深圳市政府工作报告
- 刘文强:推动人工智能创新突破和跨越发展
- 郑永年:人类整体被AI取代的危机
- 一路大白话彻底理解AI原理
- 智能数据治理实践
- 多智能体框架Intern·Agent
- TRAE SOLO Code
- CodeBuddy
- Java版AIFlowy,对标Dify
2025-07-18
- 情绪创造价值
- 迷茫时就先把手头的事做到极致
- 性能提升10倍
- Kiro:最强规范模式
- Flutter:快速生成界面代码
- GitHub Copilot
- 跨平台框架选型

- B站
- 跨平台框架终极对决
- 代理导致的上网问题
- Excel、统计学、SQL、BI、Python
-
B站
-
一、Excl
-
掌握数据清洗、函数计算、图表制作等基础操作
-
王佩丰Excel基础教程24讲完整版
-
https://www.bilibili.com/video/BV1yJ411s7wS -
Excel零基础入门
-
https://www.bilibili.com/video/BV1tz421a7yz -
二、统计学
-
理解数据分布、假设检验等核心概念,建立数据分析思维
-
系统认识数据分析
-
https://www.bilibili.com/video/BV1ZM4y1u7uF -
可汗学院统计学
-
https://www.bilibili.com/video/BV1DK4y1n7J8 -
三、SQL
-
掌握数据查询、筛选、聚合等 SQL 语句,实现高效数据提取
-
3小时学会MySQL
-
https://www.bilibili.com/video/BV1iJ411m7Fj -
MySQL基础到高级
-
https://www.bilibili.com/video/BV12b411K7Zu -
四、BI
-
掌握一款主流 BI 工具,完成数据可视化与仪表盘搭建
-
Power BI
-
https://www.bilibili.com/video/BV1sV411U7U8 -
Tableau
-
https://www.bilibili.com/video/BV1LT4y1L7BQ -
五、Python
-
掌握 Python 数据处理库(如 Pandas、Numpy),实现自动化分析
-
Python数据分析三部曲
-
https://www.bilibili.com/video/BV1ji4y157uB -
Python教程
-
https://www.bilibili.com/video/BV1HE41157bu -
利用Python进行数据分析
-
https://www.bilibili.com/video/BV1ZJ411W77D
- NebulaGraph构建智能运维
2025-07-11
2025-07-04
- 人工智能国家标准

- 百度智能云
- 标准、规范、评测、测试、案例、指南
- 人工智能检索增强生成(RAG)通用技术要求
- 人工智能检索增强生成系统评价指标与方法
- 人工智能智能体(Agent)平台通用技术要求
- 人工智能多模态智能体技术要求
- 人工智能模型即服务(MaaS)性能测试规范
- 人工智能道路交通大模型系统服务能力通用要求
- 国家人工智能产业综合标准化体系建设指南(2024版)
- 信息化标准建设行动计划(2024—2027年)
- RTX4090D Benchmark

- 金鹏
- 开始AI旅程的前期准备
- 1、设备信息检查
- 2、显存容量测试(GPU Memory Capacity)(存储空间有多大)
- 3、显存带宽测试(GPU Memory Bandwidth)(数据传输能有多快,理论上限)
- 4、FP32计算吞吐量测试(针对Tensor Core)(实际工作速度有多快,实测性能)
- GPU 核心每秒执行的计算操作数量
- 浮点运算吞吐量 (FLOPS - Floating Point Operations Per Second):用于衡量科学计算、AI 训练/推理等
- 整数运算吞吐量 (IOPS - Integer Operations Per Second)
- 5、FP16计算吞吐量测试
- 6、BF16计算吞吐量测试 (针对Ampere架构)
- 7、深度学习推理基准测试 (基于ResNet)
- 8、深度学习训练基准测试
- 9、CUDA内核启动延迟测试 (从CPU发出内核启动命令到GPU实际开始执行内核第一条指令之间的时间间隔)
2025-06-27
2025-06-20
2025-06-13
2025-06-06
- 敢闯敢试,敢为人先,埋头苦干
- 从血缘的角度破解婆媳难题
- 比特币、稳定币、数字人民币
- Mary Meeker:Trends - AI

- BOND
- 世界正以前所未有的速度被改变
- 吴恩达:AI Agents现状
- 王坚:AI的前世今生
- NLP Tagger
2025-05-30
- 智能体互联网
- IBM:Agent能解决所有问题吗?

- IBM中国
- “真假”智能体、数据是 AI Ready 的吗?、流程是自动化的吗?、回归业务本质去看待技术价值
- AI 实验的时代已经结束,企业竞争优势取决于量身定制的 AI 应用和可量化的业务成果。
- 每个企业发展阶段不一样,遇到的瓶颈也不一样,企业必须先想清楚哪个地方是真正的痛点,无论你要降本增效还是业务创新,企业的诉求自己要先想清楚。
- 企业首先要确保投资可控,因此我们团队通常会通过 POC(概念验证)和客户一起选择最典型的场景把我们的想法和产品部署上去,然后验证它的 ROI,如果满足预期再大规模部署。
- 整个 POC 的过程是 30 天左右,但每周都会对方案进行迭代,这个过程需要让客户充分参与进来,进行及时的反馈,一起验证我们是不是在一条正确的路上,如果不对就需要不断调整。
- 34个评估框架教你如何评估RAG效果
- 腾讯:AI安全风险检测工具A.I.G
- 扣子空间播客完爆NotebookLM
2025-05-23
- 端午:周六来南山看龙舟赛
- 陈平:美国经贸战逻辑
- 托克维尔:专制最欢迎利己主义
- 智能体互联网
- 真假智能体
- 智能问数
- 百度:PaddleOCR 3.0发布
- Go-Spring实战
- Vue通过指令封装高效防抖
- 正式启动算力互联网试验网建设
- 每日工作规划
2025-05-16
- 比尔盖茨:新目标
- 韦青:让AI做AI擅长的,让人更像人
- AI不再卖工具,而是卖收益
- 字节:让AI明白搜索需求
- EPOCH AI

- Epoch AI
- Epoch AI is a research institute investigating key trends and questions that will shape the trajectory and governance of AI
- Epoch AI 是一家研究机构,致力于研究将塑造 AI 发展轨迹和治理的关键趋势和问题
- 值得注意的 AI 模型
- Epoch AI Research
- 中文语言模型的扩展速度比全球语言模型慢
- Trends in AI models from China vs. elsewhere
- Open Models 落后了多远
- Trends in open-weight vs. closed-weight AI models
- CompassRank
- CompassArena: 大语言模型榜单
- Chatbot Arena
- Leaderboard: Core Scenarios
- 艾逗笔:10000个MCP Server

- InfoQ 艾逗笔(idoubi)
- Sponsored by Trae
- build with ShipAny
2025-05-09
- Python 3.14
- 地学领域基础模型GeoGPT
- 中科院:开源PPT Agent
- 华为:鸿蒙电脑5月19日发布
- 腾讯:开源跨端框架Kuikly
- 阿里:Qwen3开源
- 阿里:RAG实践深入解读
- 百度:企业高质量数据集建设
- 电信:携14家公司共建开源魔乐社区
- 工信部:算力基础设施标准
- 数据局:全国一体化算力网
- 郑南宁:机器行为与具身智能
- 丘成桐:兴趣比天赋更重要











































































































































