AI代理记忆退化:多轮对话中的LLM为何崩溃
在超过200,000次多轮会话中,LLM的准确率下降39%。三种机制驱动了这场崩溃,而更长的上下文窗口对其中任何一种都无能为力。
AI & Technology关于设计、开发、AI基础设施和产品构建的思考。
在超过200,000次多轮会话中,LLM的准确率下降39%。三种机制驱动了这场崩溃,而更长的上下文窗口对其中任何一种都无能为力。
AI & Technology训练阶段的对齐失效之处,正是运行时宪法发挥治理作用的地方。能力校验、输出关口与四大子系统,共同守住代理的安全边界。
AI & Technology15,800则Obsidian笔记投入嵌入空间,显露出三种知识拓扑。每一种都有各自的失效模式——可以诊断,也可以用桥接笔记重塑。
AI & Technology本周有五个研究团队发表了关于同一问题的研究:AI智能体生成代码的速度远快于开发者理解代码的速度。债务积累在你的脑中。
AI & Technology一个能快速建立 GLSL 直觉的实用实验室:预设、实时控制、零框架 WebGL。
Interactive Explorations多数Agent指令只定义行为。缺失的一层是自我评估。基于9个月生产实践与95个hooks的元认知框架。
AI & Technology横跨650个文件、七层层级结构的AI代理上下文工程。三次生产故障、真实的token预算,以及在这些考验中存活下来的系统。
AI & Technology一个733行的 Python 流水线,从四个维度对笔记进行评分,确定性地路由7,700+条目。算法、权重以及诚实的结果。
Engineering PracticeFastAPI + HTMX + 纯CSS,零构建工具,Lighthouse满分。真实的生产数据、诚实的取舍分析,以及清晰的边界划定。
Engineering PracticeCraig Reynolds 1986 年提出的 boids 算法,用三条局部规则催生出群集行为。同样的原理与失效模式,也出现在多智能体 AI 系统之中。
Interactive Explorations负空间是基础设施,而非缺席。空无、寂静与留白如何在物理学、音乐与设计中创造结构。
Design & UX多智能体协商能捕获单智能体系统遗漏的失败。这里记录了架构设计、走过的弯路,以及真正值得构建的部分。
AI & Technology技术写作: Introl
本地运行大型语言模型的全面硬件建议和成本分析。
针对不同AI工作负载比较NVIDIA最新数据中心加速器的GPU选择指南。
深入技术分析Google张量处理单元从TPUv1到TPUv5的演进。
容器化环境中GPU集群的资源共享策略。
使用Ray框架构建和管理分布式AI计算的指南。
开源LLM经济学分析和DeepSeek的竞争定位。
未来数据中心电力需求和NVIDIA下一代GPU路线图。
为下一代AI基础设施供电的小型模块化反应堆解决方案。
DeepSeek多头压缩架构创新的技术分析。