OpenMontage 由 instruction 控制带、canonical artifact 胶片河和工具检查点验证带组成的视频生产架构图

Instructions as Code:OpenMontage 如何用工件契约编排视频生产

渲染命令退出码是 0。 MP4 文件存在,容器可被 ffprobe 读取,render_report 也符合 JSON Schema。流水线甚至可能给出 pass,建议把成片交给用户。 ...

2026 年 8 月 7 日 · 12 分钟 · 5782 字 · Xinwei Xiong, Me
Codex 多 Surface、App Server 公共契约、Submission 与 Event 双总线以及 approval 和 sandbox 副作用闸门

Codex 的协议化内核:第二个 Surface 不该复制第一个 Agent

第二个界面,往往才是一次 Agent 架构审查的开始。 只有 CLI 时,输入框可以直接调用 loop,命令结果可以直接刷进终端,审批状态也可以藏在某个局部变量里。等 IDE 侧栏、桌面端、自动化脚本和第三方客户端陆续出现,同一份内部状态会被复制成四套近似实现:它们对“当前任务是否结束”“这次 patch 属于哪个 turn”“批准以后还受不受 sandbox 限制”给出不同答案。 ...

2026 年 8 月 7 日 · 13 分钟 · 6305 字 · Xinwei Xiong, Me
Pi 最小 Agent kernel、可拆卸 extension 轨道、provider 与 host OS 信任边界以及下方 JSONL session tree

Pi 的减法:最小 Agent Kernel 保留什么,责任又去了哪里

Pi 默认只把四个工具交给模型:read、bash、edit、write。 它没有内置 Plan Mode、Todo、MCP、subagent、permission popup 或 background bash。读到这里,很容易把 Pi 写成一篇极简主义赞歌:四个工具足够,复杂框架都可以删掉。 ...

2026 年 8 月 7 日 · 14 分钟 · 6646 字 · Xinwei Xiong, Me
Open Design 作为 Coding Agent 的四平面设计工作台

Open Design 0.16.1:给 Coding Agent 一张可复用的设计工作台

Open Design 很容易被名字带偏。这个词也指更早的开放式设计运动,但本文讨论的是 nexu-io/open-design :一个把 Coding Agent 组织成设计生产系统的开源工作区。 它不是模型,也不只是一个出图工具。更准确地说,它是一套 harness——给能力加上边界、流程与反馈回路的工作台。它为 Agent 准备可控的词汇、可复用的工作方法、视觉约束、工件迭代环,以及检查结果的地方。模型和操作者依然决定质量上限,Open Design 改善的是从意图走到成品的那段路。 ...

2026 年 7 月 22 日 · 8 分钟 · 3732 字 · Xinwei Xiong, Me
当东西人人做得出来,「这是他做的」就成了信号

当东西人人做得出来,「这是他做的」就成了信号

同一个东西,换个名字,分数就变了 有一件事我观察了挺久,一直没找到合适的地方写。 在同一个产品社区里,经常会出现两个功能几乎重合的小工具。一个发出来石沉大海,另一个被反复转发、被认真提问。你去看两个产品页,做工差不多,定价差不多,落地页甚至用了同一个模板。真正不一样的地方在发布者名字后面那一行小字——「某某项目的维护者」「写了三年 xx 的人」。 ...

2026 年 7 月 19 日 · 23 分钟 · 11052 字 · Xinwei Xiong
一场衡量 Agent 舰队真实成本的路由实验

一个人养得起多大的 Agent 舰队:2026 年低价 API 与开放权重模型的成本账

一个人究竟养得起多大的 Agent 舰队? 这个问题听起来像是在数进程,其实是在找一个错误的单位。一个 Agent 可能只抽取一段文字,也可能搜索二十分钟,或者经过八十次工具调用才完成一次仓库重构。真正有意义的单位不是“Agent 个数”,而是一个被验收的任务,以及它背后的输入、输出、工具、重试和人工善后。 ...

2026 年 7 月 15 日 · 10 分钟 · 4577 字 · Xinwei Xiong, Me
open-lovable 从网页抓取到代码生成与双沙箱预览的源码架构

open-lovable 源码拆解:Agentic Search、文本协议与双沙箱

open-lovable 看起来像一句很短的产品承诺:给它一个网址,得到一个可继续修改的 React 应用。真正值得读的却不是生成结果,而是它怎样把抓取、模型输出和不可信代码执行接成一条可控链路。 ...

2026 年 6 月 29 日 · 8 分钟 · 3683 字 · Xinwei Xiong, Me
低饱和档案卡片以线索相连,象征 Mem0 OSS v3 的选择性长期记忆

Mem0 OSS v3 实践:记忆架构、混合检索与生产取舍

这篇笔记来自我对开源 AI 系统的长期拆解:先跑起来,再读迁移文档,最后记录抽象在哪些地方成立,又在哪些地方开始漏水。 问题从来不是“记得越多越好” 只要对话还装得进上下文窗口,LLM 就能维持短暂的连续感。但这不是长期记忆,更不是可靠的应用状态。会话结束之后,模型不会自然记住用户偏好简短回答、上个月换了工作,或者已经放弃某个计划。 ...

2025 年 5 月 9 日 · 8 分钟 · 3906 字 · Xinwei Xiong, Me
UFO² 桌面 AgentOS 的多智能体架构

UFO² 桌面 AgentOS:从 Windows 自动化到 UFO³ Galaxy

桌面智能体最容易给人留下印象的,是“它真的点了那个按钮”。但按钮被点中,只是演示成立;任务能否稳定结束,才是系统成立。 微软 UFO 项目几年的演进,恰好沿着这条分界线展开:2024 年的 UFO v1 证明视觉语言模型可以操作 Windows;2025 年的 UFO² 把操作提升为一个有状态、有工具、有应用边界的桌面运行时;同年末发布的 UFO³ Galaxy,则把单机能力接入跨设备编排。 ...

2025 年 5 月 9 日 · 11 分钟 · 5137 字 · Xinwei Xiong, Me
文档经过分层转换与质量检查后成为结构化 Markdown

MarkItDown 文档转 Markdown 实战:0.1.6 机制基线与 0.1.7 状态

文档转换器是一座桥,不是真相本身。真正重要的不是输出第一眼是否整洁,而是下一套系统需要的证据有没有过桥。 MarkItDown 的演示很简单:装一个包,传入文件,得到 Markdown。困难往往从下一分钟开始。一个 PDF 可能同时包含可选文字、扫描页、图表和复杂表格;一份演示文稿的关键数字可能藏在截图里;一个工作簿的含义可能依赖公式、合并单元格与空间关系。它们虽然都叫“文档”,却不该走同一条转换路径。 ...

2025 年 4 月 21 日 · 13 分钟 · 6036 字 · Xinwei Xiong, Me
带检查点、人工审批与恢复路径的 LangGraph 状态图

2026 LangGraph 架构指南:StateGraph、持久化与故障恢复

这个项目是一场持续的开源学习:每天向前一点,用真实项目训练解决复杂问题的能力,也把判断变化的过程留下来。 项目学习清单 ...

2025 年 4 月 19 日 · 6 分钟 · 2856 字 · Xinwei Xiong, Me
模型、智能体与图工作流沿三条路径汇合的克制编辑插画

LangChain 1.x 生产实践:模型、Agent 与 LangGraph 如何选

过去介绍 LangChain,常会列出 Chain、Memory、Prompt、Loader 和各种集成。那段历史没有错,却已经不适合指导今天的项目。 ...

2025 年 4 月 16 日 · 12 分钟 · 5891 字 · Xinwei Xiong, Me
多条模型调用管道汇入 AI Gateway,并由量杯与天平衡量成本和治理

AI Gateway 选型指南:LiteLLM、Kong、APISIX、Cloudflare 与 Portkey 怎么选

AI Gateway 不是“给大模型套一层反向代理”这么简单。真正进入生产以后,模型调用同时带着长连接、流式响应、令牌计费、供应商限额、敏感数据和不可预测的输出。普通 API 网关能处理其中一部分,却很难独自回答三个问题: ...

2025 年 4 月 16 日 · 12 分钟 · 5624 字 · Xinwei Xiong, Me
GPT Researcher 深度研究代理的检索、证据与报告生成流程

GPT Researcher 源码审计:深度研究代理如何检索、写作与自托管

研究工具最容易制造一种错觉:报告越长,答案越可靠。源码给出的提醒恰好相反——真正值得审计的不是字数,而是问题怎样被拆开、证据怎样进入上下文,以及结论能否回到来源。 ...

2025 年 4 月 14 日 · 7 分钟 · 3350 字 · Xinwei Xiong, Me
Jina 搜索底座模型、托管 API 与 Jina Serve 的两层架构

Jina 2026:搜索底座模型、API 与 Jina Serve 实战指南

第一次认识 Jina 时,我把它理解成“用 Flow 编排神经搜索服务的 Python 框架”。这个理解没有错,只是停在了旧地图上。 2025 年 10 月 9 日,Elastic 宣布与 Jina AI 合并力量,随后完成收购。Jina 创始人肖涵加入 Elastic 担任 AI 副总裁,模型继续通过 Hugging Face 提供,并逐步进入 Elastic Inference Service。到 2026 年再谈 Jina,更准确的起点已经不是一个通用 MLOps 框架,而是一个面向检索的 Search Foundation Models(搜索底座模型)品牌:它提供嵌入、重排、网页读取、文本切分、分类和深度搜索等能力。Elastic 的收购公告 把方向说得很明确——把多语言、多模态检索能力放到 Elasticsearch 的搜索规模与生态中。 ...

2025 年 4 月 12 日 · 9 分钟 · 4396 字 · Xinwei Xiong, Me

探索开源以及开源商业模式研究

开源为我带来了很多的成长,很多的成长经验和学习途径都是通过开源获取到并且学习到的。 这里有一篇我的第一次开源的成长指南:/zh/engineering/posts/open-source-contribution-guidelines/ ...

2024 年 4 月 13 日 · 51 分钟 · 25336 字 · 熊鑫伟,我
废弃的胶片越过桥梁,连接到模块化视频工作流

Sora 停服之后:SoraEase 提示词档案与开发者迁移指南

2024 年 3 月,这个页面还是一份很长的 Sora 提示词合集。那是一个奇特的阶段:大多数人还没有真正用过产品,研究预览里的几段视频却已经催生了开源仓库、提示词拆解和关于新媒介的想象。我们记录镜头运动、材质和光线,试图从有限样本中辨认一种语法。 ...

2024 年 3 月 14 日 · 11 分钟 · 5161 字 · Xinwei Xiong, Me
关于2023年

回顾与前瞻:我的2023年度总结报告

我的 2023 年度总结 2023 很快就要过去了,转眼间大学生活只剩下最后半年了,我一个朋友说过,工作的越久越是觉得:*可怕的不是你失去了工作的激情,而是再也找不回来了。* ...

2023 年 12 月 31 日 · 19 分钟 · 9380 字 · Xinwei Xiong, Me

对开源商业化的思考 & 全球流量大会(GTC)学习以及总结

引言:深圳福田会展中心的全球视野 2023年12月6日,在深圳福田会展中心,GTC 2023 全球流量大会如火如荼地展开。这场盛会汇集了来自全球的技术精英,共同探索互联网行业的前沿动态和未来发展趋势。身为参与者,我有幸深入这场融合科技与商业的交流盛会,特别是“聚焦开源,扩展出海新领航”这一议题,让我收获颇丰,印象深刻。 ...

2023 年 12 月 7 日 · 21 分钟 · 10248 字 · 熊鑫伟,我

在开源社区中学会如何提问

author(Github) 在提问之前 在你准备要通过电子邮件、新闻群组或者聊天室提出技术问题前,请先做到以下事情: 尝试在你准备提问的论坛的旧文章中搜索答案。 尝试上网搜索以找到答案。 尝试阅读手册以找到答案。 尝试阅读常见问题文件(FAQ)以找到答案。 尝试自己检查或试验以找到答案。 向你身边的强者朋友打听以找到答案。 如果你是程序开发者,请尝试阅读源代码以找到答案。 当你提出问题的时候,请先表明你已经做了上述的努力;这将有助于树立你并不是一个不劳而获且浪费别人的时间的提问者。如果你能一并表达在做了上述努力的过程中所学到的东西会更好,因为我们更乐于回答那些表现出能从答案中学习的人的问题。 ...

2023 年 9 月 17 日 · 36 分钟 · 17648 字 · 熊鑫伟,我
在变更发布前执行检查、校验与批准的机械质量控制线

我的实践总结:开源社区的规范设计思路

社区不规范怎么办 作为 OpenIM 社区首席运营官,对整个社区的 communtiy 以及 GitHub 配置仓库 进行了全面的配置。并且对整个 OpenIM 的 Makefile 和 CICD 流,以及整个 OpenIM 使用的日志包 、错误码、协同流、贡献者文档以及 社区文档 进行架构和设计。 ...

2023 年 9 月 16 日 · 5 分钟 · 2482 字 · 熊鑫伟,我
一辆发条小车穿过层层受控门框,象征 AutoGPT 从 Classic 自治实验走向可治理的工作流平台

AutoGPT 2026:从 Classic 实验到 Platform 的迁移指南

状态说明(核验于 2026 年 7 月 31 日): 本文最初是一篇 2023 年的 Auto-GPT 本地安装教程。那些命令已经过时。官方现在明确说明:AutoGPT Classic 已停止支持,依赖不会再更新,并且存在已知安全问题。它适合研究历史,不适合生产使用。新项目应从仍在维护的 AutoGPT Platform,或其他活跃的工作流系统开始。 ...

2023 年 7 月 16 日 · 9 分钟 · 4084 字 · Xinwei Xiong, Me

开源的阶段性成长指南

✨ 熟悉我的人都知道,我是一名不折不扣的开源爱好者,从大一开始接触到 GitHub 后,逐渐的沉迷于 开源世界 ~ 今天这篇文章很特别,算是自己参考并且总结出来的开源阶段,以及学习开源项目的步骤和心得。未来自己也是按照自己的规划来进行成长。 同学习 Kubernetes 的成长轨迹 一样,这篇文章将会长期更新,也可以参与贡献 ~ ...

2023 年 5 月 16 日 · 14 分钟 · 6699 字 · Xinwei Xiong, Me

参与我们的区块链学习平台项目

参与本项目 ⚡ 前言 欢迎来到我们的项目!本项目旨在建立一个基于区块链的全民学习平台,通过集体的智慧和努力,推动技术和知识的普及。无论你是初学者还是经验丰富的开发者,你的贡献都将对项目产生积极影响。 ...

2022 年 2 月 1 日 · 4 分钟 · 1923 字 · 熊鑫伟,我