一组空白卡片经过木质筛选阶梯,最终陈列在用户座椅前

LLM 推荐系统工程指南:语义召回、排序、强化学习与评估

推荐系统最容易制造一种错觉:模型越新,系统就越先进。 真正做过推荐的人会知道,模型只是水面上的一小部分。水面之下还有曝光偏差、延迟预算、特征新鲜度、库存约束、探索风险和反事实评估。大语言模型(LLM)确实给推荐系统增加了新的语义入口,却没有替我们消除这些旧问题。它甚至会带来新的麻烦:成本更高、输出不稳定、解释可能看似合理却与排序依据无关。 ...

2025 年 4 月 23 日 · 13 分钟 · 6210 字 · Xinwei Xiong, Me
研究笔记中的来源页面、引用连线与决策卡片

Gemini Notebook(原 NotebookLM):从来源到决策的研究工作流

2026 年 7 月 16 日,Google 正式把 NotebookLM 更名为 Gemini Notebook。 名字变了,最值得保留的问题没有变: 我能不能沿着一段答案,走回一份自己愿意相信的证据? 这才是 Gemini Notebook 与普通聊天工具真正不同的地方。普通对话从一个宽广模型出发,靠提示词收窄范围;Gemini Notebook 先让你圈定来源,再围绕这些来源提问、比较和生成结果。它最有价值的不是“更会写”,而是缩短了生成主张到检查原文之间的距离。 ...

2025 年 4 月 21 日 · 12 分钟 · 5650 字 · Xinwei Xiong, Me
红、绿、蓝三色测试闭环环绕一个受约束的 AI 系统

AI 与大模型应用的测试驱动开发:从确定性测试到风险化评测

当被测函数只是把两个数字相加时,测试驱动开发很好解释:先写一个失败测试,让它通过,再在行为不变的前提下改善实现。困难出现在函数开始调用大模型之后——同一个问题可能有五种都算正确的回答,今天通过的结果,明天也可能因为模型、检索索引或服务端推理环境变化而不同。 ...

2025 年 4 月 21 日 · 13 分钟 · 6281 字 · Xinwei Xiong, Me
文档经过分层转换与质量检查后成为结构化 Markdown

MarkItDown 文档转 Markdown 实战:0.1.6 机制基线与 0.1.7 状态

文档转换器是一座桥,不是真相本身。真正重要的不是输出第一眼是否整洁,而是下一套系统需要的证据有没有过桥。 MarkItDown 的演示很简单:装一个包,传入文件,得到 Markdown。困难往往从下一分钟开始。一个 PDF 可能同时包含可选文字、扫描页、图表和复杂表格;一份演示文稿的关键数字可能藏在截图里;一个工作簿的含义可能依赖公式、合并单元格与空间关系。它们虽然都叫“文档”,却不该走同一条转换路径。 ...

2025 年 4 月 21 日 · 13 分钟 · 6036 字 · Xinwei Xiong, Me
带检查点、人工审批与恢复路径的 LangGraph 状态图

2026 LangGraph 架构指南:StateGraph、持久化与故障恢复

这个项目是一场持续的开源学习:每天向前一点,用真实项目训练解决复杂问题的能力,也把判断变化的过程留下来。 项目学习清单 ...

2025 年 4 月 19 日 · 6 分钟 · 2856 字 · Xinwei Xiong, Me
模型、智能体与图工作流沿三条路径汇合的克制编辑插画

LangChain 1.x 生产实践:模型、Agent 与 LangGraph 如何选

过去介绍 LangChain,常会列出 Chain、Memory、Prompt、Loader 和各种集成。那段历史没有错,却已经不适合指导今天的项目。 ...

2025 年 4 月 16 日 · 12 分钟 · 5891 字 · Xinwei Xiong, Me
多条模型调用管道汇入 AI Gateway,并由量杯与天平衡量成本和治理

AI Gateway 选型指南:LiteLLM、Kong、APISIX、Cloudflare 与 Portkey 怎么选

AI Gateway 不是“给大模型套一层反向代理”这么简单。真正进入生产以后,模型调用同时带着长连接、流式响应、令牌计费、供应商限额、敏感数据和不可预测的输出。普通 API 网关能处理其中一部分,却很难独自回答三个问题: ...

2025 年 4 月 16 日 · 12 分钟 · 5624 字 · Xinwei Xiong, Me
Jina 搜索底座模型、托管 API 与 Jina Serve 的两层架构

Jina 2026:搜索底座模型、API 与 Jina Serve 实战指南

第一次认识 Jina 时,我把它理解成“用 Flow 编排神经搜索服务的 Python 框架”。这个理解没有错,只是停在了旧地图上。 2025 年 10 月 9 日,Elastic 宣布与 Jina AI 合并力量,随后完成收购。Jina 创始人肖涵加入 Elastic 担任 AI 副总裁,模型继续通过 Hugging Face 提供,并逐步进入 Elastic Inference Service。到 2026 年再谈 Jina,更准确的起点已经不是一个通用 MLOps 框架,而是一个面向检索的 Search Foundation Models(搜索底座模型)品牌:它提供嵌入、重排、网页读取、文本切分、分类和深度搜索等能力。Elastic 的收购公告 把方向说得很明确——把多语言、多模态检索能力放到 Elasticsearch 的搜索规模与生态中。 ...

2025 年 4 月 12 日 · 9 分钟 · 4396 字 · Xinwei Xiong, Me
LangChain 1.x 模型、Agent、记忆与可观测性工程架构

LangChain 1.x 实战指南:从模型调用到可观测 Agent

一个框架最危险的时刻,不是它没有能力,而是旧教程仍然看起来能够运行。代码一旦跨过版本边界,熟悉感往往比报错更会误导人。 这篇文章只讨论 LangChain Python 1.x 的当前主线:模型、Agent、工具、结构化输出、中间件、记忆、RAG、SQL、Ollama 与 LangSmith。它不再复述 LangChain 的项目历史,也不把几十种组件罗列成字典;目标是让你拿到一条短而完整的工程路径。 ...

2024 年 5 月 22 日 · 10 分钟 · 4987 字 · Xinwei Xiong, Me
从语言模型到 RAG:理解大模型的能力、边界与工程方法

从语言模型到 RAG:理解大模型的能力、边界与工程方法

引言:不要从聊天窗口理解大模型 第一次使用大语言模型,很容易产生一种错觉:屏幕另一端似乎住着一个读过许多书、能够推理也愿意解释的人。它会写代码,会概括论文,会在同一段对话里保持语气,甚至会为自己的错误给出一套听起来完整的理由。 ...

2024 年 5 月 15 日 · 16 分钟 · 7908 字 · Xinwei Xiong, Me
从2024大模型现场笔记走向2026生产级RAG系统

2024 AI 现场笔记:从大模型涌现到生产级 RAG,2026 再校准

这篇文章最初写于 2024 年 1 月的一场大语言模型分享会。那时,行业的问题还是“模型能做什么”;两年后,更重要的问题变成了“系统凭什么值得相信”。 我没有把旧笔记涂成一篇仿佛从未犯错的新文章。时间留下的误判也有价值:它提醒我们,技术判断不是预言,而是带着证据期限的下注。以下每节都保留 2024 年的观察,并用 仍成立 / 已变化 / 当时误判 做 2026 年校准。 ...

2024 年 1 月 14 日 · 9 分钟 · 4288 字 · Xinwei Xiong, Me
一辆发条小车穿过层层受控门框,象征 AutoGPT 从 Classic 自治实验走向可治理的工作流平台

AutoGPT 2026:从 Classic 实验到 Platform 的迁移指南

状态说明(核验于 2026 年 7 月 31 日): 本文最初是一篇 2023 年的 Auto-GPT 本地安装教程。那些命令已经过时。官方现在明确说明:AutoGPT Classic 已停止支持,依赖不会再更新,并且存在已知安全问题。它适合研究历史,不适合生产使用。新项目应从仍在维护的 AutoGPT Platform,或其他活跃的工作流系统开始。 ...

2023 年 7 月 16 日 · 9 分钟 · 4084 字 · Xinwei Xiong, Me