AI Product & Workflow Portfolio Problem · Evaluation · Delivery
AI Product / Agent Workflow / Evaluation

目标方向:AI 产品经理 / AI 解决方案 · 数据科学硕士(计算语言学 / NLP)

把模型能力收束为可验证的业务工作流

我从业务问题和流程节点出发,定义输入、评测标准与人机边界;通过一次企业文本分析有偿交付,以及 Agent 工作流、模型评测与公开产品实践,把方案推进到可复核的交付物。

Product / Tech Methods Workflow Evaluation Human-in-the-loop Tool Calling
企业 AI 有偿交付 AI 友好型需求文档与 UI 原型 Tool Schema 与上下文边界 Codex / Claude Code 工作流实践
Capability & Evidence Map

四类能力,分别由项目证据支撑

先看我能承担什么,再进入主案例与关键产品判断。

01

需求与流程拆解

将模糊目标拆成输入、处理节点与交付结果。证据:企业年报文本分析有偿交付。

02

需求文档与原型

把产品流程写成数据模型、功能约束与验收清单。证据:AI 带读教练。

03

结构化交互与边界

以 Tool Schema、上下文裁剪和有界循环控制模型可见能力。证据:PersonalOS Agent。

04

验收与交付闭环

用测试、运行记录和人工复核判断是否交付或扩围。证据:主案例、带读教练与费用预检。

Additional Product Judgment

补充产品判断:三个信号决定边界、纠偏与停止

功能完成只是一个信号;还要判断哪里会错、谁来兜底,以及证据是否支持继续扩围。

从偏差信号到产品决定

每个判断都保留四个要素:初始做法、偏差信号、纠偏动作与可复用原则。

01Evidence is not a violation
流程节点 AI 化 · 费用预检 · 人机协同

证据缺失,不等于业务违规

预检阶段判断证据能否进入规则审核,最终审批由费用会计负责。

偏差信号早期规则把附件缺失与已证实违规一起归入 REJECT。
纠偏动作将缺失、冲突与待核实证据改为 FLAG,输出补证或人工核实动作。
固化原则用 T10 回归测试固定分流规则:证据不足进入 FLAG,审批结论继续由人工负责。
职责分工:预检输出证据状态与补证建议,人工负责审批与付款决定。
02Passing tests is not expansion readiness
评测门槛 · 费用预检

边界测试通过,不等于可以扩大自动化

12/12 条边界测试通过,只能证明关键规则被实现;30 条标注样本的决策准确率为 63.33%,低于预设 80% 门槛。

偏差信号工程测试结果与业务样本表现出现明显落差。
产品决定停止扩围,保留人工复核与只读流程。
下一步先补齐只读采集、样本评测与人工抽查,再重新判断自动化范围。
产品决定:评测结果低于门槛,停止扩围并保留人工复核。
03Executable is not safe
Text2SQL · 状态机工作流

SQL 可执行,不等于语义与权限安全

查询即使能生成执行计划,仍可能包含无关联 JOIN 或触及敏感字段;因此可执行性不能代替风险判断。

偏差信号缺少关联条件的 JOIN 仍能通过执行计划检查,却可能产生笛卡尔积。
纠偏动作将 AST 校验、人工审批与只读运行环境放到执行之前。
固化原则模型只提出候选;规则、权限与人工共同决定是否执行,并保留有限重试和审计。
完成内容:在 SQLite 示例数据库中验证 AST 校验、人工审批、只读执行、有限重试与审计链路。
新增开源贡献 · PR #17 已合并补充 Text-to-SQL Schema 选择与关联路径的中英双语说明,并实现独立的 Python / SQLite 评测工具:9 个测试输入,34 项自动化测试通过。
查看 Schema 评测案例与报告 查看已合并 PR
Implementation Evidence

与岗位能力对应的六组实现证据

每项只回答三件事:任务是什么、关键判断是什么、目前有什么可复核结果。

AI 带读教练Structured Spec · Stateful UX · Acceptance
AI 友好型需求与 UI 原型

把一次性问答改造成有状态、可追踪的领读产品

任务:按读者画像生成全书裁剪地图、逐章领读稿和迁移应用题,并持续记录章节进度。
判断:先定义数据模型、分块功能、生成边界与验收清单,再让 AI 辅助实现;生成链路采用厂商无关 HTTP Agent 接入,并保留本地降级。

查看需求、原型与验证记录 查看 GitHub 源码
状态
React / TypeScript 阅读产品
验证
36 条单测 · typecheck / eslint / build
产出
结构化需求、UI 原型与验收清单
PersonalOS AgentTool Schema · Context Boundary
结构化交互 · Tool Calling

用 Schema 裁剪与有界循环控制模型可见能力

任务:让模型在知识检索、全文检索等能力之间提出调用意图,由系统执行受定义的工具并回填结果。
判断:按问题裁剪可见工具 Schema,同时限制工具结果、历史消息和 Agent Loop,把对话与已用工具留存到本地。

查看交互边界与项目说明
状态
本地应用模块
边界
最近 10 条历史 · 最多 10 轮循环
留存
SQLite 会话与工具记录
WeRead AI BrainExternal Data · Analysis · Export
公开产品 · 外部数据接入

把阅读数据接入分析与 Markdown 导出流程

任务:连接用户授权的微信读书数据,完成可视化、概念分析与结构化导出。
判断:公开仓库需要把依赖、密钥配置和运行方式讲清楚,才能形成可复现入口。

ClawHub 累计下载量
623
正在从 ClawHub 更新
ClawHub 公开累计下载量;数据时间:2026.08.12
查看项目说明
状态
GitHub 开源 · Skill 发布
输入
用户自行配置 API Key
产出
可视化与 Markdown
模型任务评测Failure Modes · Tool Use · Verifiability
模型评测 · 失败归因

用失败标签检查模型能否完成复合任务

我在 OpenClaw 与 Hermes 两种执行环境下,对 5 个代号模型执行 3 类复合任务,记录工具调用、文件处理、代码执行、数据分析与产物保存表现。

  • 不以回答流畅度替代任务完成;识别上下文丢失、工具链路中断、产物格式不一致等失败模式。
  • 关注结论是否有数据支撑、失败能否恢复、结果能否被用户验证。
代号说明公开页沿用评测记录中的模型代号,重点呈现任务完成与失败类型,不作通用模型排名。
查看任务范围与项目说明
形式
模型任务评测
范围
5 个代号模型 · 3 类任务 · 2 种环境
产出
失败模式与 Badcase 判断
科学营养顾问 SkillProfiles · Logs · Safety Boundaries
公开产品 · Skill 发布

把一次性建议整理为可持续使用的 Skill 流程

我将营养咨询拆为用户档案、目标计算、每日记录、进度看板、场景建议与周期复盘,覆盖 12+ 健康管理场景(公开产品说明),并设置特殊人群与健康安全提示。

ClawHub 中英文合计下载量
1,271
正在从 ClawHub 更新
ClawHub 公开累计下载量;数据时间:2026.08.12
状态
公开发布
范围
12+ 场景 · 中英文版本
证明
状态设计与产品化闭环
RAG & MCPRetrieval · Protocol · Tool Use
检索与工具协议 · RAG / MCP

用可运行实验验证检索方案与工具协议

我用 LangChain 与 LlamaIndex 分别实现 RAG 管线,对照切分、Dense + BM25 召回与 RRF 重排;同时用 Python 标准库实现 JSON-RPC 2.0 over stdio 的最小 MCP server。

  • MCP server 提供 2 个工具;自建 client 完成 initialize、tools/list 与 tools/call 冒烟测试。
  • 验证覆盖协议握手、工具发现,以及自建 client 对 2 个工具的调用链路。
查看实现方式与测试记录
形式
检索管线与协议实现
范围
双框架 RAG · 2 个 MCP 工具
产出
可运行管线与协议测试
Product Principles

我如何判断一个 AI 方案值得继续做

三条原则分别约束问题定义、人机责任与扩围决策。

01

先定义任务结果与失败

明确用户、流程、完成标准和失败类型,再判断是否需要引入 AI。

02

分开模型、规则与人工责任

模型提出候选,规则拦截确定风险,人工对高风险业务动作负责。

03

用评测和外部证据决定扩围

预先设定门槛与停止条件,让样本表现、测试和真实交付改变产品决定。

Next Conversation

如果你的团队正在把 AI 能力落进真实业务流程

我希望参与 AI 产品的需求拆解、评测标准定义与交付闭环,把模型能力转化为可验证、可协作的人机工作流。

关注问题 业务流程 AI 化
Agent 工作流与人机协同
评测标准与交付闭环