口诀14年ToB,国能6Agent,简历+财税双项目
图像锚点时间轴叠积木 — ERP/OA(24→35家)→ 国能 6 款 Agent → 2026 双项目(简历 + 财税客服)
拆解14年ToB · 6 Agent · 简历 0-1 · 财税 Coze 客服(口述不说年龄)
练法闭眼念口诀 → 看核心速记绿条 → 扩口述长段(点 🦴 骨架 先只背速记)· 五步示范见总览 「示范 · 块 1 自我介绍」
块 1 · 120 秒自我介绍(必背 · 可直接念 · 对齐简历)
核心速记开场 · 14年ToB · Java出身 · 求职AI PM · 广州;
大家好,我叫马凯强,在广州,14 年 ToB 产品经验,Java 开发工程师出身,求职 AI 产品经理,期望在广州发展。
核心速记2025 前做数字化(ERP/OA,24→35 家,100% 使用率);
2012 到 2025 年 4 月,我主导 业财一体化 ERP、移动 OA、财税知识付费 等 10 多款 集团级产品从 0 到 1,擅长复杂流程、数据治理和跨系统集成,带过团队;在金不换支撑分公司从 24 家扩张至 35 家,集团约 六百人、系统使用率 100%——这段是 数字化项目,不是 AI 项目。
核心速记2025 后国能 · Dify · 6 Agent · 编排/Prompt/评测;
2025 年 5 月到 2026 年 2 月,我在金安尚科技驻场国能肇庆,基于 Dify 从 0 搭了 6 款集团级 AI Agent——制度 RAG 问答、人事 NL2SQL 查数、培训出题、隐患分类派单、缺陷闭环跟踪。
我主要负责需求拆解、工作流编排、Prompt 工程、Bad Case 复盘和效果评估。
上线后主要看三类结果:制度/人事咨询自助化率 100%,人工咨询 降约 70%,准确率 ≥95%;数据查询从小时级到秒级,成功率 ≥95%;隐患分类准确率 ≥95%,并且 人工确认后再生效。
核心速记2026 双项目 · 简历 0-1(需求+39页+后台)+ 财税 Coze 客服;
2026 年 2 月 国能交付离职后,我同时在推两个项目。一个是 C 端 AI 简历优化,从 0 做起:先梳理用户场景和主路径,然后写成 PRD,最后设计了 39 页小程序原型和运营后台,整条链路都齐了;用户大概 15 分钟 能从摸底走到导出简历,我自己用 Cursor 把主路径跑通验证过。另一个是 财税代理记账客服,我是在 Coze 上搭的:业务咨询走 RAG,查进度走 HTTP 对接业务系统;常见问题 Agent 自动解答,减少一线销售重复解释。
核心速记收尾 · 对研发对指标权限日志 · 日志可追;
跟研发对指标、权限、日志,这块我比较熟——上线后出了问题,日志也能追得回去。谢谢。
口径口径(心里记住,不必念出来):自我介绍不说年龄(简历/登记表有即可,被问到用下方「年龄偏大」追问答);2025.05 前 只讲 ERP/OA/数字化;2025.05 起 才讲 LLM/Agent。名词不懂(FAQ、Chunk、ChatBI…)→ 先查 附12 人话词典,再回项目举例。
常见追问:为什么用 Dify,不做一个「AI 对话框」让用户直接问?
问法:「为什么不接个大模型聊天框?」「ChatGPT 套壳不行吗?」
💬 你可以这样答
我们早期也试过 「一个对话框 + 大模型」,在国能这种央企 ToB 里,单靠聊天框不够用。
举个人事的例子:查制度得先检索,没命中不能编;查人数要走 NL2SQL、只读库、还要按权限脱敏——这不是问一句答一句能兜住的。隐患那边更要固定 JSON、人工确认了才进工单,是一条 工作流。
企业还关心能不能改 Prompt、复盘 Bad Case、看审计日志。Dify 上节点能拆开改;要是纯对话框,这些全塞进自研前后端,周期和运维都更重。
成本也扛不住——人事那边要是 每个问题都调大模型,费用难看,准确率还不稳。所以我们把高频问法放 FAQ 本地匹配,复杂的再走模型,Token 省了 60% 以上。
所以我选型的习惯是:简单场景 对话或 FAQ 够用;复杂场景 工作流 + 检索 + 工具。Dify 是国能当时的载体,换自研平台也一样,先把流程、权限、评估定清楚。简历项目也不是一个大聊天框,是 分步主路径 + 后台可配。
常见追问:年龄偏大 / 1990 年 / 35 岁还做 AI 产品吗?
问法:「你年龄不小了」「1990 年的,跟得上 AI 吗?」「我们更想要年轻人」
💬 你可以这样答
我明白您担心落地交付,我有 14 年 ToB 行业积累,完整落地过多款 集团 AI Agent,合规、Bad Case 管控、全流程上线这套实战经验十分扎实。
年轻人上手工具更快,我的核心优势是 吃透企业复杂业务、统筹多方推进规模化落地。
口径口径(心里记住):不道歉、不贬低年轻人(可说「年轻同事工具学得快」);强调 互补 而非 替代;被问到年龄/1990 年再答,不主动在自我介绍里报岁数。
常见追问:项目链接里怎么只有小程序,后台呢?
问法:「你这项目是不是只做了前端?」「运营后台在哪?」
💬 你可以这样答
链接里只放了小程序前端页面,后台内容因为项目保密没有对外展示;整套 B 端后台原型、相关文档我本地都有,您想看我可以当场打开电脑展示。
口径口径 · 现场怎么展示(不用背):公开链接因项目保密,目前只放了 C 端演示;后台和完整接口包 面试时可以现场打开(本地 HTML 原型 + 交接文档),或按模块 口述清单。我角色是 产品经理,原型是 Vibe Coding 验证;正式上线仍要研发工程化,但 后台怎么配、接口怎么定 是我输出的。
②块 2
Agent 记忆 + MCP · 第 1~2 天
口诀记忆分四层,MCP 是插座
图像锚点四层抽屉(工/短/中/长期)+ 插座板插 SQL、RAG、工单
拆解四层=工作→短期→中期→长期 · 面试答法收敛 三层(会话/业务库/偏好)· MCP=统一协议,国能用 Dify 工具节点
迷你口诀MCP 产品 → 清单·说明书·监控·安全·确认
练法闭眼念口诀 → 看核心速记绿条 → 扩口述长段(点 🦴 骨架 先只背速记)
块 2-1 · Agent 长期记忆 / Agent Memory(必背)
问法:「你们 Agent 有记忆吗?」「如果要跨会话记住用户,你怎么做?」
【扫一遍 · 四层概念(面试口述只背下面三层版)】
概念上可分工作/短期/中期/长期四层;上场只念下方「三层版」,别跟面试官堆四层名词。
核心速记口述 · 三层(会话/业务库/偏好);四层仅查阅;
【必背 · 2 分钟 · 面试主力答法(ToB + 国能实线)】
💬 你可以这样答
核心速记总述 · 三层 · 不让模型「记住用户一切」;
我一般把 Agent 记忆分成 三层,不会一上来就让大模型「记住用户一切」。下面我分三块说清楚。
核心速记①会话内 · N 轮 + 槽位(工号/部门/工单);
- 第一块 · 会话内记忆:这一轮对话里用户说了什么、查到哪一步。做法是 保留最近 N 轮 + 关键槽位(工号、部门、时间范围、工单号)。人事 NL2SQL、缺陷跟踪 主要用这套,够应对连续追问。
核心速记②业务库 · 查工单不脑记 · 可审计 · 国能未上跨会话长期记忆;
- 第二块 · 业务库记忆(ToB 我默认推这个):不让模型「脑记」业务数据,而是 按用户 ID / 工号查业务库——工单状态、考勤结果都这么拿。更准、可审计、好做权限。国能 跨会话长期记忆没上线,主要是 隐私、等保、审计;用业务库替代,用户该查到的还是能查到。
核心速记③偏好 · 记什么/不记什么/多久/怎么用 · Profile+评测;
- 第三块 · 用户偏好(跨会话才需要):比如默认查近 30 天、喜欢表格展示——这才单独存 User Profile。产品设计时我先定四件事:记什么(只记偏好)、不记什么(薪资/处分等敏感原文)、记多久(过期删、用户可导出删除)、怎么用(检索片段注入 Prompt,不塞全量聊天记录)。研发做表结构和加密,我出 PRD:字段、授权、兜底话术、评估指标。
核心速记收尾 · 国能合规未上第三层 · 可小范围试点;
效果怎么看:用户是否少重复说一遍、任务成功率是否提升;还要看 误记率、隐私投诉——记错了比没有更伤。
🏁收尾
国能因合规 没上第三块;若贵司要做,我会从 小范围试点 开始,比如只记「默认查询时间范围」,验证后再扩。
块 2-2 · MCP(必背)
问法:「了解 MCP 吗?」「我们工具很多,怎么接 Agent?」
💬 你可以这样答
核心速记定义 · MCP=大模型接工具的「统一插座」;
MCP(Model Context Protocol)可以理解成 大模型接外部工具的「统一插座」——数据库、HTTP、文件都用同一套协议接进来,换平台时工具不用重写一遍。
核心速记国能 · Dify 工具节点 · 职责同 MCP(Schema/权限/审计);
国能现场我实际怎么做的:主要用 Dify 工具节点、HTTP 插件、代码节点,没以 MCP 名义上线,但职责一样——定 Agent 能调哪些工具、入参出参 Schema、超时重试、权限和审计。
核心速记PM 五件事 · 清单/说明书/编排/监控/安全;
若贵司要上 MCP,我作为 AI PM 一般会盯五件事:
- 工具清单:哪些给 Agent 用,哪些不给(最小权限)
- 每个工具的说明书:干什么、失败怎么提示、要不要用户确认
- 和编排怎么接:Dify/自研框架里 MCP Server 怎么注册
- 监控与 Bad Case:哪个工具失败最多、延迟怎么样
- 安全兜底:敏感操作必须 人工确认 或二次鉴权
核心速记收尾 · 未主导 MCP 选型 · 6 Agent 编排做过 · 方法论相通;
🏁收尾(诚实边界)
我 还没在生产环境主导 MCP 选型,但 6 个 Agent 的工具编排、降级、复盘我都做过;迁到 MCP 主要是 协议层变化,产品上要盯的还是这五件事。入职后我会先熟悉贵司规范,选一条业务线试点。
📚第二阶段
块 1~6 顺读后再查阅 · 附1~12 / 加餐
以下 不用按顺序全文背(附13 已在上方块 5 顺读过)。面试前 30 分钟扫 附9 考前清单;被问到再翻 附2 定位题、附3 技术词、附11 抖音补题。
🎯【口诀·附2+附3】不念给面试官 · 先口诀再扩绿条 口诀转AI有落地,分工有边界;RAG搜、SQL查、Func调、MCP联
图像锚点三角(国能 / 简历 / 14年ToB)+ 四插头插座板(技术词)
拆解附2=定位6题 · 附3=技术词深答 · 附12=名词人话+项目举例 · 附11=抖音补题 · 块1~6顺读后再扫 练法考前30分钟扫口诀+附9;面试中被问再展开,不抢在块1~6前面背
附1 · 面试地图(一场面试四段话用哪一块)
| 面试官在问什么 | 用哪一块 |
|---|
| 自我介绍 / 为什么转 AI PM | 块 1 + 附2 |
| Agent 记忆、MCP、ReAct、怎么设计 | 块 2 + 附4 |
| 介绍项目、RAG、NL2SQL、Bad Case | 块 3 + 附5(含 财税客服 J) |
| 概念题、RAG 流程、Prompt、成本、意图识别 | 块 4 + 附3 + 附11(Prompt 开口 → §18) |
| 方法论单独考(AI PM 全流程 / 评测体系 / Harness / Agent 怎么评) | 块 5 · 附13(已前移 · 不必跳附3) |
| 抖音引流题(只抛问题没答案) | 附11 |
| FAQ / Chunk / ChatBI 等名词不懂 | 附12 人话词典(是什么→干什么→项目举例) |
| 行为面、离职原因、挑战 | 附7 |
| 反问 | 附8 |
附2 · 定位类 6 题
1. 为什么转 AI 产品经理?
问法:你为什么做 AI PM?是不是跟风?
💬 你可以这样答
我不是去年才开始接触 AI。之前十几年一直在做 ToB,ERP、OA、人事系统、数据治理都做过,擅长把业务流程和产品落地。2025 年 5 月起在国能肇庆,我从 0 参与设计了 6 款 Agent 上线,制度 RAG、人事和燃料 NL2SQL、培训出题、隐患派单、缺陷跟踪都有,从需求、工作流、Prompt、评估到 Bad Case 复盘我都负责。2026 年 2 月离职后 并行两个 AI 产品:C 端 AI 简历优化(PRD、39 页原型、全模块运营后台、研发交接)和 财税代理记账智能客服(Coze 工作流、意图分流、RAG、HTTP 查进度),后者和我 8 年代账行业 经验是连上的。所以转 AI PM 是有项目支撑的,不是只看热闹。
2. 你和算法 / 后端怎么分工?
问法:AI 产品和技术怎么配合?你会不会只是写 PRD?
💬 你可以这样答
我定场景、用户路径、成功指标,还有 Prompt 和工作流怎么编排、什么必须人工审核、Bad Case 怎么闭环。算法和后端负责模型选型、向量库、SQL 引擎、权限和性能。我开发出身,能看懂接口和日志,联调时不会对扯皮。举个例子:人事 NL2SQL 里「部门口语化查不对」,我会和研发一起看是别名表问题还是 Prompt 问题,改完用同一批测试题验证,而不是只说「效果不好再优化」。
3. 你学的是不是皮毛?抖音那些 Agent 记忆、MCP 你懂吗?
问法:感觉 AI 变化很快,你跟得上吗?
💬 你可以这样答
我不靠背论文,我靠落地。每个 Agent 都有准确率、自助化率、Token、幻觉这些指标,还有每周抽检和 Bad Case 表。抖音上的 Agent 记忆、MCP,我理解概念,也清楚产品该怎么设计——国能因为央企合规,跨会话长期记忆我们没上,用的是业务库加会话上下文;MCP 我现场用 Dify 工具节点,原理一样。如果贵司要用 MCP 或长期记忆,我可以按 块 2 那套思路讲怎么设计,和我现有经验是接得上的。
4. 2018 年以前的 ERP 还要讲吗?
问法:你简历很长, oldest 的项目和 AI 有什么关系?
💬 你可以这样答
老项目证明我有 ToB 基本功:复杂流程、多组织、数据口径、跨系统集成、带团队。AI 能力从 2025 年 5 月 国能 Agent 才开始写。面试时老项目我讲数字化成果;AI 细节只绑 Agent 和 C 端简历,不会把 ERP 说成 AI 项目。
5. 期望薪资 30~35K 的依据?
问法:你的期望为什么是这个区间?
💬 你可以这样答
结合广州市场和岗位:14 年 ToB 产品经验、带团队、研发背景,加上近一年 6 款 Agent 从 0 到上线,以及 C 端 0-1 的 PRD 和原型交付。我更看 能力匹配 和 能独立负责 AI 场景,具体可以聊。
6. 你日常用哪些 AI 工具?(抖音常问)
问法:你平时用什么 AI 工具?
💬 你可以这样答
工作流编排用 Dify 做 Agent;产品验证用 Cursor 做 Vibe Coding,C 端 39 页原型很多是这样快速搭出来再交给研发的;文档和 PRD 用大模型辅助写结构和润色,但业务规则、指标、合规我自己定稿;协作用常规办公和项目管理工具。工具会变,关键是 场景、指标、Bad Case 这套方法不变。
附3 · 技术词查阅(17 个)
用法:面试官 点名某个词 时用本章;若他说「讲讲你做的制度问答」,直接去 第五章 G,别整章背。 结构:什么时候答(不用背)→ 正文(要背的口语)→ 结合项目(有则背)→ 常见追问(被追问再看)。 面试官不懂英文时:先说「就是……」人话,再讲项目里哪一步,别只堆 RAG、HITL 等缩写。 名词第一次没听懂:先翻 附12 人话词典(FAQ、Chunk、ChatBI… 各带 1~2 个你项目里的例子),再回 附3 深答。 项目别混:国能 = 6 款 ToB Agent(文本);AI 简历优化 = 独立 0-1(含 OCR/多模态);财税客服 = Coze 工作流(意图+RAG+HTTP)。
1. RAG(检索增强生成)
不用背什么时候答:简历写了制度问答 / 培训出题;或问「怎么防幻觉」「知识库怎么建」。
RAG 就是先查资料再回答。大模型自己编容易瞎说,我们先从制度库、题库里检索相关段落,再让模型只根据检索到的内容组织答案,这样私有知识能更新,幻觉也会少很多。
结合项目:
在国能我做了两个 RAG:制度问答 和 培训出题。制度是按章节切分,有重叠,再向量检索,Prompt 里写死「没有检索结果不许编,要引导找人工」。培训出题是在五大题库里按类别检索,再出题,避免跨类、避免编造。
💬常见追问 · 口语答
Chunk 怎么切?
按制度章节或条款切,一段大概 200~500 字,相邻段 重叠 10%~20%,避免一句话被切两半导致搜不到。
召回率低怎么办?
先看是切分问题还是检索问题:可以 混合检索(向量 + 关键词),加 Rerank 精排,调 Top-K;Bad Case 里把「搜不到的问法」收集起来专门测。
没搜到还回答怎么办?
产品规则就是 不许编。返回「未找到相关制度,建议联系 XX 部门」,并留人工入口;这在我们央企场景是硬要求。
怎么评估效果?
看 回答准确率、幻觉率、引用是否命中;每周抽一批问题盲测,业务方也会参与抽检。
2. NL2SQL(自然语言查数)
不用背什么时候答:人事 Agent、燃料 Agent;或问「ChatBI」「Text2SQL」「数据安全」。
NL2SQL 就是员工说人话,系统生成只读 SQL 去查业务库,再用自然语言总结结果。适合考勤、编制、燃料消耗这类结构化数据。
结合项目:
人事和燃料两个 Agent 都是 Dify 工作流。前面有意图识别和业务别名(比如口语「综合部」映射到标准部门名),中间生成 SQL,后面 五层安全:参数校验、FAQ 分流、SQL 危险语句拦截、只读库、行级权限。人事高频问题走 FAQ,Token 能降 60% 以上。
💬常见追问 · 口语答
表太多怎么办?
先 限定主题域(人事一套、燃料一套),给模型 Schema 摘要和别名表,不要一次扔几百张表。表特别多时,可以加一步「先推荐 Top 相关表」再生成 SQL——产品上要定义推荐错了怎么兜底。
SQL 错了怎么办?
执行前 语法校验、拦截 delete/update 等;执行后 结果抽样、空结果/异常量告警;错例进 Bad Case,改 Prompt 或补别名,不是只改模型。
和 RAG 有什么区别?
RAG 查文档(制度 PDF、Word);NL2SQL 查数据库表。我们制度用 RAG,人事编制用 NL2SQL,选型看数据在哪。
3. Function Calling / 工具节点
不用背什么时候答:问 Agent 怎么执行动作、怎么调 API、Dify 里工具节点是什么。
Function Calling 就是模型不只会说话,还能决定调用哪个工具,比如查库、算数、调 HTTP 接口,拿到真实结果再继续推理。在 Dify 里我主要用工具节点和代码节点实现,和 Function Calling 是一类能力。
结合项目:
人事 Agent 里:FAQ 匹配、权限校验、SQL 执行、结果格式化都是节点;隐患 Agent 里输出固定 JSON 给工单系统。产品上要定义 每个工具输入输出、失败怎么办、谁有权限调。
常见追问:
工具如果调用失败,我不会让用户干等。一般会 自动重试一两次;还不行就 换降级话术(比如「暂时查不到进度,已为您转接顾问」),必要时 转人工。日志里必须能看到 哪一步、哪个工具失败,这样才能进 Bad Case,改超时、改入参或改兜底规则。
MCP 是 接工具的统一协议标准;我在国能用 Dify 插件/HTTP 工具, 产品思路一样:列工具清单、写入参出参说明书、监控成功率和延迟、敏感操作加人工确认。选型看是否要多 Agent 复用同一工具、是否要换编排平台。
4. Human-in-the-loop(人在回路)
不用背什么时候答:隐患派单、缺陷跟踪;或问「AI 错了谁负责」「央企能不能全自动」。
就是 AI 出建议,人点确认后才生效。安全、派单、涉责场景必须这样,不能 AI 直接改生产数据。
结合项目:
隐患分类 Agent 输出类别、责任部门、紧急程度,审核员确认后才写入 IMS 工单。一开始人工多,准确率高了之后,可以只对 低置信或高风险 强制人工,用 人工介入率 看效率。
追问:会不会很慢?
首月会慢,但相比以前 30 分钟一单,AI 1 分钟出建议、人 2 分钟确认,整体还是快很多;指标上 分类准确率 ≥95% 才逐步放权。
5. 幻觉防控
不用背什么时候答:任何 AI 项目都会问;C 端简历尤其会问「会不会编造经历」。
幻觉就是模型一本正经胡说。产品不能单靠 Prompt 里写请勿编造,要检索约束、格式约束、校验、评估一起上。
结合项目:
制度 RAG:无检索不回答 + 引用来源;NL2SQL:只读库 + 结果对账;分类 Agent:低温度 + JSON Schema;C 端简历:禁止编造经历 + 提交前校验 + Bad Case。目标上关键场景 宁可说不知道,也不编。
6. Bad Case 复盘
不用背什么时候答:问你怎么迭代、怎么和算法协作、效果怎么持续提升;或面试官问「Bad Case 是什么?」(很多人没听过这个词)。
Bad Case,中文你就理解成错题本:答错的、用户不满意的、业务不认账的真实例子。不是骂用户,而是把这些例子当资产,用来改产品。
怎么用(五步,面试可直接说):
收集(日志、工单、HR/业务反馈)→ 分类(检索 / Prompt / 权限 / 别名口径 / 模型)→ 找根因 → 改(补别名表、调 chunk、改 Prompt、加校验)→ 同一批错题再测一遍,看同类错误率有没有下来。
结合项目(先说归属):
- 国能·人事:「口语部门名查不对」→ 补 业务别名表
- 国能·制度:「跨章节漏召回」→ 调 chunk + 混合检索
- AI 简历优化:「夸大/虚构经历」→ Prompt 禁止编造 + Bad Case 单列一类 每周抽检
和算法怎么协作:你带 错题列表和指标 开会,不用「感觉不准」;改完必须 回归同一批题。制度项目常见是检索/chunk 问题,人事是别名/权限,财税是编价/误路由——分类思路一样,案例按项目举例即可。
7. 效果评估
不用背什么时候答:问 KPI、上线后怎么盯、和老板怎么汇报。
我分三层:技术层(准确率、幻觉率、延迟、SQL/JSON 合规率)、产品层(自助化率、查询成功率、人工介入率)、业务层(咨询量降多少、审核量降多少、决策快多少、Token 花多少)。
结合项目:
制度/人事 咨询量降约 70%,NL2SQL 成功率 ≥95%,隐患分类 ≥95%。上线后有 日报 + 每周抽检 + 月度业务复盘,指标掉下去当天就要查。
8. Prompt 工程 + 版本回退
不用背什么时候答:问和微调怎么选、Prompt 怎么写、线上出问题怎么回滚。
Prompt 就是给模型的岗位说明书:你是谁、干什么、不能干什么、输出什么格式。企业里还要能版本管理、能 5 分钟生效、出问题能一键回退——我在 C 端 PRD 和 B 端原型里都设计了提示词配置和回退。
和微调怎么选(口语):
知识常变、要快迭代 → Prompt + RAG 优先;格式极其固定、数据量很大、Prompt 顶不住 → 再考虑微调。国能 6 个 Agent 和 C 端简历,都以 Prompt + 工作流为主。
面试怎么「一开口就像懂 Prompt」(抖音高频 · 详 附11 §18):
别说「我会写很好的 Prompt」——先说 约束和输出契约,再说 和 RAG/工作流怎么分工,最后举 一个 Bad Case 怎么改 Prompt 回归。口诀:红线 · 格式 · 分工 · 版本 · 错题本。
9. Token / 成本治理
不用背什么时候答:问商业化、C 端怎么控本、企业怎么降 API 费用、Token 怎么计算。
大模型按 Token 计费,产品要想 少调用、用小模型、缓存、分流,还要 能算清楚账。
怎么算(补全抖音钩子题):
- 计费:单次 ≈ (输入 tokens × 输入单价 + 输出 tokens × 输出单价)/ 1000
- 估字数:中文粗算 1 字 ≈ 1~1.5 token;最终以 API 返回的 usage 字段 为准
- 日成本:日调用次数 × 单次均值;按场景拆(FAQ / RAG / NL2SQL / 客服意图链)
- 产品动作:埋点、预算告警、P95 监控、超预算 降级/限流
结合项目:
人事 Agent:FAQ 本地匹配,高频问题不调大模型,Token 降 60%+。C 端简历:模型分档,复杂用标准版、简单用基础版,预算触顶 自动降级,界面上 不暴露模型名,只显示「标准版/基础版」。财税客服:业务咨询走 意图 + RAG + 生成,进度走 意图 + HTTP + 短回复;价格类 无检索不答,避免长生成浪费 Token。
💬常见追问 · 口语答
怎么向业务解释成本?
我不会只跟业务讲 tokens。我会换算成 「每 1000 次咨询大约 X 元」,再和 省下来的人力(比如 HR 咨询降 70%)对比,让老板听得懂 ROI。
怎么压成本又不伤体验?
先让 FAQ 或规则 吃高频简单问法,再用 RAG 只喂 Top-K 相关段,最后复杂场景才上大模型;简单意图可以用 小模型或固定模板,别把每个问题都扔给最贵的那档。
10. Vibe Coding(Cursor)
不用背什么时候答:问你会不会用 AI 写代码、原型谁做的、和研发边界;抖音 现场 Vibe Coding / 三层难度。
Vibe Coding 是产品经理用 AI 编程助手(我主要用 Cursor)快速搭原型、验证交互和规则,不是替代正式研发。我用 Cursor 做 C 端 39 页 + B 端运营后台可点原型,对齐 PRD 和 dev-spec,研发接手时有接口和验收标准。
抖音「三层难度」(口语 · 对号入座):
| 层级 | 面试官在考什么 | 你怎么答 / 怎么现场做 |
|---|
| L1 · 认知层 | 知不知道、干过没有 | 「我用 Cursor 做 原型和规则验证,不是写生产代码」+ 简历 39 页例子 |
| L2 · 演示层 | 能不能当场改一屏 | 先口头 PRD 边界 30 秒 → 再改 一个按钮/一条校验/一页列表;小步、可回滚 |
| L3 · 方案层 | 能不能设计可交付方案 | 讲 五层:需求边界 · Prompt/规则 · 工作流/页面 · 异常兜底 · 评测 Bad Case;强调上线仍要研发工程化 |
若让「现场 Vibe Coding」(Mentor学姐等博主常考):
① 先问清范围:「改交互 mock 还是接真 API?」——原型默认 mock
② 边做边 narrate:「这里对应 PRD 的 xxx 字段 / 失败不扣点」
③ 5~10 分钟交付物:一页可点原型或一条校验,不承诺当场接生产库
④ 收尾:「正式版要研发做鉴权、性能、合规,我交付 PRD+原型+验收标准」
💬常见追问 · 口语答
和研发边界?
我用 Cursor 主要做 原型和规则验证,比如页面流程、校验规则、dev-spec 验收标准。正式上线后的 鉴权、支付、性能、合规、联调 必须研发工程化,我交付 PRD、原型和接口契约,不替代后端写生产代码。
简历怎么写?
简历里我会写「用 Vibe Coding 完成 39 页 C 端可交互原型 + 运营后台 dev-spec」,强调 提效和交付物;不会写「我会写代码取代后端」这种容易越界的表述。
Vibe Coding 是什么?现场怎么考?
Vibe Coding 就是产品经理用 Cursor 等 AI 编程助手 快速搭 可点原型,验证交互、规则和文案,交付 PRD + 验收标准。现场考 一般分三层:L1 问有没有干过——我答简历 39 页和后台原型;L2 让改一屏——我先 澄清边界,再 小步改 mock,边做边 narrate;L3 问完整交付——我会接 需求边界、Prompt/规则、工作流、异常兜底、Bad Case 评测 五层,并说明上线仍要研发做安全与联调。
11. Context Window(上下文窗口)
不用背什么时候答:问对话太长怎么办、制度很长怎么塞进去。
就是模型一次能读多长的内容,有上限。所以长制度不能整本塞进 Prompt,要用 RAG 只喂相关段;多轮对话用最近几轮加摘要;缺陷 Agent 只加载当前工单时间窗的信息。
12. Dify 工作流
不用背什么时候答:问你们技术栈、Agent 怎么编排。
Dify 是可视化把意图识别、检索、SQL、校验、生成串成一条链。6 个 Agent 各有一条主流程,共性节点包括:FAQ 分流、权限、异常分支、转人工。
13. AI 治理(安全 / 合规 / 成本)
不用背什么时候答:ToB、央企、C 端小程序合规。
AI 上线不只看准不准,还要看权限、审计、内容安全、成本上限。国能:只读库、SQL 注入防护、三级人事权限、操作留痕;C 端:深度合成相关合规、失败不扣能量点、分享打码等。
14. 多模态 / OCR(图片·文档·摄像头)
不用背什么时候答:问「多模态了解吗」「简历能不能传图」「OCR 谁做」。
查阅口语 30 秒:见块 4 第 43 题(背那一段即可)。查阅提示:OCR/多模态在 AI 简历优化;国能 6 个 Agent 是纯文本,口头不必对比。
15. 意图识别(别说「用大模型做意图识别」)
不用背什么时候答:客服 Bot、Agent 路由、NL2SQL 前置、抖音「智能体怎么做意图识别」。
意图识别就是 先判断用户想干什么,再决定走哪条路——查知识、调工具、查进度还是闲聊。别回答「用大模型」就结束,要说 分层 + 槽位 + 兜底。
推荐答法(四层):
我设计四层式意图识别流程:
- 第一层优先关键词命中,拦截高频固定问题,既稳定又节省 token
- 第二层采用模型分类加槽位抽取,结构化输出意图、置信度和业务槽位,为后续 Agent 路由提供数据
- 第三层如果模型置信度低于阈值,就主动引导用户确认意图,避免模型猜测出错
- 第四层做异常兜底,闲聊对话引导回到业务,越权查询直接拒绝,超出业务范围问题流转人工处理
结合项目:
- 财税 Coze · Finance_Taxation_Service:LLM 节点提取意图 → 三路分支(业务咨询 RAG / 办理进度 HTTP / 其他兜底);槽位 城市、服务类型、公司名 供查进度;价格 严禁编造,走知识库
- 国能人事:意图是 FAQ 直答 vs NL2SQL vs 越权拒绝;口语部门名走 别名表
- 国能隐患:意图是 分类派单,输出固定 JSON,不是开放聊天
怎么评估:意图准确率、槽位填充率、 误路由率、转人工率;Bad Case 专收「进错分支」。
16. Coze vs Dify(平台选型 · 口语)
不用背什么时候答:问为什么用 Coze、和 Dify 区别、独立项目技术栈。
Coze:上手快,适合 客服 Bot + 可视化工作流 + 知识库 + 插件;我用来做 财税代理记账客服 验证。
Dify:国能央企场景,内网部署、深度编排、NL2SQL/权限 更熟。
产品方法一样:意图 → 分支 → 检索/工具 → 评测 → Bad Case;换平台主要是 工程落地差异。
附4 · 设计题 10 问(块2已背 1~2,其余查阅)
这类题 HR 和业务都会问:「我们将来要做 XXX,你会怎么设计?」 答法结构:① 先说概念(30 秒)② 说你会怎么设计(1~2 分钟)③ 诚实说国能为什么没做/你用什么替代 ④ 接一句「和我现有 Agent 经验相通」。 阅读顺序:下面 先列必背 #1、#10,再列其余设计题(题号不变,便于交叉引用)。
必背1. Agent 长期记忆怎么设计?(抖音超高频 · 必背)
🧠 Agent 记忆 · 四层框架(先背 30 秒版)
④ 长期记忆情景+语义 · 跨会话 · 要过期删除
③ 中期记忆长任务 · 任务ID+状态表
② 短期/会话最近N轮 + 槽位
① 工作记忆当前轮 + 工具返回 · 在上下文里
主背见 块 2-1。
问法:「你们 Agent 有记忆吗?」「如果要跨会话记住用户,你怎么做?」
💬 你可以这样答
我会把记忆分成 三层,不会一上来就让大模型「记住用户一切」。
第一层:短期记忆(会话内)
就是这一轮对话里,用户说了什么、Agent 查到了什么、执行到哪一步。做法通常是 保留最近 N 轮对话 + 关键槽位,比如工号、部门、时间范围、当前工单号。我在 人事 NL2SQL、缺陷跟踪 里主要用这套,够应对连续追问。
第二层:业务记忆(推荐 ToB 默认用这个)
我不建议让模型「脑记」业务数据,而是 系统查业务库:上次工单状态、考勤结果,用 用户 ID / 工号 关联查询。这样 更准、可审计、也好做权限。国能央企场景,我们 跨会话长期记忆没上线,很大原因是 隐私、等保、审计;用业务库替代,效果上用户该查到的还是能查到。
第三层:产品长期记忆(用户偏好)
比如用户喜欢表格展示、常问的三类问题、默认时间范围——这才需要 单独存 User Profile。产品设计时我会先定四件事:
- 记什么:只记和产品相关的偏好,不记敏感原文
- 不记什么:薪资、处分、未授权字段一律不进入记忆
- 记多久:过期自动删;用户可 查看、导出、删除(对齐个保法)
- 怎么用:每次对话 检索相关记忆片段注入 Prompt,而不是把全部历史聊天记录塞进去
和研发的分工:Profile 表结构、加密、检索策略研发实现;我出 PRD:字段、授权流程、兜底话术、评估指标。
怎么评估:看 用户是否少重复说一遍、任务成功率是否提升;还要看 误记率、隐私投诉——长期记忆记错了比没有记忆更伤。
🏁收尾(诚实 + 自信)
国能项目因合规 没上第三层;若贵司要做,我可以按上面框架从 小范围试点 开始,比如只记「默认查询时间范围」,验证后再扩。
必背10. AI 问答不准,你怎么排查?(通用排查五步法 · 必背)
💬 你可以这样答
我固定五步,不和研发瞎猜:
- 检索有没有——该搜到的搜到了吗?
- Prompt 有没有用检索——是不是模型没用上片段?
- 模型参数——温度是不是太高?
- 权限和数据——是不是用户根本没权限看这条数据?
- Bad Case 是否重复——同类错误进表,改完回归
这五步在国能 每周复盘 都会用。
2. MCP 是什么?你们用过吗?如果要用你怎么做?
主背见 块 2-2。
问法:「了解 MCP 吗?」「我们工具很多,怎么接 Agent?」
💬 你可以这样答
MCP(Model Context Protocol)可以理解成 大模型连接外部工具的「统一插座」。以前接日历、数据库、企业微信,每家一套接口;MCP 让工具以 标准 Server 形式暴露,模型通过协议调用, 便于扩展和治理。
国能现场:我主要用 Dify 的工具节点、HTTP 插件、代码节点,没有以 MCP 名义上线,但 产品职责是一样的——定义 Agent 能调哪些工具、输入输出 Schema、超时重试、权限和审计。
如果贵司要上 MCP,我作为 AI PM 会做这些事:
- 工具清单:哪些给 Agent 用,哪些不给(最小权限)
- 每个工具的「产品说明书」:干什么、失败提示、是否需用户确认
- 和现有编排的关系:Dify/自研 Agent 框架里 MCP Server 怎么注册
- Bad Case 与监控:哪个工具调用失败最多、Latency 如何
- 安全:敏感工具必须 Human-in-the-loop 或二次鉴权
诚实边界:我 还没在生产环境主导 MCP 选型,但 6 个 Agent 的工具编排、降级、复盘我都做过, 迁到 MCP 主要是工程协议层变化,产品方法论是通的。入职后我会优先熟悉贵司现有 MCP 规范和一条业务线试点。
3. ReAct 是什么?和你们 Dify 工作流一样吗?
💬 你可以这样答
ReAct 是 Reason(推理)→ Act(行动)→ Observe(观察结果) 再循环,直到任务完成。比如:先想「要查人事库」→ 调 SQL 工具 → 看结果不对 → 改条件再查。
Dify 工作流可以是 固定流程,也可以是 带分支的多步,和 ReAct 思想接近。我的 隐患、缺陷 Agent 更接近「多步 + 工具」; 制度 RAG 更像固定链:检索 → 生成。面试里我会说:不是所有场景都要强 Agent,问答类 RAG 够用就行, 派单、跟踪类才上 ReAct 式编排。
4. RAG 和 Agent 有什么区别?你们为什么两个都做?
💬 你可以这样答
RAG 解决 「知识从哪来、怎么别瞎编」,典型是制度问答、培训出题。
Agent 解决 「多步完成任务、调工具、有状态」,典型是隐患派单、缺陷催办。
可以这么记:RAG + 对话是弱 Agent;我们 隐患、缺陷是强 Agent。选型看用户要完成 一步问答 还是 一条业务链路。
5. 混合检索、Rerank 是什么?产品上要关心吗?
💬 你可以这样答
向量检索 懂语义,但有时漏关键词;关键词/BM25 对制度编号、专有名词更准。混合检索 就是两个一起用再合并结果。Rerank 是用一个小模型对 Top 结果 再排一次序,提高「喂给大模型的段落」质量。
产品上要定:召回不够时先调检索还是调 Prompt;Bad Case 里要标 是检索错还是生成错——这决定改知识库还是改模型参数。
6. Agent 怎么评估?除了准确率还看什么?
💬 你可以这样答
除了 任务成功率、回答准确率,我还看:
- 步数/耗时:Agent 是否绕圈
- 人工介入率:多少单必须人点确认
- 工具调用成功率
- Grounding:回答是否真有检索/SQL 依据
- 业务结果:派单是否更快、咨询是否减少
C 端还会看 完成率、留存、单次 Token 成本。
7. Agent 死循环 / 越跑越偏怎么办?
💬 你可以这样答
产品规则上设 最大步数、总超时、重复检测(同一步骤重复 3 次就停);给用户 明确失败提示和转人工;日志里记录 每一步决策,方便 Bad Case。不会让用户对着屏幕干等。
8. 多 Agent 协作 / 主 Agent 拆子 Agent 你怎么想?
💬 你可以这样答
按 业务域拆,比如「人事 Agent」「燃料 Agent」分开,不要一个 Agent 包打天下——我们国能就是这么做的。若要做「总前台」,可以是 路由 Agent 先识别意图再 分发给子 Agent,产品上要定义 交接上下文带哪些字段、失败谁兜底。
9. RAG 知识库怎么构建?(抖音:骆齐那类题)
💬 你可以这样答
① 收资料:制度、题库、FAQ,定 owner 和更新频率
② 清洗:去重、去密、版本号
③ 切分:按章节/条款,控制长度和 overlap
④ 向量化入库
⑤ 试检索 + 试回答,用 Bad Case 调 chunk 和检索策略
⑥ 上线后增量更新,不是一次完事
制度更新时我们走 增量入库,不是整库推翻重来。
附5 · 全部项目(块3已背 B+G+J,其余查阅)
主背:块 3-2 / 3-3 / 3-4(钩子 → 转接一句 → 四步 → 问面试官);本节 1 分钟 为 压缩查阅,上场以块 3 为准,勿两套话术打架。 用法:面试官说「介绍一个项目」→ 选 2 个主力 背熟块 3 整套;其余项目 知道 30 秒钩子 即可。 阅读顺序:下面 先列标 ⭐ 的主力/备选(B→G→J→E),再列其余查阅项。
必背B. 企业人事智能查询 · NL2SQL(2025.11—2026.02)⭐ 建议主力
🛡️ 人事 NL2SQL · 五层安全(必记)
- 参数校验
- FAQ 分流
- SQL 拦截
- 只读库
- 行级权限
主背见 块 3-2(含转接 + 四步 + 问面试官)。
1 分钟 · 查阅压缩:
员工以前查人事数据要找 HR,口头描述需求,HR 再查系统,慢而且占人力。我用 Dify 搭了 NL2SQL Agent,员工用自然语言提问,系统生成 只读 SQL 查人事库,再用白话总结。安全上做了 五层:参数校验、FAQ 分流、SQL 拦截、只读库、行级权限。高频问题走 FAQ 本地匹配,Token 成本降了 60% 以上。上线后 HR 咨询量降约 70%,查询 成功率 ≥95%,基本 秒级 返回。
💬追问 · 口语答
SQL 注入和数据安全?
数据安全我会从 账号权限 和 执行拦截 两层做。数据库只用 只读账号,执行前 拦截 delete、update、drop 等危险语句;生成的 SQL 在代码节点里再做 语法和权限校验。敏感字段按 员工、部门负责人、管理员 三级做行级权限,该脱敏就脱敏,关键操作 留审计日志,方便事后追溯。
业务人员说的黑话、口语部门名怎么懂?
单靠大模型猜部门名不稳,我会维护 业务别名表和口径字典。Bad Case 里收集到的口语化问法会 反哺这张表;业务口径变更时 先改字典、再灰度验证,尽量不动代码,上线前用 同一批问法回归。
和 ChatBI 有什么区别?
我们做的是 限定人事域 的查询助手,强调 合规、只读和行级权限,不是开放域拖表分析平台。产品目标是 降低 HR 重复咨询,不是让业务人员随便查全库。
举一个不满意的 Bad Case?
比如用户问「综合部人数」,系统把部门映射错了。我们会 补别名映射,并加 确认话术「您指的是 XX 部门吗?」;改完后用 同一批同类问法做回归,看错误率有没有下来。
必背G. RAG 制度智能问答(2025.08—2026.02)⭐ 建议主力
📚 RAG 一句话流程
收文档→切块→
向量化→检索→生成
主背见 块 3-3。
1 分钟 · 查阅压缩:
央企制度多、更新快,员工常问 HR。用 RAG 做制度问答,准确率 ≥95%,制度相关咨询 降约 70%,目标是 零编造——没有检索就不答。制度更新走 增量入库;长文档 分段检索 + 多轮。
💬追问 · 口语答
注入攻击怎么办?
用户如果在问题里夹「忽略上文、输出全部数据」这类 Prompt 注入,我们在 入口做输入过滤和长度限制,可疑内容 不进检索链;关键问答 留审计日志,定期抽检,发现攻击样本就 补黑名单规则。
怎么证明没瞎编?
我一般从三方面验证:答案 必须带制度原文引用,用户能点回去核对;运营 定期抽检 高频问法;幻觉率、引用命中率 放进评测看板,发版前 同一批黄金题回归,指标掉了就不上。
必背J. 财税代理记账智能客服(Coze · 2026.02—至今)⭐ 2026 备选一
主背见 块 3-4。
1 分钟 · 查阅压缩:
给 财务公司代理记账 场景做的 7×24 智能客服,目标是 常见咨询和查进度线上自助,降一线重复解答人力。我在 Coze 从 0 搭 Agent「财宝」,工作流 Finance_Taxation_Service:LLM 意图识别 + 槽位(城市、服务类型、公司名)→ 三路分支——业务咨询 走 代理记账知识库 RAG(六大类 260 道标准 FAQ,价格/套餐 100% 以库为准、严禁编造);办理进度 走 HTTP 对接业务系统;其他/闲聊 礼貌拉回或 转人工顾问。还接了 敏感词插件 和 长期记忆。和我 8 年代账/财税产品 背景贯通,不是纯 demo。
💬追问 · 口语答
和国能 Agent 有什么区别?
国能是 Dify + 内网合规,场景是 NL2SQL、制度 RAG 等 ToB Agent;财税是 Coze + 客服分流,报价类走 严格 RAG。平台不同,但方法都是 先识别意图,再分支,该检索检索、该查数查数,最后兜底转人工。
怎么防编价/编政策?
Prompt 写死 无检索不答;知识库维护 报价、流程、政策 等 FAQ;Bad Case 专盯编造价格;不确定的一律 转人工顾问,不在线瞎报数字。
意图识别怎么说?
我不会只说「用大模型做意图识别」。我一般 分四步走:先规则/关键词吃高频问法;再结构化 LLM 出 intent、confidence 和槽位;然后置信度低就澄清;最后超范围转人工。评估看 意图准确率、误路由率、转人工率,Bad Case 专收「进错分支」。
怎么评估?
我会看 意图准确率、误路由率;编价类 Bad Case 零容忍;进度 HTTP 接口的 成功率;以及 转人工率 是否在合理区间。每周抽 50 条真实咨询 做回归,不只看 demo 好不好看。
业务 FAQ 从哪来?
来自代账一线 高频真实问法,比如注册、注销、报税、报价、进度等。我会对齐业务同事整理的问法表,持续维护进知识库,不是拍脑袋编 FAQ。
必背E. 隐患分类与派单 Agent(2025.09—2026.02)⭐ 建议备选一个
1 分钟:
现场隐患以前 30 分钟 才能分类派单。这个 Agent 不用知识库,靠 强规则 Prompt 输出 固定 JSON(类别、责任部门、紧急程度),审核员 确认后才写入工单——典型 Human-in-the-loop。分类 准确率 ≥95%,整体 1 分钟级。
💬追问 · 口语答
为什么必须人工确认?
央企 安全责任在人,AI 不能直接改生产工单。模型输出只是分类建议,审核员 点确认后才入库,这是典型的 Human-in-the-loop。
JSON 怎么对接业务系统?
输出 Schema 固定(类别、责任部门、紧急程度),和 IMS 之间加 适配层 做字段映射和校验,不让模型自由发挥格式,避免下游系统接不住。
A. C 端 · AI 简历优化助手(2026.02—至今)
1 分钟(可直接念):
这个项目是给求职者用的 AI 简历助手,目标是用大约 15 分钟 走完摸底、初稿、JD 对齐、HR 预览到导出 PDF。我独立完成了 PRD v1.3.2,里面单独写了 AI 能力专章,包括能力边界、输入输出、质量指标、评测方法和成本安全;还做了 39 页 C 端可交互原型 + 全模块 B 端运营后台原型(用户/交易/内容/增长/数据与风控等),以及含 接口、字段、JSON 示例、验收路径 的研发交接文档。原型阶段用 Cursor 做 Vibe Coding,C 端和后台规则都是先验证再交给研发。公开演示链接因保密只展示 C 端;后台面试可现场展示。合规上按微信小程序 深度合成 相关要求做了评估,设计了失败不扣点、分享打码等规则。
💬追问 · 口语答
PRD 里 AI 专章写什么?
PRD 里我会单独写 AI 专章,不让研发猜。至少写清 能做什么、不能做什么;每个 AI 能力的 输入输出;准确率/完成率 等指标;怎么评测;Token 和模型分档;以及 失败、超时、转人工 怎么处理。
怎么防编造简历经历?
简历场景最怕模型「润色」成虚构经历。Prompt 里 禁止编造,提交前做 校验和用户确认;Bad Case 里单独收 夸大/虚构 类错误。宁可提示用户补充,也不自动编一段假经历。
成本怎么控?
我会做 模型分档:复杂步骤用标准版,简单步骤用基础版;预算触顶 自动降级;后台能看单次和日均 Token。用户界面 不暴露模型名,只展示体验档位。
Vibe Coding 和研发边界?
我用 Cursor 做 原型和规则验证,快速把 PRD 里的流程和校验落到可点页面上。正式上线版本的 安全、性能、支付、合规 必须研发工程化;我交付 PRD、原型、接口和 Done 定义。
为什么链接里只有小程序?后台做了吗?
链接里只放了小程序前端页面,后台内容因为项目保密没有对外展示;整套 B 端后台原型、相关文档我本地都有,您想看我可以当场打开电脑展示。
多模态 / 上传简历图 / OCR 做了吗?
做了。AI 简历优化里,摸底和 JD 支持 粘贴文字或传图 OCR;留言可 附图;表情分析用 摄像头,用户点按钮才申请权限。图片上传前会 自动压缩;OCR 或分析 失败不扣用户能量点,并引导重传或改粘贴,不让用户以为已经识别成功。
C. 燃料数据分析 · NL2SQL(2025.11—2026.02)
🛡️ 人事 NL2SQL · 五层安全(必记)
- 参数校验
- FAQ 分流
- SQL 拦截
- 只读库
- 行级权限
1 分钟:
燃料成本分析以前靠人工导数、做表,动辄 小时级。这个 Agent 用 NL2SQL 查燃料数据,并给 分析建议,响应 秒级,帮助成本优化大约 2%~5%。架构和人事类似,但 成本数据更敏感,行级权限和脱敏更严。
💬追问 · 口语答
敏感数据怎么管?
燃料成本比人事更敏感。我会强调 行级权限、字段脱敏、操作审计 三件套;数据库仍用 只读账号,执行前 拦截危险 SQL,避免越权或误操作。
口语指标名听不懂怎么办?
现场人员会说「吨煤成本」「标煤单价」这类口语。我会先做 意图分类,再通过 标准词库和 Schema 别名表 映射到正式字段;映射错的案例进 Bad Case, 反哺别名表。
数据量大怎么扛?
复杂查询会做 索引优化和分页返回。如果一次问的范围太大,会 引导用户收窄时间范围,或 降级为汇总口径,避免一次拉全厂历史把系统拖慢。
D. 培训出题 · RAG(2025.10—2026.02)
1 分钟:
五大类题库用 RAG 检索 + 分类 Prompt 自动出题,准确率 ≥98%,出题效率提升约 90%。规则是 无检索不出题,避免模型凭空编题;内容有 敏感词过滤和抽检。
💬追问 · 口语答
怎么防题目跨类?
出题前检索时会 带类别标签,Prompt 里 锁死当前要出的题型(单选、多选或判断),避免从 A 类题库里误抽出 B 类题。
题库更新了怎么办?
题库变更走 增量入库,不用全量重训。发版前用 同一批黄金题回归,看准确率有没有掉,掉了就不上。
F. 缺陷闭环跟踪 Agent(2025.08—2026.02)
1 分钟:
跟踪缺陷工单状态,识别 逾期,自动 催办。缺陷处理周期缩短约 40%,逾期率降约 60%。催办话术和时段 可配置,避免半夜打扰。
H. 国能 IMS 智慧电厂(数字化 · 非 LLM)
30 秒:
这是 15 大模块的数字化平台,数据中台、千人 100% 使用。 AI Agent 是同期独立做的 6 个子项目,不要混成「整个 IMS 都是大模型」。
I. 金不换 ERP / 谦玛 HR(备用 · 传统数字化 · 非 LLM)
30 秒:
金不换是集团 业财一体 ERP,分公司从 24 扩至 35 家,集团约 六百人、系统使用率 100%;谦玛做过 人事 11 模块 0-1 的传统 HR 信息系统(招聘/考勤/绩效/培训/人才盘点等)。这两段都是 2012~2025.04 的数字化项目,不是 AI 项目——沉淀的是 业务流程拆解、数据口径、权限与跨系统集成 功底,为后面国能 Agent 打底。
人事 NL2SQL 是 2025 年 5 月起在国能肇庆 单独做的 Agent,别把老 ERP/谦玛 HR 包装成「做过 NL2SQL」。
不用背ERP 若深挖:最难是 多分公司口径统一;用 BPR + 标准产品 + RICE 砍定制;和金蝶税友 标准接口 + 字段映射。
附6 · 大模型基础
上下文窗口:模型一次能读多长的内容;太长就要 RAG 或摘要,不能硬塞。
对齐(Alignment):让模型输出符合人类价值观和安全要求;RLHF 是常见训练手段,产品侧更多关注 上线后边界和评测。
基座 / 微调 / Prompt:基座是通用大模型;微调用数据改模型权重;Prompt 是改指令—— 我们项目以 Prompt + RAG 为主,迭代最快。
零样本 / 少样本:不给例子或给几个例子在 Prompt 里;分类、格式控制里常用 少样本示例。
涌现:模型变大后偶发新能力;产品上 少吹概念,多测场景。
不用背Transformer / 注意力:知道是主流架构即可;面试 不必展开数学,被问就说「了解原理,工作重心在场景和评测」。
附7 · 行为面
最大挑战:C 端要在 效果和 Token 成本 间平衡 → 模型分档和降级;B 端要在 效率和安全 间平衡 → Human-in-the-loop。
失败或延期:ERP 早期定制过多导致延期 → 后面用 标准产品 + RICE 砍需求,这个思路也用在 AI:先 MVP 一个场景,再扩。
跨部门协调:国能做过 6 部门访谈、12 场培训,IMS 使用率 100%;AI 项目同样要先 对齐指标和合规 再推。
和研发分歧:用 Bad Case 列表和指标 对齐,不用「感觉不准」;我懂技术,能一起查日志。
为什么离开/看机会:按真实情况说;可强调 已完成国能 Agent 交付,希望在 AI PM 方向持续深耕。
年龄 / 35 岁 / 1990 年:我明白您担心落地交付,我有 14 年 ToB 行业积累,完整落地过多款 集团 AI Agent,合规、Bad Case 管控、全流程上线这套实战经验十分扎实。年轻人上手工具更快,我的核心优势是 吃透企业复杂业务、统筹多方推进规模化落地。
项目只有 C 端链接:链接里只放了小程序前端页面,后台内容因为项目保密没有对外展示;整套 B 端后台原型、相关文档我本地都有,您想看我可以当场打开电脑展示。
附8 · 反问
- 贵司 AI 产品是 自研编排还是 Dify/Coze 这类平台?我入职后大概多久能独立负责一条 Agent 线?
- 当前 最想解决的 1 个 AI 场景 是什么?成功指标怎么定?
- AI 产品和算法/后端 多久做一次 Bad Case 复盘?
- 未来半年更偏 B 端 Agent 还是 C 端应用?和我经历哪块更匹配?
附9 · 考前 30 分钟清单
附10 · 项目深挖 Bad Case
以下为你原稿中 燃料/培训/隐患/缺陷/制度/ERP 的「基础追问+进阶深挖+Bad Case 分类」,内容有效,不必全背,面试前按项目 扫一眼粗体问题 即可。 阅读顺序:先背「金不换 ERP · 高频 13 问」,再翻各 Agent Bad Case。
金不换 ERP · 高频 13 问
- 最难:24 家分公司口径统一
- BPR:四大流程去冗余上线
- 微服务:模块独立迭代
- 金蝶税友:标准接口+字段映射
- 成果:数据互通、流失率降、32 家分公司
燃料 NL2SQL · 进阶(节选)
- 分库分表 → 数据源路由
- 亿级数据 → 索引+分页+复杂查询降级
- 敏感成本 → 行级权限+脱敏+审计
培训 RAG · Bad Case 分类
- 检索 50% / Prompt 30% / 知识库 15% / 模型 5%
- 优化:重分段、调检索、禁止编造、增量更新
隐患 Agent · Bad Case 分类
- 术语 40% / Prompt 35% / 边界 20% / 格式 5%
缺陷 Agent · Bad Case 分类
- Prompt 45% / 定义 30% / 上下文 20%
制度 RAG · Bad Case 分类
- 检索 50% / Prompt 25% / 知识库 20%
财税代理记账客服 · Bad Case 分类
- 编价/编政策 40% → 无检索不答 + 知识库补 FAQ + 转人工
- 意图进错分支 30% → 规则补高频 + 槽位澄清
- 进度 HTTP 失败 20% → 重试 + 降级话术 + 转人工
- 闲聊/超范围 10% → 拉回业务 + 敏感词
附11 · 抖音 AI 产品高频题(补全答案 · 2026-06)
来源:抖音AI产品常见问题 链接标题整理;博主多 只抛问题引流,本节 补全可背口语答案,并 挂到你三个项目 上。 用法:块 1~6 顺读后再扫;标 ⭐ 的建议考前各说 1 遍。
阅读顺序:先背标 ⭐ 的必背区(1、2、4、7、9、10、12、15、16、18~26),再翻补充区(3、5、6、8、11、13、14、17)。题号不变,交叉引用仍写「附11 §N」。
必背1. AI 产品经理做到什么程度才算「懂业务」?⭐
💬 你可以这样答
懂业务不是背行业名词,而是 能把业务流程拆成 AI 能接、不能接的边界,并用指标验收。
我用的标准是四件事:
① 说得清用户原流程(谁、什么环节、痛点、现有人力)——代账就是一线反复答报价/进度;国能就是 HR 被问考勤编制
② 说得清 AI 改哪一段(不是「上个聊天框」)——FAQ 分流、RAG、NL2SQL、HITL
③ 定得准成功指标——咨询降 70%、成功率 95%、编价为 0
④ Bad Case 能反哺业务——别名表、知识库、转人工规则
我有 14 年 ToB + 8 年代账/财税,所以财税客服不是跟风 demo,FAQ 和槽位都来自真实一线问法。
必背2. Agent 项目 PRD 要写什么?(喂饭版)⭐
PRD 里我会单独写 AI 专章,别只写「接大模型」。核心是 8 块:① 场景与指标(谁用、解决什么、成功标准);② AI 边界(能/不能做什么,什么时候转人工);③ 工作流(意图 → 分支 → RAG/工具/生成 → 兜底);④ Prompt 与输出格式(JSON Schema、引用要求、禁止编造);⑤ 数据与安全(权限、脱敏、审计、内容安全);⑥ 评测与 Bad Case(黄金集、抽检频率、回归方式);⑦ 成本与降级(模型分档、FAQ、Token 预算);⑧ 上线与运营(版本回退、监控告警、反馈入口)。
国能 每个 Agent 一份 AI 专章;简历 PRD v1.3.2 独立 AI 章;财税 工作流图 + 三路分支 + 知识库维护说明。
必背4. 项目讲不好,AI 面试过不了 / 怎么快速讲清复杂 AI 项目?⭐
用 钩子 30 秒 → 转接一句 → 展开四步 → 问面试官 → 追问 的结构,每个项目控制在 3 分钟内:
| 项目 | 钩子 30 秒(要点) | 展开重点 |
|---|
| 人事 NL2SQL | 员工查数找 HR → NL2SQL · 咨询降 70%、成功率 ≥95% | 五层安全、FAQ 降 Token 60% |
| 制度 RAG | 制度咨询慢 → RAG · 准确率 ≥95%、零编造 | 检索+引用、增量入库 |
| 财税客服 | 代账重复报价查进度 → Coze 三类分流 | 严格 RAG 报价、HTTP 进度 |
| 简历 0-1 | 15 分钟主路径、PRD+原型+后台 | 模型分档、OCR、合规 |
🏁问面试官 · 收尾一句
「您更想先听 安全,还是先听 评测?」——把话头交给面试官。完整可念稿在 块 3-2~3-4。
必背7. 怎么评估一个 Agent 靠不靠谱?⭐
不能只看「感觉准不准」,要 任务 + 过程 + 业务 三层:任务层(任务成功率、一次答对率、转人工率);过程层(平均步数、工具成功率、意图准确率、超时率);业务层(咨询降多少、人力节省、合规事件)。定 50~100 条黄金集 + 每周抽检 + 错题本回归。
口语再加 三个红灯:① 只有 demo 没有测试集和指标;② 答错了没有错题本闭环;③ 关键动作没有权限/人工兜底(尤其 B 端)。财税 编价类错误 0 容忍;国能 SQL 和制度 必须可审计。
必背9. 智能体怎么做意图识别?(别说「大模型」)⭐
我不会只说「用大模型做意图识别」。我一般 分四步走:先规则/关键词吃高频问法;再结构化 LLM 出 intent、confidence 和槽位;然后置信度低就澄清;最后超范围转人工。财税是 三路分支(RAG / HTTP / 兜底);国能人事是 FAQ 直答、NL2SQL 或越权拒绝。评估看 意图准确率、误路由率、转人工率。
必背10. 面试问到 RAG,怎么答才到位?(30K 级思路)⭐
30 秒版:先查再答,私有知识可更新,幻觉可控。
1 分钟版(分层):
① 数据:怎么切 chunk、谁维护、增量更新
② 检索:向量+关键词混合、Top-K、Rerank
③ 生成:Prompt 只用检索片段、必须引用、 没搜到不答
④ 评测:准确率、幻觉率、引用命中率
⑤ Bad Case:检索/Prompt/知识库 分类改
结合项目:制度 RAG(块 3-3)、培训出题、财税 严格 RAG 报价(附5-J)。
必背12. Token 成本怎么计算?(博主只抛问题的补全)⭐
大模型按 Token 计费:单次成本 ≈(输入 Token × 输入单价 + 输出 Token × 输出单价)/ 1000,以 API 返回的 usage 为准。产品侧 少调用、少喂长文、简单题用小模型:FAQ 本地匹配吃高频、RAG 只喂 Top-K、模型分档、设预算告警。国能人事 FAQ 命中 Token 降 60%+;财税报价类 无检索不答,避免长生成浪费 Token。要埋 prompt_tokens/completion_tokens,按场景拆日成本。
必背15. 面试官让「现场 Vibe Coding」怎么办?(Mentor学姐)⭐
心态:考的是 产品思维 + 会不会用工具,不是考你手写 LeetCode。
现场四步(5~10 分钟):
- 澄清:改哪一页、mock 还是真接口、成功标准是什么
- 口头 PRD 30 秒:用户是谁、主按钮干什么、失败怎么提示
- 小步改:一个按钮 / 一条校验 / 一行列表——边做边 narrate
- 收尾边界:「这是 原型验证;上线要研发做安全、埋点、联调」
千万别:一上来接生产库、承诺当场上线、沉默写 10 分钟不解释。
必背16. 考察 Vibe Coding 的 3 层难度(亚慧)⭐
| 层级 | 面试官在考 | 你怎么接 |
|---|
| L1 认知 | 知不知道、干过没 | 「Cursor 做原型,简历 39 页 + 后台 dev-spec」 |
| L2 演示 | 当场改一屏 | 先边界再改 mock;见 §15 四步 |
| L3 方案 | 完整 AI 产品怎么交付 | 五层:需求边界 · Prompt/规则 · 工作流/页面 · 异常兜底 · Bad Case 评测 |
口诀:L1 讲经历 · L2 小步演示 · L3 接国能/简历/财税 完整闭环。
必背18. 一开口就知道「很懂 Prompt」怎么答?⭐
抖音标题:面了一个 AI 产品女生,她一开口就知道她很懂 Prompt(05/06) 核心:面试官听的不是「我会调 temperature」,而是 产品层的 Prompt 契约——约束、格式、和检索/工作流分工、可迭代。
30 秒版(建议背):
Prompt 对我不是堆形容词,是 岗位说明书 + 红线 + 输出格式。
事实靠 RAG/只读库,Prompt 管怎么用这些材料说话、什么情况下 必须拒答/转人工。
我改 Prompt 一定绑 Bad Case + 黄金测试集回归,线上还有 版本号可回滚——国能制度、隐患 JSON、财税报价、简历防编造都是这套。
「懂 Prompt」的五个信号(你一开口就要露出来)
| 信号 | 懂的人怎么说 | 不懂的人怎么说 |
|---|
| ① 约束优先 | 「先写 不能干什么:无检索不答、无出处不报价、禁止编造经历」 | 「我会写一段很详细的 system prompt」 |
| ② 格式契约 | 「输出要 JSON Schema / 必须带引用条款号」 | 「让模型自由发挥,差不多就行」 |
| ③ 和 RAG 分工 | 「检索管事实,Prompt 管怎么说;检索错了改库,生成了乱改 Prompt」 | 「RAG 和 Prompt 是一回事」 |
| ④ 可迭代 | 「版本号 + 50 条黄金集;改完同一批错题再测」 | 「感觉不准就再优化一下」 |
| ⑤ 场景不一刀切 | 「制度问答、隐患分类、NL2SQL、客服报价 四套 Prompt 逻辑不同」 | 「一套 Prompt 打天下」 |
六件套结构(被追问「你怎么写」时用 · 对齐块 4 第 37 题)
- 角色 — 你是谁(制度问答助手 / 隐患分类员…)
- 任务 — 这一步要干什么(根据检索片段回答 / 输出 JSON…)
- 背景/输入占位 —
{检索片段}、{用户问题}、{槽位}
- 约束 — 温度、长度、禁止编造、无检索如何处理
- 输出格式 — 纯文本+引用 / 固定 JSON 字段
- 示例(1~2 条) — 少样本,尤其分类、格式控制
口诀:角色任务 · 输入占位 · 约束格式 · 示例可选
三个项目 · 各举一句(开口就挂项目)
| 场景 | Prompt 关键设计 | 一句话举例 |
|---|
| 国能·制度 RAG | 无检索不答 + 必须引用条款 | 「只用 {chunks} 回答;找不到就说未找到,引导人工」 |
| 国能·隐患 Agent | 强规则 + 低温度 + JSON Schema | 「只输出 category/dept/urgency,审核员确认后才入工单」 |
| 财税·代账客服 | 报价 无出处不答 + 缺槽位澄清 | 「检索不到报价表条目 → 不编数字,引导留资或转人工」 |
| 简历·F2 分析 | 禁止编造 + 不确定让用户补充 | 「经历必须来自用户原文/OCR,不得虚构公司或数字」 |
30 秒口播示例(可直接练)
「我们制度问答的 Prompt,核心不是写得长,是三条契约:只用检索片段、必须带条款引用、检索为空就明确说不知道。 和隐患分类不一样——那个不要 RAG,要 固定 JSON + 低温度,因为类别是封闭集合。 所以我不会一套 Prompt 打天下;改 Prompt 一定看 Bad Case 是 检索错还是生成错,用同一批 50 条题回归。」
常见追问 · 口语答
知识常变、要快迭代,我们 6 个 Agent 和简历都以 Prompt + RAG 为主;格式极其固定、数据量很大、Prompt 顶不住时再考虑微调。
制度问答、分类、SQL 生成用 低温度;创意文案可略高;但 B 端优先格式和准确。
用 同一批 Bad Case + 黄金集 回归,看准确率、幻觉率、引用命中率,不是主观「感觉好了」。
产品定 契约和红线(无检索不答、必须引用等),运营/法务审 制度/报价文案;上线要有 版本与回退 机制。
必背19. RAG 系统里 Query 改写怎么答?(26 春招模拟面 · 扶安)⭐
抖音:[扶安AI小课堂 · RAG 里 query 改写](https://v.douyin.com/I4zrjTqIbxY/) 挂:块 4 #6 召回低 · 附13 M5 · 国能制度 / 财税报价
30 秒版(建议背):
用户问话往往 口语、省略、多轮追问;直接拿原句去搜,Recall 会掉。
我会在 检索前 加一层 Query 改写:把口语补全、拆成可检索关键词、多轮时 带上文意图 再搜;改写只服务检索,进 Prompt 的仍是 检索片段 + 原问题,避免改写本身编造事实。
三层(被追问时用)
| 层 | 做什么 | 例子 |
|---|
| ① 规范化 | 去口语、补实体 | 「陪产那个假」→「陪产假 天数 规定」 |
| ② 多轮改写 | 把指代补全 | 「那上海呢?」→「上海 代理记账 报价」 |
| ③ 多 Query | 一条变 2~3 条检索 | 制度题:条款号 + 同义词各搜一次再合并 |
和项目挂钩
- 国能·制度 RAG:用户常带 条款号/简称 → 混合检索 + 别名表;跨章漏召回类 Bad Case 先看 chunk,再看 Query 是否太窄。
- 财税·报价 RAG:口语「小规模多少钱」→ 改写补 城市+纳税人类型 再检,检不到 不编价。
- 简历·F2:上传 OCR 后用户追问「帮我改这段」→ 改写要 锚定当前简历段落,别漂到别的模块。
常见追问
Query 改写 只用于检索阶段,帮助把口语问法补全成更好搜的关键词;最终回答仍 只用检索到的片段和用户的原问题,并且 没检索到就不答,不会在改写环节编造新事实。
改写负责 扩大召回(把「它」「这个」补全、把口语变检索词);Rerank 负责 精排(从候选片段里挑出最相关的)。工程顺序一般是 先改写,再混合检索,再 Rerank,最后才生成。
必背20. 怎么保证 Agent 调用可靠性?(大模型星球)⭐
抖音:[大模型星球 · Agent 调用可靠性](https://v.douyin.com/-yN5u0dfuUI/) 挂:块 4 #27 工具失败 · #32 Agent 评估(过程层) · 附13 M4
30 秒版(建议背):
Agent 可靠不是「模型聪明就行」,是 产品 + 工程一起兜底:
超时、重试、幂等、熔断、最大步数、重复检测、转人工 都要在工作流里写死;每次工具调用可观测(成功/失败/耗时/入参摘要),失败进 错题本 回归。
五件套(面试列点用)
| # | 机制 | 产品要定什么 |
|---|
| 1 | 超时 | 单步/整任务上限;国能 Dify 节点、财税 HTTP 查进度各设 SLA |
| 2 | 重试 | 仅 幂等 读操作可重试;写库/派单 禁止盲重试 |
| 3 | 降级 | 工具失败 → 固定话术 + 转人工;别 silent fail |
| 4 | 防死循环 | max steps + 相同工具重复调用检测(块 4 #28) |
| 5 | 可观测 | 日志:意图、工具名、成功/失败、步数 → 过程层指标(块 4 #32) |
和项目挂钩
- 国能·人事 NL2SQL:SQL 只读 + 校验失败不执行;超时回 「请稍后再试或找 HR」。
- 国能·隐患 Agent:分类后 HITL 确认 才入库——可靠性靠 人兜底,不是全自动梭哈。
- 财税·Coze:进度走 HTTP;失败走 兜底分支;编价类 无出处不答(可靠性 = 业务合规)。
口播示例
「我们评 Agent 不只看答得像不像,过程层必看 工具成功率、平均步数、超时率。工具挂了有 重试→降级→转人工 三级,并且同一批多步场景进 黄金集 每周回归。」
必背21. RAG 怎么评估?(千万别只说准确率 · 小哲)⭐
抖音:[小哲讲大模型 · RAG 评估别只说准确率](https://v.douyin.com/GJg8rg3MVVY/) 挂:块 4 #10 · 附13 M5 · 国能制度 RAG / 财税报价 RAG
30 秒版(建议背):
RAG 评估我 绝不只报一个「准确率」——要 检索和生成分开看:
检索侧 看 Recall@K、Top-K 命中率(该检到的检到了没);生成侧 看 引用命中率、幻觉率、拒答率(有没有瞎编、没检到敢不敢说不答)。
线上再加 抽检 + 满意度 + Bad Case 回归,改完必须 同一批错题再测。
四层(被追问时用)
| 层 | 看什么 | 国能/财税举例 |
|---|
| ① 检索 | Recall、漏召回类 Bad Case | 制度跨章漏检 → 调 chunk + 混合检索 + §19 改写 |
| ② 生成 | 引用是否贴片段、有无编造 | 制度 必须带条款号;财税 无出处不报价 |
| ③ 拒答 | 没检到是否敢说不答 | 无检索不答 写进 Prompt 契约 |
| ④ 线上 | 抽检、满意度、错题本闭环 | 每周抽检 + 分类:检索/Prompt/知识库 |
口播示例
「制度 RAG 我们离线先看 Recall,生成看 引用和幻觉;线上不是只看用户点赞,还有 人工抽检和错题回归。如果只报一个准确率,分不清是 检错了 还是 写错了。」
常见追问
RAG 多一层 检索质量;检索错了,后面 Prompt 再漂亮也救不了——所以要 分开归因。
先 chunk/混合检索/别名表,再看 Query 改写(§19),不是一上来换大模型。
必背22. Agent 安全边界怎么考虑?(小哲)⭐
抖音:[小哲讲大模型 · Agent 安全边界](https://v.douyin.com/MjeYfVXdbg4/) 挂:块 2 · 块 4 #29、#32 · 附3 B 端边界 · 国能六 Agent
30 秒版(建议背):
Agent 安全边界不是「加一句请勿违法」,而是 产品先画圈:能做什么、不能做什么、谁有权、什么必须人工。
我按 五层 定:域(限定业务场景)· 权限(行级/只读/脱敏)· 动作(读可以、写/派单要 HITL)· 内容(无出处不答、防注入)· 审计(日志可追溯)。
B 端 国能 是典型:SQL 只读+拦截、隐患 分类后人工确认、制度 无检索不答。
五层(面试列点用)
| 层 | 产品要定什么 | 项目举例 |
|---|
| ① 业务域 | 单 Agent 单域,前面路由 | 人事/燃料/制度/隐患 各做各的 |
| ② 数据权限 | 谁能查什么、脱敏规则 | NL2SQL 行级权限 + 只读库 |
| ③ 动作边界 | 哪些工具可自动、哪些必须 HITL | 隐患 不入库直到审核员确认 |
| ④ 内容安全 | 无检索不答、防 Prompt 注入 | 制度/报价 必须引用;异常输入走兜底 |
| ⑤ 审计合规 | 谁问了什么、调了什么工具 | 央企要求 可审计、可回滚 |
和「可靠性 §20」的分工
- §20 = 工具 挂了怎么办(超时/重试/降级)
- §22 = Agent 能不能做、该不该做(权限/HITL/域)
口播示例
「人事 Agent 不是开放聊天——限定域 NL2SQL + FAQ,SQL 多层校验失败 不执行;隐患 Agent 可以分类但不能自动派单,必须 HITL。安全边界和可靠性是两套题,我会分开答。」
必背23. 怎么设计记忆系统?(上下文工程 · 小哲)⭐
抖音:[小哲讲大模型 · 记忆系统与上下文工程](https://v.douyin.com/UJgCzpIJXQU/) 挂:块 2(Agent 记忆四层)· 块 4 #29 · 附3 §1
30 秒版(建议背):
「记忆」不是让模型 脑记一切——是 上下文工程:在 有限 Context Window 里,决定 什么进 Prompt、什么走外部存储、什么必须查库。
我分 四层:工作记忆(当前轮+工具返回)· 会话记忆(最近 N 轮+槽位)· 业务记忆(工单/考勤 查库,比脑记准)· 长期偏好(试点、要定留存与隐私)。
RAG 本质是外部记忆——制度/报价不进窗口,需要时再检索。
和块 2 对齐(被追问时用)
| 层 | 放哪 | 国能实际 |
|---|
| 工作记忆 | Context 内 | 当前问题 + 刚查到的 SQL/检索片段 |
| 会话记忆 | Context 内截断/摘要 | 人事 NL2SQL 保留 工号、时间范围 等槽位 |
| 业务记忆 | 业务库 | 工单状态、考勤结果 按用户 ID 查 |
| 长期偏好 | Profile(可选) | 央企 跨会话长期记忆未上线;用业务库替代 |
上下文工程三原则
- 能查库别硬塞 — 窗口有限,RAG/NL2SQL 优于把整库塞进 Prompt
- 能摘要别堆轮 — 多轮太长就 摘要关键槽位
- 先定隐私边界 — 记什么、记多久、用户能否删;误记率 和 体验 一起看
口播示例
「国能因合规 没上跨会话长期记忆,会话内保留槽位,跨会话靠 业务库 + 用户 ID;制度知识走 RAG 外部记忆,不是把整本制度塞进 Context。若贵司要做长期记忆,我会从 小范围偏好 试点,并定 留存和审计。」
常见追问
RAG = 按需加载的外部知识;记忆系统 = 会话状态 + 用户状态 + 外部库 的整体编排。
- 抖音说的 Context Engineering?
就是 在 token 预算内选什么信息进模型——检索片段、最近对话、工具结果、系统约束 一起排优先级。
必背24. 多轮对话不做这 4 点,纯属烧钱?(AI产品天道)⭐
抖音:[AI产品天道 · 多轮对话不做这4点,纯属烧钱](https://v.douyin.com/uszQvOCeyAw/) 挂:块 4 #41 Token 成本 · #42 Context Window · 附11 §19(Query 改写)· §23(记忆分层)· 附13 M2 业务层
视频核心(一句话):
多轮对话如果不做好 上下文管理、指代消解、结构化 Prompt、对话状态跟踪,就是 纯烧钱、没效果。
30 秒版(建议背 · 对齐视频):
多轮想 省钱又有效,必须做好四点:① 上下文管理——滑动窗口 + 历史摘要 + 结构化存储,别全量喂历史;② 指代消解前置——时间/地点/实体补全后再进模型,不让模型猜;③ 结构化 Prompt——角色职责写死、历史用分隔符、强约束输出格式;④ 对话状态跟踪——关键信息变状态变量 + 状态机,流程不断裂、不重复问。不做这四点,就是 纯烧钱、没效果。
🎯【口诀·多轮四件套】不念给面试官 · 先口诀再扩绿条
① 上下文管理 · 别全量喂历史(窗口 + 摘要 + JSON 槽位)
| 项 | 内容 |
|---|
| 问题 | 每轮把 全量历史 塞给模型 → 10 轮后 Token 暴增、成本飙升、变慢甚至报错 |
| 三件套 | 滑动窗口(最近 3~5 轮)· 历史摘要(更早对话压成:诉求 + 关键实体 + 已确认信息)· 结构化存储(JSON/键值对,不堆纯文本历史) |
| 一句话 | 不要「全量喂历史」,要 窗口 + 摘要 + 结构化 |
| 项目挂 | 国能制度 RAG 切段 不进整本;人事 FAQ 命中不调大模型(Token 降 60%+);缺陷 Agent 只加载 当前工单时间窗 |
② 指代消解前置 · 先改写 Query(不让模型猜)
| 项 | 内容 |
|---|
| 问题 | 用户说「明天天气怎么样」「它」「那个」——模型不知道指什么 → 答非所问、反复澄清 |
| 做法 | 前置改写 Query:模糊指代 补全再进模型(例:「明天天气?」→「北京 2026-06-08 天气?」);可用 小模型/规则/NER 做实体消歧 + 时间补全 |
| 一句话 | 指代消解 必须前置,不让模型猜 |
| 项目挂 | NL2SQL 前补 部门、时间范围;财税查进度缺 公司名 先追问再调 HTTP;详 附11 §19 Query 改写 |
③ 结构化 Prompt · 角色 + 分隔符 + 强约束输出
| 项 | 内容 |
|---|
| 问题 | Prompt 写得随意、没结构 → 多轮后行为漂移、输出不可控、越聊越偏 |
| 三段式 | ① 角色 + 职责写死(只做 XX、不做 XX)② 历史结构化 + 分隔符(系统/用户/助手标签,历史与当前问题分开)③ 约束 + 输出格式(不能编、必须溯源、JSON/Markdown、拒敏感) |
| 一句话 | 多轮 Prompt = 角色 + 结构化历史 + 强约束,控行为不控死内容 |
| 项目挂 | 国能制度 无检索不答 + 引用出处;财税报价 无出处不答;简历各 AI 步骤 输出契约(JSON 字段对齐下游表单) |
④ 对话状态跟踪 · 状态变量 + 状态机(不重复问)
| 项 | 内容 |
|---|
| 问题 | 没状态记录 → 聊到一半忘前面、反复问同样问题、流程卡死 |
| 做法 | 状态变量:订票=出发地/目的地/日期/人数/是否确认;档案=身份/范围/涉密/已查目录 · 状态机:当前态、必填/可选、已确认/待确认 |
| 一句话 | 多轮要 状态化、变量化,模型读状态干活,不靠「回忆」 |
| 项目挂 | 简历主路径 摸底→初稿→对齐→预览→导出 状态机(非开放聊天);国能保留 工号、时间窗 槽位;财税 意图分流(咨询 vs 查进度) |
和 §19 / §23 怎么分工
| 节 | 讲什么 |
|---|
| §19 | 指代消解 / Query 改写 怎么做(召回侧) |
| §23 | 记忆分层、Context Engineering(工作/会话/业务/长期) |
| §24 | 视频 四件套总纲(面试问「多轮怎么不烧钱」先背 30 秒 + 口诀) |
口播示例(挂国能)
「人事 Agent 不是开放域聊天:上下文用 最近几轮 + 摘要,槽位 JSON 存工号和时间窗;问「上个月编制」会先 改写补全部门和时间 再 NL2SQL;Prompt 角色+红线+引用格式 写死;流程上 FAQ→复杂问法→转人工 有状态,不会每轮从零猜。」
常见追问
FAQ/RAG 是 降调用、降喂料 的工程手段,归在 ① 上下文管理 和 ③ Prompt 约束 里,不替代 ② 指代 和 ④ 状态机。
主路径 表单 + 状态机(对齐 ④);F7 等多轮场景用 ① 窗口+摘要;OCR 超长 截断(块4 #42)。
必背25. 选错 Agent 还是 Workflow,项目直接翻车?(云尔-AI大模型果果)⭐
抖音:[云尔-AI大模型果果 · Agent vs Workflow](https://v.douyin.com/nAQ10M3MQxw/) 挂:块4 #24 · 块2 常见追问(为什么用 Dify 工作流) · 附4 #3 ReAct
视频核心(一句话):
很多项目翻车,不是模型不行,是 架构选型错了——该用 固定工作流 的硬上 开放 Agent,或该分步编排的却做成 一轮对话黑盒。
30 秒版(建议背):
我先问三件事:路径是否固定、是否要调工具/查库、失败能不能审计。
- 路径固定、步骤可枚举 → Workflow(条件分支 + 工具节点),可预测、好评测、好合规。
- 步骤不确定、要循环试工具 → Agent / ReAct 式多步(设最大步数、超时、人工兜底)。
- 简单问答 → FAQ 或 RAG 链 就够,不必硬上 Agent。
国能里 制度 RAG 是固定链(检索→生成+引用);人事 NL2SQL 是工作流(FAQ 分流→意图→SQL 校验→只读库→总结);隐患 是 JSON 输出 + 人工确认,不是开放聊天。财税 是 Coze 三路分支工作流,不是纯对话框。
🎯【口诀·Agent vs Workflow】不念给面试官 · 先口诀再扩绿条
选型表(面试可画 orally)
| 信号 | 优先 | 反面(易翻车) |
|---|
| 步骤固定、可画流程图 | Workflow + 分支 | 一个 Agent 自由发挥 |
| 强合规、要审计、央企 ToB | Workflow + HITL | 端到端黑盒对话 |
| 多工具、路径随结果变 | Agent(限步数) | 无限循环聊天 |
| 单意图 FAQ / 制度问答 | FAQ / RAG 链 | 包装成「智能体平台」 |
| 成本敏感、高频重复问 | FAQ 直答(不调大模型) | 每轮都走 LLM |
国能举例(各管一域,别混)
- 制度:检索命中才答,固定 Workflow
- 人事/燃料:NL2SQL 五层安全,前面 FAQ 降 Token 60%+
- 隐患/缺陷:结构化输出 + 状态推进,不是开放域 Agent
- C 端简历:主路径状态机(摸底→导出),不是聊天框一把梭
常见追问
- Dify 算 Agent 还是 Workflow?
Dify 是 编排载体;我落地时是 工作流图 + 工具节点,产品上要自己定 哪段固定、哪段可分支,不是「挂上 Dify 就等于 Agent」。
当 同一句用户话 可能触发 不同工具组合、且无法事先画死路径 时;仍要 最大步数、重复检测、转人工(块4 #28)。
该 HITL 的没确认、该只读的没拦截、该 FAQ 的每轮烧 Token——指标上不去、合规过不了、成本爆,面试就说这是 产品架构问题,不甩锅模型。
必背26. 多智能体 vs 单智能体,区别是什么?怎么选?(果果姐说AI · 26 春招模拟面)⭐
抖音:[果果姐说AI(面试版)· 多智能体和单智能体的区别](https://v.douyin.com/mMAWpUj1Flc/) 挂:块4 #30 · 附4 #8 多 Agent 协作 · 块2 6 款 Agent 各管一域
视频核心(一句话):
单智能体 = 一个入口解决 一个域 的一类任务;多智能体 = 路由/编排层 + 多个专精子 Agent,按意图分发。不是 Agent 越多越好。
30 秒版(建议背):
单智能体适合:域清晰、权限一致、流程能画死——例如只做 制度 RAG,或只做 人事 NL2SQL。好处是 好调试、好评测、好追责。
多智能体适合:多个业务域、知识库不同、权限不同,需要 前台路由 再分发——我们国能是 6 个独立 Agent 各管一域(制度/人事/燃料/培训/隐患/缺陷),产品上是 多 Agent 矩阵,不是 一个超级 Agent 包打天下。若要做「总前台」,我会加 路由 Agent:只负责 意图识别 + 槽位 + 分发,子 Agent 只干本域;并定义 上下文交接字段、失败谁兜底、是否允许串调。
MVP 原则:先单域单 Agent 跑通指标,再考虑多 Agent;.demo 堆五个 Agent 互相调用,面试能讲、上线难维护。
🎯【口诀·多 vs 单】不念给面试官 · 先口诀再扩绿条
对比表
| 维度 | 单智能体 | 多智能体 |
|---|
| 典型形态 | 一个工作流解决一类任务 | 路由 + N 个子 Agent |
| 优点 | 简单、可观测、易回归 | 域隔离、权限清晰、可扩展 |
| 风险 | 域变大后难维护 | 调度复杂、成本叠加、调试难 |
| 国能对应 | 制度问答 Agent 单独一条链 | 6 款 Agent 分域(非一个聊天入口) |
| 2026 简历/财税 | 简历 主路径状态机;财税 三路分支 | 未做跨 Agent 互调,故意控制复杂度 |
口播示例
「国能我不是做一个万能助手,而是 人事、燃料、制度……各一个 Agent,前面可以有 统一入口做路由,但 子 Agent 不互相乱调。这和抖音说的多智能体一致:拆分是为了专精和合规,不是为了炫技。」
常见追问
多 Agent 常共用 同一套工具协议(MCP/HTTP);产品要先定 哪个 Agent 能调哪个工具,避免 越权(块4 #26 MCP)。
路由层 看意图准确率、误分发率;子 Agent 看域内任务成功率;整体 看转人工率、成本——不能只看某一个子 Agent 的准确率(附11 §8、§20)。
试点期、域还没摸清、团队运维能力有限时——一个域一条工作流 + 黄金集,比五个 Agent 互聊更靠谱。
附11 与 块 3-1、附3、附12 有重复处 以块 1~4 为准;附11 方便按抖音题目检索。
补充区(时间充裕再背)
3. AI 产品经理工作全流程(别准备漏了)
你可以这样答(按阶段,口语):
Discovery:访谈业务、看现有工单/咨询日志、定 1 个 MVP 场景 和指标。
Design:工作流/Prompt/RAG/工具、权限与兜底、 黄金测试集 50 条。
Build:和算法后端联调;原型验证(我用 Dify/Coze/Cursor)。
Evaluate:离线评测 + 业务抽检 + Bad Case 表。
Launch:内测→试点→扩量;版本回退方案。
Operate:监控 Token/成功率/转人工;每周复盘;知识库增量更新。
我 6 个 Agent 和 2026 两个产品都走这套,不是只写 PRD 不落地。
5. B 端 Agent 项目「真相」(别只讲 C 端聊天)
💬 你可以这样答
B 端 Agent 不是 开放域聊天,而是 限定域 + 强权限 + 可审计 + 可降级:
- 域:人事/燃料/制度/隐患,各做各的,前面有 路由
- 权限:行级、只读库、SQL 拦截
- 人机协同:隐患/派单 HITL,AI 不直接改生产数据
- 成本:FAQ 吃高频,别什么都调大模型
- 评测:业务 KPI + 错题本,不是 demo 好看
C 端简历偏 体验、合规、商业化;B 端国能偏 安全、稳定——我会按岗位强调匹配的那一侧。
6. AI 项目做到什么程度能写进简历?
不是搭个 demo 聊天框就能写——要能讲清 场景、你的职责、指标、迭代、边界,最好 能经得住 15 分钟深挖(场景、职责、指标、一个 Bad Case、怎么迭代)。2025 年 5 月前不写 AI;写 结果数字 + 你负责的链路;一个项目 一条故事,别只堆名词。
三档示例:国能 6 Agent 上线;简历 PRD+39 页+全模块后台+交接包;财税 Coze 工作流可演示 + 知识库 + HTTP 查进度。
8. 转行 AI 产品经理,简历项目经历怎么写?
结构:背景一句 + 你负责什么 + 结果数字 + 技术关键词各 1 个(RAG/NL2SQL/工作流/HITL)。
避免:技能堆砌、把 ERP 写成 AI、没有指标。
我的写法:国能 6 Agent 各 1 行;2026 简历 + 财税并行;2012~2025 数字化单独一段不写 LLM。
详 马凯强-AI产品经理-修订版.md。
11. Vibe Coding 是什么?简历还可以这样写?
面试答法:产品经理用 Cursor 等 AI 编程助手 快速搭 可点原型,验证交互、规则、文案;交付 PRD + dev-spec 验收标准。不是替代研发写生产代码(鉴权、支付、性能、合规仍研发)。
简历写法:写「用 Vibe Coding 完成 39 页可交互原型 + 运营后台 dev-spec」,别写「我会写代码取代后端」。现场考分 L1 概念 / L2 设计 / L3 深挖,不会的就 承认边界 + 讲怎么接到现有项目上。
13. 面了很多家 AI 产品岗的「秘密」(小蓝等博主)
你可以这样答(转正面):
大家背景不同,但 面试官真正听的是:有没有 落地项目、能不能 讲清边界和指标、概念题能否 接到你的场景。
所以我策略是 三个项目打深(国能 NL2SQL/RAG、财税客服、简历 0-1),概念题 接到这三个场景上答,不跟博主拼 背题数量。不会的就 先承认边界,再讲你会怎么设计。
14. Vibe Coding 大赏 / 到底是什么?(芜小匀等)
30 秒:就是 产品经理用 AI 编程助手(我主要 Cursor)快速搭可点原型,验证交互、规则、文案,不是写生产后端。
和「写代码」的区别:我交付 PRD + 原型 + dev-spec 验收标准;鉴权、支付、性能、合规 仍研发。
项目举例:简历优化 39 页 C 端 + B 端运营后台(Tab、列表、详情、接口专章)——Finder 双击就能演示给研发/老板。
17. Vibe coding 爆火,AI 产品/解决方案面试考什么?(Mentor学姐)
常考五块(口语):
① 会不会用 AI 提效(原型、PRD、评测集整理)
② 和研发边界清不清(什么你交付、什么必须工程化)
③ 能不能讲清复杂 AI 项目(SCQA · 块 3-1 总框架)
④ 概念能否落到场景(RAG/意图/Token → 附12 举例)
⑤ 有没有评测意识(Bad Case、指标、不只看 demo)
解决方案岗再加:客户场景怎么拆、PoC 范围、合规与私有化、和 Dify/Coze 选型理由(附3 §16)。
附12 · AI 专业名词人话词典(是什么 → 干什么 → 哪项目 → 举例)
用法:听到 FAQ、Chunk、ChatBI 等英文/缩写,先在这里 10 秒定位,再用 1~2 句项目例子 答面试官;深答、追问仍看 附3 对应节。 原则:每个词 先中文人话,再 挂钩国能 / 简历 / 财税 之一,禁止只背定义不举例子。
速查表(考前扫一眼)
| 名词 | 一句话人话 | 你项目里出现在哪 |
|---|
| FAQ | 高频问+标准答,本地匹配不调大模型 | 国能·人事 FAQ 分流 |
| Chunk | 长文档 切成小块 再入库检索 | 国能·制度 RAG 按章节切 |
| ChatBI | 开放域「说话查数做图」 | 对比:我们做人事 限定域 NL2SQL |
| RAG | 先查知识库再答,没查到不编 | 制度问答、财税报价 |
| Top-K | 检索只取 最相关 K 段 进 Prompt | 制度 RAG 调 K 防噪音/漏召回 |
| Rerank(精排) | 粗召回后再 重新排序 挑最准的 | 制度 Bad Case 跨章节漏召回 |
| 向量检索 / Embedding | 文字变向量,语义相近 能搜到 | 制度库、财税知识库 |
| 混合检索 | 关键词 + 向量 一起搜 | 制度「第 3.2 条」+「请假」 |
| NL2SQL | 人话变 SQL 查表(我们 只读) | 国能·人事「综合部多少人」 |
| 意图识别 | 判断用户 想干什么 | 财税:进度 vs 咨询 vs 转人工 |
| 槽位(Slot) | 意图里还缺的 关键信息 | 财税:公司名、城市 |
| HITL | 人确认后 才执行/入库 | 国能·隐患 Agent 审核入工单 |
| Token | 模型计费 单位(字≈token) | FAQ 命中 ≈ 0;复杂问 ~4000 |
| Bad Case | 错题本,用来迭代 | 人事别名错、制度漏召回、财税编价 |
| JSON Schema | 固定 JSON 格式 输出 | 隐患:类别+部门+紧急度 |
| 幻觉 | 模型 编造 不存在的内容 | 制度无检索不答;财税不编价 |
| OCR | 图片转文字 | 简历·F2 传截图识简历 |
| Vibe Coding | AI 助手 快速搭原型 | 简历 39 页 + 后台 dev-spec |
| React / Taro | 一套代码 出 H5+小程序;PM 定流程+验收 | 块 6 · 前端栈 30 秒(浅问 · 不必背块4) |
| 模型分档 | 简单走便宜模型、复杂走标准 | 简历 F2 分析 simple/standard |
| 增量入库 | 制度更新 只加新段 不全库重跑 | 国能·制度 RAG |
| MCP | 工具 统一接口(Agent 调外部能力) | 概念对标 Dify 工具节点 / HTTP |
| Context Window | 模型一次能 读多长 | 长 JD 截断 + 分段摘要 |
| Agent / 工作流 | 多步编排(路由→检索→生成→工具) | 国能 6 Agent;财税 Coze 三路分支 |
一、检索与知识库(RAG 全家桶)
FAQ(高频问答库 / FAQ 分流)
- 是什么:把 每天被问很多遍 的问题做成「标准问 → 标准答」,用 关键词或规则本地匹配,不调用大模型。
- 干什么:省钱(几乎 0 Token)、更快、更稳(答案固定不会编)。
- 项目举例
- 国能·人事:HR 常问「本月考勤怎么汇总」「年假还剩几天」→ 走 FAQ 本地库,命中直接返回答案;复杂编制、跨部门统计才走 NL2SQL + 大模型。整体 Token 降 60%+(简历/背诵口径)。
- 对比财税:代账知识库 六大类 260 道标准 FAQ,但客服是 RAG 检索 + 严格引用 报价,不是简单关键词表——因为问法多样、必须带出处防编价。
Chunk(切块 / 分片)
- 是什么:把一份 很长的 PDF/制度 切成 很多小段(每段几百字),再分别做向量入库。
- 干什么:检索时 只捞相关段,不会把整本制度塞进 Prompt;也避免「一段太长检索不准」。
- 项目举例
- 国能·制度 RAG:按 章节 切,每段约 200~500 字,相邻段 重叠 10%~20%(避免答案刚好卡在缝上漏掉)。
- Bad Case:用户问「产假和年假能否一起休」——答案跨两章 → 调 chunk 大小 + 重叠 + 混合检索 + Rerank(见下)。
RAG(检索增强生成 · Retrieval-Augmented Generation)
- 是什么:用户提问 → 先去知识库搜 → 把搜到的片段塞进 Prompt → 大模型 只根据片段回答,并 标注引用。
- 干什么:用 私有、可更新 的知识(制度、代账报价),降低 幻觉,答案 可审计。
- 项目举例
- 国能·制度:「研发岗年假几天?」→ 检索《考勤制度》3.2 节 → 回答 + 引用条款;没检索到 → 明确说不知道,不编。
- 财税·Coze 客服:「小规模纳税人代账多少钱?」→ 知识库检索报价表 → 无命中不报价,引导留资或转人工。
Top-K
- 是什么:检索时只取 相似度最高的 K 条 chunk 送给模型(如 K=3 或 K=5)。
- 干什么:K 太大 → Prompt 噪音多、费 Token;K 太小 → 漏掉关键段。
- 项目举例:制度 RAG 调 Top-K;跨章节 Bad Case 时 适当加大 K + Rerank,不是一味加 K。
Rerank(精排 / 重排序)
- 是什么:向量检索 先粗召回 一批候选 → 再用 精排模型 按「和问题的相关度」重新排序,取最准的几条。
- 干什么:解决「语义像但答非所问」的 chunk 排在前面。
- 项目举例:制度 召回率低 / 跨章节漏答 时,在混合检索后加 Rerank;评测看 引用命中率 + 准确率 95% 口径。
向量检索 / Embedding
- 是什么:把句子变成 一串数字(向量);问句和知识库段落 向量越近 = 语义越像。
- 干什么:用户问「请假流程」也能搜到标题写「休假管理办法」的段——不要求字面一样。
- 项目举例:制度库、培训题库、财税 260 道 FAQ 六大类 入库;问「记账一年多少钱」和库内「小规模代账年费」能 语义匹配。
混合检索(Hybrid Search)
- 是什么:关键词检索(BM25/ES)+ 向量检索 结果合并。
- 干什么:编号、专有名词 关键词更准;口语化问法 向量更准。
- 项目举例:制度里用户问 「第 3.2 条」 → 关键词;问 「陪产假几天」 → 向量;两者 合并去重 再进 Prompt。
增量入库
- 是什么:制度/知识 更新时只新增或替换变更段,不全库删除重跑。
- 干什么:更新快、旧问答不失效、运维可接受。
- 项目举例:国能制度修订 → 只更新受影响章节 chunk;培训题库加新题 → 增量写入向量库。
二、查数与分析(NL2SQL vs ChatBI)
NL2SQL(自然语言转 SQL)
- 是什么:用户说人话 → 系统生成 SQL 查数据库 → 返回表格/数字。
- 干什么:业务人员 不用写 SQL 也能查报表。
- 项目举例
- 国能·人事:「综合部现在有多少人?」→ 生成 只读 SELECT → 走 别名表(「综合部」→ 标准部门 ID)→ 结果秒级返回;写操作一律拦截。
- 安全五层:只读库 · 表白名单 · SQL 语法拦截 · 行级权限 · 审计日志(块 3-2)。
ChatBI(对话式 BI)
- 是什么:偏 开放 的商业智能——自然语言 拖表、看趋势、多维度分析,常接 宽表/数仓。
- 干什么:分析师/老板 探索性看数;灵活但 权限和口径难控。
- 和咱们的区别(面试高频):
「我们 不是 ChatBI,是 限定域 NL2SQL——只做人事域、固定指标口径、只读 + 行级权限,优先 准确和安全,不开放任意 JOIN。」
别名表
- 是什么:口语/简称 → 标准字段值 的映射表(「综合部」「综办」→ 同一
dept_id)。
- 干什么:减少 NL2SQL 查错部门。
- 项目举例:人事 Bad Case「用户说综办,库里有综合部」→ 维护 别名表 + 低置信 澄清话术。
题 21~35
三、Agent、意图与安全
意图识别(Intent)
- 是什么:判断用户 想办哪类事(查进度 / 问价格 / 投诉 / 闲聊)。
- 干什么:后面 走不同分支(不同 Prompt、不同工具、是否转人工)。
- 项目举例
- 财税·Coze:办进度 → HTTP 查工单;财税咨询 → RAG;说不清 → 澄清或转人工。
- 国能·总路由:先分 人事 / 制度 / 燃料 / 隐患… 再进对应 Agent。
HTTP 查单 / 接口查进度(口语可说「走业务系统查单」)
- 是什么:用户问「办到哪一步了」时,Agent 不调大模型编进度,而是 调财务公司业务系统接口(Coze 里用 HTTP 插件),用 公司名等参数 查真实工单状态再回复。
- 干什么:进度是 实时业务数据,必须 查库/查接口,和 RAG 查文档报价 是两条路。
- 项目举例:财税「我的记账进度怎样?」→ 识别为 办进度 → 缺公司名先追问 → 齐了之后 HTTP 调
Finance_Taxation_Service 返回状态;失败 重试一次再转人工。
槽位(Slot)
- 是什么:意图确定后,还缺的 关键参数(公司名、城市、订单号)。
- 干什么:参数齐了才能 调接口或查库。
- 项目举例:财税「查进度」缺 公司名 → 多轮追问「请问是哪家公司?」;齐了之后才走 业务系统查单。
Agent / 工作流(Workflow)
- 是什么:多节点编排:路由 → 检索 → 生成 → 调工具 → 格式化输出;比「单次 Chat」可控。
- 干什么:复杂业务 可审计、可降级、可插 HITL。
- 项目举例:国能 6 个 Agent 各管一域;财税 Coze 工作流 三路分支 + 知识库 + HTTP。
HITL(Human-in-the-Loop · 人在回路)
- 是什么:AI 产出 必须经人确认 才写入业务系统。
- 干什么:高危场景 防误操作(派单、分类、审批)。
- 项目举例:国能·隐患 Agent——AI 输出 JSON(类别、责任部门、紧急程度)→ 安全员点确认 → 才生成工单;不是 AI 直接关阀/派单。
JSON Schema
- 是什么:规定模型输出 必须是哪种 JSON 结构(字段名、类型、枚举)。
- 干什么:下游系统 稳定解析;评测 可自动比对。
- 项目举例:隐患 Agent 固定输出
{ category, dept, urgency, evidence };解析失败 → 重试或转人工。
MCP(Model Context Protocol · 了解即可)
- 是什么:给 AI 接工具(查库、HTTP、文件)的 统一协议/接口规范。
- 干什么:换模型/换平台时 工具不用重写一遍。
- 项目举例(口语):Dify 的 工具节点 / HTTP 请求、Coze 的 插件——都是「Agent 调外部能力」;MCP 是行业在推的标准化说法,面试说清你用过 HTTP/工具节点即可。
四、成本、质量与评测
Token
- 是什么:大模型读写的 计费单位(中文约 1~2 字 / token,英文约 4 字符 / token,视模型而定)。
- 干什么:控制 成本 和 上下文长度。
- 项目举例:人事 FAQ 命中 ≈ 0 tokens;复杂 NL2SQL 一问一答约 ~4000 tokens → 所以 FAQ 分流 + 缓存高频问(块 4 第 41 题、附3 §9)。
幻觉(Hallucination)
- 是什么:模型 编造 库裡没有的规定、价格、数据。
- 干什么:产品要想 约束策略,不能单靠「Prompt 里写别编」。
- 项目举例:制度 无检索不答;财税 无报价出处不报价;人事 SQL 结果必须来自只读库。
Bad Case(错题本)
- 是什么:线上/评测 答错的典型样例 存档(问、期望答、实际答、根因分类)。
- 干什么:迭代 Prompt / 检索 / 知识库 / 别名表 的输入,不是凭感觉改。
- 项目举例:人事 别名错;制度 跨章漏召回;财税 编造价格 → 各建分类,每周复盘。
Golden Set(黄金测试集)
- 是什么:上线前定好的 50~100 条标准问答/任务,含 输入、期望输出、验收规则(可人工判,也可自动比对 JSON/SQL)。
- 干什么:每次改 Prompt/检索/知识库后 同一批回归,看指标掉没掉;是 离线评测 的核心资产。
- 项目举例:制度 RAG 50 条(含跨章、边界、拒答);人事 NL2SQL 别名+口径题;财税 编价=0 容忍 专类;简历 防编造经历 子集。
Eval Harness(评测脚手架 / 评测 Harness)
- 是什么:把 黄金集 + 调用链路 + 打分规则 + 报告 打包成 可重复跑 的评测流水线(行业常叫 eval harness / evaluation harness)。
- 干什么:改一版 Prompt 就 一键批量跑测,不用手工逐条问;对标 LangSmith Evals、Ragas、自建脚本均可。
- 项目举例(诚实映射):国能/财税 没有单独采购 harness 平台名,但实践等价于 黄金集 + Dify/Coze 批量跑 + Excel/错题本 + 每周回归;简历 PRD 写了 ⑥ 评测块 + Bad Case 专章。面试可说「思路齐 harness,工程上是黄金集+回归流水线」→ 详 附13 · M3。
LLM-as-Judge(模型当裁判)
- 是什么:用 另一个 LLM 按 rubric 给回答打 相关性/忠实度/安全 分,辅助人工。
- 干什么:黄金集太大时 降人工成本;须和 人工抽检 对齐,不能 100% 信 judge。
- 项目举例:制度 RAG 可 judge 「是否引用原文、是否编造条款」;关键合规场景仍以 人工+规则 为准。
Offline Eval vs Online Eval(离线 vs 线上)
- 是什么:离线 = 发版前对黄金集批量测;线上 = 上线后看真实日志、满意度、转人工率。
- 干什么:离线 防退化;线上 发现长尾;两者 错题本并表。
- 项目举例:离线 Recall/成功率;线上 咨询降 70%、编价 Bad Case=0。
模型分档(Router / 大小模型)
- 是什么:简单任务走 便宜/快的小模型,复杂任务走 标准/大模型。
- 干什么:降 Token 成本、降延迟。
- 项目举例:简历 F2 简历分析——短简历/简单场景
simple,长简历/多段经历 standard(PRD 口径)。
五、2026 独立项目专用
OCR(光学字符识别)
- 是什么:图片/PDF 截图 → 提取文字。
- 干什么:用户 拍照上传简历/JD,不用手打。
- 项目举例:简历小程序 F2 摸底——上传 Boss/微信截图 → OCR → 再进分析;上传前压缩 省带宽(mkq 规则)。
Vibe Coding
- 是什么:用 Cursor 等 AI 编程助手 快速写 可交互 HTML/原型,验证 PRD。
- 干什么:对齐研发前 就把流程、文案、校验、dev-spec 跑通。
- 项目举例:39 页 C 端 + B-Admin 运营后台(列表 Tab、详情、⑥ 接口专章)——附3 §10、附11 §14、§15、§16、§17。
Context Window(上下文窗口)
- 是什么:模型 一次最多能读多少 Token(输入+输出总和上限)。
- 干什么:超长简历/JD 要 截断、摘要、分段处理,不能整篇硬塞。
- 项目举例:简历/JD 2 万字截断 + Toast;对话 只带最近 N 轮 + 检索段。
六、平台与工程口语(块 1 自我介绍常问)
Dify(AI 工作流编排平台)
- 是什么:可视化搭 Agent / RAG / 工具节点的 低代码平台(国能 内网部署)。
- 干什么:产品和研发能 拆节点、改 Prompt、接评测,比「纯聊天框 + 自研前后端」迭代更快。
- 项目举例:国能 6 款集团级 Agent 全在 Dify 上编排;块 1 追问「为什么不做一个对话框」→ 答 流程、权限、审计、Bad Case。
Prompt(提示词 / Prompt 工程)
- 是什么:写给大模型的 角色、任务、约束、输出格式 等指令文本。
- 干什么:控 幻觉、格式、语气;配合 版本管理 + Bad Case 迭代。
- 项目举例:国能制度 无检索不答 写进 Prompt;财税 无检索不报价;块 4 第 36~37 题 深答结构。
Coze(扣子 · 客服 Bot 平台)
- 是什么:字节系 Bot + 工作流 平台,上手快,适合 意图分流 + RAG + HTTP 工具。
- 干什么:独立验证 财税客服 三类分支(咨询 / 查单 / 兜底),不必从零写前后端。
- 项目举例:财宝 客服 · Finance_Taxation_Service 工作流;对比国能用 Dify 是因 内网与深度编排 要求更高。
LLM(大语言模型 · Large Language Model)
- 是什么:能 读长文本、生成人话 的基座模型(通义、GPT 等)。
- 干什么:Agent 里的 理解、分类、生成 引擎;不是 唯一组件——还要 检索、工具、规则、人审。
- 项目举例:2025.05 起 自我介绍才讲 LLM/Agent;FAQ 命中可 不调 LLM(≈0 Token)。
附12 · 面试口播模板(万能三句)
- 「XXX 就是……(人话)」
- 「在我们项目里用来……(干什么)」
- 「举个例子:在 国能/简历/财税 里,用户…… → 系统…… → 结果……」
例:「Chunk 就是把长制度切成小段再入库;我们制度 RAG 按章切 200~500 字;比如用户问陪产假,检索只捞《休假管理办法》相关段,不会把整本 PDF 塞给模型。」
附12 与附3 分工:附12 = 快查 + 举例;附3 = 被点名后的长答 + 追问。
文档版本:2026-06 · 口语版 v5.8 · §24 对齐抖音原文(上下文·指代·结构化Prompt·状态机)· 附11 §18、§19、§20、§21、§22、§23、§24 · §14、§15、§16、§17 · 财税客服