绿条 = 要背口语 蓝标 = 钩子 绿标 = 展开四步 橙标 = 追问口语答 灰标 = 问面试官一句 黄底 = 关键数字 灰底 = 口径·不用念 浅绿底 = 口诀(不念) 🃏 点题目展开答案 · 手机用底栏跳转

马凯强 · 面试背诵稿(从上到下背 · 2026)

对齐简历:马凯强-AI产品经理 (3).pdf · 目标:面试拿 offer 用法:从下一行开始,严格从上到下背。 顺序 块 1→2→3→4→5(附13 方法论)→6(前端栈 30 秒备用),再进入 第二阶段查阅附1~12 等)。

怎么背这页(4 条 · 总览)

  1. 总览 + 背诵方法(五步固定流程):读一遍认路,不必背;以后每小段照 看懂→口诀→短句→整块→脱稿 练。
  2. 主路径块 1→6 从上往下块 3先 3-1 扫框架约 5 分钟,再 3-2→3-3→3-4 整套(钩子→四步→问面试官一句)。
  3. 块 4每次 1 个分类、约 10 题,不要一口气 61 张;练完 3-2 做 NL2SQL 题,练完 3-3 做 RAG 题。
  4. 块 5 / 块 6 / 附1~12扫一遍或查阅附9 留到考前 30 分钟。

本稿格式(块 4 及问答区统一)

样式什么意思
粗体题号、小节名、关键数字——扫一眼即可,不必整句背
正文要背的口语,面试里直接照着说(钩子、展开、块 4 闪卡答案)
追问 · 口语答2~4 句完整口语,面试可直接说;禁止只写关键词/箭头/「详见附X」
问面试官 · 收尾一句钩子+四步讲完后,主动问面试官想先听哪块(给两个选项)——不是第四段项目内容
转接 · 一句钩子念完→展开四步前,口头过渡(如「上面是结果,我分四步说」)——禁止硬切
斜体提示、不用背、心里记住、跳转到别章
【口诀】背稿脚手架(口诀→图像锚点→再扩绿条口语)——面试不念
【可能被追问】主答说完、对方深挖时再说的绿条;标题行写清「追问什么」——别抢在第一句说完
核心速记(浅绿条)段前骨架短句——先背顺序与数字,再扩下方口述绿条;点 🦴 骨架 可只显示速记练脱稿

背诵路线图(就按这个顺序)

顺序内容时间
1块 1自我介绍 120 秒(含常见追问:Dify · 年龄 · 后台原型)第 1 天
2块 2Agent 记忆 + MCP第 1~2 天
3块 33-1 总框架,再人事 NL2SQL + 制度 RAG + 财税客服(3-2→3-3→3-4 · 选 2 主力第 2~3 天
4块 460 题 + 35+ Bad Case(共 61 张闪卡)· 每次练一个分类约 10 题第 3 天起
5块 5 · 附13方法论专章(DISCOLE / 评测三层 / Harness / Agent 评估 · 单独考第 4~5 天 扫 1 遍
6块 6 · 前端栈React/Taro 人话 30 秒(AI PM 浅问备用 · 不必背进块 4附13扫 1 遍
7第二阶段附1~12:定位题、技术词、抖音补题、名词词典… 查阅 / 考前扫块 1~6 顺读后

心态(块 4 第 60 题:背题是为了 有词可说,真正主场是 国能 6 个 Agent + AI 简历优化 + 财税代理记账客服 三个项目——答不上概念题时,先分清 国能 ToB / 简历 C 端 0-1 / 财税 Coze 客服,再拉回「我在那个项目里是这么做的…」


背诵方法 · 五步固定流程(不用念给面试官)

这是背稿训练法,面试时不要说出来。

先看懂再背——和死记硬背不是一条路:张嘴硬读、不懂逻辑,背完就忘、越背越累、头昏脑胀。你的顺序是 先理解建逻辑 → 口诀做路标 → 短句搭骨架 → 整块串联,记得牢、忘得慢。

整体顺序(每小段固定照做)

通读理解 → 熟记口诀 → 核心短句 → 拼接整块 → 脱稿复盘

做什么时间过关标准
1通读理解(不出声、不刻意记)5 分钟/小段心里明白脉络;Dify、RAG、NL2SQL 等词消陌生感
2专攻口诀(单独反复读、默背)2~3 分钟闭眼脱口而出,零卡顿;卡壳只念口诀
3核心短句(对应 核心速记 绿条,分两组练)10 分钟1~5 遍 → 休 3 分钟 → 6~10 遍;不连续硬扛
4拼接整块(顺着口诀串短句)8 分钟允许用自己的话;意思、数字、关键点对即可
5脱稿复盘(收尾一次)3 分钟遮稿靠口诀说一遍;说完立刻停,不反复磨

第 3 步怎么练(= 原 3-4-3,中间必休息)

  • 1~3 遍 · 顺句读:看着 核心速记 绿条念通;卡壳词 单独念 5 遍
  • 休 3 分钟(喝水、走动,别硬扛)
  • 4~7 遍 · 断句读:按「第一 / 第二 / 收尾」或口诀断点 停一下
  • 8~10 遍 · 脱稿:只看 块口诀 + 图像锚点 复述短句;卡壳 只回看那一句

必背 vs 可扩充

必背(得分骨架)可扩充(现场发挥)
口诀 + 核心速记绿条 + 关键数字 + 追问兜底句长修饰句、过渡语、原文长段口语
面试考察 表达和经验,不是默写——顺着骨架说,不必一字不差

核心数据打包(考前 30 秒默写 · 必背数字)

数字记法在本稿哪里
95%回答准确率 · 查询成功率 · 隐患分类
70%制度/人事 人工咨询量下降(两项目都有)
60%FAQ 分流后 Token 下降
100%制度/人事类 自助化率

口诀: 95 准 · 70 降 · 60 省 · 100 满

分层回忆 · 晨起/睡前(不累脑)

  • 晨起 5 分钟:只默背全部 块口诀;想一下对应的 核心短句;默写 95 / 70 / 60
  • 睡前 5 分钟:闭眼顺着口诀 过图像锚点(画面),不张嘴朗读
  • 块 4 加练:晚 5 分钟可随机 大声答约 10 题闪卡
  • 考前 30 分钟:只扫 口诀 + 上表 + 附9 清单,不读全文

唯一提醒:不要追求「一遍滚瓜烂熟」。今天第 5 步顺下来就行;明天晨起口诀+短句,后天再串整块——循序渐进,身体和大脑都能适应。

断点不卡壳(录音法 · 可选)

  1. 每块用手机 录一遍脱稿
  2. 回听标 卡壳断点,为该句编 迷你口诀(例:MCP 产品 → 清单·说明书·监控·安全·确认
  3. 遮挡练:盖住数字,只看口诀说出

示范 · 块 1 自我介绍(五步走一遍)

对照正文见下方 块 1;这里只演示 怎么练,不必背本段。

本例怎么做
1 通读看懂四大段:开场身份2025 前数字化(ERP/OA,不是 AI)→ 国能 6 Agent(职责+三类指标)→ 2026 双项目收尾对研发不说年龄
2 口诀14年ToB,国能6Agent,简历+财税双项目(反复默背至零卡顿);图像锚点:时间轴叠积木
3 短句对着 核心速记 绿条练 5 句:① 开场 14年ToB·Java·AI PM·广州;② 2012—2025 ERP/OA 24→35 家100% 使用率;③ 国能 6 Agent、编排/Prompt/评测、100满/70降/95准;④ 简历 39 页+后台 + 财税 Coze RAG/HTTP;⑤ 收尾对研发指标权限日志。 1~5 遍 → 休 3 分 → 6~10 遍
4 整块顺着口诀+时间轴,把 5 句扩成 约 120 秒口语;卡壳回看对应 核心速记
5 脱稿只凭口诀+5 句骨架完整说一遍 → 停手休息(追问另练,不混进 120 秒)

示范 · 块 3-2 人事 NL2SQL(五步走一遍)

对照正文见下方 块 3-2;这里只演示 怎么练,不必背本段。

本例怎么做
1 通读点开「逻辑脉络」闪卡:<strong>钩</strong>→<strong>数</strong>→<strong>方</strong>→<strong>安</strong>→<strong>迭</strong>(= 钩子 + 展开四步)
2 口诀人事查数快 · 五层保安全 · 70降95准(反复默背至零卡顿)
3 短句① 国能人事查数慢,靠 NL2SQL 秒级返回;② 70% 降人工咨询、95% 查询准确率;③ 五层:参数校验→FAQ→SQL 拦截→只读库→行级权限;④ 迭代靠别名表,Bad Case 反哺。 1~5 遍 → 休 3 分 → 6~10 遍
4 整块顺着口诀,把 4 句连成钩子+四步口语;卡壳回看口诀找下一段
5 脱稿只凭口诀+逻辑说一遍 → 停手休息

块 1

自我介绍 · 第 1 天(约 5 分钟)

【口诀·块1不念给面试官 · 先口诀再扩绿条
口诀14年ToB,国能6Agent,简历+财税双项目
图像锚点时间轴叠积木 — ERP/OA(24→35家)→ 国能 6 款 Agent → 2026 双项目(简历 + 财税客服)
拆解14年ToB · 6 Agent · 简历 0-1 · 财税 Coze 客服(口述不说年龄
练法闭眼念口诀 → 看核心速记绿条 → 扩口述长段(点 🦴 骨架 先只背速记)· 五步示范见总览 「示范 · 块 1 自我介绍」

块 1 · 120 秒自我介绍(必背 · 可直接念 · 对齐简历)

核心速记开场 · 14年ToB · Java出身 · 求职AI PM · 广州;

大家好,我叫马凯强,在广州,14 年 ToB 产品经验Java 开发工程师出身,求职 AI 产品经理,期望在广州发展。

核心速记2025 前做数字化(ERP/OA,24→35 家,100% 使用率);

2012 到 2025 年 4 月,我主导 业财一体化 ERP、移动 OA、财税知识付费10 多款 集团级产品从 0 到 1,擅长复杂流程、数据治理和跨系统集成,带过团队;在金不换支撑分公司从 24 家扩张至 35 家,集团约 六百人系统使用率 100%——这段是 数字化项目,不是 AI 项目

核心速记2025 后国能 · Dify · 6 Agent · 编排/Prompt/评测;

2025 年 5 月到 2026 年 2 月,我在金安尚科技驻场国能肇庆,基于 Dify 从 0 搭了 6 款集团级 AI Agent——制度 RAG 问答、人事 NL2SQL 查数、培训出题、隐患分类派单、缺陷闭环跟踪。

我主要负责需求拆解、工作流编排、Prompt 工程、Bad Case 复盘和效果评估

上线后主要看三类结果:制度/人事咨询自助化率 100%,人工咨询 降约 70%,准确率 ≥95%数据查询从小时级到秒级,成功率 ≥95%隐患分类准确率 ≥95%,并且 人工确认后再生效

核心速记2026 双项目 · 简历 0-1(需求+39页+后台)+ 财税 Coze 客服;

2026 年 2 月 国能交付离职后,我同时在推两个项目。一个是 C 端 AI 简历优化,从 0 做起:先梳理用户场景和主路径,然后写成 PRD,最后设计了 39 页小程序原型和运营后台,整条链路都齐了;用户大概 15 分钟 能从摸底走到导出简历,我自己用 Cursor 把主路径跑通验证过。另一个是 财税代理记账客服,我是在 Coze 上搭的:业务咨询走 RAG查进度走 HTTP 对接业务系统常见问题 Agent 自动解答,减少一线销售重复解释

核心速记收尾 · 对研发对指标权限日志 · 日志可追;

跟研发对指标、权限、日志,这块我比较熟——上线后出了问题,日志也能追得回去。谢谢。

口径口径(心里记住,不必念出来)自我介绍不说年龄(简历/登记表有即可,被问到用下方「年龄偏大」追问答);2025.05 前 只讲 ERP/OA/数字化;2025.05 起 才讲 LLM/Agent。名词不懂(FAQ、Chunk、ChatBI…)→ 先查 附12 人话词典,再回项目举例。


常见追问:为什么用 Dify,不做一个「AI 对话框」让用户直接问?

问法:「为什么不接个大模型聊天框?」「ChatGPT 套壳不行吗?」

💬 你可以这样答

我们早期也试过 「一个对话框 + 大模型」,在国能这种央企 ToB 里,单靠聊天框不够用。

举个人事的例子:查制度得先检索,没命中不能编;查人数要走 NL2SQL、只读库、还要按权限脱敏——这不是问一句答一句能兜住的。隐患那边更要固定 JSON、人工确认了才进工单,是一条 工作流

企业还关心能不能改 Prompt、复盘 Bad Case、看审计日志。Dify 上节点能拆开改;要是纯对话框,这些全塞进自研前后端,周期和运维都更重

成本也扛不住——人事那边要是 每个问题都调大模型,费用难看,准确率还不稳。所以我们把高频问法放 FAQ 本地匹配,复杂的再走模型,Token 省了 60% 以上

所以我选型的习惯是:简单场景 对话或 FAQ 够用;复杂场景 工作流 + 检索 + 工具。Dify 是国能当时的载体,换自研平台也一样,先把流程、权限、评估定清楚。简历项目也不是一个大聊天框,是 分步主路径 + 后台可配


常见追问:年龄偏大 / 1990 年 / 35 岁还做 AI 产品吗?

问法:「你年龄不小了」「1990 年的,跟得上 AI 吗?」「我们更想要年轻人」

💬 你可以这样答

我明白您担心落地交付,我有 14 年 ToB 行业积累,完整落地过多款 集团 AI Agent合规、Bad Case 管控、全流程上线这套实战经验十分扎实。

年轻人上手工具更快,我的核心优势是 吃透企业复杂业务、统筹多方推进规模化落地

口径口径(心里记住):不道歉、不贬低年轻人(可说「年轻同事工具学得快」);强调 互补 而非 替代被问到年龄/1990 年再答,不主动在自我介绍里报岁数。


常见追问:项目链接里怎么只有小程序,后台呢?

问法:「你这项目是不是只做了前端?」「运营后台在哪?」

💬 你可以这样答

链接里只放了小程序前端页面,后台内容因为项目保密没有对外展示;整套 B 端后台原型、相关文档我本地都有,您想看我可以当场打开电脑展示。

口径口径 · 现场怎么展示(不用背):公开链接因项目保密,目前只放了 C 端演示;后台和完整接口包 面试时可以现场打开(本地 HTML 原型 + 交接文档),或按模块 口述清单。我角色是 产品经理,原型是 Vibe Coding 验证;正式上线仍要研发工程化,但 后台怎么配、接口怎么定 是我输出的。


块 2

Agent 记忆 + MCP · 第 1~2 天

【口诀·块2不念给面试官 · 先口诀再扩绿条
口诀记忆分四层,MCP 是插座
图像锚点四层抽屉(工/短/中/长期)+ 插座板插 SQL、RAG、工单
拆解四层=工作→短期→中期→长期 · 面试答法收敛 三层(会话/业务库/偏好)· MCP=统一协议,国能用 Dify 工具节点
迷你口诀MCP 产品 → 清单·说明书·监控·安全·确认
练法闭眼念口诀 → 看核心速记绿条 → 扩口述长段(点 🦴 骨架 先只背速记)

块 2-1 · Agent 长期记忆 / Agent Memory(必背)

问法:「你们 Agent 有记忆吗?」「如果要跨会话记住用户,你怎么做?」

【扫一遍 · 四层概念(面试口述只背下面三层版)】

概念上可分工作/短期/中期/长期四层;上场只念下方「三层版」,别跟面试官堆四层名词。

核心速记口述 · 三层(会话/业务库/偏好);四层仅查阅;

【必背 · 2 分钟 · 面试主力答法(ToB + 国能实线)】

💬 你可以这样答

核心速记总述 · 三层 · 不让模型「记住用户一切」;

我一般把 Agent 记忆分成 三层,不会一上来就让大模型「记住用户一切」。下面我分三块说清楚

核心速记①会话内 · N 轮 + 槽位(工号/部门/工单);

  1. 第一块 · 会话内记忆:这一轮对话里用户说了什么、查到哪一步。做法是 保留最近 N 轮 + 关键槽位(工号、部门、时间范围、工单号)。人事 NL2SQL、缺陷跟踪 主要用这套,够应对连续追问。

核心速记②业务库 · 查工单不脑记 · 可审计 · 国能未上跨会话长期记忆;

  1. 第二块 · 业务库记忆(ToB 我默认推这个):不让模型「脑记」业务数据,而是 按用户 ID / 工号查业务库——工单状态、考勤结果都这么拿。更准、可审计、好做权限。国能 跨会话长期记忆没上线,主要是 隐私、等保、审计;用业务库替代,用户该查到的还是能查到。

核心速记③偏好 · 记什么/不记什么/多久/怎么用 · Profile+评测;

  1. 第三块 · 用户偏好(跨会话才需要):比如默认查近 30 天、喜欢表格展示——这才单独存 User Profile。产品设计时我先定四件事:记什么(只记偏好)、不记什么(薪资/处分等敏感原文)、记多久(过期删、用户可导出删除)、怎么用(检索片段注入 Prompt,不塞全量聊天记录)。研发做表结构和加密,我出 PRD:字段、授权、兜底话术、评估指标

核心速记收尾 · 国能合规未上第三层 · 可小范围试点;

效果怎么看:用户是否少重复说一遍、任务成功率是否提升;还要看 误记率、隐私投诉——记错了比没有更伤。

收尾

国能因合规 没上第三块;若贵司要做,我会从 小范围试点 开始,比如只记「默认查询时间范围」,验证后再扩。



块 2-2 · MCP(必背)

问法:「了解 MCP 吗?」「我们工具很多,怎么接 Agent?」

💬 你可以这样答

核心速记定义 · MCP=大模型接工具的「统一插座」;

MCP(Model Context Protocol)可以理解成 大模型接外部工具的「统一插座」——数据库、HTTP、文件都用同一套协议接进来,换平台时工具不用重写一遍。

核心速记国能 · Dify 工具节点 · 职责同 MCP(Schema/权限/审计);

国能现场我实际怎么做的:主要用 Dify 工具节点、HTTP 插件、代码节点,没以 MCP 名义上线,但职责一样——定 Agent 能调哪些工具、入参出参 Schema、超时重试、权限和审计。

核心速记PM 五件事 · 清单/说明书/编排/监控/安全;

若贵司要上 MCP,我作为 AI PM 一般会盯五件事

  1. 工具清单:哪些给 Agent 用,哪些不给(最小权限)
  2. 每个工具的说明书:干什么、失败怎么提示、要不要用户确认
  3. 和编排怎么接:Dify/自研框架里 MCP Server 怎么注册
  4. 监控与 Bad Case:哪个工具失败最多、延迟怎么样
  5. 安全兜底:敏感操作必须 人工确认 或二次鉴权

核心速记收尾 · 未主导 MCP 选型 · 6 Agent 编排做过 · 方法论相通;

收尾(诚实边界)

还没在生产环境主导 MCP 选型,但 6 个 Agent 的工具编排、降级、复盘我都做过;迁到 MCP 主要是 协议层变化,产品上要盯的还是这五件事。入职后我会先熟悉贵司规范,选一条业务线试点。



块 3

主力项目 · 第 2~3 天(三选二 · 钩子+展开各约 1.5 分钟)

【口诀·块3不念给面试官 · 先口诀再扩绿条
口诀人事秒级查数,制度零编造答
图像锚点数据库+五把锁(NL2SQL)· 制度书+放大镜+禁止符(RAG 零编造)
拆解每项目 = 钩子30秒 + 展开四步 + 问面试官一句 + 追问块 3-1 表格 + 口诀「钩数方安迭」)
练法(面试导向 · 主路径)块 3-1 练法先扫 3-1 框架 5 分钟3-2 整套 → 3-3 整套 → 3-4 钩子;每项目内 核心速记绿条 → 钩子脱稿 → ①~④ → 问面试官一句;追问大声答整段(勿只蹦 bullet 关键词)
面试说「介绍一个项目」→ 优先 3-2 人事 NL2SQL + 3-3 制度 RAG(国能主力);3-4 财税 备选题。先读 块 3-1 总框架 认骨架,再背下面三个项目正文。

块 3-1 · 复杂 AI 项目怎么讲清楚?(总框架 · 思路对照)

下面 3-2~3-4 三个项目已按本表写好——先扫本表约 5 分钟认骨架,再背项目正文;不必自己从零套框架。
【口诀·块3-1】不念给面试官 · 先口诀再扩绿条

简历 0-1、国能多 Agent 对照见 附11

统一结构(= 块 3-2~3-4 每题标题)

说什么时长
钩子谁、什么痛点、你做了什么、一句结果~30 秒
转接 · 一句如「上面是结果,我分四步说」——钩子与展开之间 必有一句~3 秒
展开 · ① 场景与指标为什么做、服务谁、量化结果(口述可说「第一块」)四步合计 ~1 分钟
展开 · ② 方案技术路径(RAG/NL2SQL/Agent…)+ 我一般会怎么拆
展开 · ③ 安全与兜底安全上(权限/防幻觉/合规)+ 兜底上(转人工/拒答)分两句讲
展开 · ④ 产品迭代Bad Case、评测、降本、规则优先(口述不说「你怎么迭代」
问面试官 · 收尾一句主内容讲完后,主动问面试官想先听哪块(给两个选项),把话头交回去——不是第四段项目内容一句
追问 · 口语答面试官深挖时的完整口语(上场区已写好,直接念)按需

练法(面试导向 · 主路径)

做什么备注
0 · 认路块 3-1 表格 + 口诀「钩数方安迭」 扫一遍约 5 分钟
1 · 第 1 天3-2 整套:钩子 → 转接一句 → ①~④ → 问面试官 → 挑 2 个追问主背
2 · 第 2 天3-3 整套:同上(第二主力)主背
3 · 第 3 天3-4:至少 钩子 + 转接 + 问面试官 脱稿;时间够再补 ①~④备选题
之后每次复习3-2 → 3-3 → 3-4 整条过一遍(含转接,不要只练钩子)10~15 分钟

块 4 衔接:练完 3-2 做 NL2SQL(13~20);练完 3-3 做 RAG(1~12)

急救(可选):若 3-2 钩子 第一天卡壳,先用 3-4 钩子 练 10 分钟找开口节奏,再回 3-2 整套——仅入门用,不是主路径


块 3-2 · 企业人事智能查询 · NL2SQL(2025.11—2026.02)⭐ 建议主力

【口诀·块3-2】不念给面试官 · 先口诀再扩绿条

核心速记钩子 · 员工查人事慢 · NL2SQL 秒级 · 70降/95准

钩子 · 约 30 秒

国能 员工 查人事数据以前要找 HR,口头描述、HR 再查系统,慢且占人力。我负责用 DifyNL2SQL Agent:自然语言 → 只读 SQL → 白话总结。结果 HR 咨询量降约 70%、查询 成功率 ≥95%、基本 秒级 返回。

转接 · 一句

上面是结果,具体怎么做的我分四步说

核心速记展开 · 四步 · ①场景70/95 ②NL2SQL+FAQ60 ③五层+转人工 ④别名表;

展开 · 约 1 分钟 · 四步
  1. 第一步 · 场景与指标:原有痛点是员工频繁找 HR 查表,造成大量重复工作。所以项目设立三大目标:减轻 HR 负担、保证查询准确、提升使用体验;对应跟踪三大核心指标:HR 咨询下降比例、查询成功率、接口响应耗时,遇到指标口径分歧,依靠别名字典、确认话术收敛问题。
  2. 第二步 · 方案:用户说人话 → 理解表结构 → 生成 只读 SQL → 查完用白话总结。高频问法走 FAQ 本地匹配,复杂的才调大模型——当时要是每问都调模型,Token 顶不住,算下来 省了 60% 以上;我们做的是 限定人事域,不是开放域 ChatBI。
  3. 第三步 · 安全与兜底安全上做了五层——参数校验、FAQ 分流、拦截 delete/update/drop、只读库、按员工/部门负责人/管理员做 行级权限,关键操作还有 审计日志兜底上,生成失败、权限不够、SQL 跑不通的,统一 引导找 HR 人工,不让用户在聊天里干等。
  4. 第四步 · 产品迭代:上线后主要靠 别名表和口径字典 收敛 Bad Case。比如有人问「综合部人数」映射错了,就补映射,加一句「您指的是 XX 部门吗?」,改完用 同类问法回归 看错误率有没有下来。

核心速记收尾 · 问:先听五层安全还是 FAQ 降 Token;

问面试官 · 收尾一句

「我这边主要部分讲完了。您更想先听 安全五层怎么做的,还是先听 FAQ 怎么帮我们把 Token 成本降下来?」

追问 · 口语答

SQL 注入和数据安全?

数据安全我会从 账号权限执行拦截 两层做。数据库只用 只读账号,执行前 拦截 delete、update、drop 等危险语句;生成的 SQL 在代码节点里再做 语法和权限校验。敏感字段按 员工、部门负责人、管理员 三级做行级权限,该脱敏就脱敏,关键操作 留审计日志,方便事后追溯。

业务人员说的黑话、口语部门名怎么懂?

单靠大模型猜部门名不稳,我会维护 业务别名表和口径字典。Bad Case 里收集到的口语化问法会 反哺这张表;业务口径变更时 先改字典、再灰度验证,尽量不动代码,上线前用 同一批问法回归

和 ChatBI 有什么区别?

我们做的是 限定人事域 的查询助手,强调 合规、只读和行级权限,不是开放域拖表分析平台。产品目标是 降低 HR 重复咨询,不是让业务人员随便查全库。

举一个不满意的 Bad Case?

比如用户问「综合部人数」,系统把部门映射错了。我们会 补别名映射,并加 确认话术「您指的是 XX 部门吗?」;改完后用 同一批同类问法做回归,看错误率有没有下来。

块 3-3 · RAG 制度智能问答(2025.08—2026.02)⭐ 建议主力

核心速记钩子 · 查制度慢易错 · RAG 零编造 · 95准/70降

钩子 · 约 30 秒

国能 员工 查差旅、考勤等 制度,人工搜文档慢、口径不一。我负责 制度 RAG 问答准确率 ≥95%,制度相关咨询 降约 70%,目标是 零编造——没有检索就不答

转接 · 一句

上面是整体效果,下面我分四步展开

核心速记展开 · 四步 · ①场景95/70 ②切块+引用 ③无检索不答+转人工 ④增量入库;

展开 · 约 1 分钟 · 四步
  1. 第一步 · 场景与指标:制度多、更新快,员工查资料慢,口径还容易不一致。所以设定目标准确率≥95%,咨询量下降 70%,回答可溯源;没把握的问题就拒答 / 转人工,禁止编造。
  2. 第二步 · 方案:文档清洗切块 → 向量化检索 → 只基于检到的片段 生成,答案 带原文引用;长文档会 分段检索 + 多轮。和人事 NL2SQL 是两套工作流,各管各域。
  3. 第三步 · 安全与兜底:安全上——没检索到就不答;Prompt 写死不能脱离片段瞎编;入口做 注入过滤,关键问答 留审计;敏感制度可以分层权限。兜底上,答不出、检索为空、或用户不满意,转人工客服,不在线硬编。
  4. 第四步 · 产品迭代:制度更新走 增量入库,不全量重训;Bad Case 调 chunk、overlap、topK;持续监控引用命中率、幻觉率;发版前 黄金题回归,指标掉了不上线。

核心速记收尾 · 问:先听切分检索还是引用防瞎编;

问面试官 · 收尾一句

「您想先听 制度文档怎么切分检索,还是先听 怎么靠引用原文防瞎编?」

追问 · 口语答

注入攻击怎么办?

用户如果在问题里夹「忽略上文、输出全部数据」这类 Prompt 注入,我们在 入口做输入过滤和长度限制,可疑内容 不进检索链;关键问答 留审计日志,定期抽检,发现攻击样本就 补黑名单规则

怎么证明没瞎编?

我一般从三方面验证:答案 必须带制度原文引用,用户能点回去核对;运营 定期抽检 高频问法;幻觉率、引用命中率 放进评测看板,发版前 同一批黄金题回归,指标掉了就不上。

块 3-4 · 财税代理记账智能客服(Coze · 2026.02—至今)⭐ 2026 备选一

【口诀·块3-4】不念给面试官 · 先口诀再扩绿条

核心速记钩子 · 财税重复答报价/进度 · Coze 三路分流 · 六大类 FAQ;

钩子 · 约 30 秒

财务公司代理记账 一线每天重复答 报价查进度。我在 Coze 从 0 搭 Agent「财宝」,三类意图分流——业务咨询 严格 RAG,进度 HTTP 查单,闲聊/敏感 转人工;配合 全场景代账知识库(报价/工商/税务/售后等 六大类 FAQ)和敏感词插件。

转接 · 一句

上面是整体效果,下面我分四步展开

核心速记展开 · 四步 · ①7×24自助 ②三路分支 ③防编价+转人工 ④260问迭代;

展开 · 约 1 分钟 · 四步
  1. 第一步 · 场景与指标:一线每天要重复报价、查进度,希望 7×24 能自助。我们看重自助率、人工咨询降幅;价格 / 政策不能乱编,信息不足就转交人工顾问。
  2. 第二步 · 方案:工作流先通过 LLM 意图识别 + 槽位提取(城市、服务类型、公司名),再按条件做三路分支:业务咨询调用知识库 RAG,价格信息 100% 以库内标准为准;进度查询通过 HTTP 接口对接业务系统;闲聊、敏感咨询礼貌引导或者转人工,不做无意义闲聊。
  3. 第三步 · 安全与兜底:安全上 —— 敏感词插件、长期记忆边界;Prompt 写死 无检索不答。兜底上,报价 / 政策检索不到、槽位填不齐、或命中敏感词的,转人工顾问,不在线编造数字。
  4. 第四步 · 产品迭代:Bad Case 重点盯「乱编价 / 政策」;知识库六大类、260 道标准问答打底,按一线问法增补;意图混淆时 规则先吃高频,再用 LLM 分类,置信度低就 澄清一句或转人工,避免选错分流链路。

核心速记收尾 · 问:先听三路分支还是防编价;

问面试官 · 收尾一句

「您想先听 三路意图怎么分支,还是先听 报价类问题怎么防编价?」

追问 · 口语答

为什么用 Coze 不用 Dify?

2026 离职后我在财税客服里用 Coze 做独立验证,因为 上手快,特别适合 客服 Bot + 工作流 这种意图分流场景。国能央企用 Dify,是因为 内网部署、合规和深度编排 要求更高。两个平台不一样,但 产品方法是一样的:先 识别意图,再 走条件分支,该检索就走 RAG、该查进度就走 HTTP,最后都有 兜底和转人工

怎么防价格瞎编?

报价类问题最怕模型「编数字」。Prompt 写死 无检索不答、缺信息转人工;知识库 六大类、260 道标准问答 覆盖报价/套餐/流程,持续按 Bad Case 增补;Bad Case 专盯编价和编政策;检索不到或不确定的一律 转人工顾问,不在线瞎报。

意图识别怎么说?(别说「用大模型」)

我不会只说「用大模型做意图识别」。我一般 分四步走用规则/关键词吃「进度」「多少钱」「注销公司」这类高频问法,零 Token、最稳;用结构化 LLM 输出 intent、confidence 和槽位(城市、服务类型、公司名);然后置信度低就追问一句或列选项,别硬猜;最后闲聊或超范围就拉回业务或转人工。财税是 LLM 提意图后 三路分支(RAG / HTTP / 兜底);国能人事是 FAQ 直答、NL2SQL 或越权拒绝,口语部门名走别名表。评估看 意图准确率、误路由率、转人工率,Bad Case 专收「进错分支」。

块 4

必考题 60 题 + 35+ Bad Case · 第 3 天起(共 61 张闪卡 · 每次约 10 题)

【口诀·块4不念给面试官 · 先口诀再扩绿条
口诀RAG十二、SQL八、Agent十五、Prompt十、通用十、工具五
图像锚点六格卡片盒 — 📚RAG · 🗄️NL2SQL · 🤖Agent · 📜Prompt · 👥通用 · 🖱️工具
拆解1~12 RAG · 13~20 NL2SQL · 21~35 Agent · 35+ Bad Case · 36~45 Prompt · 46~55 通用 · 56~60 工具(61 张闪卡
练法每次 1 分类约 10 题 大声答;答不上先分清国能/简历,再回块 2/3
格式见文首「本稿格式」:粗体=题号 · 正文=要背的口语 · 斜体=不用背
建议练习顺序(和块 2、3 最贴): ① 二、NL2SQL(13~20) → 接块 3-2 人事 ② 一、RAG(1~12) → 接块 3-3 制度 ③ 三、Agent(21~35) → 接块 2 Agent 记忆/MCP ④ 再练 四、Prompt(35+ · 36~45) · 五、通用(46~55) · 六、工具简历(56~60) 不必 61 题全文背诵,每次大声答 10 题即可;35+ 与 Prompt 类一起练。
题 1~12

一、RAG 与知识库(1~12)


题 13~20

二、NL2SQL 与数据 Agent(13~20)


题 21~35

三、Agent 与工具(21~35)


题 35+~45

四、Prompt · 模型 · 成本(35+ · 36~45)

两个 AI 项目别混:国能是 6 款 ToB Agent;AI 简历优化是离职后独立 0-1。 本类统一答法:每题先 (标准口语)→ 口诀(浅绿底速记)→ 被追问再看 【可能被追问】(项目举例 / 附3·附11 深答 · 不抢在第一句说完)。

题 46~55

五、AI 产品经理通用(46~55)

本类统一答法:每题先 (2~4 句完整口语,面试直接说)→ 口诀(浅绿底速记 · 不念给面试官)。

题 56~60

六、Vibe Coding · 工具 · 简历(56~60)


块 5

附13 · 方法论 · 第 4~5 天(扫 1 遍 · 单独考时用)

附13 · AI 产品方法论(评测 / Harness / Agent 评估 · 单独考)

什么时候用本节:面试官 不聊具体项目,而问「AI PM 方法论」「怎么做评测」「Harness 用过吗」「Agent 怎么评估」「RAG 指标有哪些」——直接用本节,再挂国能 / 简历 / 财税。 块 4 / 附3 分工块 4 = 快答 60 题 + 35+ Bad Case(61 张闪卡);附3 = 技术词长答附13 = 方法论框架 + 行业名词 + 何时用哪套(看完能当场选用)。
【口诀·附13 总览】不念给面试官 · 先口诀再扩绿条
口诀DISCOLE 六步 · 评测三层 · 黄金集回归 · Harness 流水线 · Agent 任务过程业务
图像锚点六格流水线(发现→设计→构建→评测→上线→运营)+ 中间一格 「黄金集+Harness」 像质检传送带
拆解通用 M1 · 评测总纲 M2 · Harness M3 · Agent M4 · RAG M5 · NL2SQL M6 · 意图 M7 · Prompt M8 · Bad Case M9
练法被问方法论 → 先报 阶段名/三层名 → 再举 一个项目数字 → 深挖再展开 M3M9

0. 方法论地图:面试官在考什么 → 用哪一套

面试官在问用哪套本节块 4 快答
AI PM 全流程 / 从 0 到 1 怎么做DISCOLE 通用方法论M147
效果怎么评 / KPI 怎么定 / 上线后怎么盯AI 评测方法论(总纲)M210、32、47
Harness / Eval / 评测平台 / 回归测试Eval HarnessM336~45
RAG 准不准 / Recall / 幻觉 / Query 改写 / 别只说准确率RAG 评测方法论M5 · 附11 §19§216、10
Agent 靠不靠谱 / 多步任务怎么评 / 调用可靠性Agent 效果评估M4 · 附11 §2027、32
Agent 安全边界 / 权限 / 能做什么不能做什么块 2 + 附11 §22§2229、32
记忆系统 / 上下文工程块 2 + 附11 §23§2329
多轮对话烧钱 / 上下文·指代·Prompt·状态机附11 §24§24 + §1941、42
NL2SQL / ChatBI / 查数成功率NL2SQL 评测方法论M613~20
客服路由 / 意图识别准确率意图识别评测M7附3 §15
Prompt 怎么迭代 / 版本回滚Prompt 工程方法论M836、附11 §18
怎么持续变好 / 和算法怎么协作Bad Case 驱动迭代M9附3 §6附10

口播模板:「这类问题我一般用 {方法论名}:先 {第一步},再 {第二步},在我们 {项目} 里指标是 {数字}。」


必背M1 · AI 产品经理通用方法论(DISCOLE)⭐

什么时候用:问「AI 产品从 0 到 1」「你和算法分工」「PRD 写完然后呢」——用 六阶段 框住,别只讲功能列表。

六阶段 · 每步产出什么(背阶段名即可,展开用绿条)

阶段英文你做什么典型产出三项目各举 1 句
发现Discovery访谈、看工单/咨询日志、定 MVP场景清单、1 个首发场景、成功指标国能:HR 被问考勤 → 先做人事 NL2SQL;财税:一线反复答报价 → 先做 FAQ+RAG
设计Design工作流、Prompt、RAG/工具、权限兜底流程图、AI 边界(能做/不能做)、黄金集草案制度:无检索不答;隐患:JSON+人工确认
构建Build联调、原型、知识库/别名表Dify/Coze 可跑通链路、Schema/口径表6 Agent 各一条主流程;简历 39 页+后台 dev-spec
评测Evaluate离线黄金集 + 线上监控 + Bad Case指标看板、回归节奏、错题本成功率 ≥95%、咨询 降 70%
上线Launch内测→试点→扩量、回滚预案灰度范围、值班、版本号国能集团级试点;简历交接研发
运营Operate监控 Token/成功率、知识库增量日报/周报、复盘会制度 增量入库;财税 编价类=0

答:

我做 AI 产品固定走 DISCOLE 六步

  1. Discovery(发现):从业务日志里抠 一个 MVP 场景和指标
  2. Design(设计):把边界写死(能做/不能做、权限、兜底)
  3. Build(构建):用 Dify/Coze/Cursor 把链路跑通
  4. Evaluate(评测):用 黄金测试集+回归 守门
  5. Launch(上线):内测试点扩量并留 版本回滚
  6. Operate(运营):盯 Token、成功率、转人工和 Bad Case 周报

国能 6 个 Agent、简历 0-1、财税 Coze 客服都是这套,不是只写 PRD。

补充项目落地话术(面试官深挖):

  • Discovery:国能先看 HR/燃料工单 里最高频问法;财税看 代账一线 7×24 重复问报价/进度
  • Design:B 端必写 只读库/HITL;C 端必写 失败不扣点、分享打码
  • Evaluate:每个 Agent 50~100 条黄金集;Prompt 改动 同一批必回归
  • Operate:制度/人事 咨询降约 70%Operate 层业务 KPI,不是 demo 指标
【口诀·DISCOLE】不念给面试官 · 先口诀再扩绿条
口诀发·设·构·评·上·运 — 发现场景 → 设计边界 → 构建链路 → 评测回归 → 上线灰度 → 运营复盘

必背M2 · AI 评测方法论(总纲)⭐

什么时候用:问「怎么评估 AI 效果」「离线线上区别」「指标有哪些」——先 三层指标,再 离线+线上双轨,最后挂项目数字。

三层指标(技术 · 产品 · 业务)

看什么典型指标国能举例简历/财税举例
技术层模型/链路对不对准确率、Recall、幻觉率、延迟、JSON/SQL 合规率NL2SQL 成功率 ≥95%;制度 引用命中率简历 防编造;财税 编价=0
产品层用户能不能自助自助化率、一次答对率、转人工率、满意度制度/人事 自助化 100%客服 三路分流命中率
业务层老板认不认账咨询量降多少、审核量、决策时效、Token 成本咨询降约 70%代账 7×24 自助、省一线重复劳动

双轨评测(Offline + Online)

  1. 离线(发版前)Golden Set 批量跑 → 看指标 有没有退化 → 不通过 不上线
  2. 线上(发版后):真实日志 + 抽检 + 业务反馈 → 进 Bad Case → 下一版离线集 补长尾

答:

我评 AI 效果用 「三层指标 + 离线线上双轨」

  1. 技术上盯准确率、幻觉、延迟、格式合规
  2. 产品上盯自助化、一次答对、转人工
  3. 业务上盯咨询量、人力、成本——要和业务 对齐口径,不能自嗨

发版前:用 50~100 条黄金集做离线回归

上线后日报+每周抽检+错题本,两边并表迭代

国能制度/人事 咨询降约 70%、成功率 ≥95% 就是这套;财税 编价类 Bad Case 必须 0

补充项目落地话术(面试官深挖):

  • 和老板汇报:先 业务 KPI(降 70%),再 产品 KPI(自助化),技术细节 备问再展开
  • Regression(回归):任何 Prompt/检索/知识库改动 → 同一批黄金集再跑 → 掉了 当天回滚
  • LLM-as-Judge:可作 辅助,央企/报价场景 关键项人工终审
【口诀·AI 评测】不念给面试官 · 先口诀再扩绿条
口诀技产业三层 · 离线黄金集 · 线上日志 · 错题并表

必背M3 · Eval Harness(评测脚手架)是什么?你怎么用?⭐

什么时候用:面试官 主动抛 Harness / Eval Harness / evaluation harness——这是 行业名词,本稿以前没写这个词,但 实践等价 于「黄金集 + 批量跑测 + 打分 + 报告」。

H1. Harness 是什么?和黄金集、Bad Case 什么关系?

答:

Eval Harness(评测脚手架) 就是把 测试用例、调用 Agent/RAG 的完整链路、打分规则、结果报告 打包成 可重复执行 的评测流水线——改一版 Prompt 或检索策略,一键批量跑完,看指标变没变,而不是产品经理手工一条条试。

  1. 黄金集(考什么):问 + 期望 + 验收规则——Golden Set 定义「考什么」
  2. 链路批跑(怎么考):自动跑 Agent/RAG 完整链路,批量出结果
  3. 规则打分(怎么判):SQL/JSON/拒答等 规则比对 + 人工抽检 + 必要时 LLM-as-Judge
  4. 报告回归(怎么迭代):版本号 + 指标 + 失败样例 → 跑挂的进 Bad Case → 补进下一版黄金集 回归

和 Harness 同构:集 · 链 · 规 · 报 四件套,不是手工一条条试。

补充项目落地话术(面试官深挖):

  • 诚实边界:国能 6 Agent、财税 Coze、简历 0-1 没有对外写「某商业 Harness 产品名」(如 LangSmith/Ragas 全量落地),但 产品方法完全对齐
  • 用例库 = 各 Agent 50~100 条黄金集(问+期望+验收规则)
  • 执行 = Dify/Coze 工作流批量跑 或导出用例 脚本/API 批跑
  • 打分 = 规则比对(SQL 结果、JSON Schema、是否拒答)+ 人工抽检 + 必要时 LLM-as-Judge
  • 报告 = Excel/飞书表 版本号+指标+失败样例 → 周会复盘
  • 简历项目:PRD ⑥ 评测专章(黄金集、Bad Case、回归频率)+ B 端后台 提示词版本/回退 = Harness 的 配置与回归 半条
  • 对标说法(可选):「如果上 LangSmith/Ragas,我会把现有黄金集 迁进 Dataset,把 Dify 链路 封成被测函数,Judge 用 忠实度/引用命中 rubric——思路我熟,工程按公司栈选型
  • 别夸大:不说「我们上了某某 Harness 平台」除非简历真有;说 「黄金集驱动的 eval pipeline,和 Harness 同构」
【口诀·Eval Harness】不念给面试官 · 先口诀再扩绿条
口诀集·链·规·报 — 黄金集(考什么)→ 链路批跑(怎么考)→ 规则打分(怎么判)→ 报告回归(怎么迭代)

必背M4 · Agent 效果评估方法论 ⭐

什么时候用:问「Agent 怎么评」「和多轮对话 Bot 有何不同」——用 任务·过程·业务 三层,强调 多步+工具 必看过程层。

指标国能财税
任务任务成功率、一次答对、满意度、转人工人事查询 ≥95%意图进对分支、进度 HTTP 成功
过程平均步数、工具成功率、意图/槽位准确率、超时Dify 节点失败率、SQL 校验通过率Coze 三路分支、槽位填充
业务咨询降、时效、人力、合规事件咨询降 ~70%编价=0、7×24 自助

答:

我评估 Agent 不只看对话效果,分三层:

  1. 任务层:看任务能否办结、是否需要转人工
  2. 过程层:核对意图识别、工具调用,管控执行步数防循环爆炸,多工具 Agent 核心看这一层
  3. 业务层:看咨询降幅、人力节约、合规风险,对齐业务实际价值

落地手段:多场景黄金集测试、留存全链路日志、绑定业务 KPI 验收

工程防护:工作流内置超时、重试、幂等、熔断、最大步数限制

国能人事 成功率 ≥95% + 咨询降 70%;隐患 分类 ≥95% + 人工确认后入库;财税 编价 Bad Case 零容忍

【口诀·Agent 评估】不念给面试官 · 先口诀再扩绿条
口诀任·过·业 — 任务成不成 · 过程稳不稳 · 业务值不值

M5 · RAG 评测方法论

什么时候用:制度/财税知识库、任何「检索+生成」场景。

指标怎么选

类型指标什么时候强调
检索Recall@K、MRR、引用命中率答非所问、漏章 → 先修检索
生成准确率、幻觉率、拒答率有检索仍编造 → Prompt+拒答策略
体验满意度、转人工上线后

答:

评估 RAG 我把检索、生成分开评测,不混成一个准确率:

  1. 检索侧(离线):盯 Recall、引用命中率,答非所问、漏章先修这层
  2. 生成侧(离线):盯幻觉率、拒答率,有检索仍编造,就优化 Prompt 和拒答规则
  3. 线上侧:人工抽检 + 用户满意度,收集 Bad Case 存入错题本迭代

召回偏低时:除 chunk/混合检索,还会看 Query 改写(口语补全、多轮指代、多 Query 合并)

每次优化完:统一用同一批黄金测试集做回归

制度项目 无检索不答,准确率 ≥95%;跨章漏召回 → 调 chunk+混合检索+改写 再回归。

【口诀·RAG 评测】不念给面试官 · 先口诀再扩绿条
口诀先召回 · 再忠实 · 无检索不答

M6 · NL2SQL / 数据 Agent 评测方法论

什么时候用:人事/燃料查数、ChatBI 对比题。

答:

评估 NL2-SQL 数据 Agent,我分四层逐项评测,分层排查问题:

  1. 校验意图和数据表字段匹配度,禁止开放全部数据库
  2. 确保 SQL 可执行,并坚守只读原则,拦截 delete、update、drop 等修改、删除类高危语句
  3. 核对查询结果,严格对齐指标口径库和别名字典
  4. 把输出内容用白话总结展示,避免只输出表格

我将错题分类归档,每次优化完成后统一做回归测试

国能 查询成功率 ≥95%,小时级 → 秒级。

【口诀·NL2SQL 评测】不念给面试官 · 先口诀再扩绿条
口诀选对表 · SQL 过 · 口径对 · 人话讲

M7 · 意图识别评测方法论

什么时候用:客服分流、Agent 路由(附3 §15 的长答版在这里收束成方法论)。

答:

意图评测我盯 四个率,Bad Case 专收 进错分支

  1. 意图准确率:判断用户语句,能否准确分配到对应的业务意图类别
  2. 槽位填充率:校验时间、单据编号、客户信息等关键参数槽位,是否完整提取补齐,参数缺失会导致后续流程失败
  3. 误路由率:统计意图被分错业务分支的比例
  4. 转人工率:边界问题、识别模糊场景要及时转人工,禁止 Agent 强行作答,降低用户投诉

项目落地路由方案(结合我的项目)

我项目分三条兜底路由链路:财税业务对接 RAG 知识库、进度查询调用 HTTP 接口;国能人事场景区分三类方案:FAQ 问答、NL2-SQL 数据库查询、越权问题直接拒绝访问。

分层评估策略

整体采用分层方案:关键词规则优先命中 + 模型做意图分类 + 低置信度触发用户澄清,不单独依靠大模型做分类,提升整体稳定性。

【口诀·意图评测】不念给面试官 · 先口诀再扩绿条
口诀准·槽·误·转 — 意图准 · 槽位满 · 误路由 · 转人工

M8 · Prompt 工程与迭代方法论

什么时候用:Prompt 版本、和微调对比、线上回滚(块 4 #36附11 §18方法论版)。

五原则红线 · 格式 · 分工 · 版本 · 错题本

答:

Prompt 是 岗位说明书,企业里必须做 版本管理 + 支持回滚。写 Prompt 我固定遵守 五条规则 ,调整也分一套标准流程:

  1. 红线:先定什么绝对不能生成(拒答、编造价格、无检索不答);
  2. 格式:强制规定 JSON Schema 这类固定输出格式,同时调低模型温度,保证输出稳定不乱变;
  3. 分工:分开写 RAG/工具各管什么,别全塞一段 system prompt里;
  4. 版本:每改一次 Prompt 都记录版本号,写清楚这次改了什么内容;
  5. 错题本:改动后拿同一批 Bad Case 和黄金集复测,靠指标证明优化有效,不靠主观感觉判断。

每次改动:都要跑黄金集回归 → 指标掉了就立刻回滚

和微调比知识常变用 Prompt+RAG;国能/简历/财税 都以 Prompt+工作流为主

【口诀·Prompt 迭代】不念给面试官 · 先口诀再扩绿条
口诀红格分版错 — 红线 · JSON格式 · 与RAG分工 · 版本 · 错题回归

M9 · Bad Case 驱动迭代方法论

什么时候用:「怎么持续优化」「和算法怎么协作」—— 五步闭环

五步收集 → 分类 → 根因 → 改(Prompt/检索/库/规则)→ 同批回归

答:

Bad Case 就是 错题本,优化产品我固定走 五步闭环

  1. 收集:从日志、工单、业务反馈、线上抽检里把出错会话全部摘出来;
  2. 分类:按问题根源分成 检索 / Prompt / 权限 / 别名 / 模型这几大类归档;
  3. 找根因:定位到底是chunk、口径、路由还是生成乱编导致出错;
  4. 优化改动:针对性调整 Prompt、检索、知识库、规则、别名表等产品配置
  5. 复测验证:用同一套测试题重新跑一遍,指标掉了当天就回退版本。

和算法协作:我会带上 错题列表 + 量化指标,不会只靠主观说 “效果不好”。

项目常见:制度类大多都是 检索/chunk;人事 NL2SQL 多是 别名/权限;财税客服专盯 编价和误路由

【口诀·Bad Case】不念给面试官 · 先口诀再扩绿条
口诀收·分·因·改·测

附13 · 行业名词 · 什么时候主动说(给面试官「想听的词」)

名词一句话何时主动提
Eval / Evaluation对 AI 链路做 系统化测评任何评测题开头
Golden Set标准考题库,发版回归用讲离线评测、Prompt 改动
Eval Harness自动跑黄金集+打分+报告 的流水线被直接问 harness / 评测平台
Regression改完 同一批题再测,防退化讲迭代、版本管理
LLM-as-Judge模型辅助打分讲规模化评测、仍强调人工
Offline / Online Eval发版前批测 vs 上线后日志讲完整评测体系
Rubric打分 维度表(忠实度、安全…)讲 Judge 或人工抽检标准
HITL关键动作 人工确认B 端隐患/派单
Observability链路 可追溯日志讲工具失败、死循环排查

附13 · 三项目 × 方法论对照(15 秒选型)

项目首选方法论必提数字/规则
国能 6 AgentDISCOLE + M2/M4;制度加 M5,人事燃料加 M6≥95%、咨询 降 ~70%HITL、只读库
AI 简历优化DISCOLE + M2/M8;F2 加 OCR/多模态附12模型分档、防编造、PRD ⑥ 评测
财税 Coze 客服M7 意图 + M5 RAG + M3 回归编价=0、HTTP 进度、三路分支

附13块 4 / 附3 / 附11 分工:附13 = 框架+名词+何时用块 4 = 快答附3 = 技术深答附11 = 抖音题补全


块 6

前端栈 · 人话 30 秒(备用 · 浅问 · 不必背进块 4)

会不会问 React? AI PM 岗 偶发浅问(和前端怎么协作、小程序什么栈)——扫下面 30 秒即可不要跟前端工程师拼 Hooks / 性能优化。深考属于 前端岗

问:你们前端什么栈?AI PM 写什么?

答(30 秒):

简历项目正式上线是 Taro + React一套代码H5 和小程序。我做的是 0-1 产品侧39 页 HTML 原型 + 运营后台 + 每页 dev-spec(界面文案、接口字段、验收 ⑧),研发按 研发接手-第一天.md 拆页接 API。和前端分工是:我 定流程、状态、空态、双端 Toast 差异组件实现、性能、工程化 在前端 Owner。React 我 能读能验收,不当主交付码农。

【口诀·前端栈】不念给面试官 · 先口诀再扩绿条
口诀Taro+React 双端 · PM 交原型+spec · 前端 Owner 实现
图像锚点左边机模原型,右边 React 括号,中间箭头 「验收 ⑧」
练法被问 React → 先 30 秒分工 → 再举 39 页 + dev-spec → 深了就 诚实边界

📚
第二阶段

块 1~6 顺读后再查阅 · 附1~12 / 加餐

以下 不用按顺序全文背附13 已在上方块 5 顺读过)。面试前 30 分钟扫 附9 考前清单;被问到再翻 附2 定位题、附3 技术词、附11 抖音补题
【口诀·附2+附3不念给面试官 · 先口诀再扩绿条
口诀转AI有落地,分工有边界;RAG搜、SQL查、Func调、MCP联
图像锚点三角(国能 / 简历 / 14年ToB)+ 四插头插座板(技术词)
拆解附2=定位6题 · 附3=技术词深答 · 附12=名词人话+项目举例 · 附11=抖音补题 · 块1~6顺读后再扫
练法考前30分钟扫口诀+附9;面试中被问再展开,不抢在块1~6前面背

附1 · 面试地图(一场面试四段话用哪一块)

面试官在问什么用哪一块
自我介绍 / 为什么转 AI PM块 1 + 附2
Agent 记忆、MCP、ReAct、怎么设计块 2 + 附4
介绍项目、RAG、NL2SQL、Bad Case块 3 + 附5(含 财税客服 J
概念题、RAG 流程、Prompt、成本、意图识别块 4 + 附3 + 附11Prompt 开口 → §18
方法论单独考(AI PM 全流程 / 评测体系 / Harness / Agent 怎么评)块 5 · 附13(已前移 · 不必跳附3
抖音引流题(只抛问题没答案)附11
FAQ / Chunk / ChatBI 等名词不懂附12 人话词典(是什么→干什么→项目举例)
行为面、离职原因、挑战附7
反问附8

附2 · 定位类 6 题

1. 为什么转 AI 产品经理?

问法:你为什么做 AI PM?是不是跟风?

💬 你可以这样答

我不是去年才开始接触 AI。之前十几年一直在做 ToB,ERP、OA、人事系统、数据治理都做过,擅长把业务流程和产品落地。2025 年 5 月起在国能肇庆,我从 0 参与设计了 6 款 Agent 上线,制度 RAG、人事和燃料 NL2SQL、培训出题、隐患派单、缺陷跟踪都有,从需求、工作流、Prompt、评估到 Bad Case 复盘我都负责。2026 年 2 月离职后 并行两个 AI 产品:C 端 AI 简历优化(PRD、39 页原型、全模块运营后台、研发交接)和 财税代理记账智能客服(Coze 工作流、意图分流、RAG、HTTP 查进度),后者和我 8 年代账行业 经验是连上的。所以转 AI PM 是有项目支撑的,不是只看热闹。


2. 你和算法 / 后端怎么分工?

问法:AI 产品和技术怎么配合?你会不会只是写 PRD?

💬 你可以这样答

我定场景、用户路径、成功指标,还有 Prompt 和工作流怎么编排、什么必须人工审核、Bad Case 怎么闭环。算法和后端负责模型选型、向量库、SQL 引擎、权限和性能。我开发出身,能看懂接口和日志,联调时不会对扯皮。举个例子:人事 NL2SQL 里「部门口语化查不对」,我会和研发一起看是别名表问题还是 Prompt 问题,改完用同一批测试题验证,而不是只说「效果不好再优化」。


3. 你学的是不是皮毛?抖音那些 Agent 记忆、MCP 你懂吗?

问法:感觉 AI 变化很快,你跟得上吗?

💬 你可以这样答

我不靠背论文,我靠落地。每个 Agent 都有准确率、自助化率、Token、幻觉这些指标,还有每周抽检和 Bad Case 表。抖音上的 Agent 记忆、MCP,我理解概念,也清楚产品该怎么设计——国能因为央企合规,跨会话长期记忆我们没上,用的是业务库加会话上下文;MCP 我现场用 Dify 工具节点,原理一样。如果贵司要用 MCP 或长期记忆,我可以按 块 2 那套思路讲怎么设计,和我现有经验是接得上的。


4. 2018 年以前的 ERP 还要讲吗?

问法:你简历很长, oldest 的项目和 AI 有什么关系?

💬 你可以这样答

老项目证明我有 ToB 基本功:复杂流程、多组织、数据口径、跨系统集成、带团队。AI 能力从 2025 年 5 月 国能 Agent 才开始写。面试时老项目我讲数字化成果;AI 细节只绑 Agent 和 C 端简历,不会把 ERP 说成 AI 项目。


5. 期望薪资 30~35K 的依据?

问法:你的期望为什么是这个区间?

💬 你可以这样答

结合广州市场和岗位:14 年 ToB 产品经验、带团队、研发背景,加上近一年 6 款 Agent 从 0 到上线,以及 C 端 0-1 的 PRD 和原型交付。我更看 能力匹配能独立负责 AI 场景,具体可以聊。


6. 你日常用哪些 AI 工具?(抖音常问)

问法:你平时用什么 AI 工具?

💬 你可以这样答

工作流编排用 Dify 做 Agent;产品验证用 Cursor 做 Vibe Coding,C 端 39 页原型很多是这样快速搭出来再交给研发的;文档和 PRD 用大模型辅助写结构和润色,但业务规则、指标、合规我自己定稿;协作用常规办公和项目管理工具。工具会变,关键是 场景、指标、Bad Case 这套方法不变。



附3 · 技术词查阅(17 个)

用法:面试官 点名某个词 时用本章;若他说「讲讲你做的制度问答」,直接去 第五章 G,别整章背。 结构什么时候答不用背)→ 正文(要背的口语)→ 结合项目(有则背)→ 常见追问(被追问再看)。 面试官不懂英文时:先说「就是……」人话,再讲项目里哪一步,别只堆 RAG、HITL 等缩写。 名词第一次没听懂:先翻 附12 人话词典(FAQ、Chunk、ChatBI… 各带 1~2 个你项目里的例子),再回 附3 深答。 项目别混:国能 = 6 款 ToB Agent(文本);AI 简历优化 = 独立 0-1(含 OCR/多模态);财税客服 = Coze 工作流(意图+RAG+HTTP)

1. RAG(检索增强生成)

不用背什么时候答:简历写了制度问答 / 培训出题;或问「怎么防幻觉」「知识库怎么建」。

RAG 就是先查资料再回答。大模型自己编容易瞎说,我们先从制度库、题库里检索相关段落,再让模型只根据检索到的内容组织答案,这样私有知识能更新,幻觉也会少很多。

结合项目

在国能我做了两个 RAG:制度问答培训出题。制度是按章节切分,有重叠,再向量检索,Prompt 里写死「没有检索结果不许编,要引导找人工」。培训出题是在五大题库里按类别检索,再出题,避免跨类、避免编造。

常见追问 · 口语答

Chunk 怎么切?

按制度章节或条款切,一段大概 200~500 字,相邻段 重叠 10%20%,避免一句话被切两半导致搜不到。

召回率低怎么办?

先看是切分问题还是检索问题:可以 混合检索(向量 + 关键词),加 Rerank 精排,调 Top-K;Bad Case 里把「搜不到的问法」收集起来专门测。

没搜到还回答怎么办?

产品规则就是 不许编。返回「未找到相关制度,建议联系 XX 部门」,并留人工入口;这在我们央企场景是硬要求。

怎么评估效果?

回答准确率、幻觉率、引用是否命中;每周抽一批问题盲测,业务方也会参与抽检。

2. NL2SQL(自然语言查数)

不用背什么时候答:人事 Agent、燃料 Agent;或问「ChatBI」「Text2SQL」「数据安全」。

NL2SQL 就是员工说人话,系统生成只读 SQL 去查业务库,再用自然语言总结结果。适合考勤、编制、燃料消耗这类结构化数据。

结合项目

人事和燃料两个 Agent 都是 Dify 工作流。前面有意图识别和业务别名(比如口语「综合部」映射到标准部门名),中间生成 SQL,后面 五层安全:参数校验、FAQ 分流、SQL 危险语句拦截、只读库、行级权限。人事高频问题走 FAQ,Token 能降 60% 以上

常见追问 · 口语答

表太多怎么办?

限定主题域(人事一套、燃料一套),给模型 Schema 摘要和别名表,不要一次扔几百张表。表特别多时,可以加一步「先推荐 Top 相关表」再生成 SQL——产品上要定义推荐错了怎么兜底。

SQL 错了怎么办?

执行前 语法校验、拦截 delete/update 等;执行后 结果抽样、空结果/异常量告警;错例进 Bad Case,改 Prompt 或补别名,不是只改模型。

和 RAG 有什么区别?

RAG 查文档(制度 PDF、Word);NL2SQL 查数据库表。我们制度用 RAG,人事编制用 NL2SQL,选型看数据在哪。

3. Function Calling / 工具节点

不用背什么时候答:问 Agent 怎么执行动作、怎么调 API、Dify 里工具节点是什么。

Function Calling 就是模型不只会说话,还能决定调用哪个工具,比如查库、算数、调 HTTP 接口,拿到真实结果再继续推理。在 Dify 里我主要用工具节点和代码节点实现,和 Function Calling 是一类能力。

结合项目

人事 Agent 里:FAQ 匹配、权限校验、SQL 执行、结果格式化都是节点;隐患 Agent 里输出固定 JSON 给工单系统。产品上要定义 每个工具输入输出、失败怎么办、谁有权限调

常见追问

  • 工具调用失败?

工具如果调用失败,我不会让用户干等。一般会 自动重试一两次;还不行就 换降级话术(比如「暂时查不到进度,已为您转接顾问」),必要时 转人工。日志里必须能看到 哪一步、哪个工具失败,这样才能进 Bad Case,改超时、改入参或改兜底规则。

  • 和 MCP 什么关系?

MCP 是 接工具的统一协议标准;我在国能用 Dify 插件/HTTP 工具, 产品思路一样:列工具清单、写入参出参说明书、监控成功率和延迟、敏感操作加人工确认。选型看是否要多 Agent 复用同一工具、是否要换编排平台。


4. Human-in-the-loop(人在回路)

不用背什么时候答:隐患派单、缺陷跟踪;或问「AI 错了谁负责」「央企能不能全自动」。

就是 AI 出建议,人点确认后才生效。安全、派单、涉责场景必须这样,不能 AI 直接改生产数据。

结合项目

隐患分类 Agent 输出类别、责任部门、紧急程度,审核员确认后才写入 IMS 工单。一开始人工多,准确率高了之后,可以只对 低置信或高风险 强制人工,用 人工介入率 看效率。

追问:会不会很慢?

首月会慢,但相比以前 30 分钟一单,AI 1 分钟出建议、人 2 分钟确认,整体还是快很多;指标上 分类准确率 ≥95% 才逐步放权。


5. 幻觉防控

不用背什么时候答:任何 AI 项目都会问;C 端简历尤其会问「会不会编造经历」。

幻觉就是模型一本正经胡说。产品不能单靠 Prompt 里写请勿编造,要检索约束、格式约束、校验、评估一起上。

结合项目

制度 RAG:无检索不回答 + 引用来源;NL2SQL:只读库 + 结果对账;分类 Agent:低温度 + JSON Schema;C 端简历:禁止编造经历 + 提交前校验 + Bad Case。目标上关键场景 宁可说不知道,也不编


6. Bad Case 复盘

不用背什么时候答:问你怎么迭代、怎么和算法协作、效果怎么持续提升;或面试官问「Bad Case 是什么?」(很多人没听过这个词)。

Bad Case,中文你就理解成错题本:答错的、用户不满意的、业务不认账的真实例子。不是骂用户,而是把这些例子当资产,用来改产品。

怎么用(五步,面试可直接说)

收集(日志、工单、HR/业务反馈)→ 分类(检索 / Prompt / 权限 / 别名口径 / 模型)→ 找根因(补别名表、调 chunk、改 Prompt、加校验)→ 同一批错题再测一遍,看同类错误率有没有下来。

结合项目(先说归属)

  • 国能·人事:「口语部门名查不对」→ 补 业务别名表
  • 国能·制度:「跨章节漏召回」→ 调 chunk + 混合检索
  • AI 简历优化:「夸大/虚构经历」→ Prompt 禁止编造 + Bad Case 单列一类 每周抽检

和算法怎么协作:你带 错题列表和指标 开会,不用「感觉不准」;改完必须 回归同一批题。制度项目常见是检索/chunk 问题,人事是别名/权限,财税是编价/误路由——分类思路一样,案例按项目举例即可。


7. 效果评估

不用背什么时候答:问 KPI、上线后怎么盯、和老板怎么汇报。

我分三层:技术层(准确率、幻觉率、延迟、SQL/JSON 合规率)、产品层(自助化率、查询成功率、人工介入率)、业务层(咨询量降多少、审核量降多少、决策快多少、Token 花多少)。

结合项目

制度/人事 咨询量降约 70%,NL2SQL 成功率 ≥95%,隐患分类 ≥95%。上线后有 日报 + 每周抽检 + 月度业务复盘,指标掉下去当天就要查。


8. Prompt 工程 + 版本回退

不用背什么时候答:问和微调怎么选、Prompt 怎么写、线上出问题怎么回滚。

Prompt 就是给模型的岗位说明书:你是谁、干什么、不能干什么、输出什么格式。企业里还要能版本管理、能 5 分钟生效、出问题能一键回退——我在 C 端 PRD 和 B 端原型里都设计了提示词配置和回退。

和微调怎么选(口语)

知识常变、要快迭代 → Prompt + RAG 优先;格式极其固定、数据量很大、Prompt 顶不住 → 再考虑微调。国能 6 个 Agent 和 C 端简历,都以 Prompt + 工作流为主

面试怎么「一开口就像懂 Prompt」(抖音高频 · 详 附11 §18):

别说「我会写很好的 Prompt」——先说 约束和输出契约,再说 和 RAG/工作流怎么分工,最后举 一个 Bad Case 怎么改 Prompt 回归。口诀:红线 · 格式 · 分工 · 版本 · 错题本


9. Token / 成本治理

不用背什么时候答:问商业化、C 端怎么控本、企业怎么降 API 费用、Token 怎么计算

大模型按 Token 计费,产品要想 少调用、用小模型、缓存、分流,还要 能算清楚账

怎么算(补全抖音钩子题)

  • 计费:单次 ≈ (输入 tokens × 输入单价 + 输出 tokens × 输出单价)/ 1000
  • 估字数:中文粗算 1 字 ≈ 1~1.5 token;最终以 API 返回的 usage 字段 为准
  • 日成本日调用次数 × 单次均值;按场景拆(FAQ / RAG / NL2SQL / 客服意图链)
  • 产品动作:埋点、预算告警、P95 监控、超预算 降级/限流

结合项目

人事 Agent:FAQ 本地匹配,高频问题不调大模型,Token 降 60%+。C 端简历:模型分档,复杂用标准版、简单用基础版,预算触顶 自动降级,界面上 不暴露模型名,只显示「标准版/基础版」。财税客服:业务咨询走 意图 + RAG + 生成,进度走 意图 + HTTP + 短回复;价格类 无检索不答,避免长生成浪费 Token。

常见追问 · 口语答

怎么向业务解释成本?

我不会只跟业务讲 tokens。我会换算成 「每 1000 次咨询大约 X 元」,再和 省下来的人力(比如 HR 咨询降 70%)对比,让老板听得懂 ROI。

怎么压成本又不伤体验?

先让 FAQ 或规则 吃高频简单问法,再用 RAG 只喂 Top-K 相关段,最后复杂场景才上大模型;简单意图可以用 小模型或固定模板,别把每个问题都扔给最贵的那档。

10. Vibe Coding(Cursor)

不用背什么时候答:问你会不会用 AI 写代码、原型谁做的、和研发边界;抖音 现场 Vibe Coding / 三层难度

Vibe Coding 是产品经理用 AI 编程助手(我主要用 Cursor)快速搭原型、验证交互和规则,不是替代正式研发。我用 Cursor 做 C 端 39 页 + B 端运营后台可点原型,对齐 PRD 和 dev-spec,研发接手时有接口和验收标准。

抖音「三层难度」(口语 · 对号入座)

层级面试官在考什么你怎么答 / 怎么现场做
L1 · 认知层知不知道、干过没有「我用 Cursor 做 原型和规则验证,不是写生产代码」+ 简历 39 页例子
L2 · 演示层能不能当场改一屏先口头 PRD 边界 30 秒 → 再改 一个按钮/一条校验/一页列表;小步、可回滚
L3 · 方案层能不能设计可交付方案五层:需求边界 · Prompt/规则 · 工作流/页面 · 异常兜底 · 评测 Bad Case;强调上线仍要研发工程化

若让「现场 Vibe Coding」(Mentor学姐等博主常考):

先问清范围:「改交互 mock 还是接真 API?」——原型默认 mock

边做边 narrate:「这里对应 PRD 的 xxx 字段 / 失败不扣点」

5~10 分钟交付物:一页可点原型或一条校验,不承诺当场接生产库

收尾:「正式版要研发做鉴权、性能、合规,我交付 PRD+原型+验收标准」

常见追问 · 口语答

和研发边界?

我用 Cursor 主要做 原型和规则验证,比如页面流程、校验规则、dev-spec 验收标准。正式上线后的 鉴权、支付、性能、合规、联调 必须研发工程化,我交付 PRD、原型和接口契约,不替代后端写生产代码。

简历怎么写?

简历里我会写「用 Vibe Coding 完成 39 页 C 端可交互原型 + 运营后台 dev-spec」,强调 提效和交付物;不会写「我会写代码取代后端」这种容易越界的表述。

Vibe Coding 是什么?现场怎么考?

Vibe Coding 就是产品经理用 Cursor 等 AI 编程助手 快速搭 可点原型,验证交互、规则和文案,交付 PRD + 验收标准现场考 一般分三层:L1 问有没有干过——我答简历 39 页和后台原型;L2 让改一屏——我先 澄清边界,再 小步改 mock,边做边 narrate;L3 问完整交付——我会接 需求边界、Prompt/规则、工作流、异常兜底、Bad Case 评测 五层,并说明上线仍要研发做安全与联调。

11. Context Window(上下文窗口)

不用背什么时候答:问对话太长怎么办、制度很长怎么塞进去。

就是模型一次能读多长的内容,有上限。所以长制度不能整本塞进 Prompt,要用 RAG 只喂相关段;多轮对话用最近几轮加摘要;缺陷 Agent 只加载当前工单时间窗的信息。


12. Dify 工作流

不用背什么时候答:问你们技术栈、Agent 怎么编排。

Dify 是可视化把意图识别、检索、SQL、校验、生成串成一条链。6 个 Agent 各有一条主流程,共性节点包括:FAQ 分流、权限、异常分支、转人工。


13. AI 治理(安全 / 合规 / 成本)

不用背什么时候答:ToB、央企、C 端小程序合规。

AI 上线不只看准不准,还要看权限、审计、内容安全、成本上限。国能:只读库、SQL 注入防护、三级人事权限、操作留痕;C 端:深度合成相关合规、失败不扣能量点、分享打码等。


14. 多模态 / OCR(图片·文档·摄像头)

不用背什么时候答:问「多模态了解吗」「简历能不能传图」「OCR 谁做」。

查阅口语 30 秒:见块 4 第 43 题(背那一段即可)。查阅提示:OCR/多模态在 AI 简历优化;国能 6 个 Agent 是纯文本,口头不必对比。


15. 意图识别(别说「用大模型做意图识别」)

不用背什么时候答:客服 Bot、Agent 路由、NL2SQL 前置、抖音「智能体怎么做意图识别」。

意图识别就是 先判断用户想干什么,再决定走哪条路——查知识、调工具、查进度还是闲聊。别回答「用大模型」就结束,要说 分层 + 槽位 + 兜底

推荐答法(四层)

我设计四层式意图识别流程:

  1. 第一层优先关键词命中,拦截高频固定问题,既稳定又节省 token
  2. 第二层采用模型分类加槽位抽取,结构化输出意图、置信度和业务槽位,为后续 Agent 路由提供数据
  3. 第三层如果模型置信度低于阈值,就主动引导用户确认意图,避免模型猜测出错
  4. 第四层做异常兜底,闲聊对话引导回到业务,越权查询直接拒绝,超出业务范围问题流转人工处理

结合项目

  • 财税 Coze · Finance_Taxation_Service:LLM 节点提取意图 → 三路分支(业务咨询 RAG / 办理进度 HTTP / 其他兜底);槽位 城市、服务类型、公司名 供查进度;价格 严禁编造,走知识库
  • 国能人事:意图是 FAQ 直答 vs NL2SQL vs 越权拒绝;口语部门名走 别名表
  • 国能隐患:意图是 分类派单,输出固定 JSON,不是开放聊天

怎么评估:意图准确率、槽位填充率、 误路由率、转人工率;Bad Case 专收「进错分支」。


16. Coze vs Dify(平台选型 · 口语)

不用背什么时候答:问为什么用 Coze、和 Dify 区别、独立项目技术栈。

Coze:上手快,适合 客服 Bot + 可视化工作流 + 知识库 + 插件;我用来做 财税代理记账客服 验证。

Dify:国能央企场景,内网部署、深度编排、NL2SQL/权限 更熟。

产品方法一样:意图 → 分支 → 检索/工具 → 评测 → Bad Case;换平台主要是 工程落地差异



附4 · 设计题 10 问(块2已背 1~2,其余查阅)

这类题 HR 和业务都会问:「我们将来要做 XXX,你会怎么设计?」 答法结构:① 先说概念(30 秒)② 说你会怎么设计(1~2 分钟)③ 诚实说国能为什么没做/你用什么替代 ④ 接一句「和我现有 Agent 经验相通」。 阅读顺序:下面 先列必背 #1#10,再列其余设计题(题号不变,便于交叉引用)。

必背1. Agent 长期记忆怎么设计?(抖音超高频 · 必背)

🧠 Agent 记忆 · 四层框架(先背 30 秒版)

④ 长期记忆情景+语义 · 跨会话 · 要过期删除
③ 中期记忆长任务 · 任务ID+状态表
② 短期/会话最近N轮 + 槽位
① 工作记忆当前轮 + 工具返回 · 在上下文里

ToB 面试答法 → 收敛为三层:会话内 · 业务库 · 用户偏好

主背见 块 2-1

问法:「你们 Agent 有记忆吗?」「如果要跨会话记住用户,你怎么做?」

💬 你可以这样答

我会把记忆分成 三层,不会一上来就让大模型「记住用户一切」。

第一层:短期记忆(会话内)

就是这一轮对话里,用户说了什么、Agent 查到了什么、执行到哪一步。做法通常是 保留最近 N 轮对话 + 关键槽位,比如工号、部门、时间范围、当前工单号。我在 人事 NL2SQL、缺陷跟踪 里主要用这套,够应对连续追问。

第二层:业务记忆(推荐 ToB 默认用这个)

我不建议让模型「脑记」业务数据,而是 系统查业务库:上次工单状态、考勤结果,用 用户 ID / 工号 关联查询。这样 更准、可审计、也好做权限。国能央企场景,我们 跨会话长期记忆没上线,很大原因是 隐私、等保、审计;用业务库替代,效果上用户该查到的还是能查到。

第三层:产品长期记忆(用户偏好)

比如用户喜欢表格展示、常问的三类问题、默认时间范围——这才需要 单独存 User Profile。产品设计时我会先定四件事:

  • 记什么:只记和产品相关的偏好,不记敏感原文
  • 不记什么:薪资、处分、未授权字段一律不进入记忆
  • 记多久:过期自动删;用户可 查看、导出、删除(对齐个保法)
  • 怎么用:每次对话 检索相关记忆片段注入 Prompt,而不是把全部历史聊天记录塞进去

和研发的分工:Profile 表结构、加密、检索策略研发实现;我出 PRD:字段、授权流程、兜底话术、评估指标

怎么评估:看 用户是否少重复说一遍、任务成功率是否提升;还要看 误记率、隐私投诉——长期记忆记错了比没有记忆更伤。

收尾(诚实 + 自信)

国能项目因合规 没上第三层;若贵司要做,我可以按上面框架从 小范围试点 开始,比如只记「默认查询时间范围」,验证后再扩。


必背10. AI 问答不准,你怎么排查?(通用排查五步法 · 必背)

💬 你可以这样答

我固定五步,不和研发瞎猜:

  1. 检索有没有——该搜到的搜到了吗?
  2. Prompt 有没有用检索——是不是模型没用上片段?
  3. 模型参数——温度是不是太高?
  4. 权限和数据——是不是用户根本没权限看这条数据?
  5. Bad Case 是否重复——同类错误进表,改完回归

这五步在国能 每周复盘 都会用。



2. MCP 是什么?你们用过吗?如果要用你怎么做?

主背见 块 2-2

问法:「了解 MCP 吗?」「我们工具很多,怎么接 Agent?」

💬 你可以这样答

MCP(Model Context Protocol)可以理解成 大模型连接外部工具的「统一插座」。以前接日历、数据库、企业微信,每家一套接口;MCP 让工具以 标准 Server 形式暴露,模型通过协议调用, 便于扩展和治理

国能现场:我主要用 Dify 的工具节点、HTTP 插件、代码节点,没有以 MCP 名义上线,但 产品职责是一样的——定义 Agent 能调哪些工具、输入输出 Schema、超时重试、权限和审计。

如果贵司要上 MCP,我作为 AI PM 会做这些事

  1. 工具清单:哪些给 Agent 用,哪些不给(最小权限)
  2. 每个工具的「产品说明书」:干什么、失败提示、是否需用户确认
  3. 和现有编排的关系:Dify/自研 Agent 框架里 MCP Server 怎么注册
  4. Bad Case 与监控:哪个工具调用失败最多、Latency 如何
  5. 安全:敏感工具必须 Human-in-the-loop 或二次鉴权

诚实边界:我 还没在生产环境主导 MCP 选型,但 6 个 Agent 的工具编排、降级、复盘我都做过, 迁到 MCP 主要是工程协议层变化,产品方法论是通的。入职后我会优先熟悉贵司现有 MCP 规范和一条业务线试点。


3. ReAct 是什么?和你们 Dify 工作流一样吗?

💬 你可以这样答

ReAct 是 Reason(推理)→ Act(行动)→ Observe(观察结果) 再循环,直到任务完成。比如:先想「要查人事库」→ 调 SQL 工具 → 看结果不对 → 改条件再查。

Dify 工作流可以是 固定流程,也可以是 带分支的多步,和 ReAct 思想接近。我的 隐患、缺陷 Agent 更接近「多步 + 工具」; 制度 RAG 更像固定链:检索 → 生成。面试里我会说:不是所有场景都要强 Agent,问答类 RAG 够用就行, 派单、跟踪类才上 ReAct 式编排


4. RAG 和 Agent 有什么区别?你们为什么两个都做?

💬 你可以这样答

RAG 解决 「知识从哪来、怎么别瞎编」,典型是制度问答、培训出题。

Agent 解决 「多步完成任务、调工具、有状态」,典型是隐患派单、缺陷催办。

可以这么记:RAG + 对话是弱 Agent;我们 隐患、缺陷是强 Agent。选型看用户要完成 一步问答 还是 一条业务链路


5. 混合检索、Rerank 是什么?产品上要关心吗?

💬 你可以这样答

向量检索 懂语义,但有时漏关键词;关键词/BM25 对制度编号、专有名词更准。混合检索 就是两个一起用再合并结果。Rerank 是用一个小模型对 Top 结果 再排一次序,提高「喂给大模型的段落」质量。

产品上要定:召回不够时先调检索还是调 Prompt;Bad Case 里要标 是检索错还是生成错——这决定改知识库还是改模型参数。


6. Agent 怎么评估?除了准确率还看什么?

💬 你可以这样答

除了 任务成功率、回答准确率,我还看:

  • 步数/耗时:Agent 是否绕圈
  • 人工介入率:多少单必须人点确认
  • 工具调用成功率
  • Grounding:回答是否真有检索/SQL 依据
  • 业务结果:派单是否更快、咨询是否减少

C 端还会看 完成率、留存、单次 Token 成本


7. Agent 死循环 / 越跑越偏怎么办?

💬 你可以这样答

产品规则上设 最大步数、总超时、重复检测(同一步骤重复 3 次就停);给用户 明确失败提示和转人工;日志里记录 每一步决策,方便 Bad Case。不会让用户对着屏幕干等。


8. 多 Agent 协作 / 主 Agent 拆子 Agent 你怎么想?

💬 你可以这样答

业务域拆,比如「人事 Agent」「燃料 Agent」分开,不要一个 Agent 包打天下——我们国能就是这么做的。若要做「总前台」,可以是 路由 Agent 先识别意图再 分发给子 Agent,产品上要定义 交接上下文带哪些字段、失败谁兜底


9. RAG 知识库怎么构建?(抖音:骆齐那类题)

💬 你可以这样答

收资料:制度、题库、FAQ,定 owner 和更新频率

清洗:去重、去密、版本号

切分:按章节/条款,控制长度和 overlap

向量化入库

试检索 + 试回答,用 Bad Case 调 chunk 和检索策略

上线后增量更新,不是一次完事

制度更新时我们走 增量入库,不是整库推翻重来。


附5 · 全部项目(块3已背 B+G+J,其余查阅)

主背块 3-2 / 3-3 / 3-4(钩子 → 转接一句 → 四步 → 问面试官);本节 1 分钟压缩查阅,上场以块 3 为准,勿两套话术打架。 用法:面试官说「介绍一个项目」→ 选 2 个主力 背熟块 3 整套;其余项目 知道 30 秒钩子 即可。 阅读顺序:下面 先列标 ⭐ 的主力/备选(B→G→J→E),再列其余查阅项。

必背B. 企业人事智能查询 · NL2SQL(2025.11—2026.02)⭐ 建议主力

🛡️ 人事 NL2SQL · 五层安全(必记)

  1. 参数校验
  2. FAQ 分流
  3. SQL 拦截
  4. 只读库
  5. 行级权限

高频走 FAQ → Token 降 60%+ · 成功率 ≥95%

主背见 块 3-2(含转接 + 四步 + 问面试官)。

1 分钟 · 查阅压缩

员工以前查人事数据要找 HR,口头描述需求,HR 再查系统,慢而且占人力。我用 Dify 搭了 NL2SQL Agent,员工用自然语言提问,系统生成 只读 SQL 查人事库,再用白话总结。安全上做了 五层:参数校验、FAQ 分流、SQL 拦截、只读库、行级权限。高频问题走 FAQ 本地匹配,Token 成本降了 60% 以上。上线后 HR 咨询量降约 70%,查询 成功率 ≥95%,基本 秒级 返回。

追问 · 口语答

SQL 注入和数据安全?

数据安全我会从 账号权限执行拦截 两层做。数据库只用 只读账号,执行前 拦截 delete、update、drop 等危险语句;生成的 SQL 在代码节点里再做 语法和权限校验。敏感字段按 员工、部门负责人、管理员 三级做行级权限,该脱敏就脱敏,关键操作 留审计日志,方便事后追溯。

业务人员说的黑话、口语部门名怎么懂?

单靠大模型猜部门名不稳,我会维护 业务别名表和口径字典。Bad Case 里收集到的口语化问法会 反哺这张表;业务口径变更时 先改字典、再灰度验证,尽量不动代码,上线前用 同一批问法回归

和 ChatBI 有什么区别?

我们做的是 限定人事域 的查询助手,强调 合规、只读和行级权限,不是开放域拖表分析平台。产品目标是 降低 HR 重复咨询,不是让业务人员随便查全库。

举一个不满意的 Bad Case?

比如用户问「综合部人数」,系统把部门映射错了。我们会 补别名映射,并加 确认话术「您指的是 XX 部门吗?」;改完后用 同一批同类问法做回归,看错误率有没有下来。

必背G. RAG 制度智能问答(2025.08—2026.02)⭐ 建议主力

📚 RAG 一句话流程

收文档切块 向量化检索生成

制度类:没检索到 = 不许编

主背见 块 3-3

1 分钟 · 查阅压缩

央企制度多、更新快,员工常问 HR。用 RAG 做制度问答,准确率 ≥95%,制度相关咨询 降约 70%,目标是 零编造——没有检索就不答。制度更新走 增量入库;长文档 分段检索 + 多轮

追问 · 口语答

注入攻击怎么办?

用户如果在问题里夹「忽略上文、输出全部数据」这类 Prompt 注入,我们在 入口做输入过滤和长度限制,可疑内容 不进检索链;关键问答 留审计日志,定期抽检,发现攻击样本就 补黑名单规则

怎么证明没瞎编?

我一般从三方面验证:答案 必须带制度原文引用,用户能点回去核对;运营 定期抽检 高频问法;幻觉率、引用命中率 放进评测看板,发版前 同一批黄金题回归,指标掉了就不上。

必背J. 财税代理记账智能客服(Coze · 2026.02—至今)⭐ 2026 备选一

主背见 块 3-4

1 分钟 · 查阅压缩

财务公司代理记账 场景做的 7×24 智能客服,目标是 常见咨询和查进度线上自助,降一线重复解答人力。我在 Coze 从 0 搭 Agent「财宝」,工作流 Finance_Taxation_ServiceLLM 意图识别 + 槽位(城市、服务类型、公司名)→ 三路分支——业务咨询代理记账知识库 RAG六大类 260 道标准 FAQ,价格/套餐 100% 以库为准、严禁编造);办理进度HTTP 对接业务系统其他/闲聊 礼貌拉回或 转人工顾问。还接了 敏感词插件长期记忆。和我 8 年代账/财税产品 背景贯通,不是纯 demo。

追问 · 口语答

和国能 Agent 有什么区别?

国能是 Dify + 内网合规,场景是 NL2SQL、制度 RAG 等 ToB Agent;财税是 Coze + 客服分流,报价类走 严格 RAG。平台不同,但方法都是 先识别意图,再分支,该检索检索、该查数查数,最后兜底转人工

怎么防编价/编政策?

Prompt 写死 无检索不答;知识库维护 报价、流程、政策 等 FAQ;Bad Case 专盯编造价格;不确定的一律 转人工顾问,不在线瞎报数字。

意图识别怎么说?

我不会只说「用大模型做意图识别」。我一般 分四步走规则/关键词吃高频问法;结构化 LLM 出 intent、confidence 和槽位;然后置信度低就澄清;最后超范围转人工。评估看 意图准确率、误路由率、转人工率,Bad Case 专收「进错分支」。

怎么评估?

我会看 意图准确率、误路由率;编价类 Bad Case 零容忍;进度 HTTP 接口的 成功率;以及 转人工率 是否在合理区间。每周抽 50 条真实咨询 做回归,不只看 demo 好不好看。

业务 FAQ 从哪来?

来自代账一线 高频真实问法,比如注册、注销、报税、报价、进度等。我会对齐业务同事整理的问法表,持续维护进知识库,不是拍脑袋编 FAQ。


必背E. 隐患分类与派单 Agent(2025.09—2026.02)⭐ 建议备选一个

1 分钟

现场隐患以前 30 分钟 才能分类派单。这个 Agent 不用知识库,靠 强规则 Prompt 输出 固定 JSON(类别、责任部门、紧急程度),审核员 确认后才写入工单——典型 Human-in-the-loop。分类 准确率 ≥95%,整体 1 分钟级

追问 · 口语答

为什么必须人工确认?

央企 安全责任在人,AI 不能直接改生产工单。模型输出只是分类建议,审核员 点确认后才入库,这是典型的 Human-in-the-loop。

JSON 怎么对接业务系统?

输出 Schema 固定(类别、责任部门、紧急程度),和 IMS 之间加 适配层 做字段映射和校验,不让模型自由发挥格式,避免下游系统接不住。

A. C 端 · AI 简历优化助手(2026.02—至今)

1 分钟(可直接念)

这个项目是给求职者用的 AI 简历助手,目标是用大约 15 分钟 走完摸底、初稿、JD 对齐、HR 预览到导出 PDF。我独立完成了 PRD v1.3.2,里面单独写了 AI 能力专章,包括能力边界、输入输出、质量指标、评测方法和成本安全;还做了 39 页 C 端可交互原型 + 全模块 B 端运营后台原型(用户/交易/内容/增长/数据与风控等),以及含 接口、字段、JSON 示例、验收路径 的研发交接文档。原型阶段用 Cursor 做 Vibe Coding,C 端和后台规则都是先验证再交给研发。公开演示链接因保密只展示 C 端;后台面试可现场展示。合规上按微信小程序 深度合成 相关要求做了评估,设计了失败不扣点、分享打码等规则。

追问 · 口语答

PRD 里 AI 专章写什么?

PRD 里我会单独写 AI 专章,不让研发猜。至少写清 能做什么、不能做什么;每个 AI 能力的 输入输出准确率/完成率 等指标;怎么评测Token 和模型分档;以及 失败、超时、转人工 怎么处理。

怎么防编造简历经历?

简历场景最怕模型「润色」成虚构经历。Prompt 里 禁止编造,提交前做 校验和用户确认;Bad Case 里单独收 夸大/虚构 类错误。宁可提示用户补充,也不自动编一段假经历。

成本怎么控?

我会做 模型分档:复杂步骤用标准版,简单步骤用基础版;预算触顶 自动降级;后台能看单次和日均 Token。用户界面 不暴露模型名,只展示体验档位。

Vibe Coding 和研发边界?

我用 Cursor 做 原型和规则验证,快速把 PRD 里的流程和校验落到可点页面上。正式上线版本的 安全、性能、支付、合规 必须研发工程化;我交付 PRD、原型、接口和 Done 定义

为什么链接里只有小程序?后台做了吗?

链接里只放了小程序前端页面,后台内容因为项目保密没有对外展示;整套 B 端后台原型、相关文档我本地都有,您想看我可以当场打开电脑展示。

多模态 / 上传简历图 / OCR 做了吗?

做了。AI 简历优化里,摸底和 JD 支持 粘贴文字或传图 OCR;留言可 附图;表情分析用 摄像头,用户点按钮才申请权限。图片上传前会 自动压缩;OCR 或分析 失败不扣用户能量点,并引导重传或改粘贴,不让用户以为已经识别成功。

C. 燃料数据分析 · NL2SQL(2025.11—2026.02)

🛡️ 人事 NL2SQL · 五层安全(必记)

  1. 参数校验
  2. FAQ 分流
  3. SQL 拦截
  4. 只读库
  5. 行级权限

高频走 FAQ → Token 降 60%+ · 成功率 ≥95%

1 分钟

燃料成本分析以前靠人工导数、做表,动辄 小时级。这个 Agent 用 NL2SQL 查燃料数据,并给 分析建议,响应 秒级,帮助成本优化大约 2%5%。架构和人事类似,但 成本数据更敏感,行级权限和脱敏更严。

追问 · 口语答

敏感数据怎么管?

燃料成本比人事更敏感。我会强调 行级权限、字段脱敏、操作审计 三件套;数据库仍用 只读账号,执行前 拦截危险 SQL,避免越权或误操作。

口语指标名听不懂怎么办?

现场人员会说「吨煤成本」「标煤单价」这类口语。我会先做 意图分类,再通过 标准词库和 Schema 别名表 映射到正式字段;映射错的案例进 Bad Case, 反哺别名表

数据量大怎么扛?

复杂查询会做 索引优化和分页返回。如果一次问的范围太大,会 引导用户收窄时间范围,或 降级为汇总口径,避免一次拉全厂历史把系统拖慢。

D. 培训出题 · RAG(2025.10—2026.02)

1 分钟

五大类题库用 RAG 检索 + 分类 Prompt 自动出题,准确率 ≥98%,出题效率提升约 90%。规则是 无检索不出题,避免模型凭空编题;内容有 敏感词过滤和抽检

追问 · 口语答

怎么防题目跨类?

出题前检索时会 带类别标签,Prompt 里 锁死当前要出的题型(单选、多选或判断),避免从 A 类题库里误抽出 B 类题。

题库更新了怎么办?

题库变更走 增量入库,不用全量重训。发版前用 同一批黄金题回归,看准确率有没有掉,掉了就不上。

F. 缺陷闭环跟踪 Agent(2025.08—2026.02)

1 分钟

跟踪缺陷工单状态,识别 逾期,自动 催办。缺陷处理周期缩短约 40%,逾期率降约 60%。催办话术和时段 可配置,避免半夜打扰。


H. 国能 IMS 智慧电厂(数字化 · 非 LLM)

30 秒

这是 15 大模块的数字化平台,数据中台、千人 100% 使用AI Agent 是同期独立做的 6 个子项目,不要混成「整个 IMS 都是大模型」。


I. 金不换 ERP / 谦玛 HR(备用 · 传统数字化 · 非 LLM)

30 秒

金不换是集团 业财一体 ERP,分公司从 24 扩至 35 家,集团约 六百人系统使用率 100%;谦玛做过 人事 11 模块 0-1传统 HR 信息系统(招聘/考勤/绩效/培训/人才盘点等)。这两段都是 2012~2025.04 的数字化项目,不是 AI 项目——沉淀的是 业务流程拆解、数据口径、权限与跨系统集成 功底,为后面国能 Agent 打底。

人事 NL2SQL2025 年 5 月起在国能肇庆 单独做的 Agent,别把老 ERP/谦玛 HR 包装成「做过 NL2SQL」

不用背ERP 若深挖:最难是 多分公司口径统一;用 BPR + 标准产品 + RICE 砍定制;和金蝶税友 标准接口 + 字段映射


附6 · 大模型基础

上下文窗口:模型一次能读多长的内容;太长就要 RAG 或摘要,不能硬塞。

对齐(Alignment):让模型输出符合人类价值观和安全要求;RLHF 是常见训练手段,产品侧更多关注 上线后边界和评测

基座 / 微调 / Prompt:基座是通用大模型;微调用数据改模型权重;Prompt 是改指令—— 我们项目以 Prompt + RAG 为主,迭代最快。

零样本 / 少样本:不给例子或给几个例子在 Prompt 里;分类、格式控制里常用 少样本示例

涌现:模型变大后偶发新能力;产品上 少吹概念,多测场景

不用背Transformer / 注意力:知道是主流架构即可;面试 不必展开数学,被问就说「了解原理,工作重心在场景和评测」。



附7 · 行为面

最大挑战:C 端要在 效果和 Token 成本 间平衡 → 模型分档和降级;B 端要在 效率和安全 间平衡 → Human-in-the-loop。

失败或延期:ERP 早期定制过多导致延期 → 后面用 标准产品 + RICE 砍需求,这个思路也用在 AI:先 MVP 一个场景,再扩

跨部门协调:国能做过 6 部门访谈、12 场培训,IMS 使用率 100%;AI 项目同样要先 对齐指标和合规 再推。

和研发分歧:用 Bad Case 列表和指标 对齐,不用「感觉不准」;我懂技术,能一起查日志。

为什么离开/看机会:按真实情况说;可强调 已完成国能 Agent 交付,希望在 AI PM 方向持续深耕

年龄 / 35 岁 / 1990 年:我明白您担心落地交付,我有 14 年 ToB 行业积累,完整落地过多款 集团 AI Agent合规、Bad Case 管控、全流程上线这套实战经验十分扎实。年轻人上手工具更快,我的核心优势是 吃透企业复杂业务、统筹多方推进规模化落地

项目只有 C 端链接:链接里只放了小程序前端页面,后台内容因为项目保密没有对外展示;整套 B 端后台原型、相关文档我本地都有,您想看我可以当场打开电脑展示。



附8 · 反问

  1. 贵司 AI 产品是 自研编排还是 Dify/Coze 这类平台?我入职后大概多久能独立负责一条 Agent 线?
  2. 当前 最想解决的 1 个 AI 场景 是什么?成功指标怎么定?
  3. AI 产品和算法/后端 多久做一次 Bad Case 复盘
  4. 未来半年更偏 B 端 Agent 还是 C 端应用?和我经历哪块更匹配?


附9 · 考前 30 分钟清单


  • 附10 · 项目深挖 Bad Case

    以下为你原稿中 燃料/培训/隐患/缺陷/制度/ERP 的「基础追问+进阶深挖+Bad Case 分类」,内容有效,不必全背,面试前按项目 扫一眼粗体问题 即可。 阅读顺序先背「金不换 ERP · 高频 13 问」,再翻各 Agent Bad Case。

    金不换 ERP · 高频 13 问

    • 最难:24 家分公司口径统一
    • BPR:四大流程去冗余上线
    • 微服务:模块独立迭代
    • 金蝶税友:标准接口+字段映射
    • 成果:数据互通、流失率降、32 家分公司


    燃料 NL2SQL · 进阶(节选)

    • 分库分表 → 数据源路由
    • 亿级数据 → 索引+分页+复杂查询降级
    • 敏感成本 → 行级权限+脱敏+审计

    培训 RAG · Bad Case 分类

    • 检索 50% / Prompt 30% / 知识库 15% / 模型 5%
    • 优化:重分段、调检索、禁止编造、增量更新

    隐患 Agent · Bad Case 分类

    • 术语 40% / Prompt 35% / 边界 20% / 格式 5%

    缺陷 Agent · Bad Case 分类

    • Prompt 45% / 定义 30% / 上下文 20%

    制度 RAG · Bad Case 分类

    • 检索 50% / Prompt 25% / 知识库 20%

    财税代理记账客服 · Bad Case 分类

    • 编价/编政策 40% → 无检索不答 + 知识库补 FAQ + 转人工
    • 意图进错分支 30% → 规则补高频 + 槽位澄清
    • 进度 HTTP 失败 20% → 重试 + 降级话术 + 转人工
    • 闲聊/超范围 10% → 拉回业务 + 敏感词

    附11 · 抖音 AI 产品高频题(补全答案 · 2026-06)

    来源抖音AI产品常见问题 链接标题整理;博主多 只抛问题引流,本节 补全可背口语答案,并 挂到你三个项目 上。 用法:块 1~6 顺读后再扫;标 的建议考前各说 1 遍。

    阅读顺序先背标 ⭐ 的必背区(1、2、4、7、9、10、12、15、16、18~26),再翻补充区(3、5、6、8、11、13、14、17)。题号不变,交叉引用仍写「附11 §N」。

    必背1. AI 产品经理做到什么程度才算「懂业务」?⭐

    💬 你可以这样答

    懂业务不是背行业名词,而是 能把业务流程拆成 AI 能接、不能接的边界,并用指标验收

    我用的标准是四件事:

    说得清用户原流程(谁、什么环节、痛点、现有人力)——代账就是一线反复答报价/进度;国能就是 HR 被问考勤编制

    说得清 AI 改哪一段(不是「上个聊天框」)——FAQ 分流、RAG、NL2SQL、HITL

    定得准成功指标——咨询降 70%、成功率 95%、编价为 0

    Bad Case 能反哺业务——别名表、知识库、转人工规则

    我有 14 年 ToB + 8 年代账/财税,所以财税客服不是跟风 demo,FAQ 和槽位都来自真实一线问法。


    必背2. Agent 项目 PRD 要写什么?(喂饭版)⭐

    PRD 里我会单独写 AI 专章,别只写「接大模型」。核心是 8 块:① 场景与指标(谁用、解决什么、成功标准);② AI 边界(能/不能做什么,什么时候转人工);③ 工作流(意图 → 分支 → RAG/工具/生成 → 兜底);④ Prompt 与输出格式(JSON Schema、引用要求、禁止编造);⑤ 数据与安全(权限、脱敏、审计、内容安全);⑥ 评测与 Bad Case(黄金集、抽检频率、回归方式);⑦ 成本与降级(模型分档、FAQ、Token 预算);⑧ 上线与运营(版本回退、监控告警、反馈入口)。

    国能 每个 Agent 一份 AI 专章;简历 PRD v1.3.2 独立 AI 章;财税 工作流图 + 三路分支 + 知识库维护说明。


    必背4. 项目讲不好,AI 面试过不了 / 怎么快速讲清复杂 AI 项目?⭐

    钩子 30 秒 → 转接一句 → 展开四步 → 问面试官 → 追问 的结构,每个项目控制在 3 分钟内

    项目钩子 30 秒(要点)展开重点
    人事 NL2SQL员工查数找 HR → NL2SQL · 咨询降 70%、成功率 ≥95%五层安全、FAQ 降 Token 60%
    制度 RAG制度咨询慢 → RAG · 准确率 ≥95%、零编造检索+引用、增量入库
    财税客服代账重复报价查进度 → Coze 三类分流严格 RAG 报价、HTTP 进度
    简历 0-115 分钟主路径、PRD+原型+后台模型分档、OCR、合规
    问面试官 · 收尾一句

    「您更想先听 安全,还是先听 评测?」——把话头交给面试官。完整可念稿在 块 3-2~3-4


    必背7. 怎么评估一个 Agent 靠不靠谱?⭐

    不能只看「感觉准不准」,要 任务 + 过程 + 业务 三层:任务层(任务成功率、一次答对率、转人工率);过程层(平均步数、工具成功率、意图准确率、超时率);业务层(咨询降多少、人力节省、合规事件)。定 50~100 条黄金集 + 每周抽检 + 错题本回归。

    口语再加 三个红灯:① 只有 demo 没有测试集和指标;② 答错了没有错题本闭环;③ 关键动作没有权限/人工兜底(尤其 B 端)。财税 编价类错误 0 容忍国能 SQL 和制度 必须可审计


    必背9. 智能体怎么做意图识别?(别说「大模型」)⭐

    我不会只说「用大模型做意图识别」。我一般 分四步走规则/关键词吃高频问法;结构化 LLM 出 intent、confidence 和槽位;然后置信度低就澄清;最后超范围转人工。财税是 三路分支(RAG / HTTP / 兜底);国能人事是 FAQ 直答、NL2SQL 或越权拒绝。评估看 意图准确率、误路由率、转人工率


    必背10. 面试问到 RAG,怎么答才到位?(30K 级思路)⭐

    30 秒版:先查再答,私有知识可更新,幻觉可控。

    1 分钟版(分层)

    数据:怎么切 chunk、谁维护、增量更新

    检索:向量+关键词混合、Top-K、Rerank

    生成:Prompt 只用检索片段、必须引用、 没搜到不答

    评测:准确率、幻觉率、引用命中率

    Bad Case:检索/Prompt/知识库 分类改

    结合项目:制度 RAG(块 3-3)、培训出题、财税 严格 RAG 报价附5-J)。


    必背12. Token 成本怎么计算?(博主只抛问题的补全)⭐

    大模型按 Token 计费:单次成本 ≈(输入 Token × 输入单价 + 输出 Token × 输出单价)/ 1000,以 API 返回的 usage 为准。产品侧 少调用、少喂长文、简单题用小模型:FAQ 本地匹配吃高频、RAG 只喂 Top-K、模型分档、设预算告警。国能人事 FAQ 命中 Token 60%+;财税报价类 无检索不答,避免长生成浪费 Token。要埋 prompt_tokens/completion_tokens,按场景拆日成本。


    必背15. 面试官让「现场 Vibe Coding」怎么办?(Mentor学姐)⭐

    心态:考的是 产品思维 + 会不会用工具,不是考你手写 LeetCode。

    现场四步(5~10 分钟)

    1. 澄清:改哪一页、mock 还是真接口、成功标准是什么
    2. 口头 PRD 30 秒:用户是谁、主按钮干什么、失败怎么提示
    3. 小步改:一个按钮 / 一条校验 / 一行列表——边做边 narrate
    4. 收尾边界:「这是 原型验证;上线要研发做安全、埋点、联调」

    千万别:一上来接生产库、承诺当场上线、沉默写 10 分钟不解释。


    必背16. 考察 Vibe Coding 的 3 层难度(亚慧)⭐

    层级面试官在考你怎么接
    L1 认知知不知道、干过没「Cursor 做原型,简历 39 页 + 后台 dev-spec」
    L2 演示当场改一屏先边界再改 mock;见 §15 四步
    L3 方案完整 AI 产品怎么交付五层:需求边界 · Prompt/规则 · 工作流/页面 · 异常兜底 · Bad Case 评测

    口诀:L1 讲经历 · L2 小步演示 · L3 接国能/简历/财税 完整闭环


    必背18. 一开口就知道「很懂 Prompt」怎么答?⭐

    抖音标题:面了一个 AI 产品女生,她一开口就知道她很懂 Prompt(05/06) 核心:面试官听的不是「我会调 temperature」,而是 产品层的 Prompt 契约——约束、格式、和检索/工作流分工、可迭代。

    30 秒版(建议背)

    Prompt 对我不是堆形容词,是 岗位说明书 + 红线 + 输出格式

    事实靠 RAG/只读库,Prompt 管怎么用这些材料说话、什么情况下 必须拒答/转人工

    我改 Prompt 一定绑 Bad Case + 黄金测试集回归,线上还有 版本号可回滚——国能制度、隐患 JSON、财税报价、简历防编造都是这套。


    「懂 Prompt」的五个信号(你一开口就要露出来)

    信号懂的人怎么说不懂的人怎么说
    ① 约束优先「先写 不能干什么:无检索不答、无出处不报价、禁止编造经历」「我会写一段很详细的 system prompt」
    ② 格式契约「输出要 JSON Schema / 必须带引用条款号「让模型自由发挥,差不多就行」
    ③ 和 RAG 分工检索管事实,Prompt 管怎么说;检索错了改库,生成了乱改 Prompt」「RAG 和 Prompt 是一回事」
    ④ 可迭代版本号 + 50 条黄金集;改完同一批错题再测」「感觉不准就再优化一下」
    ⑤ 场景不一刀切「制度问答、隐患分类、NL2SQL、客服报价 四套 Prompt 逻辑不同「一套 Prompt 打天下」

    六件套结构(被追问「你怎么写」时用 · 对齐块 4 第 37 题

    1. 角色 — 你是谁(制度问答助手 / 隐患分类员…)
    2. 任务 — 这一步要干什么(根据检索片段回答 / 输出 JSON…)
    3. 背景/输入占位{检索片段}{用户问题}{槽位}
    4. 约束 — 温度、长度、禁止编造无检索如何处理
    5. 输出格式 — 纯文本+引用 / 固定 JSON 字段
    6. 示例(1~2 条) — 少样本,尤其分类、格式控制

    口诀角色任务 · 输入占位 · 约束格式 · 示例可选


    三个项目 · 各举一句(开口就挂项目)

    场景Prompt 关键设计一句话举例
    国能·制度 RAG无检索不答 + 必须引用条款「只用 {chunks} 回答;找不到就说未找到,引导人工」
    国能·隐患 Agent强规则 + 低温度 + JSON Schema「只输出 category/dept/urgency,审核员确认后才入工单」
    财税·代账客服报价 无出处不答 + 缺槽位澄清「检索不到报价表条目 → 不编数字,引导留资或转人工」
    简历·F2 分析禁止编造 + 不确定让用户补充「经历必须来自用户原文/OCR,不得虚构公司或数字」

    30 秒口播示例(可直接练)

    「我们制度问答的 Prompt,核心不是写得长,是三条契约:只用检索片段必须带条款引用检索为空就明确说不知道。 和隐患分类不一样——那个不要 RAG,要 固定 JSON + 低温度,因为类别是封闭集合。 所以我不会一套 Prompt 打天下;改 Prompt 一定看 Bad Case 是 检索错还是生成错,用同一批 50 条题回归。」

    常见追问 · 口语答

    • 和微调怎么选?

    知识常变、要快迭代,我们 6 个 Agent 和简历都以 Prompt + RAG 为主;格式极其固定、数据量很大、Prompt 顶不住时再考虑微调。

    • 温度怎么设?

    制度问答、分类、SQL 生成用 低温度;创意文案可略高;但 B 端优先格式和准确

    • 你怎么证明 Prompt 改好了?

    同一批 Bad Case + 黄金集 回归,看准确率、幻觉率、引用命中率,不是主观「感觉好了」。

    • B 端提示词谁维护?

    产品定 契约和红线(无检索不答、必须引用等),运营/法务审 制度/报价文案;上线要有 版本与回退 机制。


    必背19. RAG 系统里 Query 改写怎么答?(26 春招模拟面 · 扶安)⭐

    抖音:[扶安AI小课堂 · RAG 里 query 改写](https://v.douyin.com/I4zrjTqIbxY/) 块 4 #6 召回低 · 附13 M5 · 国能制度 / 财税报价

    30 秒版(建议背)

    用户问话往往 口语、省略、多轮追问;直接拿原句去搜,Recall 会掉。

    我会在 检索前 加一层 Query 改写:把口语补全、拆成可检索关键词、多轮时 带上文意图 再搜;改写只服务检索,进 Prompt 的仍是 检索片段 + 原问题,避免改写本身编造事实。

    三层(被追问时用)

    做什么例子
    ① 规范化去口语、补实体「陪产那个假」→「陪产假 天数 规定」
    ② 多轮改写把指代补全「那上海呢?」→「上海 代理记账 报价」
    ③ 多 Query一条变 2~3 条检索制度题:条款号 + 同义词各搜一次再合并

    和项目挂钩

    • 国能·制度 RAG:用户常带 条款号/简称 → 混合检索 + 别名表;跨章漏召回类 Bad Case 先看 chunk,再看 Query 是否太窄
    • 财税·报价 RAG:口语「小规模多少钱」→ 改写补 城市+纳税人类型 再检,检不到 不编价
    • 简历·F2:上传 OCR 后用户追问「帮我改这段」→ 改写要 锚定当前简历段落,别漂到别的模块。

    常见追问

    • 改写会不会引入幻觉?

    Query 改写 只用于检索阶段,帮助把口语问法补全成更好搜的关键词;最终回答仍 只用检索到的片段和用户的原问题,并且 没检索到就不答,不会在改写环节编造新事实。

    • 和 Rerank 怎么分工?

    改写负责 扩大召回(把「它」「这个」补全、把口语变检索词);Rerank 负责 精排(从候选片段里挑出最相关的)。工程顺序一般是 先改写,再混合检索,再 Rerank,最后才生成


    必背20. 怎么保证 Agent 调用可靠性?(大模型星球)⭐

    抖音:[大模型星球 · Agent 调用可靠性](https://v.douyin.com/-yN5u0dfuUI/) 块 4 #27 工具失败 · #32 Agent 评估(过程层) · 附13 M4

    30 秒版(建议背)

    Agent 可靠不是「模型聪明就行」,是 产品 + 工程一起兜底

    超时、重试、幂等、熔断、最大步数、重复检测、转人工 都要在工作流里写死;每次工具调用可观测(成功/失败/耗时/入参摘要),失败进 错题本 回归。

    五件套(面试列点用)

    #机制产品要定什么
    1超时单步/整任务上限;国能 Dify 节点、财税 HTTP 查进度各设 SLA
    2重试幂等 读操作可重试;写库/派单 禁止盲重试
    3降级工具失败 → 固定话术 + 转人工;别 silent fail
    4防死循环max steps + 相同工具重复调用检测(块 4 #28
    5可观测日志:意图、工具名、成功/失败、步数 → 过程层指标块 4 #32

    和项目挂钩

    • 国能·人事 NL2SQL:SQL 只读 + 校验失败不执行;超时回 「请稍后再试或找 HR」
    • 国能·隐患 Agent:分类后 HITL 确认 才入库——可靠性靠 人兜底,不是全自动梭哈。
    • 财税·Coze:进度走 HTTP;失败走 兜底分支;编价类 无出处不答(可靠性 = 业务合规)。

    口播示例

    「我们评 Agent 不只看答得像不像,过程层必看 工具成功率、平均步数、超时率。工具挂了有 重试→降级→转人工 三级,并且同一批多步场景进 黄金集 每周回归。」

    必背21. RAG 怎么评估?(千万别只说准确率 · 小哲)⭐

    抖音:[小哲讲大模型 · RAG 评估别只说准确率](https://v.douyin.com/GJg8rg3MVVY/) 块 4 #10 · 附13 M5 · 国能制度 RAG / 财税报价 RAG

    30 秒版(建议背)

    RAG 评估我 绝不只报一个「准确率」——要 检索和生成分开看

    检索侧Recall@K、Top-K 命中率(该检到的检到了没);生成侧引用命中率、幻觉率、拒答率(有没有瞎编、没检到敢不敢说不答)。

    线上再加 抽检 + 满意度 + Bad Case 回归,改完必须 同一批错题再测

    四层(被追问时用)

    看什么国能/财税举例
    ① 检索Recall、漏召回类 Bad Case制度跨章漏检 → 调 chunk + 混合检索 + §19 改写
    ② 生成引用是否贴片段、有无编造制度 必须带条款号;财税 无出处不报价
    ③ 拒答没检到是否敢说不答无检索不答 写进 Prompt 契约
    ④ 线上抽检、满意度、错题本闭环每周抽检 + 分类:检索/Prompt/知识库

    口播示例

    「制度 RAG 我们离线先看 Recall,生成看 引用和幻觉;线上不是只看用户点赞,还有 人工抽检和错题回归。如果只报一个准确率,分不清是 检错了 还是 写错了。」

    常见追问

    • 和通用 LLM 评测有啥不同?

    RAG 多一层 检索质量;检索错了,后面 Prompt 再漂亮也救不了——所以要 分开归因

    • Recall 低怎么办?

    先 chunk/混合检索/别名表,再看 Query 改写§19),不是一上来换大模型。


    必背22. Agent 安全边界怎么考虑?(小哲)⭐

    抖音:[小哲讲大模型 · Agent 安全边界](https://v.douyin.com/MjeYfVXdbg4/) 块 2 · 块 4 #29#32 · 附3 B 端边界 · 国能六 Agent

    30 秒版(建议背)

    Agent 安全边界不是「加一句请勿违法」,而是 产品先画圈能做什么、不能做什么、谁有权、什么必须人工

    我按 五层 定:(限定业务场景)· 权限(行级/只读/脱敏)· 动作(读可以、写/派单要 HITL)· 内容(无出处不答、防注入)· 审计(日志可追溯)。

    B 端 国能 是典型:SQL 只读+拦截、隐患 分类后人工确认、制度 无检索不答

    五层(面试列点用)

    产品要定什么项目举例
    ① 业务域单 Agent 单域,前面路由人事/燃料/制度/隐患 各做各的
    ② 数据权限谁能查什么、脱敏规则NL2SQL 行级权限 + 只读库
    ③ 动作边界哪些工具可自动、哪些必须 HITL隐患 不入库直到审核员确认
    ④ 内容安全无检索不答、防 Prompt 注入制度/报价 必须引用;异常输入走兜底
    ⑤ 审计合规谁问了什么、调了什么工具央企要求 可审计、可回滚

    和「可靠性 §20」的分工

    • §20 = 工具 挂了怎么办(超时/重试/降级)
    • §22 = Agent 能不能做、该不该做(权限/HITL/域)

    口播示例

    「人事 Agent 不是开放聊天——限定域 NL2SQL + FAQ,SQL 多层校验失败 不执行;隐患 Agent 可以分类但不能自动派单,必须 HITL。安全边界和可靠性是两套题,我会分开答。」

    必背23. 怎么设计记忆系统?(上下文工程 · 小哲)⭐

    抖音:[小哲讲大模型 · 记忆系统与上下文工程](https://v.douyin.com/UJgCzpIJXQU/) 块 2(Agent 记忆四层)· 块 4 #29 · 附3 §1

    30 秒版(建议背)

    「记忆」不是让模型 脑记一切——是 上下文工程:在 有限 Context Window 里,决定 什么进 Prompt、什么走外部存储、什么必须查库

    我分 四层工作记忆(当前轮+工具返回)· 会话记忆(最近 N 轮+槽位)· 业务记忆(工单/考勤 查库,比脑记准)· 长期偏好(试点、要定留存与隐私)。

    RAG 本质是外部记忆——制度/报价不进窗口,需要时再检索。

    块 2 对齐(被追问时用)

    放哪国能实际
    工作记忆Context 内当前问题 + 刚查到的 SQL/检索片段
    会话记忆Context 内截断/摘要人事 NL2SQL 保留 工号、时间范围 等槽位
    业务记忆业务库工单状态、考勤结果 按用户 ID 查
    长期偏好Profile(可选)央企 跨会话长期记忆未上线;用业务库替代

    上下文工程三原则

    1. 能查库别硬塞 — 窗口有限,RAG/NL2SQL 优于把整库塞进 Prompt
    2. 能摘要别堆轮 — 多轮太长就 摘要关键槽位
    3. 先定隐私边界 — 记什么、记多久、用户能否删;误记率体验 一起看

    口播示例

    「国能因合规 没上跨会话长期记忆,会话内保留槽位,跨会话靠 业务库 + 用户 ID;制度知识走 RAG 外部记忆,不是把整本制度塞进 Context。若贵司要做长期记忆,我会从 小范围偏好 试点,并定 留存和审计。」

    常见追问

    • 和 RAG 啥关系?

    RAG = 按需加载的外部知识;记忆系统 = 会话状态 + 用户状态 + 外部库 的整体编排。

    • 抖音说的 Context Engineering?

    就是 在 token 预算内选什么信息进模型——检索片段、最近对话、工具结果、系统约束 一起排优先级


    必背24. 多轮对话不做这 4 点,纯属烧钱?(AI产品天道)⭐

    抖音:[AI产品天道 · 多轮对话不做这4点,纯属烧钱](https://v.douyin.com/uszQvOCeyAw/) 块 4 #41 Token 成本 · #42 Context Window · 附11 §19(Query 改写)· §23(记忆分层)· 附13 M2 业务层

    视频核心(一句话)

    多轮对话如果不做好 上下文管理、指代消解、结构化 Prompt、对话状态跟踪,就是 纯烧钱、没效果

    30 秒版(建议背 · 对齐视频)

    多轮想 省钱又有效,必须做好四点:① 上下文管理——滑动窗口 + 历史摘要 + 结构化存储,别全量喂历史;② 指代消解前置——时间/地点/实体补全后再进模型,不让模型猜;③ 结构化 Prompt——角色职责写死、历史用分隔符、强约束输出格式;④ 对话状态跟踪——关键信息变状态变量 + 状态机,流程不断裂、不重复问。不做这四点,就是 纯烧钱、没效果

    【口诀·多轮四件套】不念给面试官 · 先口诀再扩绿条

    ① 上下文管理 · 别全量喂历史(窗口 + 摘要 + JSON 槽位)

    内容
    问题每轮把 全量历史 塞给模型 → 10 轮后 Token 暴增、成本飙升、变慢甚至报错
    三件套滑动窗口(最近 3~5 轮)· 历史摘要(更早对话压成:诉求 + 关键实体 + 已确认信息)· 结构化存储(JSON/键值对,不堆纯文本历史)
    一句话不要「全量喂历史」,要 窗口 + 摘要 + 结构化
    项目挂国能制度 RAG 切段 不进整本;人事 FAQ 命中不调大模型(Token 降 60%+);缺陷 Agent 只加载 当前工单时间窗

    ② 指代消解前置 · 先改写 Query(不让模型猜)

    内容
    问题用户说「明天天气怎么样」「它」「那个」——模型不知道指什么 → 答非所问、反复澄清
    做法前置改写 Query:模糊指代 补全再进模型(例:「明天天气?」→「北京 2026-06-08 天气?」);可用 小模型/规则/NER 做实体消歧 + 时间补全
    一句话指代消解 必须前置,不让模型猜
    项目挂NL2SQL 前补 部门、时间范围;财税查进度缺 公司名 先追问再调 HTTP;详 附11 §19 Query 改写

    ③ 结构化 Prompt · 角色 + 分隔符 + 强约束输出

    内容
    问题Prompt 写得随意、没结构 → 多轮后行为漂移、输出不可控、越聊越偏
    三段式角色 + 职责写死(只做 XX、不做 XX)② 历史结构化 + 分隔符(系统/用户/助手标签,历史与当前问题分开)③ 约束 + 输出格式(不能编、必须溯源、JSON/Markdown、拒敏感)
    一句话多轮 Prompt = 角色 + 结构化历史 + 强约束,控行为不控死内容
    项目挂国能制度 无检索不答 + 引用出处;财税报价 无出处不答;简历各 AI 步骤 输出契约(JSON 字段对齐下游表单)

    ④ 对话状态跟踪 · 状态变量 + 状态机(不重复问)

    内容
    问题没状态记录 → 聊到一半忘前面、反复问同样问题、流程卡死
    做法状态变量:订票=出发地/目的地/日期/人数/是否确认;档案=身份/范围/涉密/已查目录 · 状态机:当前态、必填/可选、已确认/待确认
    一句话多轮要 状态化、变量化,模型读状态干活,不靠「回忆」
    项目挂简历主路径 摸底→初稿→对齐→预览→导出 状态机(非开放聊天);国能保留 工号、时间窗 槽位;财税 意图分流(咨询 vs 查进度)

    §19 / §23 怎么分工

    讲什么
    §19指代消解 / Query 改写 怎么做(召回侧)
    §23记忆分层、Context Engineering(工作/会话/业务/长期)
    §24视频 四件套总纲(面试问「多轮怎么不烧钱」先背 30 秒 + 口诀

    口播示例(挂国能)

    「人事 Agent 不是开放域聊天:上下文用 最近几轮 + 摘要,槽位 JSON 存工号和时间窗;问「上个月编制」会先 改写补全部门和时间 再 NL2SQL;Prompt 角色+红线+引用格式 写死;流程上 FAQ→复杂问法→转人工 有状态,不会每轮从零猜。」

    常见追问

    • 和 FAQ 分流、RAG 啥关系?

    FAQ/RAG 是 降调用、降喂料 的工程手段,归在 ① 上下文管理③ Prompt 约束 里,不替代 ② 指代④ 状态机

    • C 端简历呢?

    主路径 表单 + 状态机(对齐 );F7 等多轮场景用 ① 窗口+摘要;OCR 超长 截断块4 #42)。


    必背25. 选错 Agent 还是 Workflow,项目直接翻车?(云尔-AI大模型果果)⭐

    抖音:[云尔-AI大模型果果 · Agent vs Workflow](https://v.douyin.com/nAQ10M3MQxw/) 块4 #24 · 块2 常见追问(为什么用 Dify 工作流) · 附4 #3 ReAct

    视频核心(一句话)

    很多项目翻车,不是模型不行,是 架构选型错了——该用 固定工作流 的硬上 开放 Agent,或该分步编排的却做成 一轮对话黑盒

    30 秒版(建议背)

    我先问三件事:路径是否固定、是否要调工具/查库、失败能不能审计

    • 路径固定、步骤可枚举Workflow(条件分支 + 工具节点),可预测、好评测、好合规。
    • 步骤不确定、要循环试工具Agent / ReAct 式多步(设最大步数、超时、人工兜底)。
    • 简单问答FAQ 或 RAG 链 就够,不必硬上 Agent

    国能里 制度 RAG 是固定链(检索→生成+引用);人事 NL2SQL 是工作流(FAQ 分流→意图→SQL 校验→只读库→总结);隐患JSON 输出 + 人工确认,不是开放聊天。财税 是 Coze 三路分支工作流,不是纯对话框。

    【口诀·Agent vs Workflow】不念给面试官 · 先口诀再扩绿条

    选型表(面试可画 orally)

    信号优先反面(易翻车)
    步骤固定、可画流程图Workflow + 分支一个 Agent 自由发挥
    强合规、要审计、央企 ToBWorkflow + HITL端到端黑盒对话
    多工具、路径随结果变Agent(限步数)无限循环聊天
    单意图 FAQ / 制度问答FAQ / RAG 链包装成「智能体平台」
    成本敏感、高频重复问FAQ 直答(不调大模型)每轮都走 LLM

    国能举例(各管一域,别混)

    • 制度:检索命中才答,固定 Workflow
    • 人事/燃料:NL2SQL 五层安全,前面 FAQ 降 Token 60%+
    • 隐患/缺陷结构化输出 + 状态推进,不是开放域 Agent
    • C 端简历主路径状态机(摸底→导出),不是聊天框一把梭

    常见追问

    • Dify 算 Agent 还是 Workflow?

    Dify 是 编排载体;我落地时是 工作流图 + 工具节点,产品上要自己定 哪段固定、哪段可分支,不是「挂上 Dify 就等于 Agent」。

    • 什么时候才上「真 Agent」?

    同一句用户话 可能触发 不同工具组合、且无法事先画死路径 时;仍要 最大步数、重复检测、转人工块4 #28)。

    • 选错 Workflow 会怎样?

    该 HITL 的没确认、该只读的没拦截、该 FAQ 的每轮烧 Token——指标上不去、合规过不了、成本爆,面试就说这是 产品架构问题,不甩锅模型。


    必背26. 多智能体 vs 单智能体,区别是什么?怎么选?(果果姐说AI · 26 春招模拟面)⭐

    抖音:[果果姐说AI(面试版)· 多智能体和单智能体的区别](https://v.douyin.com/mMAWpUj1Flc/) 块4 #30 · 附4 #8 多 Agent 协作 · 块2 6 款 Agent 各管一域

    视频核心(一句话)

    单智能体 = 一个入口解决 一个域 的一类任务;多智能体 = 路由/编排层 + 多个专精子 Agent,按意图分发。不是 Agent 越多越好

    30 秒版(建议背)

    单智能体适合:域清晰、权限一致、流程能画死——例如只做 制度 RAG,或只做 人事 NL2SQL。好处是 好调试、好评测、好追责

    多智能体适合:多个业务域、知识库不同、权限不同,需要 前台路由 再分发——我们国能是 6 个独立 Agent 各管一域(制度/人事/燃料/培训/隐患/缺陷),产品上是 多 Agent 矩阵,不是 一个超级 Agent 包打天下。若要做「总前台」,我会加 路由 Agent:只负责 意图识别 + 槽位 + 分发,子 Agent 只干本域;并定义 上下文交接字段、失败谁兜底、是否允许串调

    MVP 原则先单域单 Agent 跑通指标,再考虑多 Agent;.demo 堆五个 Agent 互相调用,面试能讲、上线难维护

    【口诀·多 vs 单】不念给面试官 · 先口诀再扩绿条

    对比表

    维度单智能体多智能体
    典型形态一个工作流解决一类任务路由 + N 个子 Agent
    优点简单、可观测、易回归域隔离、权限清晰、可扩展
    风险域变大后难维护调度复杂、成本叠加、调试难
    国能对应制度问答 Agent 单独一条链6 款 Agent 分域(非一个聊天入口)
    2026 简历/财税简历 主路径状态机;财税 三路分支未做跨 Agent 互调,故意控制复杂度

    口播示例

    「国能我不是做一个万能助手,而是 人事、燃料、制度……各一个 Agent,前面可以有 统一入口做路由,但 子 Agent 不互相乱调。这和抖音说的多智能体一致:拆分是为了专精和合规,不是为了炫技。」

    常见追问

    • 和 MCP、工具节点啥关系?

    多 Agent 常共用 同一套工具协议(MCP/HTTP);产品要先定 哪个 Agent 能调哪个工具,避免 越权块4 #26 MCP)。

    • 多 Agent 怎么评估?

    路由层 看意图准确率、误分发率;子 Agent 看域内任务成功率;整体 看转人工率、成本——不能只看某一个子 Agent 的准确率(附11 §8§20)。

    • 什么时候坚持单 Agent?

    试点期、域还没摸清、团队运维能力有限时——一个域一条工作流 + 黄金集,比五个 Agent 互聊更靠谱。


    附11块 3-1附3附12 有重复处 以块 1~4 为准附11 方便按抖音题目检索。



    补充区(时间充裕再背)

    3. AI 产品经理工作全流程(别准备漏了)

    你可以这样答(按阶段,口语)

    Discovery:访谈业务、看现有工单/咨询日志、定 1 个 MVP 场景 和指标。

    Design:工作流/Prompt/RAG/工具、权限与兜底、 黄金测试集 50 条

    Build:和算法后端联调;原型验证(我用 Dify/Coze/Cursor)。

    Evaluate:离线评测 + 业务抽检 + Bad Case 表。

    Launch:内测→试点→扩量;版本回退方案。

    Operate:监控 Token/成功率/转人工;每周复盘;知识库增量更新。

    我 6 个 Agent 和 2026 两个产品都走这套,不是只写 PRD 不落地。


    5. B 端 Agent 项目「真相」(别只讲 C 端聊天)

    💬 你可以这样答

    B 端 Agent 不是 开放域聊天,而是 限定域 + 强权限 + 可审计 + 可降级

    • :人事/燃料/制度/隐患,各做各的,前面有 路由
    • 权限:行级、只读库、SQL 拦截
    • 人机协同:隐患/派单 HITL,AI 不直接改生产数据
    • 成本:FAQ 吃高频,别什么都调大模型
    • 评测:业务 KPI + 错题本,不是 demo 好看

    C 端简历偏 体验、合规、商业化;B 端国能偏 安全、稳定——我会按岗位强调匹配的那一侧。


    6. AI 项目做到什么程度能写进简历?

    不是搭个 demo 聊天框就能写——要能讲清 场景、你的职责、指标、迭代、边界,最好 能经得住 15 分钟深挖(场景、职责、指标、一个 Bad Case、怎么迭代)。2025 年 5 月前不写 AI;写 结果数字 + 你负责的链路;一个项目 一条故事,别只堆名词。

    三档示例:国能 6 Agent 上线;简历 PRD+39 页+全模块后台+交接包;财税 Coze 工作流可演示 + 知识库 + HTTP 查进度


    8. 转行 AI 产品经理,简历项目经历怎么写?

    结构背景一句 + 你负责什么 + 结果数字 + 技术关键词各 1 个(RAG/NL2SQL/工作流/HITL)。

    避免:技能堆砌、把 ERP 写成 AI、没有指标。

    我的写法:国能 6 Agent 各 1 行;2026 简历 + 财税并行;2012~2025 数字化单独一段不写 LLM。

    马凯强-AI产品经理-修订版.md


    11. Vibe Coding 是什么?简历还可以这样写?

    面试答法:产品经理用 Cursor 等 AI 编程助手 快速搭 可点原型,验证交互、规则、文案;交付 PRD + dev-spec 验收标准不是替代研发写生产代码(鉴权、支付、性能、合规仍研发)。

    简历写法:写「用 Vibe Coding 完成 39 页可交互原型 + 运营后台 dev-spec」,别写「我会写代码取代后端」。现场考分 L1 概念 / L2 设计 / L3 深挖,不会的就 承认边界 + 讲怎么接到现有项目上


    13. 面了很多家 AI 产品岗的「秘密」(小蓝等博主)

    你可以这样答(转正面)

    大家背景不同,但 面试官真正听的是:有没有 落地项目、能不能 讲清边界和指标、概念题能否 接到你的场景

    所以我策略是 三个项目打深(国能 NL2SQL/RAG、财税客服、简历 0-1),概念题 接到这三个场景上答,不跟博主拼 背题数量。不会的就 先承认边界,再讲你会怎么设计


    14. Vibe Coding 大赏 / 到底是什么?(芜小匀等)

    30 秒:就是 产品经理用 AI 编程助手(我主要 Cursor)快速搭可点原型,验证交互、规则、文案,不是写生产后端。

    和「写代码」的区别:我交付 PRD + 原型 + dev-spec 验收标准;鉴权、支付、性能、合规 仍研发

    项目举例:简历优化 39 页 C 端 + B 端运营后台(Tab、列表、详情、接口专章)——Finder 双击就能演示给研发/老板。


    17. Vibe coding 爆火,AI 产品/解决方案面试考什么?(Mentor学姐)

    常考五块(口语)

    会不会用 AI 提效(原型、PRD、评测集整理)

    和研发边界清不清(什么你交付、什么必须工程化)

    能不能讲清复杂 AI 项目(SCQA · 块 3-1 总框架

    概念能否落到场景(RAG/意图/Token → 附12 举例)

    有没有评测意识(Bad Case、指标、不只看 demo)

    解决方案岗再加:客户场景怎么拆、PoC 范围、合规与私有化、和 Dify/Coze 选型理由(附3 §16)。


    附12 · AI 专业名词人话词典(是什么 → 干什么 → 哪项目 → 举例)

    用法:听到 FAQ、Chunk、ChatBI 等英文/缩写,先在这里 10 秒定位,再用 1~2 句项目例子 答面试官;深答、追问仍看 附3 对应节。 原则:每个词 先中文人话,再 挂钩国能 / 简历 / 财税 之一,禁止只背定义不举例子。

    速查表(考前扫一眼)

    名词一句话人话你项目里出现在哪
    FAQ高频问+标准答,本地匹配不调大模型国能·人事 FAQ 分流
    Chunk长文档 切成小块 再入库检索国能·制度 RAG 按章节切
    ChatBI开放域「说话查数做图」对比:我们做人事 限定域 NL2SQL
    RAG先查知识库再答,没查到不编制度问答、财税报价
    Top-K检索只取 最相关 K 段 进 Prompt制度 RAG 调 K 防噪音/漏召回
    Rerank(精排)粗召回后再 重新排序 挑最准的制度 Bad Case 跨章节漏召回
    向量检索 / Embedding文字变向量,语义相近 能搜到制度库、财税知识库
    混合检索关键词 + 向量 一起搜制度「第 3.2 条」+「请假」
    NL2SQL人话变 SQL 查表(我们 只读国能·人事「综合部多少人」
    意图识别判断用户 想干什么财税:进度 vs 咨询 vs 转人工
    槽位(Slot)意图里还缺的 关键信息财税:公司名、城市
    HITL人确认后 才执行/入库国能·隐患 Agent 审核入工单
    Token模型计费 单位(字≈token)FAQ 命中 ≈ 0;复杂问 ~4000
    Bad Case错题本,用来迭代人事别名错、制度漏召回、财税编价
    JSON Schema固定 JSON 格式 输出隐患:类别+部门+紧急度
    幻觉模型 编造 不存在的内容制度无检索不答;财税不编价
    OCR图片转文字简历·F2 传截图识简历
    Vibe CodingAI 助手 快速搭原型简历 39 页 + 后台 dev-spec
    React / Taro一套代码 出 H5+小程序;PM 定流程+验收块 6 · 前端栈 30 秒(浅问 · 不必背块4
    模型分档简单走便宜模型、复杂走标准简历 F2 分析 simple/standard
    增量入库制度更新 只加新段 不全库重跑国能·制度 RAG
    MCP工具 统一接口(Agent 调外部能力)概念对标 Dify 工具节点 / HTTP
    Context Window模型一次能 读多长长 JD 截断 + 分段摘要
    Agent / 工作流多步编排(路由→检索→生成→工具)国能 6 Agent;财税 Coze 三路分支

    一、检索与知识库(RAG 全家桶)

    FAQ(高频问答库 / FAQ 分流)

    • 是什么:把 每天被问很多遍 的问题做成「标准问 → 标准答」,用 关键词或规则本地匹配不调用大模型
    • 干什么省钱(几乎 0 Token)、更快更稳(答案固定不会编)。
    • 项目举例
    • 国能·人事:HR 常问「本月考勤怎么汇总」「年假还剩几天」→ 走 FAQ 本地库,命中直接返回答案;复杂编制、跨部门统计才走 NL2SQL + 大模型。整体 Token 降 60%+(简历/背诵口径)。
    • 对比财税:代账知识库 六大类 260 道标准 FAQ,但客服是 RAG 检索 + 严格引用 报价,不是简单关键词表——因为问法多样、必须带出处防编价。

    Chunk(切块 / 分片)

    • 是什么:把一份 很长的 PDF/制度 切成 很多小段(每段几百字),再分别做向量入库。
    • 干什么:检索时 只捞相关段,不会把整本制度塞进 Prompt;也避免「一段太长检索不准」。
    • 项目举例
    • 国能·制度 RAG:按 章节 切,每段约 200~500 字,相邻段 重叠 10%~20%(避免答案刚好卡在缝上漏掉)。
    • Bad Case:用户问「产假和年假能否一起休」——答案跨两章 → 调 chunk 大小 + 重叠 + 混合检索 + Rerank(见下)。

    RAG(检索增强生成 · Retrieval-Augmented Generation)

    • 是什么:用户提问 → 先去知识库搜 → 把搜到的片段塞进 Prompt → 大模型 只根据片段回答,并 标注引用
    • 干什么:用 私有、可更新 的知识(制度、代账报价),降低 幻觉,答案 可审计
    • 项目举例
    • 国能·制度:「研发岗年假几天?」→ 检索《考勤制度》3.2 节 → 回答 + 引用条款没检索到 → 明确说不知道,不编。
    • 财税·Coze 客服:「小规模纳税人代账多少钱?」→ 知识库检索报价表 → 无命中不报价,引导留资或转人工。

    Top-K

    • 是什么:检索时只取 相似度最高的 K 条 chunk 送给模型(如 K=3 或 K=5)。
    • 干什么:K 太大 → Prompt 噪音多、费 Token;K 太小 → 漏掉关键段。
    • 项目举例:制度 RAG 调 Top-K;跨章节 Bad Case 时 适当加大 K + Rerank,不是一味加 K。

    Rerank(精排 / 重排序)

    • 是什么:向量检索 先粗召回 一批候选 → 再用 精排模型 按「和问题的相关度」重新排序,取最准的几条。
    • 干什么:解决「语义像但答非所问」的 chunk 排在前面。
    • 项目举例:制度 召回率低 / 跨章节漏答 时,在混合检索后加 Rerank;评测看 引用命中率 + 准确率 95% 口径。

    向量检索 / Embedding

    • 是什么:把句子变成 一串数字(向量);问句和知识库段落 向量越近 = 语义越像
    • 干什么:用户问「请假流程」也能搜到标题写「休假管理办法」的段——不要求字面一样
    • 项目举例:制度库、培训题库、财税 260 道 FAQ 六大类 入库;问「记账一年多少钱」和库内「小规模代账年费」能 语义匹配

    混合检索(Hybrid Search)

    • 是什么关键词检索(BM25/ES)+ 向量检索 结果合并。
    • 干什么:编号、专有名词 关键词更准;口语化问法 向量更准
    • 项目举例:制度里用户问 「第 3.2 条」 → 关键词;问 「陪产假几天」 → 向量;两者 合并去重 再进 Prompt。

    增量入库

    • 是什么:制度/知识 更新时只新增或替换变更段,不全库删除重跑。
    • 干什么:更新快、旧问答不失效、运维可接受。
    • 项目举例:国能制度修订 → 只更新受影响章节 chunk;培训题库加新题 → 增量写入向量库。

    二、查数与分析(NL2SQL vs ChatBI)

    NL2SQL(自然语言转 SQL)

    • 是什么:用户说人话 → 系统生成 SQL 查数据库 → 返回表格/数字。
    • 干什么:业务人员 不用写 SQL 也能查报表。
    • 项目举例
    • 国能·人事:「综合部现在有多少人?」→ 生成 只读 SELECT → 走 别名表(「综合部」→ 标准部门 ID)→ 结果秒级返回;写操作一律拦截
    • 安全五层:只读库 · 表白名单 · SQL 语法拦截 · 行级权限 · 审计日志(块 3-2)。

    ChatBI(对话式 BI)

    • 是什么:偏 开放 的商业智能——自然语言 拖表、看趋势、多维度分析,常接 宽表/数仓
    • 干什么:分析师/老板 探索性看数;灵活但 权限和口径难控
    • 和咱们的区别(面试高频)

    「我们 不是 ChatBI,是 限定域 NL2SQL——只做人事域、固定指标口径、只读 + 行级权限,优先 准确和安全,不开放任意 JOIN。」

    别名表

    • 是什么:口语/简称 → 标准字段值 的映射表(「综合部」「综办」→ 同一 dept_id)。
    • 干什么:减少 NL2SQL 查错部门
    • 项目举例:人事 Bad Case「用户说综办,库里有综合部」→ 维护 别名表 + 低置信 澄清话术

    题 21~35

    三、Agent、意图与安全

    意图识别(Intent)

    • 是什么:判断用户 想办哪类事(查进度 / 问价格 / 投诉 / 闲聊)。
    • 干什么:后面 走不同分支(不同 Prompt、不同工具、是否转人工)。
    • 项目举例
    • 财税·Coze办进度 → HTTP 查工单;财税咨询 → RAG;说不清 → 澄清或转人工。
    • 国能·总路由:先分 人事 / 制度 / 燃料 / 隐患… 再进对应 Agent。

    HTTP 查单 / 接口查进度(口语可说「走业务系统查单」)

    • 是什么:用户问「办到哪一步了」时,Agent 不调大模型编进度,而是 调财务公司业务系统接口(Coze 里用 HTTP 插件),用 公司名等参数 查真实工单状态再回复。
    • 干什么:进度是 实时业务数据,必须 查库/查接口,和 RAG 查文档报价 是两条路。
    • 项目举例:财税「我的记账进度怎样?」→ 识别为 办进度 → 缺公司名先追问 → 齐了之后 HTTP 调 Finance_Taxation_Service 返回状态;失败 重试一次再转人工

    槽位(Slot)

    • 是什么:意图确定后,还缺的 关键参数(公司名、城市、订单号)。
    • 干什么:参数齐了才能 调接口或查库
    • 项目举例:财税「查进度」缺 公司名 → 多轮追问「请问是哪家公司?」;齐了之后才走 业务系统查单

    Agent / 工作流(Workflow)

    • 是什么多节点编排:路由 → 检索 → 生成 → 调工具 → 格式化输出;比「单次 Chat」可控。
    • 干什么:复杂业务 可审计、可降级、可插 HITL
    • 项目举例:国能 6 个 Agent 各管一域;财税 Coze 工作流 三路分支 + 知识库 + HTTP。

    HITL(Human-in-the-Loop · 人在回路)

    • 是什么:AI 产出 必须经人确认 才写入业务系统。
    • 干什么:高危场景 防误操作(派单、分类、审批)。
    • 项目举例国能·隐患 Agent——AI 输出 JSON(类别、责任部门、紧急程度)→ 安全员点确认 → 才生成工单;不是 AI 直接关阀/派单。

    JSON Schema

    • 是什么:规定模型输出 必须是哪种 JSON 结构(字段名、类型、枚举)。
    • 干什么:下游系统 稳定解析;评测 可自动比对
    • 项目举例:隐患 Agent 固定输出 { category, dept, urgency, evidence };解析失败 → 重试或转人工。

    MCP(Model Context Protocol · 了解即可)

    • 是什么:给 AI 接工具(查库、HTTP、文件)的 统一协议/接口规范
    • 干什么:换模型/换平台时 工具不用重写一遍
    • 项目举例(口语):Dify 的 工具节点 / HTTP 请求、Coze 的 插件——都是「Agent 调外部能力」;MCP 是行业在推的标准化说法,面试说清你用过 HTTP/工具节点即可

    四、成本、质量与评测

    Token

    • 是什么:大模型读写的 计费单位(中文约 1~2 字 / token,英文约 4 字符 / token,视模型而定)。
    • 干什么:控制 成本上下文长度
    • 项目举例:人事 FAQ 命中 ≈ 0 tokens;复杂 NL2SQL 一问一答约 ~4000 tokens → 所以 FAQ 分流 + 缓存高频问块 4 第 41 题附3 §9)。

    幻觉(Hallucination)

    • 是什么:模型 编造 库裡没有的规定、价格、数据。
    • 干什么:产品要想 约束策略,不能单靠「Prompt 里写别编」。
    • 项目举例:制度 无检索不答;财税 无报价出处不报价;人事 SQL 结果必须来自只读库

    Bad Case(错题本)

    • 是什么:线上/评测 答错的典型样例 存档(问、期望答、实际答、根因分类)。
    • 干什么:迭代 Prompt / 检索 / 知识库 / 别名表 的输入,不是凭感觉改。
    • 项目举例:人事 别名错;制度 跨章漏召回;财税 编造价格 → 各建分类,每周复盘。

    Golden Set(黄金测试集)

    • 是什么:上线前定好的 50~100 条标准问答/任务,含 输入、期望输出、验收规则(可人工判,也可自动比对 JSON/SQL)。
    • 干什么:每次改 Prompt/检索/知识库后 同一批回归,看指标掉没掉;是 离线评测 的核心资产。
    • 项目举例:制度 RAG 50 条(含跨章、边界、拒答);人事 NL2SQL 别名+口径题;财税 编价=0 容忍 专类;简历 防编造经历 子集。

    Eval Harness(评测脚手架 / 评测 Harness)

    • 是什么:把 黄金集 + 调用链路 + 打分规则 + 报告 打包成 可重复跑 的评测流水线(行业常叫 eval harness / evaluation harness)。
    • 干什么:改一版 Prompt 就 一键批量跑测,不用手工逐条问;对标 LangSmith Evals、Ragas、自建脚本均可。
    • 项目举例(诚实映射):国能/财税 没有单独采购 harness 平台名,但实践等价于 黄金集 + Dify/Coze 批量跑 + Excel/错题本 + 每周回归;简历 PRD 写了 ⑥ 评测块 + Bad Case 专章。面试可说「思路齐 harness,工程上是黄金集+回归流水线」→ 详 附13 · M3

    LLM-as-Judge(模型当裁判)

    • 是什么:用 另一个 LLM 按 rubric 给回答打 相关性/忠实度/安全 分,辅助人工。
    • 干什么:黄金集太大时 降人工成本;须和 人工抽检 对齐,不能 100% 信 judge。
    • 项目举例:制度 RAG 可 judge 「是否引用原文、是否编造条款」;关键合规场景仍以 人工+规则 为准。

    Offline Eval vs Online Eval(离线 vs 线上)

    • 是什么离线 = 发版前对黄金集批量测;线上 = 上线后看真实日志、满意度、转人工率。
    • 干什么:离线 防退化;线上 发现长尾;两者 错题本并表
    • 项目举例:离线 Recall/成功率;线上 咨询降 70%、编价 Bad Case=0

    模型分档(Router / 大小模型)

    • 是什么:简单任务走 便宜/快的小模型,复杂任务走 标准/大模型
    • 干什么降 Token 成本、降延迟。
    • 项目举例:简历 F2 简历分析——短简历/简单场景 simple,长简历/多段经历 standard(PRD 口径)。

    五、2026 独立项目专用

    OCR(光学字符识别)

    • 是什么图片/PDF 截图 → 提取文字
    • 干什么:用户 拍照上传简历/JD,不用手打。
    • 项目举例:简历小程序 F2 摸底——上传 Boss/微信截图 → OCR → 再进分析;上传前压缩 省带宽(mkq 规则)。

    Vibe Coding

    • 是什么:用 Cursor 等 AI 编程助手 快速写 可交互 HTML/原型,验证 PRD。
    • 干什么对齐研发前 就把流程、文案、校验、dev-spec 跑通
    • 项目举例39 页 C 端 + B-Admin 运营后台(列表 Tab、详情、⑥ 接口专章)——附3 §10附11 §14§15§16§17

    Context Window(上下文窗口)

    • 是什么:模型 一次最多能读多少 Token(输入+输出总和上限)。
    • 干什么:超长简历/JD 要 截断、摘要、分段处理,不能整篇硬塞。
    • 项目举例:简历/JD 2 万字截断 + Toast;对话 只带最近 N 轮 + 检索段

    六、平台与工程口语(块 1 自我介绍常问)

    Dify(AI 工作流编排平台)

    • 是什么可视化搭 Agent / RAG / 工具节点的 低代码平台(国能 内网部署)。
    • 干什么:产品和研发能 拆节点、改 Prompt、接评测,比「纯聊天框 + 自研前后端」迭代更快
    • 项目举例:国能 6 款集团级 Agent 全在 Dify 上编排;块 1 追问「为什么不做一个对话框」→ 答 流程、权限、审计、Bad Case

    Prompt(提示词 / Prompt 工程)

    • 是什么:写给大模型的 角色、任务、约束、输出格式 等指令文本。
    • 干什么:控 幻觉、格式、语气;配合 版本管理 + Bad Case 迭代。
    • 项目举例:国能制度 无检索不答 写进 Prompt;财税 无检索不报价块 4 第 36~37 题 深答结构。

    Coze(扣子 · 客服 Bot 平台)

    • 是什么:字节系 Bot + 工作流 平台,上手快,适合 意图分流 + RAG + HTTP 工具
    • 干什么:独立验证 财税客服 三类分支(咨询 / 查单 / 兜底),不必从零写前后端。
    • 项目举例财宝 客服 · Finance_Taxation_Service 工作流;对比国能用 Dify 是因 内网与深度编排 要求更高。

    LLM(大语言模型 · Large Language Model)

    • 是什么:能 读长文本、生成人话 的基座模型(通义、GPT 等)。
    • 干什么:Agent 里的 理解、分类、生成 引擎;不是 唯一组件——还要 检索、工具、规则、人审
    • 项目举例2025.05 起 自我介绍才讲 LLM/Agent;FAQ 命中可 不调 LLM(≈0 Token)。

    附12 · 面试口播模板(万能三句)

    1. 「XXX 就是……(人话)」
    2. 「在我们项目里用来……(干什么)」
    3. 「举个例子:在 国能/简历/财税 里,用户…… → 系统…… → 结果……」

    例:「Chunk 就是把长制度切成小段再入库;我们制度 RAG 按章切 200~500 字;比如用户问陪产假,检索只捞《休假管理办法》相关段,不会把整本 PDF 塞给模型。」


    附12附3 分工:附12 = 快查 + 举例附3 = 被点名后的长答 + 追问


    文档版本:2026-06 · 口语版 v5.8 · §24 对齐抖音原文(上下文·指代·结构化Prompt·状态机)· 附11 §18§19§20§21§22§23§24 · §14§15§16§17 · 财税客服