ZYL / AI

ZHANG YULONG / PORTFOLIO 2026

张禹龙.

AI 产品 · 应用心理 · 智能体实践

理解人的行为,设计 AI 的回应。
从用户研究到产品落地,用评测验证真实效果。

01 / ABOUT ME

从理解人开始,
把 AI 做进真实场景。

我是张禹龙。应用心理的学习让我关注人的行为与决策,两段 AI 产品实习让我把这种理解带进业务:从访谈中发现问题,在流程中设计机制,再用评测验证效果。

我的实践围绕知识问答、动态追问、能力评估与情境训练展开。关注的不只是模型能回答什么,也包括它何时该追问、何时该停下,以及怎样证明方案有效。

用户研究产品与对话设计Prompt / RAG数据评测与迭代

02 / SELECTED WORK

把问题,
做成产品.

四个项目。
从研究、设计,到验证。

01

知识问答 / 智联招聘

测评搭子

让分散的业务知识,
成为随时可用的回答。

面向销售、项目经理与新员工的内部辅助问答。参与平台选型、知识治理、回答规则和网页方案,连接钉钉机器人与工作台的使用及反馈闭环。

RAG · 方案选型 · 知识库建设

96.7%

标准问题正确处理率 · 145/150

84.3%

内部试用问题解决率 · 118/140

PRODUCT LOGIC / 产品机制

有依据就答,
缺信息先问,超出边界交给人。

01 / 知识输入
先把文档变成知识

去重与分类标注
智能分段
召回数量与相似度阈值调优

02 / 方案选型
在业务约束下做选择

比较解析、检索、接入与维护成本
RAGAS 六题小样本语义比较
综合约束选定百炼 + AppFlow

03 / 用户触达
进入实际工作场景

Web 知识问答与历史对话
未答问题归集
钉钉群机器人与工作台

三种需要收住的回答

回答规则与异常边界

问题模糊时,先澄清

例如“通用能力测验怎么做”:线上与线下版本的流程不同,缺少版本信息时先问清;用户已明确版本时避免重复追问。此处为机制说明示例。

涉及报价时,按规则拒答

为报价类问题配置拒答规则,明确助手不应直接回答的业务边界。

没有依据时,转人工

知识库无法提供依据时转人工,同时归集未答问题,为后续知识补充提供输入。

我的工作

参与需求与场景梳理、平台比较、知识库治理、回答规则配置及评测推动;工程接口与系统运维由团队承担。

正确处理包含作答、澄清、拒答与转人工;内部试用剩余 22 条仍需人工或补充知识。

关键产品判断 / 01

选型不是模型排行榜

六题 RAGAS 比较提供局部参考,最终还要看文档解析、钉钉/网页接入、维护成本与安全约束。

设计取舍

反馈不是一个点赞按钮

把 Bad Case 分为资料缺失、版本冲突、切片/召回、生成越界和交互歧义,再对应知识更新或规则修改。

交付物需求与页面方案 · 知识分类与问答规则 · 评测样本与 Bad Case

02

对话交互 / 智联招聘

AI 易面 4.0

让每一次追问,
都更接近有效信息。

聚焦既有面试平台的实时追问迭代:判断是否听清、是否相关、行为证据是否充分,在单题时间内补足信息。整理 30 余条正常/异常用例与 20 余条 Bad Case。

多轮对话 · Prompt · 异常分支

93.3%

核心场景测试通过率

35%

重复或无效追问相对下降 · 20/100→13/100

CONVERSATION DESIGN / 对话机制

追问的关键,
是知道什么时候继续、什么时候停止。

候选人作答
听清 → 相关 → 证据 → 继续价值

短答也可能证据充分,长答也可能只有观点;结合题目目标、已问问题、剩余时间和轮次决定下一步。

继续深入
动态追问

依据回答质量触发追问,通过 Prompt 引导生成差异化问题。

处理异常
异常分支

覆盖答非所问、沉默超时与转写异常,完善对话流程。

控制边界
轮次与重复拦截

设置追问轮次上限,拦截重复追问,减少无效对话。

查看评测如何验证这套机制
测试输入23/30 → 28/30

30 条核心场景用例的通过数;另整理正常/异常用例与 Bad Case。

核心场景通过率76.7% → 93.3%

重复或无效追问从 20/100 降至 13/100:相对下降 35%,绝对下降 7 个百分点。

上述通过率是核心场景测试结果,不代表候选人能力评估或招聘决策的准确率。

我的工作

参与追问条件、Prompt 与输出约束设计;整理用例、归因 Bad Case,并协同算法和研发迭代触发与退出逻辑。

关键产品判断 / 02

追问补的是证据,不是字数

典型测试:候选人讲了行动却没说结果,追问结果;答案充分且时间将尽,结束本题。

设计取舍

先确认输入,再判断能力

噪声、沉默与 ASR 错转先进入异常处理;避免把设备或语音问题解释为能力不足。

交付物追问与退出规则 · 30 余条用例 · 20 余条 Bad Case · 回归结论

03

能力评估 / 教育局合作项目

教师 SJT

把专家经验,
转化为可验证的评分规则。

作为 AI 评分方向项目成员,将专家定稿的四级行为锚点转译为辅助评分规则。参与教师访谈与编码,用 Python、FunASR 和 Dify 搭建原型,完成约 1,000 条正式回答批量运行与交接。

用户研究 · 评分规则 · 双 LLM 工作流

88.3%

候选等级与参考等级一致 · 53/60

<1分钟

单条初评分环节(原约 6 分钟)

RESEARCH TO RUBRIC / 从研究到评分

让专家判断,
成为模型能执行、团队能复核的规则。

8名左右 · 本人访谈
从原始材料提取行为

团队共访谈 20 名教师;本人访谈约 8 名,完成 8 份材料一级编码,参与主题归并和题目修订。维度、5 道题及四级锚点由专家与项目组确定。

评分规则结构化
考察维度行为等级评分证据

将已定稿规则结构化,要求候选等级对应原文行为证据;不以回答长短、流利程度或口音代替能力判断。

语音作答FunASR 转写与语义质检Dify / 双 LLM 节点候选等级 + 原话证据专家复核裁定
查看评分验证与效率结果
约 1,000条正式回答批量运行
53/60候选等级完全一致 · 88.3%
11/60进入人工复核 · 18.3%

60 条效果评测与约 1,000 条正式运行规模分开统计。约 6 分钟→1 分钟内仅指形成候选等级和依据的初评分环节,不包含转写、重试、复核与专家裁定。

我的工作

访谈与一级编码、专家规则转译、辅助评分原型、Bad Case 分析、正式回答批量运行、POC 说明及工具交接。专家保留最终专业裁定。

关键产品判断 / 03

先检查语义,再让模型给分

典型测试:否定词错转会改变评分对象,需回听核对关键语义;严格的评分 Prompt 无法补救错误输入。

设计取舍

等级必须有原话证据

冲突行为、等级边界或无依据结果进入复核;AI 给出候选结果,专家保留最终裁定。

交付物8 份访谈编码 · 专家规则转译 · 评分原型 · 批量脚本与 POC 交接

04

情境训练 / 北京心视野

困难反馈训练

在真实沟通之前,
先有一个练习的地方。

首期聚焦“员工工作表现未达预期”。参与情境结构、AI 员工角色规则、四维三级评价与反馈机制设计,把语音模拟、专项练习和陌生案例观察连接成两周训练路径。

角色策略 · 行为评价 · 训练闭环

83.3%

试用训练完成率 · 20/24

85%

四维评价原话证据可核对 · 17/20 份报告

SIMULATION & TRANSFER / 模拟与迁移

让 AI 不只是陪聊,
而是成为有规则的训练对手。

01 / 模拟
先进入真实情境

通过语音与 AI 员工交流,围绕困难反馈完成一次模拟。

02 / 专项练习
针对薄弱行为练习

将行为评价与反馈转化为练习推荐,聚焦需要改进的环节。

03 / 迁移
换一个陌生案例

在新的情境中继续应用所练习的方法,形成两周训练流程。

AI 员工怎样被定义
  • 事件事实与隐藏信息
  • 员工异议与反应规则
  • 角色边界、情绪状态与对话推进逻辑
  • 按提问逐步披露信息,避免过早妥协或跳出角色
反馈评价看什么
事实表达倾听追问异议回应行动共识

四维度 × 三级行为评价。评分使用固定规则;受控 RAG 用于反馈解释、课程与练习推荐。

查看试用结果与陌生案例观察

24 名试用者中 20 人完成一次训练(83.3%);20 份完整报告中 17 份的四维评价具有可核对原话证据(85.0%)。陌生案例合格人数从训练前 8/20(40%)变为两周后 14/20(70%)。

陌生案例前后变化是观察到的迁移迹象,不能单独证明训练的因果效果或长期迁移。

我的工作

参与场景收敛、角色规则、Dify Prompt、四维评价及 AI 效果测试;语音接口、账号、平台集成和稳定性由研发或技术供应商承担。

关键产品判断 / 04

评分固定,反馈结合知识

评分按固定行为标准执行;RAG 为改进建议补充企业课程和规范,避免召回波动改变评价尺度。

设计取舍

练习话术之外,还要换场景

以内容不同的陌生案例观察行为变化;熟悉案例得分上升不能单独代表迁移。

交付物情境模板与角色规则 · 四维三级规范 · Prompt 与知识边界 · 测试结论

依据本人提供的项目梳理与简历整理。指标保留样本量及适用范围;示意流程与测试情境不代表实际产品截图或真实事故。

03 / HOW I WORK

让判断有依据,
让设计有回应。

01 / RESEARCH

先找到问题

通过深度访谈、编码与需求提取,把真实场景中的行为和困难变成产品输入。

实践:本人访谈约 8 名教师、8 份材料一级编码
02 / DESIGN

再设计机制

把对话、规则、角色与异常分支组织成完整流程,明确 AI 的能力和回答边界。

实践:动态追问与情境训练
03 / VALIDATE

用证据迭代

用 Python、RAGAS、专家规则、测试用例与 Bad Case,判断方案的效果与局限。

实践:60 条效果评测、约 1,000 条正式回答运行

04 / EXPERIENCE

走过的路,
也是我的方法。

实习与教育经历

实习 / PRACTICE

智联招聘

AI 产品实习生

智能问答助手方案选型、知识库与功能设计;智能面试动态追问机制与评测迭代。

北京心视野科技有限公司

AI 产品实习生

教师胜任力评估中的用户研究与 AI 评分方案;管理者情境训练机制与工作流搭建。

教育 / EDUCATION

北京师范大学

应用心理 · 硕士在读

相关课程:Python 机器学习与心理学大数据、研究设计与数据分析。

齐鲁工业大学

轻化工程 · 本科

学业奖学金一等奖 · 实践奖学金一等奖

05 / WHAT’S NEXT

下一个真实问题,
期待一起解决.

欢迎交流 AI 产品机会。

下载简历 ↓

PROJECT CASE STUDY