ZYL / AI

ZHANG YULONG / PORTFOLIO 2026

张禹龙.

AI 产品 · 应用心理 · 智能体实践

理解人的行为,设计 AI 的回应。
从用户研究到产品落地,用评测验证真实效果。

01 / ABOUT ME

从理解人开始,
把 AI 做进真实场景。

我是张禹龙。应用心理的学习让我关注人的行为与决策,两段 AI 产品实习让我把这种理解带进业务:从访谈中发现问题,在流程中设计机制,再用评测验证效果。

我的实践围绕知识问答、动态追问、能力评估与情境训练展开。关注的不只是模型能回答什么,也包括它何时该追问、何时该停下,以及怎样证明方案有效。

用户研究产品与对话设计Prompt / RAG数据评测与迭代

02 / SELECTED WORK

把问题,
做成产品.

四个项目。
从研究、设计,到验证。

01

知识问答 / 智联招聘

测评搭子

让分散的业务知识,
成为随时可用的回答。

面向业务知识获取场景,完成方案选型、知识库建设、回答边界与 Web 功能设计;通过钉钉群机器人与工作台覆盖全国业务线产品经理。

RAG · 方案选型 · 知识库建设

96.7%

回答准确率

84.3%

问题解决率

PRODUCT LOGIC / 产品机制

不是让模型多回答,
而是让回答有依据、有边界。

01 / 知识输入
先把文档变成知识

去重与分类标注
智能分段
召回数量与相似度阈值调优

02 / 方案选型
在业务约束下做选择

对比 Dify、RAGFlow、阿里云百炼
使用 RAGAS 语义相关性评测
选定百炼 + AppFlow

03 / 用户触达
进入实际工作场景

Web 知识问答与历史对话
未答问题归集
钉钉群机器人与工作台

三种需要收住的回答

回答规则与异常边界

问题模糊时,先澄清

配置模糊追问规则,避免在问题信息不充分时直接给出答案。

涉及报价时,按规则拒答

为报价类问题配置拒答规则,明确助手不应直接回答的业务边界。

没有依据时,转人工

知识库无法提供依据时转人工,同时归集未答问题,为后续知识补充提供输入。

我的工作

主导助手搭建,开展方案对比、文档处理、问答规则与 Web 功能设计。

补充成效:满意度 4.6/5 · 首 Token 响应 2.4 秒
02

对话交互 / 智联招聘

AI 易面 4.0

让每一次追问,
都更接近有效信息。

基于回答相关性与信息完整度设计动态追问,完善沉默、转写异常等分支,设置轮次上限与重复拦截,并通过 30+ 测试用例回归验证。

多轮对话 · Prompt · 异常分支

93.3%

核心场景测试通过率

≈35%

重复、无效追问占比下降

CONVERSATION DESIGN / 对话机制

追问的关键,
是知道什么时候继续、什么时候停止。

候选人作答
相关性 × 信息完整度

围绕候选人的具体经历,判断是否需要进一步获取信息。

继续深入
动态追问

依据回答质量触发追问,通过 Prompt 引导生成差异化问题。

处理异常
异常分支

覆盖答非所问、沉默超时与转写异常,完善对话流程。

控制边界
轮次与重复拦截

设置追问轮次上限,拦截重复追问,减少无效对话。

查看评测如何验证这套机制
测试输入30+ 用例

多轮回归验证核心场景与异常分支。

核心场景通过率76.7% → 93.3%

重复、无效追问占比下降约 35%。

上述通过率是核心场景测试结果,不代表候选人能力评估或招聘决策的准确率。

我的工作

设计追问流程、触发条件、异常分支与 Prompt,结合测试用例推进回归验证。

03

能力评估 / 北京心视野

教师 SJT

把专家经验,
转化为可验证的评分规则。

从 20 名教师深度访谈出发,协同专家开发情境题,将评分标准拆解为维度、行为等级与证据;基于 1,000 条语音回答验证双 LLM 评分工作流。

用户研究 · 评分规则 · 双 LLM 工作流

88%

与专家评分等级一致率

<1分钟

单条评分耗时(原 6 分钟)

RESEARCH TO RUBRIC / 从研究到评分

让专家判断,
成为模型能执行、团队能复核的规则。

20名教师
深度访谈与编码

覆盖不同职称与学科,提取关键能力表现,协同专家将真实事件转化为 SJT 情境题。

评分规则结构化
考察维度行为等级评分证据

把专家经验拆解为明确的考察对象、行为水平与判断依据。

语音作答FunASR 转写Dify / 双 LLM 节点维度评分结果复核
查看评分验证与效率结果
1,000条语音回答测试集
88%与专家评分等级一致率
≤20%人工复核

单条评分耗时从 6 分钟缩短至 1 分钟内。88% 指评分等级一致率。

我的工作

访谈与需求提取、情境题协同开发、专家标准结构化,以及评分工作流搭建与验证。

04

情境训练 / 北京心视野

困难反馈训练

在真实沟通之前,
先有一个练习的地方。

为新任管理者设计模拟、评价、专项练习与陌生案例迁移的两周训练流程;配置 AI 员工角色、情绪与对话边界,搭建语音训练工作流并完成首期内测。

角色策略 · 行为评价 · 训练闭环

5套

可复用情境模板及评价规则

4维度

三级行为评价规则

SIMULATION & TRANSFER / 模拟与迁移

让 AI 不只是陪聊,
而是成为有规则的训练对手。

01 / 模拟
先进入真实情境

通过语音与 AI 员工交流,围绕困难反馈完成一次模拟。

02 / 专项练习
针对薄弱行为练习

将行为评价与反馈转化为练习推荐,聚焦需要改进的环节。

03 / 迁移
换一个陌生案例

在新的情境中继续应用所练习的方法,形成两周训练流程。

AI 员工怎样被定义
  • 事件事实与隐藏信息
  • 员工异议与反应规则
  • 角色边界、情绪状态与对话推进逻辑
  • 受控 RAG 限定权限
反馈评价看什么
事实表达倾听追问异议回应行动共识

四维度 × 三级行为评价规则

查看交付阶段与成果

基于 Dify 搭建语音交互、行为评价、反馈生成与练习推荐链路;完成首期场景内测,沉淀 5 套可复用情境模板及评价规则。

此处展示首期内测与方案沉淀成果,现有简历未提供训练效果提升数据。

我的工作

设计训练机制、AI 员工情境要素与评价规则,搭建工作流并完成首期场景内测。

成果依据个人简历。各项指标的适用场景、测试口径与限制见项目案例。

03 / HOW I WORK

让判断有依据,
让设计有回应。

01 / RESEARCH

先找到问题

通过深度访谈、编码与需求提取,把真实场景中的行为和困难变成产品输入。

实践:20 名教师深度访谈
02 / DESIGN

再设计机制

把对话、规则、角色与异常分支组织成完整流程,明确 AI 的能力和回答边界。

实践:动态追问与情境训练
03 / VALIDATE

用证据迭代

用 Python、RAGAS、专家规则、测试用例与 Bad Case,判断方案的效果与局限。

实践:1,000 条语音回答测试集

04 / EXPERIENCE

走过的路,
也是我的方法。

实习与教育经历

实习 / PRACTICE

智联招聘

AI 产品实习生

智能问答助手方案选型、知识库与功能设计;智能面试动态追问机制与评测迭代。

北京心视野科技有限公司

AI 产品实习生

教师胜任力评估中的用户研究与 AI 评分方案;管理者情境训练机制与工作流搭建。

教育 / EDUCATION

北京师范大学

应用心理 · 硕士在读

相关课程:Python 机器学习与心理学大数据、研究设计与数据分析。

齐鲁工业大学

轻化工程 · 本科

学业奖学金一等奖 · 实践奖学金一等奖

05 / WHAT’S NEXT

下一个真实问题,
期待一起解决.

欢迎交流 AI 产品机会。

下载简历 ↓

PROJECT CASE STUDY