曾岩的动漫自画像
曾岩 / ZENG YAN Biological Sciences, 2023-2027
ABOUT / CURRENT FILE 曾岩

ZENG YAN

Building AI products, studying how people use them, and documenting what changes along the way.

做 AI 产品,也研究人与 AI 如何一起生活、使用与变化。

中央民族大学生物科学本科生,正在转向生成式 AI 产品、模型评测、用户研究、数据分析与 AI 技术治理。长期追踪主流模型与产品,关注语气、行为、体验和平台规则怎样改变真实用户的选择。

AI 产品实习 · 已结束
一段围绕掌机用户支持的 AI Support Agent 实战:PRD/POC、FAQ 知识库、回归盲测与 failure analysis。点开看实习小目录 ↓

OPEN FILES
  • 稳稳糖/
  • 英语听力台/
  • 数据增长/
  • 技能/
  • 用户语料研究/
  • 模型评测/
稳稳糖首页界面缩略图
稳稳糖 / preview
虾滑听力台工作区缩略图
虾滑听力台 / preview
CURRENTLY BUILDING: BETTER AI PRODUCT JUDGMENT

still learning, still building.

LOCAL ARCHIVE SEP 2026 STATUS: MAKING THINGS
WORK EXPERIENCEAI PRODUCT INTERN
深圳 · 2026.07 初 – 09 底

深圳市驰晶科技有限公司

AI 产品实习生 · Retroid 掌机用户支持方向

围绕 Retroid 掌机用户支持场景,结合客服流程、公开社区反馈与 Steam Deck / Odin / Anbernic 竞品调研,拆解系统设置、模拟器、硬件与售后等核心场景,把零散的人工客服经验变成一个可路由、可引用、可升级的 AI Support Agent。

  • PRD 与 POC:输出 Support Agent PRD、用户流程与人工升级规则;整理 200+ 条 FAQ / 指南 / 社区问题建知识库,搭检索 + 规则路由 POC,实现问题分类、来源引用、拒答与人工转接。
  • 评测迭代:构建 80+ 条回归 / 盲测案例,围绕分类、来源命中、风险识别与人工升级做 failure analysis,三轮迭代把独立测试集综合通过率 72% → 86%。
  • 产品化:分析 100+ 条用户反馈定位高频摩擦,提出新手引导、教程结构与自助排障优化;设计 CRM / 订单 / 工单接入方案与权限、异常回退逻辑。
三轮迭代通过率
72% → 86%
典型工单

"开机卡在 LOGO,刷了系统还是没反应"

→ AI 先问型号 / 系统版本 → 命中排障条目 → 给自助步骤,未解决自动转人工
PROJECT 03USER RESEARCH
MULTILINGUAL AI USER RESEARCH · 2026

多语种 AI 产品变更用户反馈语料库

项目发起人 / 产品研究负责人Python · pandas · LLM API · Agent 工作流 · 多语言 Embeddings · 向量数据库 · RAG · 聚类 · 人类评测

  • 从真实 AI 产品迭代后的跨语言用户反馈出发,设计隐私优先的数据管线:处理 5,232 条公开社媒来源记录,通过跨来源身份匹配、精确文本及 SimHash / Jaccard 近似去重形成 4,582 条可追溯主记录,并筛出 3,875 条研究候选,分离匿名分析、私有全文与审计视图。
  • 设计研究助理 Agent 与 Workflow,将人工 Codebook 固化为 Theme / Claim / Narrative / Evidence / Action 等多维编码 Schema;逐帖独立调用、固定 Prompt、带证据句与主题强度置信度、支持续跑与人工审核,支撑大规模结构化质性编码。
  • 对完整帖子、语义 chunk 与标准化研究摘要分别生成多语种 embeddings 写入向量数据库;结合主题、时间、语言、叙事阶段等元数据过滤做混合检索,支撑相似案例召回、跨语言语义检索与基于原始证据的 RAG 问答。
  • 建立 human-in-the-loop 评测与质控链路:基于 180 条人工盲标样本比较规则、LLM 与混合方案,通过低置信、无主题、未知聚类、过度编码等异常样本定位系统性错误,迭代 Codebook 与 Prompt。
5,232原始记录
4,582去重后记录
3,875研究语料
4.218M总字符数
66人工复核修正
可审计语料库流水线系统图:5,232 输入,经规范化、去重、分类、人工复核与评分,66 次人工覆盖
DATA PIPELINE / V0.4
研究笔记:字段完整不代表上下文完整,引用完整性审计与单独检索队列决策
RESEARCH NOTE / FINDING 02
脱敏后的语料索引表示例,仅展示合成行,无句柄、无网址、无帖子文本
ANONYMIZED CORPUS SAMPLE
3,875 条语料解读前的构成与长度分布图
RESEARCH VISUALIZATION
PROJECT 01 HEALTH PRODUCT
PERSONAL + FAMILY METABOLIC HEALTH

稳稳糖

Personal & Family Metabolic Health App个人与家庭代谢健康管理 App

陪个人与家庭记录血糖、饮食、运动、睡眠、月经、压力与用药的代谢健康 App:从中文表达、单位换算与家庭代际共用出发,重构记录—理解—行动的闭环;AI 只在用户自选数据范围内做趋势分析与建议,健康档案本地存储、隐私可控。

MY ROLE 我的角色
Product Definition / User Flow / AI Governance / Validation
PRODUCT DECISIONS 关键设计
十类多维记录、AI 趋势对话与可验证小行动建议;数据按时间与类型勾选授权,敏感信息不上传;多成员隔离、本地优先。
145 / 145回归测试全通过
10多维记录类型
0静态分析错误
稳稳糖核心流程:首页、血糖趋势、记录一笔、饮食记录、运动记录
CORE FLOWS · 首页 / 趋势 / 记录
稳稳糖 AI 对话、数据授权、健康档案与身体指标记录
AI & PRIVACY · 对话 / 授权 / 档案
OPEN CASE FILE 稳稳糖 · 完整 executive summary
EXECUTIVE SUMMARY / AI PRODUCT

稳稳糖

把一个开源血糖记录 App,重构为面向中国用户与家庭的代谢健康管理工具:从只记血糖,扩展到血糖、饮食、运动、睡眠、月经、压力、身体指标、用药、化验的多维记录与 AI 趋势分析。

145/145项自动化测试通过
10多维记录类型
0静态分析错误/警告
P0–P4需求路线图
PROBLEM
只记一个血糖数字,撑不起长期自我管理

单一看板无法解释血糖为什么高——饮食、运动、睡眠、压力、用药都会影响;而健康数据又敏感,用户不敢随便交给 AI。

SOLUTION
多维记录 + 用户自选授权的 AI 分析

首页一屏看完血糖/饮食/运动/睡眠,"记录一笔"覆盖十类日常;AI 对话只读取用户勾选的时间范围与数据类型,输出趋势、可能关联与"可验证的小行动建议",并给出何时该就医的边界。

PROJECTAI AGENT · 独立项目
对抗测试 · 4 类风险场景

澄初 · AI 零售导购 Agent

面向个人护理零售场景的多轮导购 Agent

  • 独立设计并部署 AI 导购 Agent,把自然语言需求转成产品筛选、预算核验、政策判断与安全边界控制,支持多轮会话与 Web 端交互。
  • 把价格、适用条件、香味、预算与政策结构化为业务规则;用确定性 price_check 工具处理 SKU 与组合总价,压掉大模型算价幻觉。
  • 针对预算冲突、假 VIP 折扣、索要赠品、不适状态强推酸类做对抗测试,修掉提示词注入、记忆污染、跨 SKU 串用与多轮约束丢失;确立"已验证业务事实 > 用户陈述"。
OPEN DEMO 打开澄初 ↗ 和金牌导购聊聊~
澄初首页:护理不必从被说服开始 澄初 AI 金牌导购对话,拒绝虚假 VIP 折扣
PROJECT 04 / LAB NOTE

Multi-model Behavior Evaluation

多模型行为与体验差异研究

495 RUNS · RESULTS

面向 GLM / Kimi / DeepSeek 做端到端选型评测:覆盖基础、稳定性与鲁棒性共 495 次模型执行,按内容、格式、截断、API 错误分层归因,用 Wilson 置信区间和 McNemar 检验代替单一拍脑袋正确率。

FOCUS 评测维度
知识正确性 / 指令遵循 / 鲁棒性 / 稳定性 / p50·p95 延迟 / 接口质量
KEY RESULT 结论
DeepSeek 综合 64.2% 居首;GLM 经扩展预算恢复后 58.2%→63.6%;API 错误率 0%。
模型综合表现:严格成绩与扩展预算恢复后成绩,GLM 58.2%到63.6%、Kimi 43.0%、DeepSeek 64.2%
SCORECARD · 综合端到端正确率
分题型内容准确率,带 Wilson 95% 置信区间
BY TASK · 分题型准确率(95% CI)
错误类型热力图:内容错误、格式错误、截断、API 错误占比
ERROR PROFILE · 错误类型热力图
SHRIMP_LISTENING_STUDIO.HTML
虾滑听力台主工作区,包含资料库、音频、题目与原文
LIBRARY / QUESTION WORKSPACE
虾滑听力台练习记录与历史筛选界面
REVIEW HISTORY
虾滑听力台深色模式生词本界面
VOCABULARY WORKFLOW
TRANSCRIPT DETAIL
SCREENSHOT
IELTS LISTENING WORKSPACE

虾滑听力台

IELTS Listening Workspace雅思听力工作台

把分散的听力资料重构成可检索、可作答、可定位、可精听、可复盘的学习工作台,并已部署为可公开访问的网页产品。

MY ROLE
Product Definition / User Workflow / AI-assisted Development / Validation
  1. 找题
  2. 作答
  3. 定位
  4. 精听
  5. 复盘
194Listening Sets
1,931Questions Structured
172Sentence-level Timelines
894 / 894Option Coverage
OPEN CASE FILE 虾滑听力台 · 完整 executive summary
EXECUTIVE SUMMARY / AI PRODUCT

虾滑听力台

将 194 篇分散的雅思听力网页,重构成可检索、可作答、可定位、可复盘的学习工作台。

194篇内容统一入库
1,931道题结构化
172篇逐句时间轴
894/894字母题选项完整
PROBLEM
资料有内容,但没有形成练习闭环

原始网页散落在压缩包和独立 HTML 中。找题、切原文、拖音频、另开工具翻译,以及练习与错题记录都难以沉淀。

SOLUTION
把关键动作收进同一个工作区

围绕“找题 - 作答 - 答案句定位 - 逐句精听 - 错题复盘”组织流程,并加入筛选、倍速、历史导出和生词回跳。

虾滑听力台三栏学习工作区
VALIDATION

194/194 音频存在;1,691 题精确定位,240 题明确标记附近定位;桌面与移动端完成真实浏览器回归。

BOUNDARY

这些是内容与工程覆盖率,不等于用户增长或多人可用性结论。

PUBLIC DELIVERY

公开网页已部署,完整题库仍在本地材料中保留。

OPEN LIVE SITE ↗
03 / DATA GROWTH

CONTENT LAB

AI PRODUCT & TECH WRITING

长期追踪模型更新、公司变化、产品功能、UI 与交互、模型行为差异、科技舆论和真实用户反馈。真实增长来自内容实验:更少的发布、更强的开场、中文优先与更完整的分析。

805K+Verified Views
20.8KLikes
4,154Reposts
23Posts Over 10K Views
~35%Later Contentcontributed ~98% of total views
脱敏后的 X 高表现内容数据拼贴
X / selected posts33.5K peak shown
脱敏后的小红书内容数据截图
Xiaohongshu / selected posts4.4W peak shown
WHAT CHANGED? 改了什么

早期

高频更新 / 每天好几篇 / 大多只有几百阅读

后期

更新更少 / 开头更抓人 / 中文优先 / 视觉结构更好 / 长文深度分析

代表性结果

~18K 篇表现最好的长文 typical 阅读

~33.4K 单篇峰值阅读

04 / VISIBLE SKILLS BOARD

THINGS I USE TO BUILD

按它们怎样进入真实工作来分组。

01

AI & WORKFLOW

CodexClaude CodePrompt EngineeringAgent workflowsMCPSkill / plugin workflows

把模型能力组织成可复用、可审查的协作流程。

02

DATA

PythonSQLpandasNumPyscikit-learnJupyterMatplotlibPlotly

清洗、分析,并把数据转成可以验证的证据。

03

PRODUCT & BUILD

FlutterTypeScriptGit / GitHubFigmaSQLite / SQLCipherCloudflare Pages

从需求、界面到可运行原型,持续用真实反馈迭代。

04

RESEARCH

User researchQualitative codingCorpus constructionThematic analysisModel evaluation

把用户反馈、语料和模型行为整理成可分析的研究对象。

06 / ACADEMIC ARCHIVE

RESEARCH / ACADEMIC

生物科学训练让我更重视证据、方法、可复现过程,以及对结论边界的谨慎表达。

01

Traditional Ecological Knowledge

文献计量分析 / CiteSpace / 知识图谱

2,500+PAPERS
02

Bioinformatics Data Analysis

RNA-Seq 差异表达分析 / GO / KEGG

7SAMPLES 23,932ROWS 60 / 2GO / KEGG
03

Multilingual AI User Research

从跨语言、跨国家和不同产品时刻中整理可追溯的定性证据。

OPEN PROJECT 查看项目

07 / CONTACT

LET’S BUILD SOMETHING INTERESTING.

欢迎来信。

replying from somewhere between a lab notebook and a browser window.