AI 时代的
行为实验平台
人们越来越多地与 AI 对话,而研究它的人还在用问卷和截图。 真实的人机交互实验,需要一个可控、可复现、合乎伦理的标准环境—— 青蓝为此而建。
AI 交互实验,缺一个标准环境
问卷只能测自我报告,线下实验排程贵、样本小。当研究问题变成"人与 AI 的真实交互",研究者往往只能让被试自己打开某个 AI App,再靠截图和回忆收数据——刺激不可控,过程不可见,结果不可复现。
模型版本、系统提示、界面人人不同——每个被试面对的其实是不同的刺激材料,组间比较无从谈起。
对话发生在厂商服务器里。轮次、时间戳、完整文本全部缺失,只剩截图和被试的自我报告。
问卷系统管前后测、微信群管招募、AI App 管交互、Excel 手工对齐三方数据——错漏无法审计。
商业模型随时升级,三个月后同一实验重跑不出来;审稿人问"AI 当时说了什么",答不上。
被试数据流入第三方,知情同意、退出权利、数据归属全是模糊地带,伦理审查难以通过。
| 问卷自报 | 线下实验 | 借用商业 AI App | 青蓝 Cylan | |
|---|---|---|---|---|
| 真实 AI 交互行为 | ✗ 只有自我报告 | △ 需自建系统 | ✓ 真实但失控 | ✓ 真实多轮对话 |
| 刺激可控、可复现 | ✓ 静态材料 | ✓ 成本极高 | ✗ 模型随时变 | ✓ 发布快照冻结配置 |
| 过程数据完整 | ✗ 无过程 | △ 靠录像转录 | ✗ 在厂商手里 | ✓ 逐条消息 + 事件留痕 |
| 伦理可交代 | ✓ 成熟惯例 | ✓ 成熟惯例 | ✗ 数据归属模糊 | ✓ 同意/退出/留痕内建 |
| 成本与样本规模 | ✓ 低成本大样本 | ✗ 贵且慢 | △ 全靠人盯 | ✓ 一个分享码在线收数 |
一个实验是怎么跑起来的
- 接入 AI 对话后端(Mock / Dify)
- 上传对话记录、配置评分量表
- 把任务编排成被试旅程
- 同一任务可复用、可重复出现
- 实验组名称、名额、时间窗口
- 知情同意与前后测问卷
- 一个分享码走完全程
- 漏斗与进度实时可见
- 五张 CSV 宽表 + 全量 JSON
- 直接进 R / SPSS / Python
对话实验现场
谁说的、什么时候说的、属于第几轮——全部落库,乱序与覆盖被状态机挡住。
对话设 50 轮上限,被试点「完成本轮对话」推进流程,不靠口令暗号。
调试用 Mock,正式实验接 Dify;提示词与密钥只属于研究者。
刷新、换网络都不丢进度,被试回来时停在原来的节点上。
四种任务类型
- 真实多轮人机对话
- Mock / Dify 后端
- 阅读材料 + 逐题评分
- 必答校验、提交即锁定
- 逐题作答、进度可视
- 自定义量表与计分
- 问卷星等外链系统
- 打开/确认两段留痕
数据生而可发表
| claimId | condition | questionId | score | answeredAt |
|---|---|---|---|---|
| cm…7qmz | 干预组 | q1 | 4 | 10:38:59 |
| cm…7qmz | 干预组 | q2 | 5 | 10:39:12 |
| cm…230r | 对照组 | q1 | 2 | 11:02:47 |
| cm…230r | 对照组 | q2 | 3 | 11:03:05 |
发布那一刻任务配置被冻结成快照,第 1 个和第 100 个被试做的是同一个实验。
从领取分享码到最后一题,每个动作都有时间戳,审稿人问什么都答得上。
按被试 × 题目展开的长表,列名稳定,R 里一行 read_csv 开始分析。
研究者说
"以前跑一个对话实验要拼问卷系统、微信群和 Excel,现在一个分享码把全流程串起来了。"
"导出的 CSV 干净到可以直接进 R。审稿人让补一个反应序列分析,事件日志里全都有。"
"知情同意、退出权利、数据留痕都是平台内建的,伦理审查材料写起来踏实了很多。"
常见问题
全部归研究者。随时整库导出 CSV / JSON,平台不做任何二次使用;发布只可软删除,数据不会物理丢失。
内置 Mock 后端用于调试流程,正式实验可接入 Dify(自带 30 秒超时与历史截断保护);更多兼容接口在路线图上。
知情同意独立确认并记录时间、被试可随时退出、全程事件留痕——这些是内建流程,可直接写进 IRB / 伦理材料。
什么都不用。浏览器打开分享码链接即可,手机和电脑都支持,断线刷新后从原节点继续。
开始你的第一个实验
从一个分享码开始,让数据自己长出来。