青蓝Cylan
✦ 青出于蓝 · est. 2026Human–AI Interactionn 还在涨

AI 时代的
行为实验平台

人们越来越多地与 AI 对话,而研究它的人还在用问卷和截图。 真实的人机交互实验,需要一个可控、可复现、合乎伦理的标准环境—— 青蓝为此而建。

4种任务类型对话 / 评分 / 量表 / 外链
10个流程节点状态机驱动全程
5张数据宽表CSV 直接进统计软件
1份发布快照配置冻结,数据可比
100%事件留痕每一步都可审计
№ 01 · 问题新的研究对象,旧的研究工具。

AI 交互实验,缺一个标准环境

问卷只能测自我报告,线下实验排程贵、样本小。当研究问题变成"人与 AI 的真实交互",研究者往往只能让被试自己打开某个 AI App,再靠截图和回忆收数据——刺激不可控,过程不可见,结果不可复现。

痛点 01环境不可控

模型版本、系统提示、界面人人不同——每个被试面对的其实是不同的刺激材料,组间比较无从谈起。

痛点 02过程数据拿不到

对话发生在厂商服务器里。轮次、时间戳、完整文本全部缺失,只剩截图和被试的自我报告。

痛点 03工具链靠手工拼接

问卷系统管前后测、微信群管招募、AI App 管交互、Excel 手工对齐三方数据——错漏无法审计。

痛点 04无法复现

商业模型随时升级,三个月后同一实验重跑不出来;审稿人问"AI 当时说了什么",答不上。

痛点 05伦理说不清

被试数据流入第三方,知情同意、退出权利、数据归属全是模糊地带,伦理审查难以通过。

问卷自报线下实验借用商业 AI App青蓝 Cylan
真实 AI 交互行为✗ 只有自我报告△ 需自建系统✓ 真实但失控✓ 真实多轮对话
刺激可控、可复现✓ 静态材料✓ 成本极高✗ 模型随时变✓ 发布快照冻结配置
过程数据完整✗ 无过程△ 靠录像转录✗ 在厂商手里✓ 逐条消息 + 事件留痕
伦理可交代✓ 成熟惯例✓ 成熟惯例✗ 数据归属模糊✓ 同意/退出/留痕内建
成本与样本规模✓ 低成本大样本✗ 贵且慢△ 全靠人盯✓ 一个分享码在线收数
№ 02 · 流程从想法到数据,五步走完。

一个实验是怎么跑起来的

Step 1准备任务
  • 接入 AI 对话后端(Mock / Dify)
  • 上传对话记录、配置评分量表
Step 2组合方案
  • 把任务编排成被试旅程
  • 同一任务可复用、可重复出现
Step 3发布分享码
  • 实验组名称、名额、时间窗口
  • 知情同意与前后测问卷
Step 4被试执行
  • 一个分享码走完全程
  • 漏斗与进度实时可见
Step 5导出数据
  • 五张 CSV 宽表 + 全量 JSON
  • 直接进 R / SPSS / Python
№ 03 · 现场被试看到的,就是这样一场对话。

对话实验现场

AI 协作对话 · 进行中round 3 / 50
任务开始:请与 AI 协作,完成一段压力应对的讨论。
你好,我是今天的协作伙伴。最近有什么让你压力比较大的事吗?
最近在赶论文,总觉得时间不够用。
听起来负荷不小。如果把压力分成「能控制」和「不能控制」两部分,你觉得各占多少?
大概一半一半吧,截稿日期没法改,但进度安排其实在我手里。
Enter 发送 · Shift+Enter 换行完成本轮对话
每一条消息都带时间戳

谁说的、什么时候说的、属于第几轮——全部落库,乱序与覆盖被状态机挡住。

轮数上限与显式完成

对话设 50 轮上限,被试点「完成本轮对话」推进流程,不靠口令暗号。

AI 后端可换

调试用 Mock,正式实验接 Dify;提示词与密钥只属于研究者。

断线可恢复

刷新、换网络都不丢进度,被试回来时停在原来的节点上。

№ 04 · 任务抽屉四个抽屉,按你的设计取用。

四种任务类型

№ 01AI 协作对话CHAT_COLLABORATION
  • 真实多轮人机对话
  • Mock / Dify 后端
№ 02对话记录评分DIALOGUE_SCORING
  • 阅读材料 + 逐题评分
  • 必答校验、提交即锁定
№ 03量表填写SCALE_FILLING
  • 逐题作答、进度可视
  • 自定义量表与计分
№ 04外部问卷EXTERNAL_SURVEY
  • 问卷星等外链系统
  • 打开/确认两段留痕
№ 05 · 数据收完即可分析,不用再洗一遍。

数据生而可发表

answers.csv
claimIdconditionquestionIdscoreansweredAt
cm…7qmz干预组q1410:38:59
cm…7qmz干预组q2510:39:12
cm…230r对照组q1211:02:47
cm…230r对照组q2311:03:05
claims.csvmessages.csvanswers.csvsurveys.csvevents.csv
发布快照 = 可比性

发布那一刻任务配置被冻结成快照,第 1 个和第 100 个被试做的是同一个实验。

事件日志 = 可审计

从领取分享码到最后一题,每个动作都有时间戳,审稿人问什么都答得上。

宽表导出 = 零清洗

按被试 × 题目展开的长表,列名稳定,R 里一行 read_csv 开始分析。

№ 06 · 同行来自早期使用者的实验后记。

研究者说

"以前跑一个对话实验要拼问卷系统、微信群和 Excel,现在一个分享码把全流程串起来了。"
王同学 · 社会心理学博士生
"导出的 CSV 干净到可以直接进 R。审稿人让补一个反应序列分析,事件日志里全都有。"
L 实验室 · 认知科学方向
"知情同意、退出权利、数据留痕都是平台内建的,伦理审查材料写起来踏实了很多。"
陈老师 · 人机交互研究组
№ 07 · FAQ实验开始前,先把这些说清楚。

常见问题

数据归谁?

全部归研究者。随时整库导出 CSV / JSON,平台不做任何二次使用;发布只可软删除,数据不会物理丢失。

支持哪些 AI 后端?

内置 Mock 后端用于调试流程,正式实验可接入 Dify(自带 30 秒超时与历史截断保护);更多兼容接口在路线图上。

伦理审查怎么办?

知情同意独立确认并记录时间、被试可随时退出、全程事件留痕——这些是内建流程,可直接写进 IRB / 伦理材料。

被试需要安装什么?

什么都不用。浏览器打开分享码链接即可,手机和电脑都支持,断线刷新后从原节点继续。

开始你的第一个实验

从一个分享码开始,让数据自己长出来。