VIBE CODING PROJECT · 02

大模型回答
双盲评测台

统一 Query、匿名候选回答和五维量表,把“我觉得更好”转化为可以复核、比较和导出的评测记录。

DOUBLE
BLIND
匿名演示模式
评测进度0 / 9

回答来源在评分阶段保持隐藏,避免品牌偏好影响判断。

Q-01岗位理解

一名候选人有视频剪辑和客户沟通经历,但没有正式 AI 项目经验。请客观分析他与多模态内容质检岗位的匹配点和主要短板。

CANDIDATE A来源已隐藏

候选人的视频剪辑经历能够迁移到画面、节奏和音画同步判断,客户沟通经历有助于理解交付标准。短板是缺少按统一规则完成多维标注、记录 Bad Case 和输出一致性数据的证据。建议先通过小规模试标验证判断尺度,不应直接宣称具备正式 AI 项目经验。

五维评分1 = 严重不足 · 5 = 表现优秀
60/100
问题标签可多选

EVALUATION METHOD

统一输入,先盲评,再比较。

控制变量同一 Query、同一评分维度、同一分值范围。

证据优先每次评分都保留问题标签和文字依据。

诚实边界页面使用演示答案,不代表豆包、Kimi、DeepSeek等真实产品表现。