7月13日,斯坦福大学发布研究指出,当前AI心理健康安全评估严重依赖人工专家标注,但专家对“何为安全”的判断一致性极低。这项发现直指生成式AI在敏感医疗场景落地的最大瓶颈。
该研究显示,即便使用同一套评估框架,不同专家对同一AI回复的安全性评判差异显著。随着聊天机器人被越来越多用于心理支持,这一分歧直接动摇了现有安全测试的可靠性。相比之下,代码生成或通用对话的安全标准虽有争议,但远未达到需要“专家共识”的严苛程度。
与此同时,OpenAI、Anthropic等实验室正加速将模型推向医疗、情感陪伴等高风险领域。过去两年,这些公司已在安全对齐上投入巨资,却仍难以解决“谁来定义安全”的根本问题。中国企业如阿里、百度在类似垂直应用上的推进同样面临数据与伦理双重约束。
这一缺陷暴露了行业从“参数竞赛”转向“可验证安全”的结构性困境。未来6-12个月,若无法建立跨专家、可量化的评估协议,AI在心理健康等领域的商业化或将遭遇监管与用户信任的双重阻力。
信源:https://hai.stanford.edu/news/inside-the-ai-index-12-takeaways-from-the-2026-report
https://www.govinfosecurity.com/bipartisan-house-bill-pushes-ai-for-pediatric-cancer-care-a-32216 (同期政策背景参考)










