
在谷歌搜索“青少年每天使用屏幕的时间过长是多少”时,返回的不再是传统链接列表,而是一个由人工智能生成的综合答案。该答案不仅给出了具体数字,还补充指出:屏幕使用的质量与平衡比单纯时长更重要,“过多”的定义取决于睡眠、运动、学业压力及情绪状态等多重因素。
另一项关于“是否应每日服用阿司匹林”的搜索中,AI 同样提供了包含风险警告的医疗信息,并表示若提供年龄和病史,可给出更具针对性的指导。
这些回复引发了对 AI 生成内容评估标准的思考。目前关于 AI 答案的争论多聚焦于准确性,但这仅是检验标准之一。弗吉尼亚大学图书馆馆长兼图书馆院长 Leo S. Lo 指出,将 AI 答案划分为事实性、解释性、建构性和战略性四类,有助于用户从不同角度进行判断。这一分类法最初发表于《学术图书馆期刊》(Journal of Academic Librarianship)。
四类 AI 回答及其评估策略
尽管 AI 代理的回答可能混合多种类型,且均以流畅、权威的形式呈现,但区分其本质至关重要。
事实性回答(Factual):此类回答做出原则上可通过证据核实的声明,如“弗吉尼亚大学成立于何时”或“金的化学符号”。评估关键在于信源核查:若回答引用了来源,用户应点击链接验证,而非直接将 AI 生成的文本视为证据。
解释性回答(Interpretive):建立在证据之上,但无唯一结论。例如“远程工作是否能提高生产力”或前述的屏幕时间问题。美国儿科学会并未规定青少年的确切屏幕时长,而是强调使用类型及对其它活动的挤占效应。评估此类回答时,需审视系统强调或遗漏了哪些证据,是否存在其他可辩护的解释。有效的后续提问包括:“支持不同结论的最强证据是什么?”
建构性回答(Constructive):此类内容为“创造”而非“发现”,如起草求职信、撰写悼词或重组段落,不存在唯一正确结果。评判标准在于目的、受众和语气的契合度。一篇语法完美的悼词若缺乏感染力或不符合逝者形象,即为低质回答。用户需结合具体情境评估其适用性。
战略性回答(Strategic):涉及“应该做什么”的决策,如“是否应买房”或“是否每日服用阿司匹林”。这类回答结合信息与个人目标、风险权衡。谷歌在阿司匹林案例中警告风险并建议咨询专业人士,这与美国预防服务工作组(U.S. Preventive Services Task Force)关于个体化决策的指导一致。评估时需明确系统还需哪些个人信息才能提供合理建议,并考虑后果及替代方案。最终判断权仍在用户手中,因为用户是结果的承担者。
先问类型,再问对错
随着 AI 生成响应直接嵌入搜索结果,回答类型可能在同一次交互中悄然切换。例如,报告医疗指南内容与将其应用于特定个人属于不同性质的智力工作。
作为用户,在质疑 AI 回答是否正确之前,应先识别其所属类型。这一基本判断将决定后续的验证步骤:是核查信源、审视证据偏差、评估语境契合度,还是寻求专业人员的介入。唯有厘清回答类型,才能有效驾驭 AI 提供的复杂信息。