← 返回动态

Giving your AI a Job Interview

one-useful-thing 前沿 理论与框架 低信号 Wed, 12 No
像面试员工一样面试AI,建立结构化评估流程。

关键标注

关键数据
最好的模型在软件开发到个人财务顾问等领域击败了人类
显示AI在特定任务上已超越人类专家,量化了AI能力的实际水平。
关键决策
OpenAI让第三组专家对结果进行评分,不知道哪些答案来自AI,哪些来自人类,这个过程每个问题花费超过一小时。
采用盲评方式确保客观性,是严谨评估AI能力的典范做法。
你需要系统性地测试你的AI,针对它将实际执行的工作和它将做出的实际判断。创建反映你使用场景的现实场景。多次运行以观察模式,并花时间让专家评估结果。
建议企业建立定制化、场景化的AI评估流程,而非依赖通用基准。
关键观点
当你的AI大规模提供建议时,持续将想法评分高出或低出3-4分,意味着持续将你引向不同的方向。
强调AI的微小偏差在规模化应用时会被放大,影响战略方向。
你不会仅凭SAT成绩就聘用一位副总裁。你也不应该仅仅因为某个AI知道直立人的平均颅容量略低于1000立方厘米,就选择它来为你的组织提供数千个决策的建议。
类比招聘,警示高管不能依赖通用基准选择AI,需像面试高管一样严格评估。
给AI做求职面试 随着AI建议变得越来越重要,我们需要更善于评估它 考虑到开发新AI所投入的巨大精力(无论是字面意义上的还是比喻意义上的),我们却出奇地难以准确衡量它们到底有多“聪明”。最常见的方法是像对待人类一样对待AI,给它做测试并报告它答对了多少题。有几十种这样的测试,称为基准测试,它们是衡量AI随时间进步程度的主要方式。 这种方法存在一些问题。 首先,许多基准测试及其答案都是公开的,因此一些AI最终会无意或有意地将它们纳入基础训练中,以便在这些基准测试中取得高分。但即使没有发生这种情况,我们往往也不知道这些测试真正衡量的是什么。例如,非常流行的MMLU-Pro基准测试包含诸如“直立人的平均颅容量大约是多少?”和“廉价把戏摇滚乐队1979年现场专辑的标题中提到了哪个地方?”等问题,每个问题有十个可能的答案。答对这些能告诉我们什么?我不知道。更不用说测试通常未经校准,这意味着我们不知道从84%正确率提高到85%是否与从40%提高到41%一样具有挑战性。而且,除此之外,对于许多测试来说,实际最高分可能是无法达到的,因为测试问题中存在许多错误,并且指标通常以不寻常的方式报告。 尽管存在这些问题,所有这些基准测试放在一起似乎衡量了某种潜在的能力因素。而更高质量的基准测试,如ARC-AGI和METR Long Tasks,显示出相同的上升趋势,甚至是指数级趋势。这与AI在各行业实际影响的测试结果相符,表明这种“智能”的潜在提升转化为从医学到金融等各个领域的实际能力。 因此,总体而言,基准测试具有真正的价值,但少数几个稳健的个体基准测试侧重于数学、科学、推理和编程。如果你想衡量写作能力、社会学分析、商业建议或同理心,选择非常有限。我认为这给个人和组织都带来了问题。公司根据基准测试决定使用哪些AI,新AI发布时也会大肆宣传其基准测试性能。但你真正关心的是哪个模型最适合你的需求。 为了自己弄清楚这一点,你需要面试你的AI。 凭感觉进行基准测试 如果基准测试可能让我们失望,有时“感觉”却能成功。如果你使用足够多的AI模型,你就能开始以难以描述但容易识别的方式看出它们之间的差异。因此,一些经常使用AI的人会开发出独特的基准测试来测试AI能力。例如,Simon Willison要求每个模型画一只骑自行车的鹈鹕,而我要求每个图像和视频模型创作一只坐飞机的水獭。虽然这些方法很有趣,但它们也让你感受到AI对事物之间关系的理解,即它的“世界模型”。我还有很多其他的方法,比如要求AI为“遥远未来的星舰控制面板”创建JavaScript(你可以在下面看到一些新旧模型的表现),或者创作一首有挑战性的诗。我让AI构建视频游戏和着色器,并分析学术论文。我还进行小型写作实验,包括时间旅行问题。每个实验都让我对模型的运作方式有所了解:它犯的错误多吗?它的答案是否与其他模型相似?它反复出现的主题和偏见是什么?等等。 稍加练习,就能轻松找到新模型的“感觉”。举个例子,我们来尝试一个写作练习:“写一段话,描述一个人像战时配给一样分配自己剩余的词语,因为他被告知一生只剩下一万个词了。他还有47个词,抱着刚出生的孩子。”如果你经常使用这些AI,你不会对结果感到惊讶。你会明白为什么Claude 4.5 Sonnet常被认为是一个强大的写作模型。你会注意到Gemini 2.5 Pro(目前这四个模型中最弱的)甚至不能准确追踪使用的词数。你会发现GPT-5 Thinking在写小说时往往风格相当狂野,喜欢复杂的隐喻,但有时会牺牲连贯性和故事性(我不确定有人会用完47个词,但至少计数是对的)。你会认识到新的中文开源模型Kimi K2 Thinking也有类似的问题,有些有趣的短语,但故事不太合理。 通过“感觉”进行基准测试——无论是故事、代码还是水獭——对个人来说是了解AI模型的好方法,但也非常主观。AI每次给出的答案都不同,除非你非常严格,否则任何比较都不公平。此外,更好的提示可能会带来更好的结果。最重要的是,我们依赖的是感觉而非实际衡量标准——但“感觉”上的明显差异表明,仅靠标准化基准是不够的,尤其是在某个特定任务上拥有稍好的AI确实很重要的时候。 在现实世界中进行基准测试 当公司选择使用哪些AI系统时,他们通常将其视为技术和成本决策,依赖公开基准来确保他们购买了一个足够好的模型(如果他们使用任何基准的话)。这在某些用例中可能没问题,但很快就会失效,因为在很多方面,AI更像一个人,具有奇怪的能力和弱点,而不是软件。如果你用招聘而非技术采用的类比,那么“足够好”的基准测试方法就更难站住脚了。公司花很多钱雇佣那些比平均水平更优秀的人,如果他们要雇佣的人负责为许多其他人提供建议,他们会特别谨慎。对AI也需要类似的态度。你不应该仅仅为公司挑选一个模型,你需要进行严格的面试。 面试AI不是一件容易的事,但可以解决。现实世界基准测试的最佳例子可能是OpenAI最近的GDPval论文。第一步是建立真实任务,OpenAI通过召集平均有14年行业经验(从金融、法律到零售)的专家,让他们生成复杂且现实的项目,这些项目需要人类专家平均4到7小时完成(你可以在这里看到所有任务)。第二步是测试AI在这些任务上的表现。在这种情况下,多个AI模型和其他人类专家(按小时付费)都完成了每个任务。最后是评估阶段。OpenAI让第三组专家对结果进行评分,不知道哪些答案来自AI,哪些来自人类,这个过程每个问题花费超过一小时。总的来说,这工作量很大。 但它也揭示了AI的强项(最好的模型在软件开发到个人财务顾问等领域击败了人类)和弱项(药剂师、工业工程师和房地产经纪人轻松击败了最好的AI)。你还可以看到不同模型的表现不同(ChatGPT是更好的销售经理,Claude是更好的财务顾问)。因此,好的基准测试有助于你了解我们所说的AI能力的“锯齿形前沿”的形状,并跟踪它如何随时间变化。 但即便是这些测试,也无法揭示一个关键问题:AI在做决策时的潜在态度。为了举例说明如何探究这一点,我向多个AI简要介绍了一个我认为不太靠谱的想法——一家通过无人机配送鳄梨酱的公司。我要求每个AI模型对“鳄梨无人机”的可行性进行十次评分(每次1-10分,注意AI每次回答可能不同,因此需要多次测试)。各个AI模型自身的回答其实相当一致,但不同AI之间的评分差异很大。我个人会给这个想法打2分或更低,但模型们更宽容。Grok认为这是个好主意,微软Copilot也很兴奋。其他模型,如GPT-5和Claude 4.5,则更为怀疑。 这些差异并非微不足道。当你的AI大规模提供建议时,持续将想法评分高出或低出3-4分,意味着持续将你引向不同的方向。有些公司可能希望AI拥抱风险,另一些则可能希望规避风险。但无论如何,理解你的AI如何“思考”关键业务问题至关重要。 面试你的模型 随着AI模型在任务上表现越来越好,并更深入地融入我们的工作和生活,我们需要更严肃地对待它们之间的差异。对于日常使用AI的个人来说,基于感觉的基准测试可能就足够了。你可以直接运行你的水獭测试。不过,对我来说,飞机上的水獭已经太简单了,所以我尝试在Sora 2中输入提示词:“1960年代关于那个乐队在遭遇水獭群事件前最后一场著名演唱会的纪录片片段”,并得到了令人印象深刻的结果。 但大规模部署AI的组织面临不同的挑战。是的,总体趋势是明确的:更大、更新的模型通常在大多数任务上表现更好。但当你决定哪个AI将处理数千个实际任务或为数百名员工提供建议时,“更好”还不够。你需要具体了解你的AI擅长什么,而不是AI平均擅长什么。 这正是GDPval研究揭示的:即使在顶级模型中,不同任务的表现也差异显著。而“鳄梨无人机”的例子展示了另一个维度——当任务涉及对模糊问题的判断时,不同模型会给出持续不同的建议。这些差异会随着规模扩大而累积。一个在分析财务数据上稍差,或在建议中持续更倾向于冒险的AI,影响的不仅仅是一个决策,而是数千个。 你不能依靠感觉来理解这些模式,也不能依靠通用基准来揭示它们。你需要系统性地测试你的AI,针对它将实际执行的工作和它将做出的实际判断。创建反映你使用场景的现实场景。多次运行以观察模式,并花时间让专家评估结果。在你关心的任务上直接比较模型。这就像知道“这个模型在MMLU上得了85%”与知道“这个模型在我们的财务分析任务上更准确,但在风险评估上更保守”之间的区别。而且,随着新模型的出现和需要评估,你将需要每年多次进行这样的测试。 这项工作值得投入。你不会仅凭SAT成绩就聘用一位副总裁。你也不应该仅仅因为某个AI知道直立人的平均颅容量略低于1000立方厘米,就选择它来为你的组织提供数千个决策的建议。
通用所有规模AI评估招聘思维