我们发布了首个在 InterSystems ObjectScript 和 IRIS 平台上衡量 LLM 能力的开放式基准测试:ObjectScript LLM 基准测试。
为何推出该基准
现有的编程基准测试——SWE-bench、LiveCodeBench、Terminal-Bench——均基于 Python、 JavaScript 和 shell 语言。其中没有一项涵盖 ObjectScript、IRIS SQL、嵌入式 Python 或 %CSP.REST。 已发布的编程评分无法直接应用于 IRIS 平台。这是首次尝试 直接衡量这一差距。
我们测量的内容
140个手工编写的项目,涵盖三个类别:代码生成、代码理解和错误修复。 主要评分器是一个实时运行的 IRIS 实例——模型响应会被编译并执行, 输出结果与预期字符串进行比对。对于 93 个基于执行结果评分的 题目,不存在主观评分。47 个理解类题目则采用基于评分标准的 LLM 评判器。
我们运行了14个模型(Claude 4.x/5、GPT-5变体以及三个自托管的Qwen3/DeepSeek模型), 均采用其可用的最高推理配置,每个项目在温度为0的条件下生成一个响应。
总体结果

总体准确率在0.515至0.851之间。 排名前九的模型集中分布在 0.737 至 0.851 之间,且其 95% 置信区间存在重叠——在样本量 n=140 的情况下,我们无法将它们 相互区分,仅能区分排名前九的聚类与后五名。
按任务类别划分的结果

代码生成是难度最高的任务类(上限为 0.745,各模型得分范围为 0.511),也是 区分度最高的。而错误修复的区分度最低(范围为 0.196)。 所有模型在理解任务上的得分 均高于生成任务——差距在0.03到0.25之间,尽管其中部分 差异源于各任务家族不同的评分标准,而不仅仅取决于能力本身。
有几点观察结果值得特别指出:
- DeepSeek-v4-flash(自主部署)在代码生成(0.745)**方面并列第一,**并在 错误修复(0.913)方面领先,总排名第7位。 其理解能力得分较低(0.774,而顶尖 Claude 模型为 0.91–0.96 ),且由不同的评委打分,因此请谨慎解读这一比较。
- **成本效率的波动比原始准确率更大。**在得分高于0.80的模型中,
claude-sonnet-5每1,000个正确答案的成本为4.61美元,而gpt-5-6-sol则为17.54美元。
成本与准确率

在10个已标价模型中,每次请求的成本范围为0.0009–0.0144美元,跨度达15倍。按准确率进行标准化 后,该跨度压缩至12倍,且排名顺序也发生了变化。
局限性
- 语料规模较小。 140 个条目样本量有限,置信区间已体现这一点。
- 仅采用 Pass@1 指标。 每个条目仅生成一次回复,温度设为 0,未捕捉推理模型的运行间方差。
- 自引用评判。 代码理解任务由固定版本的
claude-opus-4-8评分,该模型同时也录得了最高的理解得分(0.960)。执行评分项不受影响,但阅读理解得分列时应留意这一背景。 - 覆盖盲区。 未包含互操作性(productions/HL7/DTL)、大上下文任务及纯 SQL 工作。
- 后续污染风险。 运行时尚未公开的条目,本次发布后将公开,因此未来针对这些条目的测试存在数据污染风险。
核心要点
- ObjectScript LLM 基准测试提供了一个专门针对 LLM 在 ObjectScript 及 InterSystems IRIS 平台上表现的开放基准。
- 14 个参评模型的整体准确率介于 0.515 至 0.851 之间,排名前 9 的模型 95% 置信区间存在重叠。
- 代码生成是最困难、区分度最高的任务类别,而缺陷修复在不同模型间的表现差异较小。
常见问题
1.问:什么是 ObjectScript LLM 基准测试?
答:ObjectScript LLM 基准测试是一个开放基准,旨在衡量 LLM 在 ObjectScript 和 InterSystems IRIS 平台上的表现。它包含 140 个手写任务,涵盖代码生成、代码理解和缺陷修复。
2. 问:基准测试中如何对 LLM 回复进行评分?
答:对于 93 个执行评分项,模型回复会在真实的 InterSystems IRIS 实例上编译并执行,其输出与预期结果进行比对。其余 47 个理解任务则采用基于评分标准的 LLM 评判方式进行评估。
3. 问:哪类 ObjectScript 任务对 LLM 来说最难?
答:代码生成是基准测试中最困难、区分度最高的任务类别。所有参评模型在代码理解上的得分均高于代码生成。
4. 问:哪个 LLM 在 ObjectScript 基准测试中表现最佳?
答:整体准确率介于 0.515 至 0.851 之间。然而,排名前 9 的模型 95% 自助法置信区间存在重叠,因此该基准未能提供足够证据在统计学上将这一头部集群中的模型区分开来。
5. 问:更昂贵的 LLM 在 ObjectScript 任务上表现更好吗?
答:不一定。基准测试显示,即使在整体准确率相近的模型之间,成本也存在显著差异。对于得分在 0.80 以上的模型,每 1,000 个正确答案的 reported 成本从 claude-sonnet-5的 4.61 美元到 gpt-5-6-sol的 17.54 美元不等。