我们发布了首个在 InterSystems ObjectScript 和 IRIS 平台上衡量 LLM 能力的开放式基准测试:ObjectScript LLM 基准测试。
为何推出该基准
现有的编程基准测试——SWE-bench、LiveCodeBench、Terminal-Bench——均基于 Python、 JavaScript 和 shell 语言。其中没有一项涵盖 ObjectScript、IRIS SQL、嵌入式 Python 或 %CSP.REST。 已发布的编程评分无法直接应用于 IRIS 平台。这是首次尝试 直接衡量这一差距。
我们测量的内容
140个手工编写的项目,涵盖三个类别:代码生成、代码理解和错误修复。 主要评分器是一个实时运行的 IRIS 实例——模型响应会被编译并执行, 输出结果与预期字符串进行比对。对于 93 个基于执行结果评分的 题目,不存在主观评分。47 个理解类题目则采用基于评分标准的 LLM 评判器。
我们运行了14个模型(Claude 4.x/5、GPT-5变体以及三个自托管的Qwen3/DeepSeek模型), 均采用其可用的最高推理配置,每个项目在温度为0的条件下生成一个响应。
总体结果

总体准确率在0.515至0.851之间。 排名前九的模型集中分布在 0.737 至 0.








