今天外面天气真好,南半球,尤其是悉尼,终于迎来了春天, 但上周我和同事们在黑山度过了愉快的时光,庆祝Banksia成立五周年,回来后我严重时差反应,再加上还在对抗感冒症状,所以现在还是静静地坐在电脑前比较好,而不是去外面寻找新的疯狂冒险。 还有什么比浏览社区帖子更能让这段时间物有所值呢?
其中一篇特别引起了我的注意,那是@Nicholai.Mitchko关于大语言模型(LLM)代理编码基准测试的精彩研究与文章——如果你还没读过,不妨先去读一读。 研究结果基本印证了我的经验感受——在IRIS编码方面,Claude系列模型表现大同小异;正因如此,如今我进行编码任务时几乎只使用Sonnet,而OpenAI的模型虽然稍逊一筹,但依然表现不俗。 不过有一个意外发现:DeepSeek V4 Flash模型,其排名几乎与Claude持平。这激发了我尝试DeepSeek的兴趣。正如我的同事@Aleksandr Kolesov在他最近的文章中所指出的,在大型语言模型(LLM)领域,即使全力以赴,也只能勉强维持现状。
安装
Nicholai 使用的是自托管的 DeepSeek,慷慨地将其成本标为 0 美元,但我的这台“强悍”的 MacBook Air 在性能方面肯定表现不佳,所以今天我们将使用托管版本。








