蓝耘把五个顶级 AI 塞进一个模型,我出了三道刁钻题让他们打一架
蓝耘最近悄悄上了个新模型,叫 automodel。一次叫五个顶级大模型去解题,看看到底行不行。
故事是这样的。
这两天我刷到蓝耘上了一款新模型,名字叫 automodel。
我第一反应是,缝合怪啊这是。
点进去一看,果然是把五个当下最猛的模型塞进了一个入口,Gemma3-27B、Qwen3-VL-32B-Instruct、DeepSeek-V3.2、MiniMax-M2.5、GLM-5.1,一个不落。

这种「模型路由器」的玩法不算新了。前两年就有厂商做过,思路也不复杂,你把问题扔过去,后台看哪个模型擅长这个,就派它上。
你问代码生成,DeepSeek 出马。你丢个视觉问题,Qwen3-VL 上场。你写个长文档分析,GLM 顶上。理论上,每个问题都能找到最对口的那位选手。
听着挺美好的对吧。
但是不是真的美好,谁知道呢。得拉出来遛遛。
接入其实不复杂,三分钟搞定
我是用 Cherry Studio 接的它,整个过程也就三分钟。
打开 Cherry Studio,找到模型服务这块,点左下角的添加按钮,弹出添加模型的窗口。这里要填两个东西,一个是 API 地址,也就是 https://maas-api.lanyun.net,另一个是模型 ID,直接输入 automodel 就行。

API KEY 得去蓝耘的 MaaS 平台拿。打开蓝耘控制台,左下角找到系统管理里的 API KEY 管理,点创建 API KEY,然后复制那一串 sk-ak 开头的密钥,回到 Cherry Studio 粘到 API 密钥那里。

粘完之后记得点一下右边那个对勾按钮检测一下,看到绿色的「连接成功」弹出来,就齐活了。

说实话这个流程比我想的简单。复杂模型通常意味着复杂的接入成本,蓝耘这个至少在接入这一关没给我添堵。
一切准备就绪,可以开始测试了。
三道刁钻题,五位选手上擂台
接下来就是正片了。
我准备了三道题,难度逐级上升,分别考察推理能力、代码能力、还有综合调度能力。
为啥挑这三块?因为这正是 automodel 这种路由模型最被诟病的地方。五个模型来回切,调度能不能切对?会不会把简单问题扔给最贵的那个?能不能真的像宣传的那样「任务级最优」?
光听宣传没用,咱们实测一遍。
第一题,逻辑推理
题目是这样的,「A、B、C 三人中有一个说谎者。A 说,B 在说谎。B 说,C 在说谎。C 说,A 和 B 都在说谎。请用一步步推理得出到底谁在说谎,谁说真话。」
看着简单吧,这种题目小学奥赛就见过。但实际上是一道经典的逻辑陷阱题,思考路径稍微偏一点就绕不出来。

我把同样的题目分别扔给了 automodel、DeepSeek、GPT。
automodel 给的答案是「B 说真话,A 和 C 说假话」,并且把整个推理过程写得很完整,从假设到验证到最终结论,一步一步来。


DeepSeek 给出了同样的答案,但多加了一句话,「如果坚持只有一个说谎者,则题目条件无解」。这个提示挺关键的,说明它真的把题目当逻辑问题拆解了,而不是套答案模板。

GPT 给出的答案就有点不一样了。它列了三种假设情况,每种都不成立,最后得出结论,题目本身不满足条件的答案,建议修改题目的某个表述。

三家答案在表述方式上略有差异,但核心逻辑都对。automodel 在这一步的表现,至少不比单兵作战的 DeepSeek 差。
这里有一个细节我想提一下。automodel 处理这种逻辑推理任务的时候,明显调用了 DeepSeek-V3.2 这个底座,因为推理风格几乎一模一样。这说明后台的路由判断是准的,它知道这种长链逻辑该派谁上。
这个测试目的,是看它能否展现出极强的逻辑链推理(CoT),不被绕晕。
第二题,代码生成
我给三家的题目是,「用 Python 写一个单文件函数,输入一个 List,不借助任何第三方库,在 O(n) 时间复杂度和 O(1) 空间复杂度内找出其中未出现的最小正整数。要求写出极致简洁优雅的代码并附带说明。」
这题是 LeetCode 第 41 题,经典中的经典。难的不是做出来,是做漂亮。

DeepSeek 给的 Python 实现,是用原地哈希表的思路,把 nums[i] 放到 nums[i]-1 的位置上,然后扫描找第一个不满足的位置。代码很优雅,注释也清楚。
GPT 给的方案思路差不多,但实现细节略有不同,交换条件的写法不一样。
automodel 给的代码,跟前两家几乎是同一个套路,只是变量名和注释风格有差异。
这种结果其实挺合理的,因为这题本来就有一个标准的最优解,三家都奔着最优解去写,自然会写得很像。
但反过来想,这也说明 automodel 在代码任务上大概率调用的也是 DeepSeek 或者 GLM,因为风格对得上。
不管调用的谁,结果是准确的,边界条件考虑到了,效率符合要求。这就够了。
第三题,混合作业
第三题我故意搞得很刁钻,「分析下面这句话的语法错误,并用英文重写,最后附带一段可以输出重写后文本的 Bash 脚本,'He don't know where is the nearest bank.'」
这道题同时考察三件事,语法纠错、跨语言改写、脚本生成。三个任务叠加在一起,正好是路由模型最考验调度能力的场景。
把题目扔给 automodel,它在一次对话里把这三件事全办了。语法错误找得很准,主谓不一致和语序问题两个都指出来了,英文重写版本是「He doesn't know where the nearest bank is.」,然后给了一段 Bash 脚本,输出重写后的句子。
我又把同样的题目扔给 GPT 和 DeepSeek,对比了一下。三家都能完成,但写法不太一样。automodel 的 Bash 脚本里用了一个 corrected_sentence 变量来承接重写结果,比直接 echo 显得更工程化一点。

这种「语法纠错+翻译+脚本」的混合任务,能一次给齐,说明路由系统在调度的时候没把任务拆碎,而是把它当作一个整体派给了最合适的那一位。
这一点其实是最让我意外的。
很多路由模型的真实表现是,遇到复杂任务就开始犯迷糊,要么把多个子任务拆给不同模型导致上下文丢失,要么就一股脑全塞给最贵的那个浪费资源。
automodel 这块处理得还行,至少没让我看到明显的调度事故。
真上生产环境,结果还不错
测完三道题,我心里的结论是,automodel 至少是及格线以上的。
但我想了想,光做几道题还不够。这种模型最终还是要落到真实业务里,能不能扛住生产环境的考验才是关键。
正好我手上有个项目,叫 AI 人生规划师,是用 Next.js 写的,已经开源到 GitHub 了。

之前这个项目的核心对话是用单一模型驱动的,效果还行但有点单调。换句话说,每个用户的问题都由同一个大脑回答,缺乏多样性。
这次我直接把 automodel 接了进去,让它根据问题的类型自动派给不同的子模型。
比如用户问职业规划,DeepSeek 来答,逻辑严密。用户问学习成长建议,Qwen 来答,调性更活泼。用户问财务规划,GLM 来答,更专业。
跑了两天下来,效果确实有改善。最明显的是回答的多样性上来了,不再是单一模型的固定腔调。
顺便还把项目的视觉风格也升了一下。原来是冷色调,换成了更温和的渐变色,看起来没那么「硬核」,更像一个陪伴型的产品。
这个项目是开源的,地址放在下面,感兴趣的朋友可以 star 一下,或者直接拿去二开都行。
GitHub 地址:GitHub – Leterhong/ai-life-planner · GitHub


写在最后
回到 automodel 这个产品本身。
坦率的讲,它不是完美的。三个测试都是单回合测试,没有长时间对话的记忆评估。也没有覆盖到多模态、视频理解、Agent 工具调用这些更复杂的场景。
但作为一个「五合一」路由模型,它在三道刁钻题上的表现,让我对这种「模型路由器」的产品形态有了新的看法。
去年的时候,我对这种「模型路由器」是有点不屑的。总觉得这是打不过单兵王者的无奈之举,把好几个二线模型拼一起,看起来功能全面,其实每项都不精。
automodel 这次让我意识到,我可能有点偏见。
如果路由调度真的能做到任务级最优,那「五个 90 分的模型」可能真的比「一个 99 分的模型」更实用,因为 90 分覆盖的领域更多,99 分可能只在一个领域特别突出。
这个想法对不对,我现在也不敢说死。
但有一件事我可以确定,下次再有人问我「我该用哪个模型」的时候,我会多问一句,「你的问题类型是单一的还是混合的?」
如果是单一垂直问题,那就挑那个领域的王者。如果是混合问题,那 automodel 这类路由模型,可能真的值得一试。