同一份任务、同一套 OpenAlex AI Landscape v1 数据、同一组交付要求。四个模型都需要从结构化统计表、论文样本和 PDF 页面中完成分析,并交付结论、证据、脚本、图表、Dashboard 和验证记录。
本文讲述:将四份交付物摆在一起,能看到什么结论,以及 Qwen3.8-Max 的优势到底落在哪里。
四个模型都回答对了主要问题。差异不在“有没有答案”,而在答案后面有没有证据、有没有做边界检查、交付物能不能继续复核,能否挖掘出表面数据之下的隐含信息。
| Qwen3.8-Max | Fable5 | Opus4.8 | Sol | |
|---|---|---|---|---|
| 可信洞察指数 | 100 | 94 | 89 | 87 |
| 核心结论前提 | 40 | 40 | 40 | 40 |
| 证据可追溯性 | 25 | 21 | 14 | 13 |
| 本质挖掘与稳健分析 | 20 | 20 | 20 | 19 |
| 产物可验证性 | 15 | 13 | 15 | 15 |
| 结构化结论 | 18 | 16 | 15 | 13 |
| 页级证据 | 6 | 5 | 3 | 3 |
| 稳健性分析组数 | 3 | 3 | 3 | 2 |
| 最终自动验证 | 44/44 | 48/48 | 31/31 | 21/21 |
| 耗时 | 44.9 分钟 | 34.0 分钟 | 24.8 分钟 | 23.1 分钟 |
Qwen3.8-Max 不是最快的,也不是最少消耗 Token 的。它赢在另一件事:以优秀的成本效率,把“结论”继续往下拆成证据链、边界条件和可复核产物。
这个分数是本次同任务对比的展示型指标,不是通用模型排名。四个模型的核心结论都可用,分差主要反映证据深度、稳健性和交付自检验闭环。
数据集是 OpenAlex AI Landscape v1。它更像一张“全球 AI 研究地图”,模型要在三种尺度之间来回核对:
| 数据层 | 要回答的问题 | 数据规模 |
|---|---|---|
| 全景统计层 | AI 研究是在数量膨胀,还是质量也在提升? | 2020–2025 年、10 个国家,共 60 个国家—年份单元;含论文量、Top 1%/Top 10%、开放获取和国际合作指标 |
| 论文样本层 | 这些变化由哪些论文、主题和机构构成? | 按国家—年份分层抽取,去重后 1,198 篇论文;含摘要、引用、主题、作者机构、国家、开放获取和来源字段 |
| 原文证据层 | 代表性论文究竟做出了什么突破,又有哪些边界? | 17 篇 CC-BY 论文、290 页 PDF,提供页分隔文本和页面图像,覆盖能力、可靠性、安全、医疗、教育、材料和治理 |
所以任务所测的不是“能不能写一段像样的摘要”,而是:
-
能不能从 60 个国家—年份单元恢复总体趋势;
-
能不能把规模、质量、合作、开放获取和主题变化放到同一张图里解释;
-
能不能区分总体统计与 1,198 篇样本;
-
能不能回到 17 篇论文的具体页面,验证代表性结论;
-
能不能把分析交付成别人可以运行、检查和继续加工的东西。
总 Token 按 input_tokens + output_tokens 计算;缓存命中输入属于输入的一部分,不重复累加。
| 模型 | 总 Token | 当前计费系数 | 折算消耗 |
|---|---|---|---|
| Qwen3.8-Max | 7,856,944 | 0.5× | 3,928,472 |
| Opus4.8 | 4,954,026 | 1.6× | 7,926,442 |
| Fable5 | 4,244,838 | 0× | 0 |
| Sol | 784,698 | 未公开 | 无法核算 |
Qwen3.8-Max 消耗的原始 Token 最多,但在本次模型目录系数下,折算消耗约 392.8 万,低于 Opus4.8 的约 792.6 万。更准确的说法是:它用更多上下文和执行过程换取更完整的分析闭环,同时保持了较好的成本效率。
这张表只能说明本次会话的资源成本,不能单独证明模型质量。
这些是本轮判断“结论正确性”的共同基线:
-
AI 研究既扩量,也提质。 十国论文总量从 2020 年的 32,306 篇增至 2025 年的 64,072 篇,增长 98.3%;加权 Top 10% 占比从 27.2% 升至 38.6%,Top 1% 占比从 3.3% 升至 5.1%。Top 1% 论文数约增至 3.03 倍,不能简单归结为数量膨胀。
-
规模和转化效率不是一回事。 中国 2025 年论文量最大,为 27,080 篇,2020–2025 年增长 167.3%,Top 10% 占比升至 40.1%。新加坡 2025 年仅 1,198 篇,但 Top 10% 占比 51.8%、Top 1% 占比 9.3%,国际合作占比 85.4%。
-
合作和高影响力存在稳定相关,但不是因果结论。 国际合作占比与 Top 10% 占比的 Pearson 相关约 +0.55、Spearman 相关约 +0.58;国家内去均值后仍约 +0.49。开放获取与 Top 10% 的 Pearson 相关约 −0.30,国家内去均值后接近 −0.05。
-
研究热点在扩散。 Top 5 主题份额从 23.0% 降至 20.6%,HHI 从 0.0240 降至 0.0228;AI in Service Interactions 增长 775%,Explainable AI 增长 539%,Adversarial Robustness 增长 274%。研究从能力展示扩展到应用、可靠性和治理。
-
代表性论文同时呈现突破和边界。 深读证据包括 Med-PaLM、USMLE 等能力突破,也包括幻觉检测、安全 V&V、医疗治理和低 FWCI 复制型考试评测。研究增长不是单向度的“全面突破”。
四个模型都能回答主问题。Qwen3.8-Max 进一步把结果拆成 18 条结构化结论,其中 6 条带有页级证据。
它没有只写“论文增长了、质量也提高了”,而是把总体表、主题表、代表性论文和 PDF 页面图像串在一起。读者可以从一句结论回到具体表格,再回到论文页码。这个差异不是多写几段话,而是多了一层复核路径。
country_year.csv 是总体统计,works.csv 是 1,198 篇分层样本。Qwen3.8-Max 明确区分了两者,没有把样本机构结果外推成全球机构排名,也没有把样本中的主题频次当成总体份额。
在合作、开放获取和高影响力之间,它使用“相关”而不是“导致”;同时补充国家内去均值、逐年相关和剔除 2025 年等检查。不是所有检查都能变成因果识别,但至少没有把相关性包装成因果性。
它没有停在“某主题增长很快”。服务交互、可解释性、对抗鲁棒性、医疗和材料等主题的增长,被进一步连接到幻觉检测、安全验证、医学 copilot 和科研自动化等论文证据,形成了:
能力扩展 → 可靠性攻坚 → 应用落地与治理跟进
这是从指标变化往研究阶段变化走了一步。这个解释仍然需要谨慎,尤其不能把主题共现直接当作技术路线的因果链,但它比单纯罗列增速更接近研究问题本身。
Qwen3.8-Max 完成了三组稳健性分析、44/44 自动验证、图表和离线 Dashboard,并留下 evidence、run-summary、验证和归档信息。
对于需要审阅、复跑和继续加工的研究任务,真正有用的交付通常是:
答案 + 证据 + 执行轨迹 + 可验证产物
这也是本轮 Qwen3.8-Max 得分领先的主要原因。它不是结论数量最多,而是把结论和证据组织得更像一份可以交接的研究工作。
-
本轮是四个模型在同一任务、同一冻结数据集上的外部评估,不等同于通用模型能力排名;
-
“可信洞察指数”是展示型指标,结论前提统一给 40 分,避免把“做出一个可用回答”和“证据深度”混为一谈;
-
17 篇深读论文是固定的 CC-BY 语料,只用于补充和挑战总体趋势,不能代表全部 AI 论文;
-
2025 年引用窗口较短,Top 1%/Top 10% 的年度跳升需要谨慎解释;
-
相关性不能推出“国际合作导致高影响力”,也不能推出“开放获取降低影响力”;
-
Token 消耗和耗时反映本次会话成本,不是模型质量本身;
-
Fable5 的 0×和 Sol 的未公开系数来自当前模型目录,不应直接当作长期计费承诺。
统一提示词:
各模型生成的可交互网页产物:
fable.html · sol.html · qwen3.8max.html · opus4.8.html
结果横向展示与分析 PPT:
这轮真正拉开差距的,不是模型能不能从数据里找出一个答案,而是它能不能把答案继续做成一条经得起回查的证据链,挖掘隐含有价值的信息,并交付成别人可以运行和复核的研究产品。