Skip to content

Latest commit

 

History

History

Folders and files

NameName
Last commit message
Last commit date

parent directory

..
 
 
 
 
 
 
 
 
 
 

README.md

Qwen3.8-数据分析case报告

四个模型,同一批真实全球 AI 论文数据

同一份任务、同一套 OpenAlex AI Landscape v1 数据、同一组交付要求。四个模型都需要从结构化统计表、论文样本和 PDF 页面中完成分析,并交付结论、证据、脚本、图表、Dashboard 和验证记录。

本文讲述:将四份交付物摆在一起,能看到什么结论,以及 Qwen3.8-Max 的优势到底落在哪里。

一、结论先行

四个模型都回答对了主要问题。差异不在“有没有答案”,而在答案后面有没有证据、有没有做边界检查、交付物能不能继续复核,能否挖掘出表面数据之下的隐含信息。

Qwen3.8-Max Fable5 Opus4.8 Sol
可信洞察指数 100 94 89 87
核心结论前提 40 40 40 40
证据可追溯性 25 21 14 13
本质挖掘与稳健分析 20 20 20 19
产物可验证性 15 13 15 15
结构化结论 18 16 15 13
页级证据 6 5 3 3
稳健性分析组数 3 3 3 2
最终自动验证 44/44 48/48 31/31 21/21
耗时 44.9 分钟 34.0 分钟 24.8 分钟 23.1 分钟

Qwen3.8-Max 不是最快的,也不是最少消耗 Token 的。它赢在另一件事:以优秀的成本效率,把“结论”继续往下拆成证据链、边界条件和可复核产物。

这个分数是本次同任务对比的展示型指标,不是通用模型排名。四个模型的核心结论都可用,分差主要反映证据深度、稳健性和交付自检验闭环。

二、全球 AI 研究“地图”分析

数据集是 OpenAlex AI Landscape v1。它更像一张“全球 AI 研究地图”,模型要在三种尺度之间来回核对:

数据层 要回答的问题 数据规模
全景统计层 AI 研究是在数量膨胀,还是质量也在提升? 2020–2025 年、10 个国家,共 60 个国家—年份单元;含论文量、Top 1%/Top 10%、开放获取和国际合作指标
论文样本层 这些变化由哪些论文、主题和机构构成? 按国家—年份分层抽取,去重后 1,198 篇论文;含摘要、引用、主题、作者机构、国家、开放获取和来源字段
原文证据层 代表性论文究竟做出了什么突破,又有哪些边界? 17 篇 CC-BY 论文、290 页 PDF,提供页分隔文本和页面图像,覆盖能力、可靠性、安全、医疗、教育、材料和治理

所以任务所测的不是“能不能写一段像样的摘要”,而是:

  • 能不能从 60 个国家—年份单元恢复总体趋势;

  • 能不能把规模、质量、合作、开放获取和主题变化放到同一张图里解释;

  • 能不能区分总体统计与 1,198 篇样本;

  • 能不能回到 17 篇论文的具体页面,验证代表性结论;

  • 能不能把分析交付成别人可以运行、检查和继续加工的东西。

三、容易误导的点:Token 多,不等于成本高

总 Token 按 input_tokens + output_tokens 计算;缓存命中输入属于输入的一部分,不重复累加。

模型 总 Token 当前计费系数 折算消耗
Qwen3.8-Max 7,856,944 0.5× 3,928,472
Opus4.8 4,954,026 1.6× 7,926,442
Fable5 4,244,838 0× 0
Sol 784,698 未公开 无法核算

Qwen3.8-Max 消耗的原始 Token 最多,但在本次模型目录系数下,折算消耗约 392.8 万,低于 Opus4.8 的约 792.6 万。更准确的说法是:它用更多上下文和执行过程换取更完整的分析闭环,同时保持了较好的成本效率。

这张表只能说明本次会话的资源成本,不能单独证明模型质量。

四、四个模型共同回答对了什么

这些是本轮判断“结论正确性”的共同基线:

  1. AI 研究既扩量,也提质。 十国论文总量从 2020 年的 32,306 篇增至 2025 年的 64,072 篇,增长 98.3%;加权 Top 10% 占比从 27.2% 升至 38.6%,Top 1% 占比从 3.3% 升至 5.1%。Top 1% 论文数约增至 3.03 倍,不能简单归结为数量膨胀。

  2. 规模和转化效率不是一回事。 中国 2025 年论文量最大,为 27,080 篇,2020–2025 年增长 167.3%,Top 10% 占比升至 40.1%。新加坡 2025 年仅 1,198 篇,但 Top 10% 占比 51.8%、Top 1% 占比 9.3%,国际合作占比 85.4%。

  3. 合作和高影响力存在稳定相关,但不是因果结论。 国际合作占比与 Top 10% 占比的 Pearson 相关约 +0.55、Spearman 相关约 +0.58;国家内去均值后仍约 +0.49。开放获取与 Top 10% 的 Pearson 相关约 −0.30,国家内去均值后接近 −0.05。

  4. 研究热点在扩散。 Top 5 主题份额从 23.0% 降至 20.6%,HHI 从 0.0240 降至 0.0228;AI in Service Interactions 增长 775%,Explainable AI 增长 539%,Adversarial Robustness 增长 274%。研究从能力展示扩展到应用、可靠性和治理。

  5. 代表性论文同时呈现突破和边界。 深读证据包括 Med-PaLM、USMLE 等能力突破,也包括幻觉检测、安全 V&V、医疗治理和低 FWCI 复制型考试评测。研究增长不是单向度的“全面突破”。

五、Qwen3.8-Max 优势在哪里

1. 把“结论可用”推进到了“结论可复核”

四个模型都能回答主问题。Qwen3.8-Max 进一步把结果拆成 18 条结构化结论,其中 6 条带有页级证据。

它没有只写“论文增长了、质量也提高了”,而是把总体表、主题表、代表性论文和 PDF 页面图像串在一起。读者可以从一句结论回到具体表格,再回到论文页码。这个差异不是多写几段话,而是多了一层复核路径。

2. 更早发现了数据边界

country_year.csv 是总体统计,works.csv 是 1,198 篇分层样本。Qwen3.8-Max 明确区分了两者,没有把样本机构结果外推成全球机构排名,也没有把样本中的主题频次当成总体份额。

在合作、开放获取和高影响力之间,它使用“相关”而不是“导致”;同时补充国家内去均值、逐年相关和剔除 2025 年等检查。不是所有检查都能变成因果识别,但至少没有把相关性包装成因果性。

3. 把“热点增长”解释成研究阶段变化

它没有停在“某主题增长很快”。服务交互、可解释性、对抗鲁棒性、医疗和材料等主题的增长,被进一步连接到幻觉检测、安全验证、医学 copilot 和科研自动化等论文证据,形成了:

能力扩展 → 可靠性攻坚 → 应用落地与治理跟进

这是从指标变化往研究阶段变化走了一步。这个解释仍然需要谨慎,尤其不能把主题共现直接当作技术路线的因果链,但它比单纯罗列增速更接近研究问题本身。

4. 交付的是分析产品,不只是一段答案

Qwen3.8-Max 完成了三组稳健性分析、44/44 自动验证、图表和离线 Dashboard,并留下 evidence、run-summary、验证和归档信息。

对于需要审阅、复跑和继续加工的研究任务,真正有用的交付通常是:

答案 + 证据 + 执行轨迹 + 可验证产物

这也是本轮 Qwen3.8-Max 得分领先的主要原因。它不是结论数量最多,而是把结论和证据组织得更像一份可以交接的研究工作。

六、测评的边界

  • 本轮是四个模型在同一任务、同一冻结数据集上的外部评估,不等同于通用模型能力排名;

  • “可信洞察指数”是展示型指标,结论前提统一给 40 分,避免把“做出一个可用回答”和“证据深度”混为一谈;

  • 17 篇深读论文是固定的 CC-BY 语料,只用于补充和挑战总体趋势,不能代表全部 AI 论文;

  • 2025 年引用窗口较短,Top 1%/Top 10% 的年度跳升需要谨慎解释;

  • 相关性不能推出“国际合作导致高影响力”,也不能推出“开放获取降低影响力”;

  • Token 消耗和耗时反映本次会话成本,不是模型质量本身;

  • Fable5 的 0×和 Sol 的未公开系数来自当前模型目录,不应直接当作长期计费承诺。

七、如何复现

统一提示词:

TASK.md

各模型生成的可交互网页产物:

fable.html · sol.html · qwen3.8max.html · opus4.8.html

结果横向展示与分析 PPT:

Qwen3.8-Max 模型对比.pptx

结尾

这轮真正拉开差距的,不是模型能不能从数据里找出一个答案,而是它能不能把答案继续做成一条经得起回查的证据链,挖掘隐含有价值的信息,并交付成别人可以运行和复核的研究产品。