使用示例

本章节提供了不同规模数据量的使用示例,帮助您了解 AutoSTAT 在处理不同大小数据集时的性能表现。 注意,所有耗时测试均在自动模式下进行。

备注

我们对每个实验进行了 5 次独立重复测试,并以 “均值 ± 标准差” 的形式报告耗时结果。测试结果不包括数据上传与解析为 DataFrame 的时间。需要注意,由于大模型生成内容存在一定的不确定性,且不同模型间性能差异较大,实际运行中的耗时可能会出现一定波动。
*总耗时为端到端耗时,流程含并行执行,故不等于各环节之和。

小规模数据量示例(<1000 条)

我们使用 UC Irvine 中的数据集 “ Wine ”(包含 178 条数据,去除 Index 文件)作为测试数据集。 各部分耗时情况如下(单位:秒):

环节

GPT-5.4-mini 耗时

DeepSeek-v4-flash 耗时

数据导入

8.87±1.09

11.55±2.00

数据预处理

29.98±2.93

62.99±9.58

数据可视化

238.04±154.45

267.90±91.14

建模分析

85.93±14.75

172.91±46.76

报告生成

374.62±128.82

421.00±81.57

总耗时*

743.09±291.66

938.34±216.80

生成报告示例:

GPT-5.4-mini: 点击以下载doc文档

DeepSeek-v4-flash: 点击以下载doc文档

中等规模数据量示例(1000 条–10000 条)

我们使用 UC Irvine 中的数据集 “ Seoul Bike Sharing Demand ”(包含 8760 条数据)作为测试数据集。 各部分耗时情况如下(单位:秒):

环节

GPT-5.4-mini 耗时

DeepSeek-v4-flash 耗时

数据导入

9.57±0.99

14.24±1.85

数据预处理

46.60±14.07

168.66±75.93

数据可视化

318.06±115.06

240.06±70.24

建模分析

58.05±17.25

155.29±27.24

报告生成

508.90±95.46

463.64±247.03

总耗时*

945.65±206.60

1043.58±317.46

生成报告示例:

GPT-5.4-mini: 点击以下载doc文档

DeepSeek-v4-flash: 点击以下载doc文档

大规模数据量示例(>10000 条)

我们使用 UC Irvine 中的数据集 “ Steel Industry Energy Consumption ”(包含 35040 条数据)作为测试数据集。 各部分耗时情况如下(单位:秒):

环节

GPT-5.4-mini 耗时

DeepSeek-v4-flash 耗时

数据导入

10.59±1.04

15.33±2.35

数据预处理

44.23±9.15

129.39±29.91

数据可视化

247.40±117.68

189.66±60.48

建模分析

59.35±11.32

187.60±45.64

报告生成

402.64±145.48

525.96±180.00

总耗时*

771.04±268.76

1051.71±221.87

生成报告示例:

GPT-5.4-mini: 点击以下载doc文档

DeepSeek-v4-flash: 点击以下载doc文档

超长报告生成示例

GPT-5.4(Forty Soybean Cultivars from Subsequent Harvests): 点击以下载 DOCX

GPT-5.4(SkillCraft1 Master Table Dataset): 点击以下载 DOCX

GPT-5.4(Real Estate Valuation): 点击以下载 DOCX

备注

实际耗时可能因硬件配置、网络状况和具体操作而有所不同。由于大模型返回结果不稳定,如果在自动模式下出现预处理、可视化及建模环节 debug 次数过多的情况,请清空数据并重新开始流程;如为手动操作,请切换至其他环节并再切回对应出错环节重试。