使用示例
本章节提供了不同规模数据量的使用示例,帮助您了解 AutoSTAT 在处理不同大小数据集时的性能表现。 注意,所有耗时测试均在自动模式下进行。
备注
我们对每个实验进行了 5 次独立重复测试,并以 “均值 ± 标准差” 的形式报告耗时结果。测试结果不包括数据上传与解析为 DataFrame 的时间。需要注意,由于大模型生成内容存在一定的不确定性,且不同模型间性能差异较大,实际运行中的耗时可能会出现一定波动。
*总耗时为端到端耗时,流程含并行执行,故不等于各环节之和。
小规模数据量示例(<1000 条)
我们使用 UC Irvine 中的数据集 “ Wine ”(包含 178 条数据,去除 Index 文件)作为测试数据集。 各部分耗时情况如下(单位:秒):
环节 |
GPT-5.4-mini 耗时 |
DeepSeek-v4-flash 耗时 |
|---|---|---|
数据导入 |
8.87±1.09 |
11.55±2.00 |
数据预处理 |
29.98±2.93 |
62.99±9.58 |
数据可视化 |
238.04±154.45 |
267.90±91.14 |
建模分析 |
85.93±14.75 |
172.91±46.76 |
报告生成 |
374.62±128.82 |
421.00±81.57 |
总耗时* |
743.09±291.66 |
938.34±216.80 |
生成报告示例:
GPT-5.4-mini: 点击以下载doc文档
DeepSeek-v4-flash: 点击以下载doc文档
中等规模数据量示例(1000 条–10000 条)
我们使用 UC Irvine 中的数据集 “ Seoul Bike Sharing Demand ”(包含 8760 条数据)作为测试数据集。 各部分耗时情况如下(单位:秒):
环节 |
GPT-5.4-mini 耗时 |
DeepSeek-v4-flash 耗时 |
|---|---|---|
数据导入 |
9.57±0.99 |
14.24±1.85 |
数据预处理 |
46.60±14.07 |
168.66±75.93 |
数据可视化 |
318.06±115.06 |
240.06±70.24 |
建模分析 |
58.05±17.25 |
155.29±27.24 |
报告生成 |
508.90±95.46 |
463.64±247.03 |
总耗时* |
945.65±206.60 |
1043.58±317.46 |
生成报告示例:
GPT-5.4-mini: 点击以下载doc文档
DeepSeek-v4-flash: 点击以下载doc文档
大规模数据量示例(>10000 条)
我们使用 UC Irvine 中的数据集 “ Steel Industry Energy Consumption ”(包含 35040 条数据)作为测试数据集。 各部分耗时情况如下(单位:秒):
环节 |
GPT-5.4-mini 耗时 |
DeepSeek-v4-flash 耗时 |
|---|---|---|
数据导入 |
10.59±1.04 |
15.33±2.35 |
数据预处理 |
44.23±9.15 |
129.39±29.91 |
数据可视化 |
247.40±117.68 |
189.66±60.48 |
建模分析 |
59.35±11.32 |
187.60±45.64 |
报告生成 |
402.64±145.48 |
525.96±180.00 |
总耗时* |
771.04±268.76 |
1051.71±221.87 |
生成报告示例:
GPT-5.4-mini: 点击以下载doc文档
DeepSeek-v4-flash: 点击以下载doc文档
超长报告生成示例
GPT-5.4(Forty Soybean Cultivars from Subsequent Harvests): 点击以下载 DOCX
GPT-5.4(SkillCraft1 Master Table Dataset): 点击以下载 DOCX
GPT-5.4(Real Estate Valuation): 点击以下载 DOCX
备注
实际耗时可能因硬件配置、网络状况和具体操作而有所不同。由于大模型返回结果不稳定,如果在自动模式下出现预处理、可视化及建模环节 debug 次数过多的情况,请清空数据并重新开始流程;如为手动操作,请切换至其他环节并再切回对应出错环节重试。