2025-02-13-清华大学-DeepSeek+DeepResearch——让科研像聊天一样简单_86页_15mb
报告摘要
文档总结:DeepSeek+DeepResearch 与各类AI模型在科研任务中的表现
核心内容
本文档主要探讨了多个AI模型(包括DeepSeek R1、Open AI o3mini、Claude 3.5 sonnet、Kimi k1.5)在科研任务中的表现,具体包括爬虫数据采集、文件数据读取、文本数据集成以及数据分析等方面。通过对不同任务的执行效果进行对比,评估了各模型在处理数据时的准确性和效率。
主要观点
1. 爬虫数据采集
- DeepSeek R1:能够提取所有网址并进行筛选、去重,所撰写代码运行后完成数据爬虫任务,所获取数据准确,少量数据有所遗漏。
- Open AI o3mini:响应速度快,能够高效提取所有需求链接,输出完整可运行的Python脚本,但数据采集结果为空。
- Claude 3.5 sonnet:能够提取所有网址,调整后可输出正确代码,运行代码能生成本地文件,但提取数据结果为空。
- Kimi k1.5:能够提取所有网址,代码运行后生成本地文件,但提取数据结果为空。
2. 文件数据读取
- DeepSeek R1:能够详细全面地提取文件中的数据,并整理成可视化数据表格,逻辑性强、指标清晰。
- Open AI o3mini:暂不支持附件上传,响应速度快,能够快速读取粘贴数据,输出结果格式工整、简洁。
- Claude 3.5 sonnet:很好地完成了数据读取及提取任务,没有漏数据指标,数据逻辑性很好。
- Kimi k1.5:能够快速读取文件数据,并整理成可视化数据表格,数据准确,但数据维度不够全面。
3. 文本数据集成
- DeepSeek R1:在一般文本处理任务中提取的文本数据维度最为全面,但容易受文本长度或模型稳定性影响出现失误;在长文本处理任务中表现不佳,无法完成任务。
- Open AI o3mini:在一般文本处理任务中能够高效提取数据,输出格式规范的数据表格,但数据维度有所缺失。
- Claude 3.5 sonnet:能够准确集成文本数据表格,但数据维度有限。
- Kimi k1.5:在长文本处理任务中表现优于短文本,提取准确且数据维度更加全面。
4. 数据分析
- DeepSeek R1:能够精准提取关键指标“幸存率”,分析多个因素特征对幸存率的影响,结合历史背景对数据及规律进行验证,并敏锐察觉数据异常,提出了异常处理建议。
- Open AI o3mini:响应速度快,高效输出数据分析结果,分析各因素对关键指标生存率的影响,语言表达自然,重点突出,但没有察觉数据异常。
- Claude 3.5 sonnet:提供数据分析程序代码,能够提取大部分特征并对其与生存率的关联进行分析,但最终没有形成明确的结论。
- Kimi k1.5:能够精准分析关键指标生存率,但对特征提取不完整,仅能识别较为浅层的数据关联,分析能力相对较弱。
关键信息
1. 爬虫任务
- DeepSeek R1:支持联网查询网址,能够生成完整的代码并执行数据采集任务,数据结果较为完整。
- Open AI o3mini:响应速度快,但不支持附件上传,需依赖粘贴数据,数据采集结果为空。
- Claude 3.5 sonnet:支持联网查询网址,能够生成代码并执行任务,但数据结果为空。
- Kimi k1.5:支持联网查询网址,能够生成代码并执行任务,但数据结果为空。
2. 文件数据读取任务
- DeepSeek R1:能够提取并整理文件中的数据,输出表格详细。
- Open AI o3mini:不支持附件上传,依赖粘贴数据,输出表格准确。
- Claude 3.5 sonnet:输出表格格式规范,数据逻辑性强。
- Kimi k1.5:输出表格数据准确,但维度不够全面。
3. 文本数据集成任务
- DeepSeek R1:在短文本中表现良好,但无法处理长文本。
- Open AI o3mini:在短文本中表现良好,但在长文本中数据维度不足。
- Claude 3.5 sonnet:输出表格格式规范,数据维度有限。
- Kimi k1.5:在长文本中表现更好,提取准确,数据维度更全面。
4. 数据分析任务
- DeepSeek R1:能够分析幸存率与多个因素的关系,如性别、年龄、舱位等级等,并结合历史背景进行验证。
- Open AI o3mini:能够分析数据,但未察觉异常。
- Claude 3.5 sonnet:能够提取大部分特征,但未形成明确结论。
- Kimi k1.5:能够分析幸存率,但对数据特征的提取不完整。
结论
- DeepSeek R1:在爬虫和数据分析任务中表现最为全面,数据提取准确,但对长文本处理能力有限。
- Open AI o3mini:响应速度快,适合快速任务处理,但在数据维度和附件支持方面有所欠缺。
- Claude 3.5 sonnet:输出格式工整,但数据维度和任务完成度存在不足。
- Kimi k1.5:在长文本处理中表现突出,数据提取准确,但对短文本的处理能力较弱。
各模型在不同任务中的表现各有优劣,选择合适的模型需根据具体任务需求进行评估。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载