大模型试用后综合报告

一、绪论

试用时间:2026/06/08~2026/07/16
覆盖模型范围:GPT5.5、claude-opus-4.6、DeepSeek V4、Gemini 3.1Pro
测试环境:Window10、Claude Code、第三方接入平台
核心评测维度声明:根据模型在代码优化、文本提取、每百万token价格多个方面综合评价
注意点:考虑成本只做简单实例验证

二、代码编辑与优化能力比较

如果试用太简单/太经典的题目对于各大模型来说测不出什么差距,所以本次使用了LeetCode Hard 级别的逻辑 + 复杂边界处理来验证模型对于低效代码的优化效果,以下是示例/原始代码:
提示词:下面是用暴力枚举法(O(n²))实现“柱状图中最大矩形面积”的 Python 代码。请重写为时间复杂度 O(n) 的单调栈算法,保持函数名 largestRectangleArea 不变,只输出代码,不要解释。
输出结果如下:
  • GPT5.5
  • Claude opus4.6
  • DeepSeek V4Pro
  • Gemini 3.1Pro
测试在一百条用例下,由各大模型优化后的代码平均运行时间,实际运行结果如下(测试代码在附件):
模型测试结果
模型测试结果
结论:Claude的代码优化能力最佳,其次为GPT,DeepSeek的代码时间复杂度高于其他三个模型,Gmini优化最弱

三、文本提取能力比较

准备一段长文字,使用各大模型提取其中的关键词,原文内容见附件。
此次内容提示词为:
请阅读上面的内部项目沟通文本,提取出以下 9 个关键信息点,并以严格的 JSON 格式输出。不要有任何多余的解释或前缀,只输出 JSON。
要求提取的字段如下(Key 必须完全一致):
  1. "project_name":项目的中文名称
  1. "new_go_live_date":海外节点部署推迟后的新启动日期
  1. "budget_change":研发预算的调整幅度(百分比,带%号)
  1. "additional_funds":追加的运营预算金额(单位:万元,只输出数字)
  1. "new_feature":新增的产品功能模块名称
  1. "core_metric":新的北极星考核指标名称
  1. "metric_target":该指标在 Q3 末的目标数值(含单位,如 "120万")
  1. "new_meeting_place":下周起变更后的新会议室名称
  1. "ceo_name":CEO 的完整中文姓名
以下是各大模型的生成结果:
  • GPT5.5
  • Claude opus4.6
  • DeepSeek V4Pro
notion image
  • Gemini 3.1Pro
结论:Claude提取出具体的项目名称;GPT和Gmini提取了项目代号;DeepSeek提取了代号+名称,但输出存在冗余内容且json串不全,其他模型的数据仅有json。如果忽略本次测试中DeepSeek输出内容不全的问题,综合来看DeepSeek输出的文本更全面,包括项目名称和时间两个字段

四、测试自动化中的表现

目前在自动化项目编写中常用的模型为GPT5.5,主要考虑到的优势有:
  • 生成稳定,即使是通过第三方调用响应速度依然快
  • 通过第三方平台调用价格实惠
  • 对于常规的 id、class_name、xpath(相对路径)定位准确率高,目前还未遇到定位失败的情况
但目前使用频率不算高,后续试用其他模型后再综合对比

五、上下文及输出长度

模型
上下文长度(tokens)
输出长度(tokens)
GPT5.5
1000K
128K
Claude-opus4.6
1000K
64K
DeepSeek V4Pro
1M
375K
Gemini 3.1Pro
1M
32K

六、模型定价(标准模式每100万tokens)

模型
输入($)
输出($)
GPT5.5
5
30
模型
输入($)
输出($)
Claude-opus4.6 —-上下文长度 <= 200K
10
37.5
Claude-opus4.6 —-上下文长度 > 200K
5
25
模型
输入($)
输出($)
DeepSeek V4Pro
0.435
0.870
模型
输入($)
输出($)
Gemini 3.1Pro —-上下文长度 <= 200K
2
12
Gemini 3.1Pro —-上下文长度 > 200K
4
18

七、最终结果

综合来看,如果追求日常高频开发的效率与成本的平衡,GPT-5.5 或 DeepSeek V4 是最合适的选择,两者在常规代码生成上差距不大,成本敏感型任务可优先考虑 DeepSeek;如果遇到复杂的业务逻辑、需要重构遗留代码或要求极高的首次生成质量,Claude Opus-4.6 值得投入,多花一些成本换取的是大量调试时间的节省;如果需要处理超长文档、理解整个项目全貌或进行多模态相关的测试,Gemini 3.1 Pro 是不错的选择

附件

1、代码能力测试

 

2、文本能力测试

测试原文数据
 
上一篇
自动化调研及总结
下一篇
软件测试
Loading...
目录