大模型试用后综合报告
一、绪论
试用时间:2026/06/08~2026/07/16
覆盖模型范围:GPT5.5、claude-opus-4.6、DeepSeek V4、Gemini 3.1Pro
测试环境:Window10、Claude Code、第三方接入平台
核心评测维度声明:根据模型在代码优化、文本提取、每百万token价格多个方面综合评价
注意点:考虑成本只做简单实例验证
二、代码编辑与优化能力比较
如果试用太简单/太经典的题目对于各大模型来说测不出什么差距,所以本次使用了LeetCode Hard 级别的逻辑 + 复杂边界处理来验证模型对于低效代码的优化效果,以下是示例/原始代码:
提示词:下面是用暴力枚举法(O(n²))实现“柱状图中最大矩形面积”的 Python 代码。请重写为时间复杂度 O(n) 的单调栈算法,保持函数名 largestRectangleArea 不变,只输出代码,不要解释。
输出结果如下:
- GPT5.5
- Claude opus4.6
- DeepSeek V4Pro
- Gemini 3.1Pro
测试在一百条用例下,由各大模型优化后的代码平均运行时间,实际运行结果如下(测试代码在附件):

结论:Claude的代码优化能力最佳,其次为GPT,DeepSeek的代码时间复杂度高于其他三个模型,Gmini优化最弱
三、文本提取能力比较
准备一段长文字,使用各大模型提取其中的关键词,原文内容见附件。
此次内容提示词为:
请阅读上面的内部项目沟通文本,提取出以下 9 个关键信息点,并以严格的 JSON 格式输出。不要有任何多余的解释或前缀,只输出 JSON。
要求提取的字段如下(Key 必须完全一致):
- "project_name":项目的中文名称
- "new_go_live_date":海外节点部署推迟后的新启动日期
- "budget_change":研发预算的调整幅度(百分比,带%号)
- "additional_funds":追加的运营预算金额(单位:万元,只输出数字)
- "new_feature":新增的产品功能模块名称
- "core_metric":新的北极星考核指标名称
- "metric_target":该指标在 Q3 末的目标数值(含单位,如 "120万")
- "new_meeting_place":下周起变更后的新会议室名称
- "ceo_name":CEO 的完整中文姓名
以下是各大模型的生成结果:
- GPT5.5
- Claude opus4.6
- DeepSeek V4Pro

- Gemini 3.1Pro
结论:Claude提取出具体的项目名称;GPT和Gmini提取了项目代号;DeepSeek提取了代号+名称,但输出存在冗余内容且json串不全,其他模型的数据仅有json。如果忽略本次测试中DeepSeek输出内容不全的问题,综合来看DeepSeek输出的文本更全面,包括项目名称和时间两个字段
四、测试自动化中的表现
目前在自动化项目编写中常用的模型为GPT5.5,主要考虑到的优势有:
- 生成稳定,即使是通过第三方调用响应速度依然快
- 通过第三方平台调用价格实惠
- 对于常规的 id、class_name、xpath(相对路径)定位准确率高,目前还未遇到定位失败的情况
但目前使用频率不算高,后续试用其他模型后再综合对比
五、上下文及输出长度
模型 | 上下文长度(tokens) | 输出长度(tokens) |
GPT5.5 | 1000K | 128K |
Claude-opus4.6 | 1000K | 64K |
DeepSeek V4Pro | 1M | 375K |
Gemini 3.1Pro | 1M | 32K |
六、模型定价(标准模式每100万tokens)
模型 | 输入($) | 输出($) |
GPT5.5 | 5 | 30 |
模型 | 输入($) | 输出($) |
Claude-opus4.6 —-上下文长度 <= 200K | 10 | 37.5 |
Claude-opus4.6 —-上下文长度 > 200K | 5 | 25 |
模型 | 输入($) | 输出($) |
DeepSeek V4Pro | 0.435 | 0.870 |
模型 | 输入($) | 输出($) |
Gemini 3.1Pro —-上下文长度 <= 200K | 2 | 12 |
Gemini 3.1Pro —-上下文长度 > 200K | 4 | 18 |
七、最终结果
综合来看,如果追求日常高频开发的效率与成本的平衡,GPT-5.5 或 DeepSeek V4 是最合适的选择,两者在常规代码生成上差距不大,成本敏感型任务可优先考虑 DeepSeek;如果遇到复杂的业务逻辑、需要重构遗留代码或要求极高的首次生成质量,Claude Opus-4.6 值得投入,多花一些成本换取的是大量调试时间的节省;如果需要处理超长文档、理解整个项目全貌或进行多模态相关的测试,Gemini 3.1 Pro 是不错的选择
附件
1、代码能力测试
2、文本能力测试
测试原文数据
上一篇
自动化调研及总结
下一篇
软件测试
Loading...