103
社区成员
发帖
与我相关
我的任务
分享| 这个作业属于哪个课程 | 2501_CS_SE_FZU |
|---|---|
| 这个作业要求在哪里 | 软件工程实践——软件评测作业 |
| 这个作业的目标 | 调研,评测,分析两个大模型;购车决策程序实践 |
| 其他参考文献 | 《消费者购车决策模型研究》 |

模型基本功能介绍:
DeepSeek 是由深度求索公司开发的大型语言模型。我们测试的版本是 DeepSeek 最新版本模型,其主要功能包括:智能对话、代码编程助手、文件处理、创意写作、逻辑推理与分析、联网搜索等。
| 评价维度 | 优点 | 缺点 |
|---|---|---|
| 数据量 | 知识覆盖面广,对编程、学术等领域理解深刻;支持 128K 长上下文,能处理很长的对话和文档。 | 知识截止日期相对较早,对于最新事件的内部知识有限;联网搜索需要手动触发,且并非所有问题都能精准找到最新答案。 |
| 界面 | 界面设计简洁、干净,无过多干扰信息;对话区域和输入框布局符合用户习惯。 | 功能入口不够直观,缺乏对话/会话的管理功能(如文件夹归类、搜索)。 |
| 功能 | 代码能力和逻辑推理能力出色,文件支持格式多样。 | 没有语音输入/输出功能,没有多模态识别能力。 |
| 准确度 | 在编程、逻辑分析、总结提炼方面准确度很高,答案可靠。 | 在涉及非常小众或最新知识时,有时会“幻觉”出错误信息;联网搜索的结果质量依赖于搜索引擎,有时会引入不相关或广告信息。 |
| 用户体验 | 极高的效率: 从遇到问题到获得精准的解决方案,整个过程不超过2分钟;交互自然,零门槛: 不需要学习复杂的查询语法,只需用自然语言描述问题并粘贴代码 | 启用深度思考时,思考过程存在赘余重复的现象 |

注册过程非常流畅。访问DeepSeek官网,使用手机号即可快速完成注册,过程无需复杂验证。
邱毅伟在基础问答中询问了一个复杂的编程问题,要求代码生成一个Python爬虫脚本,并处理可能遇到的异常。
邱毅伟使用过程总体顺畅,成功解决了“快速生成一个健壮的爬虫脚本”的需求,将原本需要自行搜索、编写和阅读的时间从数小时缩短到几分钟,效率提升显著。
问题 :
亮点:代码质量高、解释通俗易懂、工具免费。
DeepSeek模型在核心能力(尤其是代码和逻辑方面)表现出色,且免费策略极具吸引力。然而,在用户体验,特别是新用户引导、功能发现的直观性和交互细节上,还有较大的改进空间。通过一次简单的用户测试就发现了开发团队可能忽略的初始用户痛点,这充分说明了在产品开发中引入真实用户反馈的重要性。

模型基本功能介绍
Qwen 是阿里巴巴集团开发的大语言模型系列,核心功能包括:256K 超长上下文处理(支持50 万字文本),适用于代码文档分析、复杂项目需求理解等场景;动态专家激活机制(128 专家仅激活 8 个),LiveCodeBench 编码测试得分 74.1 分超 GPT-4.5,擅长代码错误定位、多语言代码调试;推理过程可视化(思考标记 token ID:151668),代码问题解题正确率达88.2%,可清晰展示代码修复;代码专项功能:支持 Python、Java、C++ 等 28 种主流编程语言的错误修复、代码重构建议、逻辑优化指导
| 维度 | 优势 | 不足 |
|---|---|---|
| 数据量 | 预训练覆盖 30 万亿 token,包含 1.2 万亿代码专项 token,覆盖主流编程语言 | 小众编程语言(如 Rust 特定框架)代码数据较少,修复建议准确性待提升 |
| 界面 | 代码功能分区清晰,修复思路可视化直观,支持代码实时编辑 | 代码对比视图需手动开启,未默认展示修复前后差异 |
| 功能 | 代码错误定位、逻辑优化、多语言转换核心突出,支持复杂代码片段(千行级)处理 | 代码性能优化建议较笼统,缺乏具体参数调优方案 |
| 准确度 | 常见代码错误(语法错误、逻辑漏洞)修复准确率 92.5%,超行业平均 10.3% | 涉及深层算法逻辑的代码问题(如机器学习模型训练代码)修复成功率仅 68% |
| 用户体验 | 双模式切换响应快(精准修复模式 2.5s 内启动),支持代码片段一键复制 | 复杂代码问题修复结果展示冗长,关键修复步骤未突出标注 |

上传存在逻辑漏洞的 Python 数据分析代码(数据空值未处理),成功定位 3 处空值处理漏洞,提供 2 种修复方案(填充默认值 / 删除空值行),附带方案选择建议。
然后输入简单 Python 数据可视化代码,要求转为 Matlab 代码,生成可运行的 Matlab 代码,但部分 Python 特有函数(如 pandas 数据读取)转换后需手动调整参数。
问题
Qwen大模型,特别是Qwen2.5系列,在核心能力(尤其是代码和长文本处理)上已经达到了非常高的水准,其开源策略更是赋予了开发者巨大的灵活性和隐私保障。然而,其在用户体验,特别是功能的易用性和可发现性上,仍有显著的提升空间。本次简单的用户测试清晰地揭示了,将强大的技术能力转化为平滑、直观的用户体验,是Qwen乃至许多开源模型下一步需要攻克的关键课题。通过降低使用门槛,Qwen有望吸引更广泛的用户群体,真正释放其作为顶级开源模型的潜力。
评测指标包括需求匹配度、数据完整性、推荐质量、比较分析深度、结构化程度五个指标,对这些指标采用量化处理,以10分为满分对该模型的对应能力进行1-10的打分。
对两大模型询问的都是统一的问题,程序根据大模型的回答进行量化评分。以下分别是导出的Qwen和Deepseek收到的问题和回答


Qwen3-Max 在购车决策能力评估中平均得分 6.41/10.0,DeepSeek-Chat 平均得分 6.18/10.0,Qwen3-Max 综合表现基本持平(+3.67%)。以下是Qwen3-Max 和 DeepSeek-Chat 在购车决策能力指标表现的可视化:


将Qwen3-Max 和 DeepSeek-Chat 购车决策能力指标表现放在一起进行对比

Qwen3-Max 在购车决策任务中综合表现更佳,适合在购车需求匹配、比较分析深度等场景下优先使用;但在推荐质量方面存在明显不足,建议配合其他工具或人工干预完善推荐环节。DeepSeek-Chat 虽综合得分略低,但推荐质量相对更优,可作为推荐环节的补充工具。
在办公场景中,DeepSeek 的代码生成功能可帮助普通程序员将简单功能开发效率提升 40%,Qwen 的多轮对话能力则能辅助职场人快速整理会议纪要,减少 30% 的文档处理时间;在生活服务领域,二者均能通过自然语言交互为用户提供个性化行程规划、家电故障排查建议,降低非专业领域问题的解决门槛。
对学生群体,DeepSeek 的学术问答功能可解析复杂公式推导逻辑,Qwen 的多模态理解能力能将抽象知识点转化为可视化解释,弥补传统教育中 “个性化辅导不足” 的痛点;对中老年用户,其简化的交互逻辑(如语音输入 + 方言识别)降低了数字产品使用门槛,助力银发群体融入智能社会。
二者均存在 “生成内容准确性波动” 问题,如在医疗建议、法律条款解读等专业领域易出现误导性信息;同时,数据隐私风险凸显,用户在输入个人需求(如购车预算、健康状况)时,存在数据被二次利用的担忧,需通过技术优化(如本地部署选项)和政策监管缓解。
总体而言,大模型正以 “工具赋能 + 认知补位” 的方式重构生活模式,但需在效率与风险间寻找平衡,推动技术合规化落地。
| 评估维度 | DeepSeek | Qwen | GPT-4 | 文心一言 |
|---|---|---|---|---|
| 功能覆盖 | 代码生成、学术问答强 | 多模态交互、电商场景适配优 | 全场景能力均衡 | 中文语境理解、百度生态联动强 |
| 性能表现 | 推理速度快(100token/s) | 长文本处理优(支持 8k 上下文) | 复杂逻辑推理准确率高 | 中文生成流畅度高 |
| 数据质量 | 技术领域数据精准 | 电商、生活服务数据丰富 | 全球多语言数据覆盖全 | 中文互联网数据更新快 |
| 用户体验 | 界面简洁,开发者友好 | 交互流畅,普通用户易上手 | 功能入口多,学习成本高 | 集成百度服务(如地图),场景连贯 |
| 成本 | 免费额度适中,API 单价 0.01 元 / 千 token | 阿里生态内用户免费额度高 | 收费较高(0.05 元 / 千 token) | 免费功能多,高级功能付费 |
优势
在技术垂直领域(代码、学术)表现突出,API 调用延迟低(平均 500ms),适合开发者、科研人员等专业用户;支持自定义模型微调,满足企业个性化需求。
劣势
生活服务场景数据储备不足,如对小众品牌汽车参数的识别准确率仅 65%;多模态功能(图片理解、语音交互)尚未成熟。
优势
依托阿里生态,在电商、本地生活场景适配性强,如能精准关联汽车周边产品(保险、保养服务);长文本处理能力突出,生成购车分析报告时逻辑连贯性达 90%。
劣势
技术领域深度不足,复杂代码调试(如 Python 爬虫优化)的准确率仅 70%;API 接口文档不够完善,新手开发者上手成本较高。
DeepSeek 优化方向
优化代码生成的 “上下文关联算法”,解决购车参数推导时 “前后逻辑矛盾” 问题;采用 “哈希表 + 红黑树” 组合数据结构,提升车型参数查询速度。
Qwen 优化方向
强化多模态数据的 “融合算法”,实现 “文字需求 - 车型图片 - 视频评测” 的联动解析;优化长文本处理的 “滑动窗口机制”,避免生成购车报告时 “遗漏关键配置”。
搭建 “用户反馈实时处理系统”,对购车场景的用户投诉(如参数错误)实现 24 小时内响应;增加 “灰度发布” 机制,新功能先向 10% 用户推送,降低故障影响范围。
完善 API 接口文档,补充 “购车场景专用参数说明”(如动力类型、安全配置术语解释);为开发者提供 “汽车插件二次开发指南”,支持第三方企业定制功能。
采用 “敏捷开发 + 双周迭代” 模式,产品、技术、运营团队同步推进汽车插件开发;建立 “跨部门需求池”,优先处理购车用户高频反馈(如 “增加新能源车型筛选”)。
聚焦 “技术 + 垂直场景”,推出 “企业版汽车模型插件”,向汽车经销商收取年费(预计单价 1.2 万元 / 年);开放 API 接口,与汽车媒体合作提供 “智能问答” 服务。
依托阿里生态,实现 “插件使用数据 - 电商消费数据” 联动,向汽车厂商收取 “精准营销服务费”;推出 “免费基础版 + 付费高级版” 模式,高级版提供 “专属购车顾问 1 对 1 咨询” 服务。
据艾瑞咨询 2024 年数据,中国大模型行业市场规模达 890 亿元,同比增长 68%;预计 2025 年将突破 1500 亿元,核心增长动力来自企业级应用(如金融风控、工业质检)和 C 端场景(如智能助手、个性化推荐)。其中,垂直场景大模型(如汽车领域专用模型)市场占比已达 23%,年增速超 80%。
截至 2024 年底,DeepSeek 累计注册用户达 1200 万,其中企业用户占比 35%(以科技公司、高校为主);Qwen 累计注册用户达 1800 万,企业用户占比 28%(以电商、零售企业为主)。
汽车行业潜在用户规模超 5000 万(含购车用户、汽车经销商、维修服务企业);教育、医疗领域潜在用户分别达 1.2 亿、8000 万,未来可通过场景定制化拓展用户边界。
当前市场呈现 “头部平台 + 垂直玩家” 竞争态势:百度(文心一言)、阿里(Qwen)凭借生态优势占据 C 端市场主导地位;DeepSeek、智谱 AI 等以技术垂直领域为切入点,在 B 端专业市场形成差异化竞争力;国际品牌(如 OpenAI GPT-4)在高端企业服务市场有一定份额,但受数据本地化政策限制,市场占比逐步下降。
基于 DeepSeek 与 Qwen 的现有优势,结合购车推荐场景痛点,提出 “汽车场景专属大模型插件” 新功能规划,并通过 NABCD 框架论证:
开发 “汽车全周期服务插件”,集成车型数据库实时更新、个性化需求匹配算法、线下服务联动三大核心能力,解决当前大模型 “车型数据滞后、需求匹配粗糙、线上线下脱节” 的痛点。
据汽车之家 2024 年调研,72% 的购车用户希望获取 “实时车型报价 + 本地化优惠信息”,65% 用户需要 “从选车到保养的全流程建议”,现有大模型均无法满足该闭环需求。
当前无大模型平台实现 “实时数据 + 全流程服务” 闭环,该功能可形成差异化优势;相比汽车垂直 APP(如懂车帝),大模型的自然语言交互更便捷,能理解 “家庭有 2 个孩子,需要大空间且省油” 等模糊需求。
本次作业我们依旧以线下会议的形式开展,并划分任务,根据每个人的擅长之处进行任务分配。

| 学号 | 工作内容 | 贡献度 |
|---|---|---|
| 102300231 | 博客随笔、自动化测试、PPT修改 | 16% |
| 102300230 | 自动化测试 | 14% |
| 102300232 | 自动化测试 | 14% |
| 102300227 | 自动化测试 | 14% |
| 052301436 | 分析、规划建议 | 14% |
| 292300206 | 模型使用体验、采访 | 14% |
| 082300207 | 评测结论、PPT制作 | 14% |