晴空ClearSky——大模型评测作业

晴空ClearSky 2025-10-26 17:29:45
这个作业属于哪个课程2501_CS_SE_FZU
团队名称晴空ClearSky
这个作业要求在哪里软件工程实践——大模型评测作业-CSDN社区
这个作业的目标通过对于一些大模型的测评、思辨、总结,了解软件工程原则在实践中的体现,初步掌握一些软件测评的方法。
其他参考文献阿里云百炼-API参考软件工程 案例分析作业_软件工程例子-CSDN博客

目录

  • 第一部分 调研与评测
  • 1. 大模型1(Qwen3-Max)
  • 1.1 体验
  • 1.1.1 简介
  • 1.1.2 主要功能使用情况
  • 1.1.3 优缺点分析
  • 1.1.4 改进意见
  • 1.1.5 用户采访
  • a.采访对象背景与需求
  • b.实际使用的产品栏目
  • c.使用中的亮点与问题
  • d.用户体验改进建议
  • 1.2 自动化测试
  • 1.2.1 评测指标
  • 1.2.2 评测过程
  • 1.2.3 评测结果
  • 1.3 模型小结
  • 2. 大模型2(DeepSeek-v3)
  • 2.1 体验
  • 2.1.1 简介
  • 2.1.2 主要功能使用情况
  • 2.1.3 优缺点分析
  • 2.1.4 改进意见
  • 2.1.5 用户采访
  • a.采访对象背景与需求
  • b.实际使用的产品栏目
  • c.使用中的亮点与问题
  • d.用户体验改进建议
  • 2.2 自动化测试
  • 2.2.1 评测指标
  • 2.2.2 评测过程
  • 2.2.3 评测结果
  • 2.3 模型小结
  • 3. 大模型购车测评总结
  • 3.1 客观得分对比
  • 3.2 主观体验分析
  • 3.2.1 推荐车型
  • 3.2.2 响应长度
  • 3.2.3 知识准确性和参数分析
  • 3.2.4 沟通自然度
  • 3.2.5 结构化输出
  • 3.3 最终结论
  • 第二部分 分析
  • 4. 同类产品对比
  • 5. 软件工程方面的建议
  • 6. 大模型性能不同的原因分析
  • 7. 市场概况
  • 7.1 中国市场表现
  • 7.2 全球影响力
  • 8. 产品未来可能的规划
  • 8.1 NABCD分析
  • 8.1.1 N (Need - 需求)
  • 8.1.2 A (Approach - 做法)
  • 8.1.3 B (Benefit - 好处)
  • 8.1.4 C (Competitors - 竞争)
  • 8.1.5 D (Delivery - 推广)
  • 8.2 团队角色配置(6人,4个月)
  • 8.3 16周详细规划
  • 8.4 创新点
  • 8.5 用户使用产品理由
  • 9.大模型对软件工程专业学生的影响
  • 10. 团队绩效

第一部分 调研与评测

1. 大模型1(Qwen3-Max)

1.1 体验

1.1.1 简介

Qwen3-Max 是阿里云推出的通义千问系列中性能最强的大语言模型之一,面向复杂、多步骤的任务场景进行优化。该模型在推理能力、上下文理解、多轮对话连贯性以及结构化输出方面表现突出,适用于需要高准确率与强逻辑性的应用场景,如智能客服、专业咨询、代码生成与决策辅助等。

1.1.2 主要功能使用情况

  • 对话与问答。这是最基础、最直观的功能,体现模型的理解和回应能力。使用样例如下:

img

img

  • 内容创作与文本生成。体现模型的创造性和语言组织能力。使用样例如下:

img

img

  • 信息提取与总结。体现模型处理和理解长文本信息的能力。使用样例如下:

img

  • 逻辑推理与编程。体现模型的逻辑思维和代码能力。使用样例如下:

img

  • 角色扮演与情景模拟。体现模型的适应性和一致性。使用样例如下:

img

img

  • 多语言翻译。体现模型的语言能力。使用样例如下:

img

  • 创意与联想。体现模型的发散思维能力。使用样例如下:

img

img

1.1.3 优缺点分析

  • 优点:①通用知识覆盖和专业领域理解表现优异;②在启用搜索后,事实性回答的准确率高,能引用权威来源并标注信息出处;③逻辑推理和代码生成能力在同类模型中处于领先水平。
  • 缺点:①若未启用搜索功能,模型仍受限于其训练数据截止时间(2025 年中),在处理高度时效性问题时可能出现信息滞后;②文件支持格式有限(目前主要支持纯文本),不支持 cpp、json 等常见文档的直接解析;③启用联网搜索与深度思考后,响应时间较长。

1.1.4 改进意见

  • 增加cpp、json格式文件直接解析。
  • 改善搜索交互体验,预估响应时间,允许用户选择数据源偏好,比如限制在政务专栏、学术数据库等。

1.1.5 用户采访

采访剪影材料图:

img

img

a.采访对象背景与需求

采访对象:计算机专业研一某学生

选择原因:计算机专业学生具备扎实的计算机科学理论基础和一定的实践经验,对大模型术有更深入的了解和认识。他能够从技术角度深入分析大模型的架构、算法、性能等方面,提供专业的见解和评价。

核心需求

  • 代码生成:使用该大语言模型生成代码并辅助开发

  • 数学计算:帮助用户进行一些特定的数学计算

b.实际使用的产品栏目

代码生成,数学计算。

c.使用中的亮点与问题
  • 亮点:该大语言模型对于一些篇幅较短的问题时,能给出较为不错的回答,并且响应速度较快,效率能够满足用户的需求。

  • 问题:该大语言模型在面对一些较长的问题时,给出的回答有缺漏甚至是答非所问,并且,在部分情况下,给出的答案不准确。

d.用户体验改进建议
  • 希望该大语言模型在回答一些较为抽象的问题时有更好的表现;

  • 能够在回答问题时生成更加完整具体的代码。

1.2 自动化测试

编写了简单的Python自动化测试脚本,从不同方面提出问题,对模型回答进行简单分析加权赋分,并自动生成csv表格结果、JSON结果、可视化雷达图、柱状图、热力图。对于Qwen3-max模型的测试脚本,请参见以下附件(API_KEY已隐去):

ModelTest-qwen3-max.py 49.80K

同时提供相关依赖自动安装脚本,请参见以下附件:

install_dependencies.py 2.34K

1.2.1 评测指标

每项指标平均得分满分为10分。

$$
加权得分=平均得分*权重
$$

$$
总体得分=加权得分总和/权重总和
$$

评测指标指标说明权重
需求理解能力评估模型理解用户购车需求的能力。包括对预算、使用场景(如通勤)、具体需求(如空间、安全)的理解和回应。1.2
推荐相关性评估模型推荐车型与用户需求的匹配程度。推荐的车型是否在预算内,是否符合用户的使用场景和具体需求。1.3
参数分析能力评估模型分析和对比车型参数的能力。包括对动力性能、油耗/电耗、安全配置、保值率、品牌口碑等参数的分析。1.1
上下文一致性评估模型在多轮对话中保持推荐一致性的能力。在后续对话中是否保持对之前提及的候选车型的讨论,而不是无故切换。1
决策支持能力评估模型提供最终决策建议的合理性。是否能够综合考虑所有因素,给出明确的最终推荐,并详细说明理由。1.2
知识准确性评估模型提供车型信息的准确程度。提供的数据是否具体、详细,避免模糊表述,并且没有明显错误。1.1
结构化输出评估模型生成表格和结构化信息的能力。是否能够以表格形式清晰对比车型参数,表格格式是否规范。0.9
沟通自然度评估模型对话的自然流畅程度。回答是否通顺、符合人类表达习惯,是否具有友好的交流态度。0.8

1.2.2 评测过程

执行脚本后,脚本将自动开始测评,同时指明当前测评模型,输出测评过程中的缩略信息,最终决策完成后将自动对模型进行指标评测并自动生成CSV、JSON报告以及指标的雷达图、柱状图、场景热力图。

测评过程如下:

img

img

1.2.3 评测结果

  • 总体得分: 9.05/10
  • 各指标得分:
    需求理解能力: 10.0/10
    推荐相关性: 10.0/10
    参数分析能力: 8.42/10
    上下文一致性: 8.67/10
    决策支持能力: 10.0/10
    知识准确性: 7.17/10
    结构化输出: 10.0/10
    沟通自然度: 7.5/10
  • 测试场景: 城市通勤场景
    候选车型: 丰田-凯美瑞, 本田-CRV, 比亚迪-汉EV, 大众-迈腾, 特斯拉-Model3
    最终推荐: 比亚迪-汉EV
  • 测评CSV格式报告,请参见以下附件:

car_purchase_evaluation_report_20251025_160753.csv 3.75K

  • 测评JSON格式报告,请参见以下附件:

car_purchase_evaluation_report_20251025_160753.json 32.02K

  • 雷达图如下:

img

  • 柱状图如下:

img

  • 场景热力图如下:

img

1.3 模型小结

  • 定性:非常推荐
  • 定量:总体得分: 9.05/10

2. 大模型2(DeepSeek-v3)

2.1 体验

2.1.1 简介

DeepSeek-v3 是DeepSeek系列一款通用的文字模型,专注于文本理解、生成与多轮交互等复杂任务场景。该模型在推理逻辑、上下文保持及代码生成等方面表现优异,适用于智能问答、数据分析、教学辅助、内容创作及程序开发等多种应用。

2.1.2 主要功能使用情况

  • 对话与问答。这是最基础、最直观的功能,体现模型的理解和回应能力。使用样例如下:

img

img

  • 内容创作与文本生成。体现模型的创造性和语言组织能力。使用样例如下:

img

img

img

  • 逻辑推理与编程。体现模型的逻辑思维和代码能力。使用样例如下:

img

img

img

img

  • 角色扮演与情景模拟。体现模型的适应性和一致性。使用样例如下:

img

img

img

  • 多语言翻译。体现模型的语言能力。使用样例如下:

img

  • 创意与联想。体现模型的发散思维能力。使用样例如下:

img

img

2.1.3 优缺点分析

  • 优点:①功能覆盖面广,包括文本生成、内容创作、逻辑推理、代码编写、多语言翻译及文件读取等;②模型响应速度较快,普通模式下生成结果稳定且延迟低,能够快速输出逻辑清晰的回答;③DeepSeek-v3 在事实性问答、逻辑推理及代码生成方面表现稳定,尤其在技术与教育类场景中准确率较高。
  • 缺点:①部分回答存在轻微“幻觉”现象;②多轮对话中上下文的连续性偶有丢失。

2.1.4 改进意见

  • 增强模型对多轮对话中上下文信息的保持能力,减少长对话场景中的语义偏移问题。
  • 增加对话分类、关键词检索与导出功能。

2.1.5 用户采访

采访剪影材料图:

img

img

img

a.采访对象背景与需求

采访对象:计算机系大二某学生

选择原因:DeepSeek-v3的一大特点是代码能力强,计算机系学生在这方面的应用频繁且贴近现实生活。

核心需求:代码修改、部分模块功能提示。

b.实际使用的产品栏目

算法优化,代码编写。

c.使用中的亮点与问题
  • 亮点:做中小型任务时正确率高,针对不理解的点解释得很详细。

  • 问题:有时会答非所问、修改不到正确的点。

d.用户体验改进建议
  • 对用户问题的理解还需加强,有的时候不能准确理解指令的意思;
  • 对代码格式要求太高导致反而忽略重点;
  • 在持续修改的过程中答非所问、忘记之前的指令。

2.2 自动化测试

编写了简单的Python自动化测试脚本,从不同方面提出问题,对模型回答进行简单分析加权赋分,并自动生成csv表格结果、JSON结果、可视化雷达图、柱状图、热力图。对于DeepSeek-v3模型的测试脚本,请参见以下附件(API_KEY已隐去):

ModelTest-deepseek-v3.py 49.80K

同时提供相关依赖自动安装脚本,请参见以下附件:

install_dependencies.py 2.34K

2.2.1 评测指标

与1.2.1节相同,请参见1.2.1节。

2.2.2 评测过程

执行脚本后,脚本将自动开始测评,同时指明当前测评模型,输出测评过程中的缩略信息,最终决策完成后将自动对模型进行指标评测并自动生成CSV、JSON报告以及指标的雷达图、柱状图、场景热力图。

测评过程如下:

img

img

2.2.3 评测结果

  • 总体得分: 8.97/10
  • 各指标得分:
    需求理解能力: 10.0/10
    推荐相关性: 10.0/10
    参数分析能力: 7.42/10
    上下文一致性: 8.33/10
    决策支持能力: 10.0/10
    知识准确性: 7.17/10
    结构化输出: 10.0/10
    沟通自然度: 8.5/10
  • 测试场景: 城市通勤场景
    候选车型: 丰田-凯美瑞, 本田-雅阁, 大众-迈腾, 比亚迪-汉DM, 吉利-星瑞L
    最终推荐: 比亚迪-汉DM
  • 测评CSV格式报告,请参见以下附件:

car_purchase_evaluation_report_20251025_161624.csv 3.50K

  • 测评JSON格式报告,请参见以下附件:

car_purchase_evaluation_report_20251025_161624.json 23.90K

  • 雷达图如下:

img

  • 柱状图如下:

img

  • 场景热力图如下:

img

2.3 模型小结

  • 定性:推荐
  • 定量:总体得分: 8.97/10

3. 大模型购车测评总结

3.1 客观得分对比

评测指标Qwen3-MaxDeepSeek-v3
需求理解能力10.010.0
推荐相关性10.010.0
参数分析能力8.427.42
上下文一致性8.678.33
决策支持能力10.010.0
知识准确性7.177.17
结构化输出10.010.0
沟通自然度7.58.5
总体得分9.058.97

从客观得分来看,Qwen3-Max在参数分析能力和上下文一致性上略高于DeepSeek-v3,而DeepSeek-v3在沟通自然度上略高于Qwen3-Max。其他指标上两者持平。总体得分Qwen3-Max(9.05)略高于DeepSeek-v3(8.97),但差距不大。

3.2 主观体验分析

3.2.1 推荐车型

  • 两个模型都给出了5款候选车型,并且都选择了比亚迪汉系列(Qwen3-Max推荐汉EV,DeepSeek-v3推荐汉DM)作为最终推荐。这表明两个模型都能够把握用户的需求(城市通勤、预算20万左右)并做出合理的推荐。
  • 从候选车型列表来看,Qwen3-Max的推荐包括丰田凯美瑞、本田CR-V、比亚迪汉EV、大众迈腾、特斯拉Model3,覆盖了日系、德系、中美电动车。DeepSeek-v3的推荐包括丰田凯美瑞、本田雅阁、大众迈腾、比亚迪汉DM、吉利星瑞L,覆盖了日系、德系、国产混动和燃油车。两者都具有一定的多样性。

3.2.2 响应长度

  • Qwen3-Max的响应普遍较长(阶段1:1391字符,阶段2:1500-2000字符,阶段3:2431字符,阶段4:1663字符),说明它提供了更详细的信息。
  • DeepSeek-v3的响应相对简洁(阶段1:783字符,阶段2:900-1400字符,阶段3:3077字符,阶段4:1395字符),但在表格对比阶段(阶段3)提供了更长的响应,说明它可能生成了更详细的表格。

3.2.3 知识准确性和参数分析

两个模型在知识准确性上得分相同(7.17),但Qwen3-Max在参数分析能力上得分更高(8.42 vs 7.42)。这意味着Qwen3-Max在分析车辆参数(如动力、能耗、安全配置等)时表现更好。

3.2.4 沟通自然度

DeepSeek-v3在沟通自然度上得分更高(8.5 vs 7.5),说明它的对话更自然流畅,用户体验可能更好。

3.2.5 结构化输出

两个模型在结构化输出上都得了满分(10.0),说明它们都能很好地生成表格和结构化信息。

3.3 最终结论

推荐选择:Qwen3-Max

理由:

  • Qwen3-Max技术专业性更强:在参数分析这一关键维度显著领先。

  • Qwen3-Max分析深度更优:对车辆技术特性的解读更透彻。

  • Qwen3-Max推荐逻辑更严谨:上下文一致性更好,决策过程更透明。

  • Qwen3-Max信息量更丰富:虽然沟通稍显正式,但提供了更多有价值信息。

    两款模型在购车推荐任务中都表现出色,总体得分接近9分,说明都具备了优秀的汽车顾问能力。

    对于大多数购车用户而言,Qwen3-Max的专业深度更能满足复杂的购车决策需求,因此获得本次评测的推荐。

使用场景建议:

  • 选择 Qwen3-Max :

    • 用户对汽车技术参数有较高要求。

    • 需要深入的技术对比分析。

    • 重视推荐的系统性和逻辑性。

    • 不介意相对正式的表达风格。

  • 选择 DeepSeek-v3 :

    • 用户更看重沟通的自然流畅。

    • 希望获得简洁明了的建议。

    • 对技术细节要求不是特别高。

    • 偏好更人性化的交互体验。

第二部分 分析

4. 同类产品对比

Qwen3-max发布时期同类产品对比图:

img

DeepSeek-v3发布时期同类产品对比图:

img

简单的大模型决策图:

img

5. 软件工程方面的建议

建议大模型能够增强生成代码的可测试性。

希望大模型能够在生成代码前先产出测试用例:
用户需求 → 生成测试用例 → 基于测试用例生成代码 → 验证通过。

这样可以减少调试时间,使得问题在代码生成阶段就能够被发现,生成的代码更容易融入现有测试框架。

6. 大模型性能不同的原因分析

不同大模型性能不同的主要原因有以下几点:

  • 模型规模不同:包括参数量、层数、隐藏层维度等因素。通常模型规模越大,性能越好,但需要平衡计算成本。
  • 训练数据量不同:包括数据量、质量、多样性等因素。高质量、大规模、多样性的数据有助于模型学习更广泛的知识。
  • 训练策略存在差异:包括优化算法、学习率调度、正则化方法等。训练策略的选择对模型性能有重要影响。
  • 模型架构存在差异:不同的架构设计会影响模型的表现。
  • 评估基准:不同的评估标准和测试集也可能导致不同的性能结果。

7. 市场概况

2025上半年中国企业级市场日均大模型调用量达 10.2万亿Tokens。相较2024年下半年,日均调用量暴增363%。超过80% 的企业未来预计将采用开源大模型。 71% 的企业计划增加对公有云形态生成式AI服务的投入。

7.1 中国市场表现

Qwen3-Max

  • 技术地位:作为阿里云通义千问的最新旗舰模型,在国内处于第一梯队。
  • 中文能力:在古文理解、诗词创作、中文推理等方面表现优异。
  • 生态整合:深度整合到阿里云生态,在企业级市场渗透率较高。
  • 行业应用:在金融、电商、政务等领域有广泛应用。

DeepSeek-V3

  • 技术特色:以高性价比和强大推理能力著称。
  • 市场定位:主打“性能与成本的最佳平衡”,受到中小企业青睐。
  • 创新应用:在代码生成、数学推理等垂直领域表现突出。
  • 用户口碑:凭借免费策略和优秀性能积累了良好用户基础。

7.2 全球影响力

Qwen3-Max

  • 国际排名:在多个国际基准测试中位列前茅,与GPT-5等模型竞争。
  • 多语言能力:支持多种语言,但在英语等语言上仍需提升。
  • 国际化进程:通过阿里云国际化布局逐步拓展海外市场。

DeepSeek-V3

  • 技术突破:在MT-Bench、IFEVAL等权威榜单上取得优异成绩。
  • 成本优势:以极低的推理成本提供接近顶级模型的性能。
  • 开源策略:通过开源方式获得全球开发者关注和采用。
  • 特色能力:128K上下文长度和强大的推理能力受国际认可。

8. 产品未来可能的规划

我们团队假设要优化Qwen3-max模型,新增功能为:“交互式代码调试与优化助手”。

8.1 NABCD分析

8.1.1 N (Need - 需求)

软件工程师在日常编码中经常遇到代码调试和性能优化的问题,尤其是复杂代码的调试和性能瓶颈定位。目前的大模型虽然能生成代码,但缺乏交互式调试和深度优化指导。用户需要的是一个能够理解代码上下文、设置断点、逐步执行、分析性能瓶颈并提供优化建议的智能助手。

8.1.2 A (Approach - 做法)

我们将在Qwen3-max模型中集成一个交互式代码调试与优化模块。该模块允许用户:
上传代码或指定代码段,设置断点。
模型模拟执行代码,并逐步展示执行过程(变量变化、函数调用栈等)。
自动检测代码中的潜在问题(如性能瓶颈、内存泄漏等)。
提供优化建议,并允许用户与模型交互以获取更详细的解释。
生成优化后的代码,并对比优化前后的性能。

8.1.3 B (Benefit - 好处)

提高调试效率:用户无需在IDE和模型之间切换,一站式完成代码调试和优化。
深度代码理解:模型利用其强大的代码理解能力,提供更准确的调试和优化建议。
学习与提升:用户可以通过模型的解释学习到代码优化和调试的技巧。

8.1.4 C (Competitors - 竞争)

目前市场上已有一些代码调试工具(如IDE自带的调试器)和静态代码分析工具(如SonarQube),但它们缺乏与自然语言交互的能力。也有一些AI代码助手(如GitHub Copilot)提供代码建议,但不提供交互式调试和深度性能优化。我们的功能将结合调试器和AI的优势,提供更智能的交互体验。

8.1.5 D (Delivery - 推广)

作为Qwen3-max模型的一个特色功能,在官方文档和演示中突出展示。
针对开发者社区,举办线上教程和竞赛,鼓励使用该功能。
与热门IDE插件集成,方便用户使用。

8.2 团队角色配置(6人,4个月)

项目经理(1人):负责项目进度管理、资源协调、风险管理。
后端开发(2人):负责模型功能集成、调试器后端逻辑、性能分析模块。
前端开发(1人):负责用户界面开发,实现代码编辑器、调试控制台等。
测试工程师(1人):负责功能测试、性能测试、用户体验测试。
美工/UI设计师(1人):负责界面设计,确保用户体验友好。

8.3 16周详细规划

第1-4周:需求分析与设计

第1周:项目启动,明确需求,技术调研。
第2周:制定详细的产品需求文档和设计文档。
第3周:UI/UX设计,输出界面原型。
第4周:技术架构设计,确定技术栈,制定开发计划。

第5-8周:核心开发阶段

第5周:搭建开发环境,后端开发开始实现代码解析和模拟执行模块。
第6周:后端开发继续,前端开发开始根据设计实现界面。
第7周:后端实现调试控制逻辑,前端实现代码编辑器和调试控制器。
第8周:前后端联调,实现基本的代码调试流程。

第9-12周:功能增强与集成

第9周:集成性能分析模块,后端开发性能检测算法。
第10周:实现优化建议生成,并与模型交互。
第11周:前端优化,提升用户体验。
第12周:前后端集成测试,修复重大问题。

第13-16周:测试与发布

第13周:内部测试,收集反馈,进行迭代。
第14周:Beta版发布,邀请外部用户测试。
第15周:根据反馈优化,修复bug。
第16周:正式发布,准备发布文档和宣传材料。

8.4 创新点

交互式调试:将传统调试器的逐步执行与自然语言交互结合,用户可以用自然语言询问调试过程中的问题。
智能优化建议:不仅指出问题,还提供优化建议,并生成优化后的代码。
性能分析集成:在调试过程中实时分析性能,定位瓶颈。

8.5 用户使用产品理由

一站式解决方案:无需在多个工具间切换,一个界面完成编码、调试、优化。
智能辅助:利用大模型的代码理解能力,提供更深入的调试和优化建议。
学习工具:通过模型的解释,用户能够学习到代码优化的技巧,提升自身能力。

9.大模型对软件工程专业学生的影响

协助日常学习工作

大语言模型可以作为编程学习的助手,帮助解答问题、解释概念、提供代码示例,从而加速学习过程。例如,当遇到不理解的算法或语法时,可以立即向模型提问,获得即时帮助。

在完成编程作业或项目时,大语言模型能够生成代码片段,帮助实现特定功能,同时也能辅助调试,解释错误信息,提供修复建议,节省大量时间和精力。

在撰写技术报告、文档或论文时,大语言模型可以帮助整理思路、润色文字、检查语法,提高写作效率和质量。

大语言模型可以协助完成一些重复性的任务,如生成脚本、处理数据、自动生成测试用例等,提高效率。

不能过度依赖大语言模型

过度依赖大语言模型可能导致独立思考能力和解决问题能力的下降。此外,模型可能提供错误的信息,需要批判性思维来辨别。

使用大语言模型时,需要注意代码的版权问题,避免直接使用模型生成的代码而侵犯知识产权。同时,注意保护隐私,不要输入敏感信息。

大语言模型为软件工程专业的学生提供了强大的工具,但需要合理使用,将其作为辅助而非替代,同时保持批判性思维和持续学习的态度。

10. 团队绩效

学号实际工作内容贡献度
102300107负责第8.1节,对大模型可能的新功能模块产品规划进行NABCD分析。12%
102300121负责第1.1.5节,对Qwen3-Max模型进行用户采访。12%
102300207负责第4到7节,对不同大模型进行对比分析,调研市场概况,在软件工程方面对大模型提出建议,协助调试自动化测评脚本。12%
102300211负责第2.1节、第8.2到8.5节,分析体验大模型DeepSeek-v3,完成对大模型可能的新功能模块产品规划进行具体团队规划。12%
102300312负责1.1节,分析体验大模型Qwen3-Max。12%
102300408负责2.1.5节,对DeepSeek-v3模型进行用户采访。12%
102300432负责1.2到1.3节、2.2到2.3节、第9、10节,设计全自动测评脚本,对两款大模型进行自动化测试并分析评测结果,说明大模型对软件工程大学生的影响,分配任务撰写博客。16%
102300434负责答辩PPT制作,协助调试自动化测评脚本。12%
...全文
345 回复 打赏 收藏 转发到动态 举报
写回复
用AI写文章
回复
切换为时间正序
请发表友善的回复…
发表回复
数据集可视化效果可参见下方展示。 【数据集概况】 · 检测类别(中文):[保龄球(bowling)] · 训练集:594 张 · 验证集:75 张 · 测试集:74 张 · 总计:743 张 该数据集聚焦于室内保龄球馆场景,系统性采集了多角度、多姿态下保龄球在不同运动阶段的视觉特征,为保龄球运动过程中的球体识别与轨迹分析提供了高质量标注样本,具有明确的体育训练与智能辅助系统开发价值。... 【训练曲线与评估图】 【模型训练配置】 参数 | 值 模型 | yolo26n 训练轮数 | 100 epochs 输入尺寸 | 640x640 批次大小 | 24 优化器 | auto 初始学习率 | 0.01 训练设备 【关键指标汇总】 训练了 100 个 epoch,最终轮指标: 指标 | 数值 mAP50 | **0.9938** mAP50-95 | 0.6966 Precision | 0.9740 Recall | 0.9974 train/box_loss | 0.9113 train/cls_loss | 0.2862 val/box_loss | 1.1516 val/cls_loss | 0.3116 【训练过程分析】 100 轮训练后 mAP50 达到 0.9938,模型收敛良好。Loss 曲线前段快速下降,后段趋于平稳,val_loss 无反弹,没有明显过拟合。但 mAP50-95 为 0.6966,和 mAP50 差距 0.30,定位精度仍有优化空间。 【模型性能评估】 Precision 0.9740、Recall 0.9974,精召双高,模型对保龄球的检测能力强。 【预测效果展示】 验证集预测效果较好,检测框基本准确覆盖保龄球,置信度整体偏高。 【改进建议】 1. 丰富场景多样性:补充不同光照、背景和遮挡条件下的样本。 2. 提升输入分辨率:640 ...
PaddleOCR 与YOLO目标检测 HTTP 服务。 项目通过 PaddleOCROnnx 原生库集成 OnnxRuntime加速能力,围绕 ONNX 模型部署, 以统一接口提供图像文字识别、YOLO 目标检测和 Tensor 数据输出。 功能概览 文字识别:支持图片 Base64、multipart/form-data 上传,以及文本和 JSON 结果。 目标检测:支持 YOLO 图片检测,返回检测框 JSON 或原始 Tensor。 浏览器演示:访问服务根地址,上传图片并切换 OCR、YOLO 模式。 健康检查:通过 /health 查看服务及 OCR、YOLO 引擎初始化状态。 并发处理:通过 OCR 引擎实例池处理并发请求,可调整实例数量。 体验与调用 启动后访问: 入口 地址 浏览器演示 http://localhost:5000/ 健康检查 http://localhost:5000/health 原生依赖 Windows:优先从 runtimes/win-x64/native/ 加载原生 DLL;该目录没有 PaddleOCROnnx.dll 时,尝试从可执行文件所在目录加载。主 DLL 与对应后端依赖应放在同一原生目录中,不要将同一组依赖分散到多个目录。 Linux:原生运行时位于 runtimes/linux-x64/native/,程序使用相对于可执行文件的运行时搜索路径查找随包部署的依赖。 后端选择:CoreOCROnnx 支持 ONNX Runtime、OpenVINO、TensorRT 后端。请使用与平台、进程架构、硬件和后端匹配的一整套运行时,不要混用不同后端或版本的依赖。

103

社区成员

发帖
与我相关
我的任务
社区描述
2501_CS_SE_FZU
软件工程 高校
社区管理员
  • FZU_SE_LQF
  • 木村修
  • 心态773
加入社区
  • 近7日
  • 近30日
  • 至今
社区公告
暂无公告

试试用AI创作助手写篇文章吧