软件工程实践——软件评测作业

222100413刘家伟 2024-04-14 09:16:41
这个作业属于哪个课程班级的链接
这个作业要求在哪里作业要求的链接
这个作业的目标对两个语言模型进行对比测试
其他参考文献构建之法

目录

  • 1 调研测评
  • 1.1 文心一言
  • 1.1.1 使用体验
  • 介绍
  • 优缺点分析
  • 优点
  • 缺点
  • 改进意见
  • 用户采访
  • 1.1.2 Bug描述
  • Bug发生时的测试环境
  • Bug的可复现性及具体复现步骤
  • Bug分析
  • 1.1.3 结论
  • 1.2 Kimi.ai
  • 1.2.1 使用体验
  • 介绍
  • 优缺点分析
  • 优点
  • 缺点
  • 改进意见
  • 用户采访
  • 1.2.2 Bug描述
  • Bug发生时的测试环境
  • Bug的可复现性及具体复现步骤
  • Bug分析
  • 1.2.3 结论
  • 2 分析
  • 2.1 开发时间估计
  • 2.2 同类产品对比排名
  • 2.3 软件工程方面建议
  • 2.4 Bug存在的原因分析
  • 3 建议和规划
  • 3.1 市场概况
  • 3.2市场现状
  • 3.3市场与产品生态分析
  • 3.4 新功能规划

1 调研测评

1.1 文心一言

1.1.1 使用体验

介绍

文心一言(英文名:ERNIE Bot)百度全新一代知识增强大语言模型文心大模型家族的新成员,能够与人对话互动、回答问题、协助创作,高效便捷地帮助人们获取信息知识灵感。文心一言从数万亿数据和数千亿知识中融合学习,得到预训练大模型,在此基础上采用有监督精调、人类反馈强化学习、提示等技术,具备知识增强、检索增强和对话增强的技术优势。

img

文心一言可以解答你的问题

img

文心一言可以使用AI绘画

img

优缺点分析

优点
  1. 理解和推理能力:文心一言不仅能返回相关的信息,还能理解和解释用户的查询意图,并提供相应的解释和推理。文心一言可以分析上下文,理解问题的复杂性和深层含义,从而提供更精确、更有针对性的回答。

  2. 自然语言交互:文心一言能够以自然语言的方式与用户进行交互,这意味着用户可以使用自然语言提问,而不需要使用特定的关键词或查询语句。这使得交流更加自然、直观和易于理解。

  3. 功能丰富齐全:文心一言为各行各业的工作者、学生提供了丰富的创作工具,可以快速创作如文章解读、插图、内容扩展、文章检查及优化等功能。

缺点
  1. 实时性和时效性限制:文心一言所获取的信息和知识是基于训练数据和互联网上的信息,这些信息可能不是最新的。因此,在涉及实时信息或最新发展的领域,可能无法提供最新、最准确的信息。

  2. 处理复杂和模糊问题的能力有限:对于某些复杂、模糊或涉及多个因素的问题,文心一言可能无法给出精确或满意的回答。这是因为理解和解释这类问题通常需要深入的领域知识、综合分析和推理能力。

改进意见

  1. 增加训练数据和多样性:通过扩大训练数据集和提高其多样性,可以更好地理解各种情境和问题,并生成更精确和丰富的回答。这包括使用更多的领域知识、跨语言数据以及实时更新的数据。

  2. 优化算法和模型架构:不断改进算法和模型架构,可以提高性能和准确性。这包括使用更先进的自然语言处理技术和深度学习算法,以优化推理、理解和生成能力。

  3. 增强实时性和时效性:提供更及时和准确的信息,与实时数据源进行集成,以便在回答中包括最新的信息。同时,定期更新训练数据和模型,确保能够跟上时代的发展和变化。

  4. 引入用户反馈机制:通过引入用户反馈机制,从用户那里获取宝贵的意见和建议,以便不断优化回答质量和用户体验。这可以通过设置评分系统、提供反馈渠道或进行定期的用户调查来实现。

    用户采访

    背景:高中同学 软件工程专业大三学生
    原因:他没用过文心一言
    需求:写文章、报告, AI辅助编程

    img

img

他的评价是牛头不对马嘴,需要画一幅厦门旅游路线图却只给了文字描述,辅助编程也不如copilot

1.1.2 Bug描述

Bug发生时的测试环境

操作系统:Win11 23H2
浏览器:Chrome 123.0.6312.107(正式版本) (64 位)
发生的时间段:2024/4/13

Bug的可复现性及具体复现步骤

描述: 绘画预测功能异常
可复现性: 经常发生
复现步骤: 先让他做ai绘画,之后的某些问题即使你没要求他绘画也会帮你自动绘画

img

Bug分析

成因: 先让他做ai绘画,可能之后的prompt都会被当成绘画的描述,而不是正常的问题
严重性:
系统功能:算法对上下文的理解能力
用户体验:不好 本来只想问个问题的 看来中途切换个话题 ai不能即使反应
改进意见: 增强ai对于上下文的理解能力 不要把之前的话题直接套到之后的话题中

1.1.3 结论

使用体验一般 有广告 回答效果也不突出

类别评分(满分10分)
核心功能6
界面5
用户体验4
综合5

1.2 Kimi.ai

1.2.1 使用体验

介绍

Kimi是月之暗面科技有限公司开发的人工智能助手,擅长处理中英文对话,并能够提供安全、有帮助且准确的信息。Kimi具备阅读和理解多种文件格式内容的能力,同时也能够解析网页信息,以便更好地回答用户的问题。在必要时,Kimi还能利用搜索功能来获取信息。Kimi遵循一系列规则,确保对话内容的适当性,避免涉及不当的话题。

img

Kimi可以帮你写代码

img

Kimi可以解析文件内容

img

Kimi可以定制常用语

img

优缺点分析

优点
  1. 多语言交流能力:Kimi擅长中文和英文的对话,能够与不同语言背景的用户进行有效沟通。
  2. 结合搜索结果提供答案:Kimi能够利用搜索结果来提供更为准确和全面的答案,增强了问题解决的深度和广度。
  3. 处理多种文件格式:Kimi能够阅读和理解多种文件格式,包括TXT、PDF、Word文档、PPT幻灯片和Excel电子表格等,为用户提供了极大的便利。
  4. 即时响应:Kimi能够迅速回应用户的查询,提供高效的服务体验,无需用户长时间等待。
  5. 安全性和适当性:Kimi会拒绝回答可能涉及不当内容的问题,确保对话的安全性和适当性。
缺点
  1. 无法创建文档:Kimi不具备创建文档或文件的能力,这限制了其在某些情况下提供帮助的范围。
  2. 缺乏人类情感理解:作为一个AI,Kimi无法完全模拟人类的情感,这可能在某些需要同理心的交流场合中造成局限。
  3. 受限于预设规则:Kimi的回答受到预设规则的限制,可能无法灵活应对所有问题。
  4. 知识更新的局限性:Kimi的知识库可能不会实时更新,这可能导致其在回答最新事件或信息时存在滞后。
  5. 无法执行实际操作:Kimi无法进行实际操作,如提供下载链接或通过电子邮件发送文件,这限制了其在某些情况下的实用性。
  6. 依赖用户输入:Kimi的回答质量依赖于用户提供的信息的准确性和完整性,若用户输入有误或不完整,可能会影响回答的质量。

改进意见

  1. 增强情感理解能力:通过进一步的算法优化和情感分析技术,Kimi可以更好地理解用户的情感状态,并作出更为人性化的回应。这将有助于提升用户的满意度和交流质量。
  2. 实时更新知识库:为了确保Kimi提供的信息始终是最新的,可以建立一个自动更新机制,定期更新Kimi的知识库,特别是在关键领域,如科技、政治和经济等。
  3. 提供更多交互方式:除了文本交流,Kimi可以集成语音识别和合成技术,允许用户通过语音与Kimi交流,同时获取语音反馈,这将极大地提高易用性和可访问性。
  4. 增强个性化服务:通过分析用户的历史查询和行为模式,Kimi可以提供更为个性化的服务和建议,更好地满足用户的特定需求。
  5. 扩展文件处理能力:虽然Kimi能够处理多种文件格式,但还可以进一步扩展其能力,比如支持更多的文件类型、提供文件编辑或转换功能,以满足用户更复杂的需求。
  6. 提供实际操作支持:考虑开发与第三方服务的集成,如云存储服务,以便Kimi可以帮助用户管理文件,提供下载链接或发送电子邮件。
  7. 优化搜索和回答算法:通过采用更先进的自然语言处理技术,Kimi可以更准确地理解复杂的问题,并提供更相关、更精确的答案。
  8. 用户反馈机制:建立一个有效的用户反馈系统,允许用户提供关于Kimi服务的意见和建议。这些反馈可以用来不断改进Kimi的功能和性能。
  9. 提高安全性和隐私保护:确保Kimi在处理用户数据时遵循严格的隐私政策和安全标准,以保护用户信息不被未经授权的访问和使用。

用户采访

背景:高中同学 人工智能专业大二学生
原因:他没玩过这种ai
需求:帮他写作业

img

img

评价是还行 只是回答的有点模糊 没有给出明确结果

1.2.2 Bug描述

Bug发生时的测试环境

操作系统:Win11 23H2
浏览器:Chrome 123.0.6312.107(正式版本) (64 位)
发生的时间段:2024/4/13

Bug的可复现性及具体复现步骤

描述: 对农历的回答是错误的
可复现性: 偶尔发生,20次测试出现了3次
复现步骤: 先问今天星期几,再问是农历多少。重复多次问农历就可以触发

正确答案应该是农历三月初五

img

Bug分析

成因: 中国的农历计算方法较为复杂 AI可能是通过过往训练集推导出今天是农历几号,可能出现推导错误的情况
严重性:
系统功能:这涉及到训练集以及算法是否准确。
用户体验:很糟糕 不能放心相信AI的答案 如果我有个日程安排是农历制的 那我很可能会错过这个安排
改进意见: 要么换训练集和算法 要么联网对比多个在线农历查询网站的结果再给答案

1.2.3 结论

好用,推荐。界面ui很漂亮,上下文理解能力很强,还能处理文件,nice

类别评分(满分10分)
核心功能7
界面9
用户体验7
综合8

2 分析

2.1 开发时间估计

首先要收集训练集,然后用专业卡训练模型,再开发web端功能以及开放api,在有训练模型的基础上可以在2年左右训练出来

2.2 同类产品对比排名

文心一言不好用,广告多,回复慢,ui也不好看,排名垫底。
Kimi的ui设计优秀,拥有目前所有大模型中最强的上下文理解能力,能够分析文件,排名低于ChatGPT4,排名第二

2.3 软件工程方面建议

代码质量和安全性:利用GPT模型进行代码审查,帮助识别潜在的代码问题和安全漏洞。这需要对模型进行适当的训练,以便它能够理解代码的语义和结构。
多语言和文化适应性:考虑到GPT模型可能在不同语言和文化背景下的表现差异,开发者应当关注模型的多语言支持和文化适应性,确保其在全球范围内的有效应用。
持续监控和评估:在软件工程实践中,持续监控GPT模型的性能和输出质量是非常重要的。通过定期评估,可以及时发现问题并进行调整,确保模型的可靠性和有效性。

2.4 Bug存在的原因分析

1.文心一言的上下文理解能力还是存在缺陷,这涉及到大模型算法本身的缺陷,可能是为了节省成本而没有选择提高模型的上下文理解能力,而是专注于在web端投放广告获取收益。
2.Kimi的农历计算存在错误,可能是因为网上已经有提供现成的工具,Kimi直接选择做一个简单的大部分时间都能正确回答的功能,而不是完美的功能。Kimi本身也是新创公司,开发团队没有足够的人手和时间去打磨各种细节。

3 建议和规划

3.1 市场概况

GPT技术及其相关应用的市场正在快速增长,成为人工智能领域的一个重要分支。根据的数据,截至2023年12月,ChatGPT拥有约1.8亿用户。这个数字不仅展示了GPT技术的直接用户基数,也反映了其市场规模的庞大。此外,ChatGPT的平均每月网站浏览量达到17亿次,这进一步证明了其市场影响力和用户基础的活跃度。

在潜在用户方面,考虑到GPT技术的多样性和应用范围,潜在市场规模可能更加庞大。GPT技术不仅可以用于聊天机器人,还可以应用于文本生成、语言翻译、内容创作等多个领域。随着技术的进步和应用场景的拓展,潜在用户群体可能会进一步增加。例如,教育和办公任务是ChatGPT最受欢迎的用途之一,这表明在这些领域中,还有大量潜在用户尚未充分利用GPT技术。

另外,根据的估算,整个ChatGPT的市场规模超过2000亿美元,这表明市场对ChatGPT及其相关技术的需求巨大,从而也暗示了潜在用户群体的庞大规模。全球有超过10亿潜在用户可使用ChatGPT,这一数字表明,尽管已经拥有1.8亿直接用户,但ChatGPT仍有巨大的市场空间去吸引更多的用户。

总的来说,GPT技术的市场规模巨大,已经拥有庞大的直接用户群体,并且随着技术的不断发展和应用的深入,潜在用户市场也具有巨大的增长潜力。

3.2市场现状

市场现有产品概览

目前市场上已经推出了众多集成了GPT技术的产品,这些产品覆盖了从消费者应用到企业服务的广泛领域。

消费者应用

  • 聊天机器人
  • 个性化推荐系统
  • 社交媒体平台的增强功能

企业服务

  • 自动化客服系统
  • 内容生成工具
  • 数据分析和报告生成

教育领域

  • 个性化学习辅导
  • 自动生成教学材料
  • 互动式学习体验

编程辅助

  • 代码自动生成工具
  • Bug修复助手
  • 编程教育平台

产品定位、优势与劣势

优势

  • 能够处理大量数据
  • 提供快速响应
  • 支持自然语言交互
  • 在特定任务上表现出色

劣势

  • 可能存在事实性错误
  • 时效性差
  • 成本高昂
  • 专业性一般
  • 对特定领域的深度理解和推理能力有限

产品间关系与竞品态势

关系

  • 互补和竞争的关系
  • 聊天机器人和社交媒体平台可能相互集成

竞品

  • ChatGPT与其他类似产品如Claude等形成竞争关系

态势

  • 市场上的竞争非常激烈
  • 各家公司都在不断推出新功能和服务
  • 吸引用户和客户

领域发展阶段

  • 目前正处于成长阶段
  • 技术的不断进步和应用场景的拓展
  • 市场对于GPT技术的需求持续增长
  • 竞争加剧
  • 未来可能过渡到平台阶段,形成稳定的市场格局

3.3市场与产品生态分析

核心用户群特征

典型用户

  • 学历:通常拥有中等或以上的教育水平,能够理解和使用基于GPT的产品。
  • 年龄:覆盖广泛,但可能以年轻和中年人群为主,这部分人群对新技术接受度高。
  • 专业:多样化,包括但不限于IT专业人士、市场营销人员、教育工作者、学生等。
  • 爱好:对新技术、编程、数据科学、内容创作等领域感兴趣。
  • 收入:收入水平各异,但可能倾向于中等以上收入群体,因为某些产品可能需要付费使用。
  • 表面需求:提高工作效率、获取信息、学习新知识、娱乐互动等。
  • 潜在需求:持续的个人成长、职业发展、社交需求、时间管理优化等。

用户群体间的关系

  • 用户群体间可能存在互动和协作的关系,例如IT专业人士可能为非技术用户提供技术支持和培训。
  • 教育工作者可以利用GPT技术创建教学材料,而学生则是这些材料的使用者。
  • 创作者和内容消费者之间形成内容生产和消费的生态。

子产品与其他相关产品间的关系

  • GPT技术的子产品,如聊天机器人、内容创作工具、教育辅导软件等,可以相互集成,形成更加丰富的用户体验。
  • 例如,聊天机器人可以与内容创作工具结合,提供个性化的内容建议和创作辅助。
  • 教育辅导软件可以与其他学习管理平台整合,提供一站式的学习解决方案。
  • 通过API和SDK,不同产品之间的数据和服务可以互通,形成更加紧密的产品生态。

利用产品特性构建产品生态的可能性

  • 通过开放平台和API策略,鼓励开发者和合作伙伴利用GPT技术开发新的应用和服务。
  • 构建一个平台,让用户可以自定义和组合不同的产品功能,以满足其独特的需求。
  • 通过用户反馈和社区参与,不断优化产品特性,增强产品间的协同效应。

3.4 新功能规划

功能名称: 交互式知识增强助手 (Interactive Knowledge Enhancement Assistant, IKEA)

功能描述:
开发一个交互式的知识增强平台,允许用户通过深入交互实时更新和扩展知识库,从而提高内容生成和问题回答的准确性和个性化水平。

功能原因:

  • 满足用户对精准、个性化信息服务的需求。
  • 利用GPT模型的技术进步,提供更丰富的交互体验。
  • 市场上缺乏实时更新和个性化的知识增强工具。

用户使用动机:

  • 获得定制化的信息和建议。
  • 实时更新和扩展个人或企业的知识库。
  • 通过交互式体验提高工作效率和内容质量。

创新点:

  • 实时知识更新功能,提高模型的准确性。
  • 上下文感知内容生成,提升用户体验。
  • 用户反馈驱动的知识库优化。

NABCD分析

N (Need): 用户对于更精准、个性化的信息服务的需求。
A (Approach): 通过交互式知识增强助手,用户可以实时更新知识库并引导内容生成。
B (Benefit): 用户将获得更准确、个性化的信息和内容生成服务。
C (Cost): 开发和维护新功能的成本,以及用户可能需要支付的订阅费用。
D (Differentiation): 与其他GPT应用相比,提供实时知识更新和上下文感知的增强功能。

团队配置

  • 前端开发工程师:1人
  • 后端开发工程师:3人
  • 知识库管理专家:1人
  • 测试工程师:1人

发布规划

第1-2周:项目启动和规划

  • 召开项目启动会议,明确目标、角色职责和里程碑。
  • 完成需求分析,撰写并审批功能规格书。
  • 设计系统架构和数据库模型。

第3-4周:设计和原型制作

  • 交互设计师与前端开发工程师合作完成界面设计。
  • 制作功能原型,进行用户交互流程的测试。

第5-8周:开发阶段

  • 前端开发工程师实现用户界面和交互逻辑。
  • 后端开发工程师负责编写API、集成GPT模型和实现知识库管理功能。
  • 知识库管理专家负责构建和优化知识库结构。

第9-12周:测试和优化

  • 测试工程师进行单元测试、集成测试和性能测试。
  • 根据测试反馈,开发团队进行代码优化和功能调整。

第13周:内部发布和最终测试

  • 内部发布版本供全体员工使用,收集反馈。
  • 进行最终的系统测试和安全检查。

第14周:公开Beta测试

  • 向选定的用户群体发布Beta版本,收集反馈。
  • 准备发布前的最终市场推广材料。

第15周:发布准备

  • 根据Beta测试结果进行最后的调整。
  • 确认发布计划和推广活动。

第16周:正式发布

  • 正式发布新功能。
  • 监控发布后的用户反馈和系统稳定性,准备后续的维护和更新计划。
...全文
182 回复 打赏 收藏 转发到动态 举报
写回复
用AI写文章
回复
切换为时间正序
请发表友善的回复…
发表回复
内容概要:本文围绕基于XGBoost的光伏阵列故障诊断方法展开研究,提出利用XGBoost这一先进的集成学习算法对光伏阵列多类型复合故障进行高效、准确的诊断。文中系统阐述了XGBoost算法的核心原理及其在分类任务中的显著优势,如强大的高维数据处理能力、优异的抗过拟合性能和高预测精度,并将其创新性地应用于光伏发电系统中常见的故障模式识别,涵盖短路、断路、局部阴影遮挡等多种典型故障。通过科学构建特征工程,提取电流、电压、温度等关键运行参数作为模型输入,结合真实运行环境下的实测数据集,完成了模型的训练、验证与性能评估。实验结果充分证明,该方法相较于传统的阈值判断或单一机器学习模型,在诊断准确率、鲁棒性和泛化能力方面均有显著提升,能够有效增强光伏发电系统的智能化运维水平,及时发现潜在故障,从而保障系统安全稳定运行并提高发电效率。; 适合人群:具备一定机器学习基础,从事新能源、电力系统或智能算法研究的研发人员及高校研究生。; 使用场景及目标:①应用于光伏发电系统的实时故障监测与早期预警;②提升光伏电站的智能化运维水平,减少非计划停机时间,降低人工巡检成本;③为风力发电、储能系统等其他可再生能源领域的智能故障诊断提供可借鉴的技术路径与实现方案。; 阅读建议:读者应结合文中提供的Python代码实例,深入理解XGBoost模型从数据预处理、特征工程、模型构建、超参数调优到性能评估的全流程实现细节,建议在自有或公开的光伏数据集上进行复现实验,并通过交叉验证和对比实验优化模型性能,以深刻掌握其在复杂故障诊断场景下的应用精髓。
内容概要:本文研究了考虑阶梯碳交易与绿证联合机制的虚拟电厂多时间尺度优化调度问题,并基于Matlab实现了相应的代码模型。通过构建日前、日内、实时等多时间尺度的协同优化调度框架,整合风电、光伏等可再生能源出力、负荷需求及电力市场交易机制,深入探讨了阶梯式碳定价与绿色证书交易对虚拟电厂运行经济性与低碳效益的耦合作用。研究建立了包含分布式电源、储能系统、可控负荷等多种资源的虚拟电厂聚合模型,采用数学优化算法求解各时间尺度下的调度方案,旨在实现系统运营成本最小化与碳排放强度最低化的双重优化目标。通过仿真案例验证了该联合机制在促进清洁能源消纳、引导削峰填谷、降低系统碳强度以及提升虚拟电厂市场竞争力方面的有效性与优越性。; 适合人群:具备电力系统分析、能源经济学或优化建模基础知识,从事综合能源系统、虚拟电厂运营、碳市场机制设计、低碳调度等相关领域的研究生、科研人员及工程技术人员。; 使用场景及目标:①研究虚拟电厂在碳交易与绿证双重市场机制下的协同优化运行策略;②掌握多时间尺度滚动优化调度的建模方法及其Matlab实现技术;③分析低碳政策工具(如阶梯碳价、绿证)对能源系统调度决策与经济效益的影响机制; 阅读建议:建议结合Matlab代码与文档中的模型结构进行对照学习,重点关注目标函数构建、约束条件设定及时序耦合逻辑,宜通过修改参数和场景设置进行敏感性分析以加深理解。

122

社区成员

发帖
与我相关
我的任务
社区描述
FZU-SE
软件工程 高校
社区管理员
  • LinQF39
  • 助教-吴可仪
  • 一杯时间
加入社区
  • 近7日
  • 近30日
  • 至今
社区公告
暂无公告

试试用AI创作助手写篇文章吧