软件工程时间——软件测评作业

222100431姚宇杰 2024-04-16 17:49:40

软件工程实践——软件评测作业

这个作业属于哪个课程福州大学-202302软件工程实践
这个作业要求在哪里软件工程实践——软件评测作业
这个作业的目标对两个语言模型进行对比测试
其他参考文献构建之法

目录

目录

  • 软件工程实践——软件评测作业
  • 目录
  • 1 调研测评
  • 1.1文心一言
  • 1.1.1使用体验
  • 优缺点
  • 改进意见
  • 用户采访
  • 1.1.2Bug描述
  • 测试环境
  • Bug的可复现性和具体复现步骤
  • Bug分析
  • 1.1.3 结论
  • 1.2讯飞星火
  • 1.2.1使用体验
  • 优缺点
  • 改进意见
  • 用户采访
  • 1.2.2Bug描述
  • 测试环境
  • Bug的可复现性和具体复现步骤
  • Bug分析
  • 1.2.3 结论
  • 2 分析
  • 2.1开发时间估计
  • 2.2同类产品对比排名
  • 2.3软件工程方面建议
  • Bug存在的原因分析
  • 建议和规划
  • 3.1市场概况
  • 3.2市场现状
  • 3.3产品规划
  • 3.3.2人员分配
  • 3.3.3规划

1 调研测评

1.1文心一言

1.1.1使用体验

文心一言可以协助完成范围广泛的任务并提供有关各种主题的信息,比如回答问题,提供定义和解释及建议。

1.png

对于简单问题答案往往是正确的

1.png

对于一些角色关系稍微复杂其实也不复杂的题目,他不能判断谁是谁

3.png

可以辅助画图

2.png

优缺点
  • 优点:

    1. 知识覆盖面广,除了日常对话,还能处理各种专业领域的问题。这得益于训练时使用了海量的多领域语料。
    2. 对话自然流畅,能较好地模拟人类的对话方式,保持上下文连贯性。
    3. 生成式输出,不仅可回答问题,还可协助写作、分析等高阶任务。
    4. 具备一定的理解推理能力,不完全是检索式回答。
  • 缺点:

    1. 受训练数据影响,可能在某些领域存在偏差或不确定性。
    2. 知识水平截止至训练数据的时间点,难以实时跟进最新信息。
    3. 缺乏情感认知和常识推理能力,无法完全模拟人类智能。
改进意见

1.持续学习:让模型能够自主地从最新的语料中学习,及时吸收更新的知识和信息,避免知识库过时的问题。

2.多模态融合:将自然语言处理与计算机视觉、语音识别等其他模态相结合,让模型能够理解和生成多模态信息,提高认知和交互能力。可考虑融入视频理解、情感分析等模块。

用户采访

背景:软件工程专业大三学生

产品:文心一言

问题:文心一言总是答非所问

image.png

1.1.2Bug描述

测试环境

操作系统:win10 22H2

浏览器:Microsoft Edge 123.0.2420.81

发生的时间: 2024/4/14

Bug的可复现性和具体复现步骤

92f8598c16a1d88401b9efaaaa6cc40.png

026cad0bd2d384917d1dc338f31aceb.png

描述:绘图功能异常

可复现性:必然发生

Bug分析

可能成因:模型训练有问题,文心一言只会在先前的图上进行修改

严重性:

  • 系统功能:严重,背后代码逻辑有误
  • 安全性:安全
  • 用户体验:极为糟糕的用户体验

1.1.3 结论

一般

类别评分(满分10分)
核心功能5
界面7
用户体验6
综合6

1.2讯飞星火

1.2.1使用体验

讯飞星火可以和人类进行自然交流,解答问题,高效完成各领域认知智能需求。

简单的逻辑问题回答是正确的

image.png

和上面一样的问题,讯飞星火没有在人物判断上犯错误,但在解答逻辑上出现了错误

image.png

可以绘画

image.png

优缺点
  • 优点:
    1. 整合了讯飞公司语音技术优势,未来有望实现语音与自然语言的深度融合。
    2. 采用先进的预训练技术,如Mask语言模型等,提高了语义表示能力。
    3. 模型规模大,参数达数十亿,拥有强大的语言理解和生成能力。
  • 缺点:
    1. 知识仅来自静态训练数据,难以及时获取最新信息。
    2. 语义表征偏差、缺乏情感认知和常识推理能力等问题仍未根本解决。
    3. 生成式模型存在不确定性和安全隐患,需要引入控制机制。
改进意见

1.情感认知增强:加强情感计算和情感识别模块,赋予模型对人类情感的理解和产生能力,提升人机情感交互的自然性和亲和力。可结合表情、语音等多模态信息进行情感推理。

2.持续学习:设计在线持续学习模块,让模型能够自主从最新语料中学习,持续充实和更新知识库,提高模型对新兴事物和热点信息的响应能力。

用户采访

背景:软件工程专业大三学生

产品:讯飞星火

问题:讯飞星火不能理解用户提出的问题

image.png

1.2.2Bug描述

测试环境

操作系统:win10 22H2

浏览器:Microsoft Edge 123.0.2420.81

发生的时间: 2024/4/14

Bug的可复现性和具体复现步骤

image.png

image.png

image.png

image.png

描述:对于提出的问题会出现答非所问

可复现性:经常发生

Bug分析

可能成因:讯飞星火在对上下文的理解方面还存在缺陷

严重性:

  • 系统功能:算法上存在漏洞
  • 用户体验:较为不适,容易惹恼用户

1.2.3 结论

一般

类别评分(满分10分)
核心功能8
界面6
用户体验7
综合7

2 分析

2.1开发时间估计

18个月

2.2同类产品对比排名

文心一言使用体验过于一般,相较于其他同类型产品处于劣势,总是答非所问,难以提供良好的用户体验。

讯飞星火对比于文心一言较好,虽然有时会理解不了用户提出的逻辑问题,但对绘画相关问题的理解是还可以的。

chatgpt3.5,在同类型产品中接触最早,早些年有不错的优势,给人的感受也很惊艳。

2.3软件工程方面建议

1.模型评估和测试:制定完善的模型评估机制,包括离线评估和线上评估相结合。构建自动化测试框架,覆盖单元测试、集成测试、回归测试等,持续验证模型的质量和鲁棒性。

2.模型部署和发布:实现模型部署的自动化和标准化,支持模型动态加载、滚动升级等功能。建立模型发布审批流程,确保发布前通过安全性、隐私合规等严格检查。

Bug存在的原因分析

1.文心一言的绘图问题可能是大模型本身的缺陷

2.讯飞星火对上下文理解有误,可能是算法逻辑有缺陷

建议和规划

3.1市场概况

近年来,大型语言模型及其相关技术在全球范围内得到了迅猛发展,呈现出蓬勃的市场前景。

目前,这一领域主要由一些科技巨头和创新企业主导,包括谷歌、OpenAI、Anthropic、DeepMind、Meta、华为、百度、科大讯飞等公司。他们通过持续的研发投入,不断推出新的大模型和应用产品。

在市场需求方面,大型语言模型技术被广泛应用于自然语言处理的各个领域,例如智能对话系统、文本摘要、机器翻译、写作辅助、客服机器人、内容审核等,为各行各业带来了全新的AI赋能机遇。

根据第三方研究机构的数据,全球大型语言模型市场在2022年的规模已超过20亿美元,预计到2028年将达到100多亿美元,年复合增长率超过30%。其中,以ChatGPT为代表的对话式大模型需求尤其旺盛。

从区域分布来看,目前北美和中国占据了较大的市场份额,欧洲、其他亚太地区等新兴市场也在快速增长。除了客户端应用,云服务和API调用也将成为未来重要的商业模式。

不过,大模型技术仍面临一些挑战,如隐私安全风险、社会影响、技术瓶颈等,业界需要进一步加强研究和治理。总的来说,伴随AI浪潮的推进,大型语言模型产业将持续保持高速增长,市场规模和前景十分可观。

3.2市场现状

  • Claude:

    • 定位:通用对话大模型
    • 优势:具有强大的自然语言理解和生成能力,可支持多轮交互对话、问答、写作辅助等应用场景
    • 劣势:知识存在滞后性,且存在一定的不确定性和安全隐患。
  • 文心一言:

    • 定位:通用对话大模型
    • 优势:可以协助完成范围广泛的任务并提供有关各种主题的信息,比如回答问题,提供定义和解释及建议。
    • 劣势:知识存在滞后性
  • Chatgpt:

    • 定位:通用对话大模型
    • 优势:强大的语言理解和生成能力,输出内容流畅自然
    • 劣势:缺乏情感认知和常识推理能力,难以完全模拟人类智能、知识存在滞后性

领域正处于成长阶段

3.3产品规划

####3.3.1 NABCD

  • Need

文心一言目前的知识来源于静态的训练数据集,无法实时获取最新信息,这在很大程度上限制了它应对动态变化环境的能力。用户对AI助手的实时响应和最新知识获取有着迫切需求。

  • Approach

引入持续学习模块,让模型能够自主从最新数据流(如网络爬取的文章、评论等)中实时学习,动态更新知识库,提高对新兴事物和热点话题的响应能力。

  • Benefits

显著增强文心一言T对最新信息的获取和处理能力,为用户提供更加及时、前沿的智能服务,提升用户体验。同时也减少了人工干预更新知识库的需求,降低运维成本。

  • Competition

目前谷歌等公司的大模型已初步具备持续学习能力,如果文心一言不增加这一功能,将在未来竞争中处于劣势。

  • Differentiation

通过自主研发创新的知识更新架构,实现模型端到端的自动持续学习,而非简单的知识库文本替换,可提供更加精准、完整和上下文关联的知识获取能力。

3.3.2人员分配

1)技术主管(1名) - 统筹规划技术路线,把控关键节点
2)AI算法研发(2名) - 负责持续学习模型的设计与实现
3)知识工程师(1名) - 维护知识库,优化知识获取和融合机制
4)后端开发(1名) - 负责系统部署,服务编排和API集成
5)测试工程师(1名) - 执行集成测试,性能测试和压力测试
6)项目协调(1名,兼职) - 跟进日常执行,确保按计划推进

3.3.3规划

  • 1-2周

​ 需求评审,设计系统架构和核心算法框架

  • 3-6周

​ 研发迭代1 - 构建知识获取和预处理模块

  • 7-8周

    中期评估,完成核心功能验证和迭代优化

  • 9-12周

    研发迭代2 - 实现持续学习模型集成和优化

  • 13-14周

    系统集成测试,性能优化和压力测试

  • 15周

    测试修复,发布准备

  • 16周

    正式版本发布上线,并通过A/B测试持续优化

...全文
70 回复 打赏 收藏 转发到动态 举报
写回复
用AI写文章
回复
切换为时间正序
请发表友善的回复…
发表回复

122

社区成员

发帖
与我相关
我的任务
社区描述
FZU-SE
软件工程 高校
社区管理员
  • LinQF39
  • 助教-吴可仪
  • 一杯时间
加入社区
  • 近7日
  • 近30日
  • 至今
社区公告
暂无公告

试试用AI创作助手写篇文章吧