122
社区成员
发帖
与我相关
我的任务
分享| 这个作业属于哪个课程 | 2302软件工程社区 |
|---|---|
| 这个作业要求在哪里 | 软件工程实践——软件评测作业 |
| 学号 | 222100308 |
| 这个作业的目标 | 完成软件调研、评测、分析、建议和规划 |
| 其他参考文献 | 2023年大模型应用调研报告、构建之法 |
主要界面分析

主要界面主要借鉴了chat-gpt网站,左侧是提问的历史记录,右侧则是提问的问答框,每次问答都会形成一个类似qq聊天工具的聊天截图
回答界面分析

与大模型交流时可以传入图片或者文件,也可以选择适当的插件来获得更多的功能
百宝箱功能介绍

百宝箱提供了一些预定义好的prompt语句,用户可以自由选择prompt来获取答案
使用指南介绍

使用指南提供了文心一言的使用手册,用户可以在里面自行学习其使用





输入报错理应回答具体在之前的代码中的错误,而不是宽泛答案,此时只有重新复制前面询问过的代码,才会说明具体的代码问题

问题是润色一小段文字,但是回答却是整篇演讲稿,质量较低,而且通篇存在大量套话

此处的奖杯明显出现绘制错误


- 增强模型对长多文本的识别能力,同时防止模型在一些需要简洁回答的输入时过拟合,回答过长的情况
- 增强模型对图片的识别,不能识别英语以及各种小物品绘制时的错误减少
- 历史信息的标题也应该让gpt生成,而不是直接选取第一句输入
- 历史消息的搜索功能应该支持全篇关键词的搜索,只搜索标题并且标题本身也无法体现整个对话内容,导致搜索功能鸡肋



| 星级 | 级别 | 描述 | 紧急程度 | 影响范围 |
|---|---|---|---|---|
| ★★★★★ | 紧急/阻断 | 系统完全崩溃,无法执行核心功能,用户无法进行任何操作。需立即修复。 | 非常紧急 | 整个系统 |
| ★★★★ | 严重 | 关键功能失败,严重影响用户的日常操作,降低用户满意度。需尽快修复。 | 紧急 | 较大范围 |
| ★★★ | 中等 | 部分功能存在问题,用户操作不便,但不影响主要工作流程。应在短期内解决。 | 适中 | 一般范围 |
| ★★ | 轻微 | 用户体验受到影响,但不影响功能使用。可以稍后解决,优先级较低。 | 低 | 小范围 |
| ★ | 建议 | 用户反馈的改进点,不涉及缺陷。可作为功能优化或后续迭代的参考。 | 最低 | 微小范围 |


可复现性:百分之百可以复现
复现步骤:如下图


具体情况:当输入指令带有英文字符时ai绘图无法进行,即使该英文字符并不影响大意仍然绘制
原因:个人觉得非常不可思议,因为大部分的大模型语料库一定会包括英文数据集,如果全部使用中文数据集进行训练,不理解为何百度会单独将其作为ai画图的训练集,本人腹黑地猜测是因为之前文心一言被指责调用其他国外公司大模型进行绘制,因此直接禁止用户输入英文字符,这样就可以营造出确实是国产训练的结果
严重性:二星级
bug改进建议:允许大模型接收少量不影响句子意思的英文字符,而不是全盘阻止用户使用英文输入


好,不错
总的来说文心一言作为百度公司的主力大模型应用在大模型能力和使用体验方面都做得不错,只是有一些瑕疵,总体来说很值得推荐。下面是用文心一言绘制的评分图:


主页较为简洁,以大面积留白为主,给人一种小清新的感觉,主要问答界面与大部分gpt类似,都是采取一问一答的形式


历史对话模块相比于文心一言,更加简洁,每个历史会话都支持自定义标题
支持离线和在线的推理模式



在线模式下会根据问题自行查找相关文献并且进行总结,可以方便用户找到问题的出处,离线模式下的回答则更加丰富
历史对话标题更有意义

除了可以支持自定义标题以外,kimi的主题提取更好,更符合对话内容,且可以根据对话的发展自动生成最新的更符合内容的标题
支持超长的文本输入

功能较为单一,只提供文字功能

逻辑推理能力较差

实际上2023年的农历新年应该是在1月22日,而不是2月22日,涉及到数学知识并不能正确推理
模型改进
增加ai绘图功能以及一些表格绘制功能,丰富大模型的使用场景
功能优化
kimi的整体界面及其简约,可能对于新手上手没有那么轻松,建议可以提供一些新手教程或者预定义好的prompt示例


| 星级 | 级别 | 描述 | 紧急程度 | 影响范围 |
|---|---|---|---|---|
| ★★★★★ | 紧急/阻断 | 系统完全崩溃,无法执行核心功能,用户无法进行任何操作。需立即修复。 | 非常紧急 | 整个系统 |
| ★★★★ | 严重 | 关键功能失败,严重影响用户的日常操作,降低用户满意度。需尽快修复。 | 紧急 | 较大范围 |
| ★★★ | 中等 | 部分功能存在问题,用户操作不便,但不影响主要工作流程。应在短期内解决。 | 适中 | 一般范围 |
| ★★ | 轻微 | 用户体验受到影响,但不影响功能使用。可以稍后解决,优先级较低。 | 低 | 小范围 |
| ★ | 建议 | 用户反馈的改进点,不涉及缺陷。可作为功能优化或后续迭代的参考。 | 最低 | 微小范围 |




总体来说kimi的表现很不错,其简洁外观很适合我这种有其他大模型使用经验的用户,且它提供的联网功能可以增加用户对其内容的信任度,并且其回答精确度也更加提高,会减少其他大模型可能存在的”幻觉“现象(即大模型自圆其说胡说八道),因此我觉得是个很值得深度使用的软件
| 过程 | 时间估计(天数) |
|---|---|
| 需求分析与设计 | 15 |
| 大模型训练以及微调 | 200++(30) |
| 前端网页设计 | 30 |
| 后端接口设计 | 40 |
| 测试运维 | 20 |
| 编写用户文档 | 10 |
| 报备上线 | 10 |
| 项目后期管理 | 30+ |
解释:
| 评分项目 | ChatGPT | 通译千问 | 文心一言 | Kimi |
|---|---|---|---|---|
| 界面美观程度 | 81 | 84 | 83 | 85 |
| 内容精确度 | 94 | 84 | 84 | 87 |
| 易操作性 | 75 | 82 | 90 | 82 |
| 响应速度 | 86 | 80 | 81 | 84 |
| 多功能性 | 84 | 82 | 88 | 80 |
| 总分 | 84 | 82.4 | 85.2 | 83.6 |
| 排名 | 2 | 4 | 1 | 3 |
结论:我们将chatgpt作为一个对照组来分析其他三个国产大模型,最后得分最高的是文心一言,文心一言由于背靠百度公司,在五项评分中都没有太大的短板,但是注意到三者在内容精确度上都与chatgpt有着较大的差距。
我们选取前文评分中两个软件的最低项目进行分析可提升点
具体的设计质量不高,在设计时算法工程师就没有或者不愿意考虑英文输入的情况,可能也跟他们觉得受众群体只是国内有关,对用户的需求分析不够到位
测试把关不严,测试时没有做到大规模的针对不同文件类型的测试,导致部分pdf无法正确识别
开发人员疏忽,产品经理对功能介绍不妥当,纯图像无法识别这个问题可以在功能描述上说明,比如该功能只支持文字信息提取等
国内应用层面的需求推动AI产业的加速发展,或将带来市场的爆发性增长。根据IDC数据预测,2021年中国人工智能软件及应用市场规模为51亿美元,预计2026年将会达到211亿美元。数据、算法、算力是AI发展的驱动力,其中数据是AI发展的基石,中国数据规模增速或排名全球第一。据IDC统计,中国数据规模将从2021年的18.51ZB增长至2026年的56.16ZB,年均增长速度CAGR为24.9%,增速位居全球第一。

大模型应用增强了AI技术的通用性,助力普惠AI的实现。未来,大模型有望于场景深度融合,配合专业工具和平台支持应用落地,开放的生态来激发创新,形成良性循环。目前已经在例如办公、金融、消费等领域有了具体应用

行业专业人士:在金融、法律、医疗等专业领域工作的人士可能会直接使用大模型来辅助他们的工作,如进行专业咨询、数据分析、报告撰写等。
内容创作者:内容创作者,包括作家、博主、记者等,可能会使用大模型来辅助内容生成、编辑和创意拓展。例如,利用大模型进行文案创作、新闻摘要或创意写作。
教育工作者和学生:教育工作者和学生可能会直接使用大模型进行教学辅助、学习辅导和研究工作。例如,利用大模型进行个性化教学、作业批改或学术资料的搜集和整理。
技术开发者:技术开发者可能会直接使用大模型的API进行应用开发,或者利用大模型提供的服务进行产品迭代和功能增强
企业用户:企业用户是大模型应用的重要潜在用户群体,他们可能寻求通过大模型来提升业务流程的效率、降低成本、增强数据分析能力等。例如,金融企业可能利用大模型进行风险评估和市场预测,而制造业企业可能利用大模型进行供应链优化和产品设计。
开发者和技术公司:开发者和技术公司关注大模型的开放性和可扩展性,他们可能会基于大模型开发新的应用程序或服务。例如,一些技术公司可能会利用大模型开发智能助手或自动化工具,以提供更加个性化的服务。
教育机构和研究人员:教育机构和研究人员可能对大模型在教育和科研领域的应用感兴趣。他们可能会利用大模型进行知识管理和学术研究,如自动生成教育内容、辅助文献综述等。
普通消费者:普通消费者也可能成为大模型应用的潜在用户,尤其是在娱乐、日常生活管理、健康咨询等方面。例如,消费者可能会使用基于大模型的聊天机器人进行日常对话或获取生活建议。

商汤科技大模型
商汤科技的大模型主要聚焦于多模态应用支持能力,结合视觉、语言及各种模态的数据,形成强大的AI应用能力。商汤科技的大模型体系被称为“日日新SenseNova”,这一体系下的语言大模型展示了对长文本的理解和归纳能力,能够在理解问题后生成总结性答案,而不是简单地复制文本内容。
盘古大模型
盘古大模型是由华为推出的预训练语言模型,旨在通过深度学习和大数据分析,提供强大的自然语言处理能力。盘古大模型在多项NLP任务中表现出色,能够进行文本理解、生成、翻译等多种语言任务。
kimi
Kimi是由月之暗面科技有限公司开发的人工智能助手,擅长中文和英文对话,能够提供安全、有帮助、准确的回答。Kimi具备多种能力,包括解析用户上传的文件、访问互联网信息、结合搜索结果提供回答等。Kimi在对话中遵循严格的指导原则,确保信息的安全性和合规性。
文心大模型
文心大模型是由百度推出的产业级知识增强大模型,覆盖了NLP、CV、跨模态等多个领域。文心大模型通过结合大数据预训练和多源知识,不断吸收新知识,提升模型效果。它包括文心·NLP大模型、文心·CV大模型和文心·跨模态大模型等,能够在语言理解、语言生成、视觉任务定制等方面提供支持,适用于千行百业的AI开发需求。百度还推出了基于文心大模型的智能体平台——灵境矩阵,支持开发者打造个性化的智能应用。
随着chatgpt的访问量增加,国内各种产品也喷涌而出,这也说明大模型产品的发展处在风口阶段,技术的成熟、资本的推动、政策的支持、市场需求的增长以及社会影响力的扩大,共同促成了大模型技术的快速发展和广泛应用

| 核心用户 | 年龄 | 学历 | 专业 | 爱好 | 收入 | 表面需求 | 潜在需求 |
|---|---|---|---|---|---|---|---|
| 科研工作者 | 30-60岁 | 硕士研究生及以上 | 理工科为主 | 科研 | 年收入30-100w | 提高阅读文献速度,便于整理文献 | 获取科研灵感 |
| 学生 | 16-30岁 | 本科学历及以上 | 不限 | 倒腾新事物 | 无 | 利用大模型来辅助学习和作业 | 提高学习能力 |
| 自媒体创作者 | 18-40岁 | 不限 | 文科为主 | 拍摄短视频或者文案 | 年收入10w到1000w | 提高内容创作的效率和质量。大模型可以辅助写作、内容生成、内容审核和推荐 | 快速生成创意灵感和完善作品 |
存在利用其相互作用二次构成特定用户生态的可能性:
互补性:不同的用户群体可能在大模型应用中扮演互补的角色。例如,开发者可以利用大模型开发新的应用程序或服务,而普通用户则是这些应用程序的最终使用者。开发者通过创新满足用户需求,而用户的反馈又可以促进开发者改进产品。
互动性:用户之间可以通过大模型应用进行互动和交流。例如,在社交媒体或内容创作平台上,内容创作者使用大模型生成的内容可以引发用户的讨论和互动,形成活跃的社区生态。
反馈循环:大模型应用产品的用户群体可以通过反馈机制相互影响。用户在使用产品过程中产生的数据可以用于训练和优化大模型,而优化后的模型又能提供更好的用户体验,形成一个正向的反馈循环。
生态系统构建:企业可以通过构建开放的平台和生态系统,鼓励不同用户群体之间的合作和创新。例如,百度提出的“生态雨林”概念,旨在吸引开发者、内容创作者和商业伙伴共同参与到大模型应用的开发和推广中,形成一个多元共生的生态系统。
价值共创:用户群体之间的相互作用可以促进价值共创。专业用户可能提供深度的行业洞察和专业知识,而普通用户则通过日常使用贡献数据和反馈,共同推动大模型应用在特定领域的深入发展。
存在通过这些产品特性之间的相互作用来构建一个更加丰富和多元的产品生态系统的可能性:
互补性:不同的大模型子产品可以针对特定的应用场景或用户需求提供专业化服务。例如,一些子产品可能专注于图像识别,而另一些则可能更擅长自然语言处理。这些产品之间的互补性可以为用户提供一个全面的解决方案,满足他们在不同领域的AI需求。
集成性:大模型产品可以通过API或其他集成方式与现有的软件和服务相结合,从而扩展其功能和应用范围。例如,企业可以将大模型集成到自己的CRM系统中,利用其数据分析能力来提高客户服务的质量和效率。
协同性:大模型产品的不同子产品可以相互协作,共同完成更复杂的任务。例如,一个负责内容生成的模型可以与一个负责内容审核的模型相结合,以自动产生并检查社交媒体帖子,确保内容的合规性和质量。
数据共享和学习:大模型产品可以通过共享数据和学习成果来提升整个生态系统的智能水平。通过这种方式,各个产品可以相互借鉴和优化,实现知识的积累和智能的增长。
开放性和标准化:通过建立开放的平台和标准化的接口,大模型产品可以更容易地与其他产品和技术整合。这不仅有助于推动创新,还可以降低开发和维护的成本,促进生态系统的健康发展。
在移动端增加虚拟化形象ki小mi,类似ios系统下的siri,可以实现与人类进行直接语音交流,使用者不需要通过敲击键盘实现对话,可以直接语音唤醒小mi,比如在出门之前可以说:“小mi,帮我选择一条到工作地的时间最快的线路”或者可以让小mi通过联网功能寻找上班时可以听的新闻。
| NABCD模型 | 具体描述 |
|---|---|
| 需求(Need) | 1. 用户需要一种更自然、便捷的交互方式,以获取信息和服务。 2. 用户希望能够通过语音命令获取定制化的内容 3.用户在特定环境下希望能够快速得到回答,而不是敲击键盘慢慢看回复才能获取答案 |
| 做法 (Approach) | 1. 开发高效的语音识别和处理算法,提高语音命令的识别准确率和响应速度 2. 将“ki小mi”与现有的移动操作系统和服务无缝集成,提供流畅的用户体验。 3. 制定严格的数据安全政策,保护用户的个人信息和隐私不被泄露 |
| 效益(Benefits) | 1. 用户可以节省时间,减少在移动设备上的操作步骤。 2.提高了用户体验,使得获取信息和服务更加轻松愉快 |
| 竞争(Competitors) | 1. 相对于市面上大量的需要手动输入和阅读的gpt工具,利用其语音输入和输出可以快速节省时间,补充市场空缺 2. 更人性化的使用方式提高了用户的使用粘性 |
| 推广(Delivery) | 1. 通过营销活动和教育项目提高市场对“ki小mi”的认知度 2. 与移动设备制造商、应用商店和其他合作伙伴建立合作关系,扩大“ki小mi”的分发渠道 3. 管理销售渠道和合作伙伴关系,确保“ki小mi”能够有效地触达目标用户 |
| 角色类型 | 工作介绍 | 人数 |
|---|---|---|
| 大模型工程师 | 设计大模型架构以及训练细节,确保App的核心AI功能能够高效准确地执行 | 2 |
| 前端工程师 | 负责App的用户界面(UI)和用户体验(UX)的开发,确保界面美观、直观且易于使用 | 1 |
| 后端工程师 | 负责App的后端逻辑开发,包括服务器、数据库和应用程序接口(API)的设计和实现 | 1 |
| ui设计师 | 负责App的视觉设计,包括界面布局、颜色方案、图标和动画效果 | 1 |
| 运维测试员 | 负责App的质量保证和测试,确保产品在发布前和发布后都能稳定运行 | 1 |
| 周数 | 工作主题 | 工作内容 |
|---|---|---|
| 第1周 | 项目启动与规划 | 确定项目范围和目标,分配资源和人员,进行市场调研和用户需求分析 |
| 第2周 | 技术栈和工具选择 | 确定前后端技术栈,选择合适的开发工具和平台,搭建开发和测试环境 |
| 第3周 | 需求分析和设计 | 完成详细的需求文档,UI设计师开始初步的界面设计,大模型工程师开始数据准备和模型初步设计 |
| 第4周 | 初步设计和原型制作 | UI设计师完成初步设计稿,制作交互式原型,后端工程师开始编写API和逻辑处理 |
| 第5周 | 开发启动 | 前端工程师开始实现UI界面,后端工程师继续搭建后端架构,大模型工程师开始模型训练 |
| 第6周 | 核心功能开发 | 完成核心功能的开发工作,初步集成前后端功能,进行初步的功能测试和性能评估 |
| 第7周 | 功能迭代和优化 | 根据测试反馈进行功能迭代,优化UI/UX和后端性能,大模型工程师继续优化模型 |
| 第8周 | 全面测试 | 运维测试人员开始全面的测试工作,进行安全性和兼容性测试,收集反馈并进行调整 |
| 第9周 | 用户测试和反馈 | 邀请用户参与测试,根据用户反馈进行产品调整,准备市场推广材料 |
| 第10周 | 性能优化和准备上线 | 对App进行性能优化,准备上线所需的文档和资源,确定上线日期 |
| 第11周 | 软发布和监控 | 在小范围内进行软发布,监控App的表现和用户反馈,准备扩大发布范围 |
| 第12周 | 全面发布 | 在所有目标平台上发布App,进行市场推广活动,监控用户下载和使用情况 |
| 第13周 | 发布后支持和维护 | 提供用户支持和帮助,修复发现的问题和漏洞,收集用户反馈 |
| 第14周 | 数据分析和市场反馈 | 分析用户数据和市场表现,评估推广活动的效果,收集竞争对手信息 |
| 第15周 | 迭代规划和新功能开发 | 根据用户反馈和市场数据规划新功能,开始新功能的开发工作 |
| 第16周 | 回顾和未来规划 | 回顾项目的整体表现,总结经验教训,规划下一阶段的发展路线图 |