122
社区成员
发帖
与我相关
我的任务
分享| 这个作业属于哪个课程 | 福州大学-202302软件工程实践 |
|---|---|
| 这个作业要求在哪里 | 软件工程实践——软件评测作业 |
| 这个作业的目标 | 对两个语言模型进行对比测试 |
| 其他参考文献 | 构建之法 |
文心一言可以协助完成范围广泛的任务并提供有关各种主题的信息,比如回答问题,提供定义和解释及建议。

对于简单问题答案往往是正确的

对于一些角色关系稍微复杂其实也不复杂的题目,他不能判断谁是谁

可以辅助画图

优点:
缺点:
1.持续学习:让模型能够自主地从最新的语料中学习,及时吸收更新的知识和信息,避免知识库过时的问题。
2.多模态融合:将自然语言处理与计算机视觉、语音识别等其他模态相结合,让模型能够理解和生成多模态信息,提高认知和交互能力。可考虑融入视频理解、情感分析等模块。
背景:软件工程专业大三学生
产品:文心一言
问题:文心一言总是答非所问

操作系统:win10 22H2
浏览器:Microsoft Edge 123.0.2420.81
发生的时间: 2024/4/14


描述:绘图功能异常
可复现性:必然发生
可能成因:模型训练有问题,文心一言只会在先前的图上进行修改
严重性:
一般
| 类别 | 评分(满分10分) |
|---|---|
| 核心功能 | 5 |
| 界面 | 7 |
| 用户体验 | 6 |
| 综合 | 6 |
讯飞星火可以和人类进行自然交流,解答问题,高效完成各领域认知智能需求。
简单的逻辑问题回答是正确的

和上面一样的问题,讯飞星火没有在人物判断上犯错误,但在解答逻辑上出现了错误

可以绘画

1.情感认知增强:加强情感计算和情感识别模块,赋予模型对人类情感的理解和产生能力,提升人机情感交互的自然性和亲和力。可结合表情、语音等多模态信息进行情感推理。
2.持续学习:设计在线持续学习模块,让模型能够自主从最新语料中学习,持续充实和更新知识库,提高模型对新兴事物和热点信息的响应能力。
背景:软件工程专业大三学生
产品:讯飞星火
问题:讯飞星火不能理解用户提出的问题

操作系统:win10 22H2
浏览器:Microsoft Edge 123.0.2420.81
发生的时间: 2024/4/14




描述:对于提出的问题会出现答非所问
可复现性:经常发生
可能成因:讯飞星火在对上下文的理解方面还存在缺陷
严重性:
一般
| 类别 | 评分(满分10分) |
|---|---|
| 核心功能 | 8 |
| 界面 | 6 |
| 用户体验 | 7 |
| 综合 | 7 |
18个月
文心一言使用体验过于一般,相较于其他同类型产品处于劣势,总是答非所问,难以提供良好的用户体验。
讯飞星火对比于文心一言较好,虽然有时会理解不了用户提出的逻辑问题,但对绘画相关问题的理解是还可以的。
chatgpt3.5,在同类型产品中接触最早,早些年有不错的优势,给人的感受也很惊艳。
1.模型评估和测试:制定完善的模型评估机制,包括离线评估和线上评估相结合。构建自动化测试框架,覆盖单元测试、集成测试、回归测试等,持续验证模型的质量和鲁棒性。
2.模型部署和发布:实现模型部署的自动化和标准化,支持模型动态加载、滚动升级等功能。建立模型发布审批流程,确保发布前通过安全性、隐私合规等严格检查。
1.文心一言的绘图问题可能是大模型本身的缺陷
2.讯飞星火对上下文理解有误,可能是算法逻辑有缺陷
近年来,大型语言模型及其相关技术在全球范围内得到了迅猛发展,呈现出蓬勃的市场前景。
目前,这一领域主要由一些科技巨头和创新企业主导,包括谷歌、OpenAI、Anthropic、DeepMind、Meta、华为、百度、科大讯飞等公司。他们通过持续的研发投入,不断推出新的大模型和应用产品。
在市场需求方面,大型语言模型技术被广泛应用于自然语言处理的各个领域,例如智能对话系统、文本摘要、机器翻译、写作辅助、客服机器人、内容审核等,为各行各业带来了全新的AI赋能机遇。
根据第三方研究机构的数据,全球大型语言模型市场在2022年的规模已超过20亿美元,预计到2028年将达到100多亿美元,年复合增长率超过30%。其中,以ChatGPT为代表的对话式大模型需求尤其旺盛。
从区域分布来看,目前北美和中国占据了较大的市场份额,欧洲、其他亚太地区等新兴市场也在快速增长。除了客户端应用,云服务和API调用也将成为未来重要的商业模式。
不过,大模型技术仍面临一些挑战,如隐私安全风险、社会影响、技术瓶颈等,业界需要进一步加强研究和治理。总的来说,伴随AI浪潮的推进,大型语言模型产业将持续保持高速增长,市场规模和前景十分可观。
Claude:
文心一言:
Chatgpt:
领域正处于成长阶段
####3.3.1 NABCD
文心一言目前的知识来源于静态的训练数据集,无法实时获取最新信息,这在很大程度上限制了它应对动态变化环境的能力。用户对AI助手的实时响应和最新知识获取有着迫切需求。
引入持续学习模块,让模型能够自主从最新数据流(如网络爬取的文章、评论等)中实时学习,动态更新知识库,提高对新兴事物和热点话题的响应能力。
显著增强文心一言T对最新信息的获取和处理能力,为用户提供更加及时、前沿的智能服务,提升用户体验。同时也减少了人工干预更新知识库的需求,降低运维成本。
目前谷歌等公司的大模型已初步具备持续学习能力,如果文心一言不增加这一功能,将在未来竞争中处于劣势。
通过自主研发创新的知识更新架构,实现模型端到端的自动持续学习,而非简单的知识库文本替换,可提供更加精准、完整和上下文关联的知识获取能力。
1)技术主管(1名) - 统筹规划技术路线,把控关键节点
2)AI算法研发(2名) - 负责持续学习模型的设计与实现
3)知识工程师(1名) - 维护知识库,优化知识获取和融合机制
4)后端开发(1名) - 负责系统部署,服务编排和API集成
5)测试工程师(1名) - 执行集成测试,性能测试和压力测试
6)项目协调(1名,兼职) - 跟进日常执行,确保按计划推进
需求评审,设计系统架构和核心算法框架
研发迭代1 - 构建知识获取和预处理模块
7-8周
中期评估,完成核心功能验证和迭代优化
9-12周
研发迭代2 - 实现持续学习模型集成和优化
13-14周
系统集成测试,性能优化和压力测试
15周
测试修复,发布准备
16周
正式版本发布上线,并通过A/B测试持续优化