哈基米队——大模型评测作业

哈基米队 2025-10-27 21:06:19
这个作业属于哪个课程软件工程
这个作业要求在哪里软件工程实践——大模型评测作业
团队名称哈基米队
这个作业的目标针对优质大模型进行测评,并且以此了解相关的运行原理和市场规律
其他参考文献《构建之法》

目录

  • 第一部分 调研,评测
  • 1.1大模型1(Qwen3)
  • 1.1.1使用体验
  • 1.1.1.1介绍和使用
  • 1.1.1.2优缺点分析
  • 1.1.1.3改进意见
  • 1.1.1.4采访
  • 1.1.2自动化测试
  • 1.1.3结论
  • 1.2大模型2智普Ai
  • 1.2.1使用体验
  • 1.2.1.1介绍和使用
  • 1.2.1.2优缺点分析
  • 1.2.1.3改进意见
  • 1.2.1.4采访
  • 1.2.2自动化测试
  • 1.2.3结论
  • 第二部分 分析
  • 2.1同类产品对比排名
  • 2.2软件工程方面的建议
  • 2.2.1 模型研发与迭代:强化工程化管理
  • 2.2.2 安全与合规:筑牢工程防线
  • 2.3市场概况
  • 2.3.1 Qwen3市场概况
  • 2.3.2 智普AI市场概况
  • 2.4产品规划
  • 2.5团队绩效

第一部分 调研,评测

1.1大模型1(Qwen3)

1.1.1使用体验

1.1.1.1介绍和使用

通义千问(Qwen)是阿里巴巴集团通义实验室自主研发的超大规模语言模型,具备强大的语言理解与生成能力。它不仅支持多语言交互,还在对话理解、代码生成、逻辑推理和多模态处理等方面表现出色。

通过多轮对话优化与上下文感知,通义千问能够实现自然、连贯且富有逻辑的对话体验,广泛适用于智能客服、虚拟助手、教育辅导等场景。除了纯文本模型,通义千问还推出了多模态版本(如 Qwen-VL),可支持图像理解、图文问答和视觉推理等任务。

此外,阿里巴巴已开源多个版本的 Qwen 系列模型(包括 Qwen、Qwen1.5、Qwen2、Qwen2.5、Qwen3 等),覆盖从 0.5B 到 72B 等多种参数规模,满足不同性能与资源需求。这些模型支持本地部署和微调,已被广泛应用于学术研究和工业实践。

以下是千问模型的一些主要功能使用:

●多轮对话与上下文理解

img

●对编程语言的理解、代码生成和调试能力

img

●多模态能力(如使用 Qwen-VL)

img

1.1.1.2优缺点分析

✅ 优点
1.中文能力强:在中文对话、写作、代码注释、成语古诗等方面表现优秀,贴合本土用户习惯。

2.开源生态丰富:提供从 0.5B 到 72B 多种规模模型(如 Qwen、Qwen2、Qwen3),含 Chat/Instruct/Base 等版本,支持 GGUF、AWQ 等量化格式,适合不同部署需求。

3.代码生成出色:支持多种编程语言,能生成结构清晰、带中文注释的代码,适合开发者使用。

4.多模态支持:Qwen-VL 可理解图像和图表(如传感器界面),Qwen-Audio 支持语音处理。

5.本地部署友好:开源协议较宽松,兼容 vLLM、Ollama、llama.cpp 等工具,适合私有化或校园项目。

6.持续更新活跃:模型迭代快,社区(GitHub、魔搭、Hugging Face)资源丰富。

❌ 缺点
1.无法联网(开源版):不能获取实时信息(如天气、新闻),易“编造”答案;联网和工具调用仅限阿里云 API 版本。

2.长文本处理一般:虽支持超长上下文,但信息定位和逻辑连贯性不如 Claude 3 或 GPT-4。

3.英文能力较弱:多语言支持尚可,但复杂英文写作或学术表达不如国际顶尖模型。

4.资源消耗大:大模型在普通笔记本(如 ROG 魔霸7 Plus)上运行较慢;小模型速度快但能力有限。

5.存在幻觉风险:可能生成看似合理但错误的内容,需人工核验。

6.工具链较分散:不同平台(ModelScope/HF/Ollama)的加载方式和格式不统一,初学者易遇兼容问题。

1.1.1.3改进意见

  1. 优化小模型的专业能力
    问题:Qwen-1.8B/4B 等小模型在图形学、算法、工程类问题上回答简略或错误。
    建议:针对计算机、软件工程等专业领域,推出垂类微调的小模型版本(如 Qwen-Coding-1.8B)。支持用户上传本地文档(如课程讲义、API 手册)进行 RAG 增强,提升专业问答准确性。

  2. 提升代码生成的工程实用性
    问题:生成的代码有时缺少边界检查、错误处理或不符合项目规范。
    建议:允许用户在提示中指定“代码风格”(如“带异常处理”“符合 Google C++ 风格”“注释用中文”)。支持根据已有代码上下文(如类定义、头文件)生成连贯实现。

  3. 加强中文技术社区支持
    问题:部分高级功能(如 Agent、Function Calling)缺乏中文教程或示例。
    建议:在魔搭(ModelScope)上增加中文实战项目模板(如“用 Qwen 搭建传感器数据问答系统”)。提供面向高校学生的教学包(含实验指导、测试数据集),便于课程集成。

  4. 降低本地运行门槛
    问题:即使量化后,7B 以上模型在普通笔记本上响应慢,影响交互体验。
    建议:推出更高效的4-bit 量化版本,并优化 llama.cpp 后端推理速度。提供“性能-质量”滑块选项,让用户在速度与准确率间灵活权衡。

1.1.1.4采访

a. 采访对象背景
采访对象:某高校计算机专业大二学生,王同学

选择原因:正在修读《数据结构》《Java程序设计》等课程。典型的“课程作业驱动型”用户,频繁需要编写算法、调试代码、撰写注释;无大模型部署经验,仅通过 Web 端(如通义app 或 魔搭 ModelScope 在线体验)使用 Qwen;代表大多数只想“快速解决问题”而非研究模型本身的学生用户。

核心需求:“我写作业时经常卡在某个函数实现上,希望有个工具能快速给我一段带中文注释的参考代码,最好还能解释为什么这么写。”

b. 实际使用的产品栏目
王同学在千问网页端使用 Qwen-Max3,共约 15 分钟,主要操作包括:
输入课程作业题:“用 C++ 实现 Dijkstra 最短路径算法,要求使用邻接表存储,输出从起点到各点的最短距离。”
追问:“请为每一步添加中文注释。”
修改需求:“如果图中有负权边怎么办?这段代码还能用吗?”
尝试让模型检查一段自己写的有 bug 的代码。

c. 使用过程中的问题与亮点
亮点:
响应迅速,代码结构规范:生成的 Dijkstra 代码使用 priority_queue 和 vector<vector<pair<int, int>>> 实现邻接表,符合课程要求;
中文注释准确到位:如“// 使用小顶堆优化,每次取出当前距离最小的节点”,帮助理解算法思想;
能指出负权边问题:明确说明“Dijkstra 不能处理负权边,建议改用 Bellman-Ford”,并简要解释原因。

遇到的困难:
无法访问本地代码上下文:当上传自己写的 buggy 代码时,模型只能基于片段分析,无法结合完整项目逻辑判断问题根源。
偶尔过度简化:生成的代码未包含输入合法性检查(如节点编号越界),王同学需手动补充;

d.用户体验改进建议
从日常作业辅助角度,王同学提出以下改进点:

1.增强代码鲁棒性提示:在生成基础算法代码后,自动附加“常见边界情况处理建议”(如空图、孤立点、负权边等)。
2.提供错误代码诊断模板:当用户粘贴问题代码时,引导其补充“预期行为 vs 实际输出”,帮助模型更精准定位 bug。

1.1.2自动化测试

为客观评估大模型在复杂决策任务中的表现,我使用 Python 编写了一套自动化测试程序,模拟完整的 购车决策流程。程序通过调用 Qwen 的官方 API(阿里云百炼平台)实现多轮对话,并对模型输出进行结构化解析与评分。

测评结果如下:

img

img

img

img

img

img

img

img

img

img

img

1.1.3结论

在本次“购车决策”自动化评测任务中,Qwen 模型展现了强大的中文理解和多轮对话能力,能够完整执行从需求输入到最终推荐的全流程。然而,通过与 ChatGLM 的量化对比,其在结构化输出稳定性和响应效率方面存在明显短板。

  1. 核心任务完成情况
    流程完整性:Qwen 成功完成了所有预设步骤,包括初步推荐、逐条要点分析、参数表格生成及最终车型推荐,任务完成度为 100%。
    候选车型覆盖:程序共识别出 7 款候选车型(大众速腾、朗逸、丰田卡罗拉、大众朗逸 Plus、长安福特福克斯、日产轩逸、本田雅阁),覆盖了主流合资品牌,符合市场预期。
    最终推荐合理性:Qwen 最终推荐 本田雅阁,理由充分,涵盖了预算匹配、用途适配性、性能表现、安全配置和使用成本等多个维度,逻辑连贯,具备较强的说服力。

2.量化结果分析

评估维度Qwen 得分ChatGLM 得分对比分析
长度得分 (length_score)1.001.00两者均能提供足够详尽的回答,无显著差异。
清晰度得分 (clarity_score)1.001.00回答语言通顺,逻辑清晰,易于理解。
完整性得分 (completeness_score)0.910.91均能覆盖用户提出的全部购车要点,信息完整度高。
结构化得分 (structured_score)0.500.50两者在生成 Markdown 表格时均出现格式不稳定问题,导致程序解析失败率较高,是主要失分项。
响应时间 (response_time)23.71 秒12.98 秒ChatGLM 明显更快,平均响应时间仅为 Qwen 的 55%,用户体验更优。
时间得分 (time_score)0.000.13程序根据响应时间进行归一化评分,ChatGLM 因速度优势获得额外加分。
综合总分 (total_score)0.730.75ChatGLM 胜出,在保持同等功能完整性的前提下,凭借更高的响应效率获得更高总分。

1.2大模型2智普Ai

1.2.1使用体验

1.2.1.1介绍和使用

img

模型基本功能介绍: GLM-4.5V是智谱AI(Zhipu AI)于2025年8月发布的开源视觉-语言大模型(VLM)。该模型基于其旗舰文本基座模型GLM-4.5-Air构建,拥有1060亿总参数和120亿激活参数,采用混合专家(MoE)架构。其核心能力是“全场景视觉推理”,主要功能涵盖:
●图像推理:包括场景理解、复杂多图分析、位置识别(如看图猜地址)、空间关系推理等。
●视频理解:能够进行长视频分镜分析,并理解动作的“意图”和“上下文”,而非简单的动作识别。
●复杂文档理解:可处理长达数十页、包含大量图表的PDF或PPT文档,实现文字与图像信息的同步理解。
●GUI Agent能力:能精准解析网页或App的UI截图,甚至能生成高质量、可交互的HTML代码来复刻前端界面。
●思考模式:支持在“快速响应”和“深度推理”之间切换,以适应不同复杂度的任务。
注册与使用过程: 用户可以通过访问智谱AI开放平台(BigModel.cn)进行注册和使用。注册流程简单,只需邮箱验证即可。登录后,在模型选择下拉菜单中选择GLM-4.5V,即可通过网页前端直接上传图片、视频或文档进行交互。平台为新老用户提供了2000万Tokens的免费资源包,降低了体验门槛。

以下是使用该模型的过程

img

1.2.1.2优缺点分析

使用过程总体流畅。上传一张包含复杂表格的截图后,模型能准确地将其内容结构化为Markdown表格;

img

上传一张烹饪图片,模型不仅能描述步骤,还能分析出厨师的操作意图和技巧要点。

img

这有效解决了用户在信息提取、内容理解和知识获取方面的问题。

各维度的优缺点:
●数据量/能力:优点在于其106B的庞大参数量和在41个权威榜单上的SOTA表现,尤其在STEM(科学、技术、工程、数学)领域的复杂推理任务上优势显著。缺点为对非常小众或训练数据中罕见的视觉概念,偶尔会出现幻觉或理解偏差。
●界面:智谱开放平台的Web界面简洁直观,上传和交互逻辑清晰,对新手友好。但作为开发者平台,其界面设计更偏向功能导向,缺乏一些消费级产品的趣味性和引导性。
●功能:功能非常强大且全面,尤其是在GUI理解和长视频分析方面展现了前沿水平。OCR能力出色,能识别手写体和模糊扫描件。但“思考模式”的开启方式不够显眼,初次使用者可能不知道有此功能。
●准确度:在常见任务如物体识别、文本提取、基础问答上准确度极高,接近甚至部分超越人工水平。但在涉及复杂逻辑链推断或多步骤因果分析时,仍有提升空间。
●用户体验:整体体验良好,响应速度快(尤其在快速模式下)。主要问题是免费Token消耗较快,对于需要大量测试的用户,可能会很快触及限额,影响深度体验。

1.2.1.3改进意见

1.希望能在Web界面上更明确地标识“思考模式”的开关,并提供不同模式下的预期响应时间。
2.增加更多针对普通用户的引导性示例和模板,降低非技术用户的使用门槛。
3.提供更详细的Token消耗明细和用量预警。

1.2.1.4采访

采访对象的背景:我们的采访对象为软件工程专业大三学生。选择他是因为他正在参与一个校园二手交易平台界面原型设计的课程作业,需要频繁使用多模态大模型来解析网页界面,这与GLM-4.5V的核心功能高度契合。他的核心需求是将UI图形中的信息通过大模型直接描述,完成该作业。
采访对象实际使用的产品栏目: 李明主要使用了GLM-4.5V的图片分析功能。他上传了多个的校园手交易平台界面的网站截图,要求模型分析页面结构、识别关键按钮(如“加入购物车”、“立即购买”)并尝试生成相应的原型设计分析。
遇到的问题和亮点:
亮点:采访人对模型的UI元素识别能力感到惊喜。模型不仅能准确识别出按钮、输入框等标准组件,还能理解一些自定义图标的含义(如一个购物袋图标代表购物车)。
问题:他遇到了两个主要困难。首先,对于包含复杂交互逻辑(如多级下拉菜单、动态加载内容)的页面,模型有时会遗漏关键的交互步骤。其次,他在初次使用时,不知道需要在提示词中明确写出“请以深度推理模式分析此UI”,导致前几次尝试的结果不够理想,让他一度认为模型能力不足。
用户体验角度的改进建议: 采访人认为,开发团队可能过于关注模型底层能力的强大,而忽略了初级用户在“如何有效提问”上的天然障碍。他建议:
1.提供场景化模板:在UI分析功能旁,直接提供几个预设的、高质量的提示词模板,例如“分析此截图中的所有可点击元素及其功能”。
2.智能提示引导:当用户上传一张UI截图但输入的提示词过于简单(如“这是什么?”)时,系统可以弹出一个友好提示:“检测到您上传了UI截图,是否需要尝试以下专业分析功能?”,并列出几个选项。
3.可视化反馈:在返回分析结果时,如果可能,可以在原图上用高亮或标注的方式,直观地展示模型识别出的关键元素,这样用户能立刻验证模型的理解是否正确。

img

img

img

img

1.2.2自动化测试

img

img

img

img

img

img

img

img

img

img

img

img

img

img

1.2.3结论

根据自动化测试数据,可以总结如下:
调用稳定性高:在8次API调用中,成功率为100%(8/8),表明其服务在本次测试中非常稳定可靠。
响应速度快:平均响应时间仅为0.82秒,说明模型推理和API服务的效率很高,能为用户提供流畅的交互体验。
性能表现优异:无论是成功率还是响应速度,智谱ChatGLM在本次测试中都展现出了优秀的综合性能。
然而,在用户体验层面,模型的强大能力与普通用户的使用门槛之间存在一定的鸿沟。如用户访谈所示,初级用户可能因不了解“深度推理模式”或无法撰写高质量的提示词,而无法充分发挥模型的潜力,甚至产生负面的第一印象。这表明,模型的“黑箱”特性在易用性上构成了挑战。
因此,GLM-4.5V的核心优势在于其顶尖的底层技术能力,但其主要短板在于面向非专业用户的交互设计和引导机制。未来,若能将强大的自动化测试所验证的技术实力,通过更智能的用户界面(如场景化模板、智能提示和可视化反馈)转化为更平滑的用户体验,该模型的实用价值和市场竞争力将得到质的飞跃。

第二部分 分析

2.1同类产品对比排名

大模型AI具有强大的性能和广泛的应用前景,但也存在一些不容忽视的局限性。以下是对其优势和劣势的详细评价:

优势
强大的学习与处理能力
·大规模数据处理:能够处理海量数据,在复杂数据集中精准找出模式和关联,且常部署于GPU集群、TPU等并行计算硬件及分布式计算框架上,可处理PB级数据。
·深度特征提取:借助深度学习与神经网络,尤其是深度神经网络,能自动从原始数据中提取有用特征,无需人工过多干预,可学习到数据中的复杂关系,进行准确的预测和决策。
·优秀的泛化能力:通过在大规模数据集上训练,大模型具备强大的泛化能力,能在未见过的数据上有良好表现,可应用于多种任务和场景。
灵活的应用与开发特性
·迁移学习高效:利用预训练模型在新任务上快速适应,减少新任务所需的数据量,加速学习过程,降低开发成本和时间。
·可扩展性与定制性强:大模型通常架构灵活,参数可定制,通过微调等技术能快速适应新任务和数据集,企业可基于此搭建定制化智能体。
·自动化程度高:自动化和智能化程度较高,能自动提取和处理数据中的有用信息,并做出智能决策,提高工作效率和准确性,降低人为干预和错误的可能性。
推动技术创新与发展
大模型的发展推动了人工智能技术的不断创新,为研究人员提供了新的思路和方法,促进了相关领域的交叉融合和协同发展,如自然语言处理与计算机视觉的结合等。

劣势
资源需求与成本高昂
·数据需求大:为获得准确结果,需要大量高质量、多样化的训练数据,数据获取和处理成本高,且若数据存在偏差或不足,会影响模型性能。
·计算成本高:训练和运行大模型需要大量高性能的GPU、TPU等硬件设备以及大量存储空间,能耗巨大,训练一个大模型的能耗可能相当于几百个家庭一年的电量。
性能与可靠性问题
·知识准确性与时效性不足:大模型基于训练数据进行概率预测,并非真正理解知识,容易出现“幻觉”现象,编造错误信息,且由于训练数据的时间局限性,对最新知识更新不及时。
·推理速度慢:推理时间较长,实时响应体验不如轻量模型,在高并发业务中容易卡顿或成本飙升。
可解释性与安全性差
·可解释性差:内部机制复杂,参数众多,决策过程难以被人类理解和解释,限制了在一些需要高透明度和可信度场景下的应用,如合规审计等。
·隐私和安全风险高:训练和应用过程中涉及大量敏感数据和个人隐私信息,若数据保护不当,易引发隐私泄露和安全风险,且可能成为黑客攻击目标。
技术门槛与维护难题
大模型的研发和应用需要专业的技术知识和经验积累,对于一般企业和个人而言,技术门槛较高,难以直接参与和应用。同时,模型维护与更新难度大,一旦过时,更新成本也较高。

2.2软件工程方面的建议

2.2.1 模型研发与迭代:强化工程化管理

(1)训练流程标准化与自动化
建立统一的训练流水线,涵盖数据清洗、预处理、tokenization、分布式训练调度等环节,通过工具链实现自动化,减少人工干预,提升可重复性。针对Qwen3和智普AI的模型特性,定制化训练监控指标,实时预警异常数据或训练漂移。
(2)版本控制与实验追踪
对模型权重、训练配置、数据集版本进行严格的版本管理,确保每次迭代可追溯,支持 “回滚” 到历史最优版本。引入实验管理平台,记录不同模型版本的性能对比,为迭代决策提供数据支撑。

2.2.2 安全与合规:筑牢工程防线

(1)安全防护体系
对抗性攻击防护:通过对抗样本训练、输入过滤增强模型鲁棒性,避免模型被诱导生成有害内容。隐私保护:采用联邦学习、差分隐私技术处理敏感训练数据;推理阶段对用户输入/输出进行脱敏,符合 GDPR、国内《生成式 AI 服务管理暂行办法》等法规。
(2)可解释性与审计追踪
对模型决策过程进行工程化记录,支持事后审计。针对垂直领域,输出模型置信度评分,明确适用边界,避免过度依赖模型导致风险。

2.3市场概况

2.3.1 Qwen3市场概况

市场份额增长迅速:据行业数据显示,在2025年Q1至Q2期间,Qwen3系列市场占比从0%迅速攀升至56%,而此前占据主导地位的DeepSeek系列则从99%下滑至44%。
下载量和衍生模型数量众多:Qwen系列模型的累计下载量已超4亿次,衍生模型超14万,位居全球排名第一。
性能优势明显:Qwen3-235B-A22B在代码生成、数学推理等权威榜单上超越DeepSeek-R1等竞品,成为首个在多维度测试中跻身全球前三的开源模型,在MMLU、HumanEval、GSM8K三大基准测试中,与GPT-4、Claude4等闭源模型的差距已缩小至5%以内。
成本优势突出:Qwen3-Coder的平均价格只是Claude4的1/3,Qwen3的6bit量化版本可在消费级GPU上流畅运行,硬件成本降低70%以上。
应用场景广泛:其原生支持119种语言,Agent能力通过MCP协议与外部工具无缝集成,已实现代码解释器、数据库查询等10类工具的自动调用,可应用于智能客服、专业助手、内部研发等多个场景。

2.3.2 智普AI市场概况

融资情况良好:智谱AI成立不到6年完成17轮融资,2025年3月更是连融3轮,总计拿下18亿元,背后资方清一色是地方国资,估值突破200亿元。
用户数量众多:截至2024年12月,智谱AI的产品拥有2500万用户,其MaaS开放平台BigModel已经吸引了70万企业和开发者用户。
产品丰富:智谱AI打造出了包括AI提效助手智谱AI清言、高效率代码模型CodeGeeX、多模态理解模型CogVLM、文生图模型CogView、端到端模型GLM-ReaItime等一系列产品。
商业合作广泛:智谱AI已经中标32个政府大模型项目,深度参与北京、杭州、珠海等地AI基建,还与联想、飞书、泛微、北森、蒙牛等伙伴,共同发布智谱AI大模型生态合作伙伴联盟,推动大模型的产业落地。

2.4产品规划

维度内容
N(Need,需求)报错解读困难:面对编译器 / 解释器抛出的英文报错(如 Python 的AttributeError、Java 的NullPointerException),常因缺乏经验难以快速定位原因(是语法错误、逻辑漏洞还是环境问题?);纠错路径模糊:即使理解报错类型,也可能不知道具体修复步骤(比如 “索引越界” 是循环条件错误还是数组初始化问题?);知识点碎片化:解决报错后,难以系统关联背后的核心知识(如修复 “并发死锁” 后,不清楚锁机制的底层原理和避免原则),导致重复踩坑
A(Approach,方法)多维度报错解析:支持直接粘贴报错日志 + 代码片段(或关联 IDE 实时捕获报错),自动识别报错类型(语法 / 运行时 / 逻辑错误)、触发场景(编译阶段 / 运行阶段 / 特定输入下);用 “新手友好语言” 翻译技术术语(如将 “TypeError: unsupported operand type(s) for +: 'int' and 'str'” 解读为 “你试图把数字和文字直接相加,但 Python 不允许这种操作”),并标注错误在代码中的精确位置(行数、变量名)。阶梯式纠错方案:基础方案:直接给出可运行的修复代码(标注修改点和原因,如 “将第 5 行的str(num)改为int(num),因为后续计算需要数字类型”);进阶方案:提供 2-3 种不同修复思路(如 “除了类型转换,也可以用 f-string 拼接:print(f"结果是{num}")”),并分析各方案的适用场景;环境排查:若报错与环境相关(如依赖缺失、版本不兼容),自动生成操作指令(如 “执行pip install requests==2.25.1安装适配版本”)。报错关联知识图谱:针对当前报错,自动提炼核心知识点(如修复 “索引越界” 后,总结 “列表 / 数组的索引规则、循环边界条件设计、len()函数的正确使用”);以 “问题卡片” 形式呈现:包含知识点定义、常见错误案例、底层原理(如 “为什么 Python 列表索引从 0 开始?”)、扩展练习链接(如 LeetCode 相关题目);
B(Benefit,好处)效率提升:将 “查报错→搜解决方案→试错” 的平均耗时从 30 分钟 + 缩短至 5 分钟内,避免新手在低价值问题上浪费时间;精准性:相比通用 AI 的 “泛化建议”,聚焦报错场景,修复方案更具体(关联代码上下文),减少 “试错式修改”;知识沉淀:从 “解决单个问题” 升级为 “掌握一类问题的原理”,帮助新手建立结构化知识体系,减少重复犯错;易用性:支持多种输入方式(粘贴代码 / 报错日志、IDE 插件实时调用),无需复杂操作,符合新手使用习惯。
C(Competition,竞争)与 IDE 自带提示对比:IDE 仅能识别语法错误,无法解释逻辑错误原因,更无知识总结(如 VS Code 的 Python 插件能标红语法错,但不会讲 “为什么缩进错误会导致IndentationError”);与 GitHub Copilot 等代码生成工具对比:这类工具侧重 “写代码”,而非 “修代码”,对报错的解读停留在表面,缺乏阶梯式方案和知识关联;与通用大模型(如 ChatGPT)对比:通用模型常 “答非所问”(因缺乏代码上下文理解),而本系统通过 “报错 + 代码片段” 双输入,聚焦性更强,且知识总结更结构化(非零散文本)。
D(Delivery,交付)IDE 插件优先:开发 VS Code、PyCharm 插件,直接集成到开发环境,实时捕获报错并弹出诊疗窗口,无需切换工具;轻量化 Web 端:支持代码和报错日志粘贴,适合未安装插件的场景(如在线编程平台练习时);错题本同步:插件与 Web 端数据互通,自动同步收藏的知识点,支持按 “最近报错”“高频错误” 排序,方便复习;免费 + 增值模式:基础报错解析和修复免费,高级知识图谱(如底层原理视频讲解、扩展练习详解)可订阅,降低新手入门门槛。

2.5团队绩效

学号工作内容贡献度
102300416撰写博客产品规划11.1%
102300417撰写博客同类产品对比排名11.1%
102300418撰写博客软件工程方面的建议11.1%
102300419博客整合11.1%
102300420参与ppt制作11.1%
102300421撰写博客智普介绍11.1%
102300422参与ppt制作11.1%
102300423参与ppt制作11.1%
102300429撰写博客大模型1(Qwen3)11.1%
...全文
284 回复 打赏 收藏 举报
写回复
用AI写文章
回复
切换为时间正序
请发表友善的回复…
发表回复

103

社区成员

发帖
与我相关
我的任务
社区描述
2501_CS_SE_FZU
软件工程 高校
社区管理员
  • FZU_SE_LQF
  • 木村修
  • 心态773
加入社区
  • 近7日
  • 近30日
  • 至今
社区公告
暂无公告

试试用AI创作助手写篇文章吧