社区
一般软件使用
帖子详情
unk未后缀的文件用什么软件能打开?``
harvey8343
2003-07-23 12:03:06
请各位高手发话
...全文
523
回复
打赏
收藏
unk未后缀的文件用什么软件能打开?``
请各位高手发话
复制链接
扫一扫
分享
转发到动态
举报
写回复
配置赞助广告
用AI写文章
回复
切换为时间正序
请发表友善的回复…
发表回复
打赏红包
记录一下使用GPT-2 tokenizer 的过程中一个disgusting的问题 (eos_token_id 是None,怎么手动设置eos_token_id)
eos_token_id 是None,怎么手动设置eos_token_id
大模型输入处理:从分词到向量的7步工业级Pipeline
大语言模型(LLM)的输入处理并非简单文本切分,而是决定模型理解能力的基础环节。其核心原理在于将原始文本通过清洗、编码归一、规范化、分词、词表映射、特殊token注入和向量化等步骤,转化为模型可计算的数字序列。这一过程直接关联tokenization(分词)与vocabulary(词表)两大关键技术点,深刻影响语义保真度、上下文窗口利用率及跨语言鲁棒性。在法律、医疗、金融等垂域应用中,不当的输入处理常导致关键实体识别失准、金额/剂量误判等高风险问题。本文聚焦工程落地,系统拆解从原始文本到张量封装的完整链路,
从零打造大语言模型--处理文本数据
本文介绍了构建大语言模型前处理文本数据的关键步骤。主要内容包括:1)词嵌入将离散 token 映射为连续向量;2)文本分词技术,包含正则表达式切分英文、jieba 处理中文以及混合分词方案;3)建立词表实现 token 与 ID 的双向映射;4)实现简单分词器并处理特殊 token;5)介绍 BPE 算法和 tiktoken 工具的应用;6)展示滑动窗口采样和数据加载器的实现。文章通过代码示例演示了从原始文本到模型可处理数据的完整流程,涵盖了英文、中文及混合文本的处理方法。
从文本到上下文:深入解析Tokenizer、Embedding及高级RAG架构的底层原理
摘要 本文系统性地阐述了自然语言处理(NLP)中从原始文本到语义理解的技术流程。首先,Tokenizer通过子词切分算法(BPE/WordPiece)将文本转换为数字序列,解决词汇表规模与OOV问题。其次,Embedding模型基于分布假说,将离散ID映射为稠密向量,其中BERT等动态嵌入模型通过上下文感知解决了一词多义问题。最后,池化操作将变长序列转换为固定维度向量,为下游的语义搜索和RAG系统提供统一表示。整个流程体现了NLP技术从词法分析到语义理解的演进,为构建高效信息检索系统奠定了理论基础。
LLM分词器原理与实战:BPE、SentencePiece、WordPiece详解
分词器(Tokenizer)是大语言模型理解自然语言的前置编译器,其本质是将文本映射为离散token ID序列的工程化翻译系统。它基于子词(subword)建模原理,在语义完整性、词表规模与泛化能力之间寻求平衡;技术价值体现在解决OOV问题、支撑多语言处理、保障RAG一致性等关键场景。主流方案如BPE通过频率驱动的贪心合并构建词表,SentencePiece则以字节级输入和Unigram概率建模实现端到端鲁棒切分。本文聚焦开发者真实调试痛点,解析Tokenizer加载失败、中文乱码、长文本截断异常等典型问题
一般软件使用
4,171
社区成员
38,468
社区内容
发帖
与我相关
我的任务
一般软件使用
Windows专区 一般软件使用
复制链接
扫一扫
分享
社区描述
Windows专区 一般软件使用
社区管理员
加入社区
获取链接或二维码
近7日
近30日
至今
加载中
查看更多榜单
社区公告
暂无公告
试试用AI创作助手写篇文章吧
+ 用AI写文章