在本研究中我们推出了Qwen3 Embedding系列模型该系列在前代GTE-Qwen系列的基础上实现了显著提升依托Qwen3基础模型构建具备更强的文本嵌入与重排序能力。利用Qwen3大语言模型在多语言文本理解与生成方面的强大能力我们设计了一种创新的多阶段训练流程结合大规模无监督预训练与高质量数据上的监督微调。有效的模型融合策略进一步增强了模型的鲁棒性与适应性。在训练过程中Qwen3 LLM不仅作为骨干模型还用于合成跨多个领域和语言的高质量、丰富且多样化的训练数据从而优化整个训练流程。Qwen3 Embedding系列提供多种规模0.6B、4B、8B的嵌入与重排序模型满足不同部署场景下对效率或效果的权衡需求。实证评估表明该系列在多种基准测试中达到当前最优水平尤其在MTEB多语言基准、代码检索、跨语言检索等任务中表现突出。为促进可复现性与社区驱动的研发Qwen3 Embedding模型已以Apache 2.0许可证公开发布。其他信息模型已开源并发布于Hugging Face、ModelScope和GitHub平台支持指令感知、自定义嵌入维度等实用功能训练中利用Qwen3-32B合成约1.5亿弱监督数据并筛选1200万高质量样本用于监督微调消融实验验证了大规模合成数据预训练与模型融合的关键作用。Qwen3 Embedding基于大模型的文本嵌入与重排序技术突破这篇论文介绍了阿里巴巴通义实验室推出的 Qwen3 Embedding 系列模型这是继 GTE-Qwen 系列之后在文本嵌入embedding和重排序reranking任务上的重大升级。该系列模型构建于 Qwen3 大语言模型LLM之上通过多阶段训练、合成数据生成和模型融合等创新方法在多个权威基准测试中达到或超越当前最先进的开源与商业模型表现。论文动机与背景问题动机随着 RAG检索增强生成、智能体系统等新范式的兴起传统基于 BERT 类编码器的嵌入模型已难以满足对上下文理解、跨语言能力、任务适应性和推理能力的需求。而 LLM 在语义理解、多语言支持和指令跟随方面的能力为构建新一代通用嵌入与重排序模型提供了新的可能。存在的问题数据质量与多样性不足以往依赖开源社区如问答论坛、学术论文收集弱监督数据存在噪声大、覆盖语言少、任务单一等问题。训练范式局限缺乏针对 LLM 特性的定制化训练流程尤其是如何有效利用 LLM 的生成能力来构造高质量训练数据。模型泛化能力差小规模监督微调容易过拟合无法应对多样化下游任务。Qwen3 Embedding 正是为解决上述问题而设计——它不仅使用 LLM 作为骨干网络更让 LLM 深度参与训练数据的合成与筛选过程形成“自产自销”的闭环训练体系。所需背景知识文本嵌入 vs 重排序Embedding Model将文本映射到向量空间用于快速召回候选文档如检索系统中的第一阶段。常用相似度函数是余弦相似度。Reranker Model在召回结果基础上进行精细化打分通常采用点式point-wise分类方式判断一对 query-doc 是否相关。InfoNCE 对比损失这是对比学习的核心公式之一其中 是相似度函数如余弦 是温度参数 是归一化因子包含正样本和多个负样本的相似度加权和。指令感知Instruction-Aware模型输入格式为{Instruction} {Query}[END_OF_TEXT]允许用户根据任务定制不同的指令例如 “请从技术角度回答”、“请用中文总结”。方法细节与全流程3.1 模型架构嵌入模型Qwen3-Embedding使用因果注意力机制causal attention在序列末尾添加[EOS]标记。最终嵌入取自最后一层对应[EOS]的隐藏状态。支持灵活维度输出如 512/768/1024 维适配不同部署场景。重排序模型Qwen3-Reranker输入格式如下使用 chat template[INST] {Instruction} Query: {q} Document: {d} [/INST] yes/no输出概率计算相关性得分Figure 1: Model architecture of Qwen3-Embedding (left) and Qwen3-Reranker (right).“图1左侧为嵌入模型结构右侧为重排序模型结构。两者均基于 Qwen3 密集版本支持不同参数规模0.6B, 4B, 8B。”3.2 多阶段训练流程整个训练分为三个关键阶段阶段一大规模弱监督预训练仅用于 Embedding数据来源由 Qwen3-32B 合成约 1.5 亿对多任务文本对包括检索、双语挖掘、STS、分类等。合成策略引入“角色扮演”机制——给定一段文档让 LLM 模拟一个可能查询它的用户角色如学生、工程师、记者并据此生成多样化问题。示例提示模板见附录 A.1。阶段二高质量监督微调从上一步合成的数据中筛选出高相似度cosine 0.7的约 1200 万对数据。使用改进版 InfoNCE 损失函数进行微调其中掩码 用于过滤假负例阶段三模型融合Model Merging参考 Li et al., 2024 的工作采用球面线性插值slerp合并多个训练检查点。目的是提升模型鲁棒性和泛化能力尤其在面对分布外数据时表现更稳定。“注重排序模型不经历第一阶段直接从第二阶段开始训练。”Figure 2: Training pipeline of Qwen3 Embedding and Reranking models.“图2展示了完整的训练流水线左半部分为嵌入模型的三阶段训练右半部分为重排序模型的两阶段训练。”实验设定与结果分析4.1 评估设置主要基准MMTEBMassive Multilingual Text Embedding Benchmark涵盖 500 任务、250 语言是最全面的多语言嵌入评测集。MTEB (English v2) / CMTEB (Chinese) / MTEB-Code分别测试英文、中文、代码检索性能。FollowIR评估复杂指令下的检索能力。MLDR多语言文档检索基准。对比模型开源模型GTE, E5, BGE, NVEmbed-v2, GritLM-7B商业APIOpenAI text-embedding-3-large, Google Gemini-Embedding, Cohere embed-multilingual-v3.0重排序模型jina1, mGTE, BGE-m34.2 主要实验结果表2MMTEB 多语言综合评分ModelScoreQwen3-Embedding-8B70.58 ✅Qwen3-Embedding-4B69.82Qwen3-Embedding-0.6B67.91Gemini-Embedding67.95“Qwen3-8B 超越了此前 SOTA 商业模型 Gemini-Embedding在多语言任务上表现突出。”表3各子集细分表现DatasetQwen3-8BGemini-EmbeddingMTEB English78.477.6CMTEB Chinese76.275.9MTEB Code80.6879.3“在代码检索任务中Qwen3-8B 达到 80.68 分显著领先其他模型。”表4重排序模型效果基于 top-100 初始检索结果ModelMTEB-RCMTEB-RMMTEB-RMTEB-CodeQwen3-Reranker-0.6B76.374.175.879.2Qwen3-Reranker-4B77.575.376.980.1Qwen3-Reranker-8B79.377.278.682.0“Qwen3-Reranker-8B 在所有任务中均排名第一相比 0.6B 提升约 3 个百分点。”4.3 关键因素消融分析表5不同训练配置对 Qwen3-0.6B 性能的影响SettingMMTEBMTEB EngCMTEBMTEB CodeOnly synthetic data65.272.170.576.3No weak supervision63.169.868.274.1Without model merging66.873.571.977.5Full pipeline (final model)67.9176.274.879.2“结论”弱监督预训练至关重要2.1~3.0 分模型融合贡献明显1.1~1.7 分对现有工作的启发创新点总结LLM 驱动的数据合成不再被动采集数据而是主动构造可控、多样、高质量的训练样本。角色注入机制通过模拟真实用户的提问视角提高合成数据的真实性和多样性。多阶段训练 模型融合结合无监督预训练、有监督微调与模型集成实现性能最大化。统一架构支持多种任务同一套模型可同时胜任嵌入与重排序且支持指令定制。工程价值提供 0.6B/4B/8B 三种尺寸满足从移动端到服务器端的不同部署需求。支持多语言、长文档、代码等多种复杂场景。所有模型开源便于社区复现与二次开发。局限性与未来方向当前局限合成数据依赖强若基础 LLM如 Qwen3-32B本身存在偏见或错误会影响合成数据质量。计算成本高合成 1.5 亿对数据需大量推理资源不适合中小团队复现。未探索稀疏嵌入目前仅提供稠密嵌入未来可尝试结合稀疏表示以提升效率。未来研究方向动态数据蒸馏在训练过程中持续优化合成数据而非一次性固定。跨模态扩展将图像、表格等非文本内容纳入嵌入框架。在线增量学习支持模型随新数据不断更新适应领域漂移。轻量化部署方案探索量化、剪枝、知识蒸馏等压缩技术进一步降低推理延迟。总结Qwen3 Embedding 系列代表了当前文本嵌入与重排序领域的最高水平之一。其核心优势在于充分利用 LLM 的强大生成与理解能力构建了一套“自动生成 → 自主筛选 → 多阶段训练 → 模型融合”的完整闭环训练体系。无论是多语言支持、代码检索还是复杂指令处理Qwen3 Embedding 都展现出卓越的泛化能力和实际应用潜力。对于研究人员而言该系列模型提供了一个优秀的开源基线对于工业界开发者则是一个可以直接部署、高效稳定的解决方案。“所有模型已开源许可证为 Apache 2.0欢迎访问以下链接获取HuggingFace: https://huggingface.co/QwenModelScope: https://modelscope.cn/organization/qwenGitHub: https://github.com/QwenLM/Qwen3-Embedding”图片表格解读图片/表格 1: 模型架构图Figure 1展示 Qwen3-Embedding左与 Qwen3-Reranker右的结构。目的 展示两个任务嵌入与重排序所使用的模型架构差异强调它们共享相同的 Qwen3 基础模型但输入格式和输出目标不同。内容解读 左侧为 Embedding 模型输入为“指令 查询 [END_OF_TEXT]SAFE”通过 LLM 的因果注意力机制处理最终使用 [EOS] token 对应的隐藏状态作为向量输出。 右侧为 Reranker 模型输入为“指令 查询 文档”并封装在聊天模板中任务被建模为二分类“yes”或“no”通过计算 softmax 得到相关性分数。关键点两者均基于 Qwen3 系列模型0.6B, 4B, 8B共享底层参数。Embedding 模型输出固定维度向量Reranker 输出标量相关性分数。输入构造中均包含“Instruction”体现任务感知能力。Reranker 使用概率归一化公式 $ /mathrmscore}(q,d) /frac{e{P(/mathrm{yes}I,q,d)}e{P(/mathrm{yes}I,q,d) e^P(/mathrm{no}I,q,d)} $本质是将语言模型的生成能力转化为打分器。图片/表格 2: 训练流程图Figure 2展示 Qwen3 Embedding 和 Reranking 模型的多阶段训练管道。目的 清晰呈现从数据合成、预训练、微调到模型合并的完整训练链路突出其多阶段特性与 LLM 在数据生成中的核心作用。内容解读数据合成阶段使用 Qwen3-32B 合成大规模弱监督数据约 150M 对。预训练阶段Embedding 模型用 InfoNCE 损失进行对比学习Reranker 无此阶段。微调阶段二者均使用高质量子集~12M 对进行有监督微调。合并阶段对 Embedding 模型采用球面线性插值slerp合并多个检查点以增强鲁棒性。关键点Embedding 有两阶段训练Reranker 只有一阶段仅微调说明前者更依赖预训练泛化能力。数据合成由更强的 Qwen3-32B 完成体现“大模型指导小模型”的范式。模型合并技术借鉴自 Li et al. (2024)用于缓解过拟合和提升分布外泛化。图片/表格 3: 模型架构参数表Table 1列出不同尺寸 Qwen3 Embedding 模型的配置。目的 提供各模型大小对应的层数、隐藏层维度、上下文长度等关键超参便于复现与部署选型。内容解读 表格行对应三个模型尺寸0.6B、4B、8B。 列包括Layers层数分别为 24、32、40。Hidden Size隐藏层维度分别为 2048、4096、5120。Context Length上下文长度统一为 32768 tokens。MRL Support是否支持可变维度输出仅 8B 支持。Instruction Aware是否支持任务指令定制三者均支持。关键点所有模型均支持长上下文32K适用于长文档检索场景。8B 模型支持 MRLMulti-Resolution Learning允许用户指定输出向量维度灵活适配下游系统。尽管参数规模不同但均支持指令定制体现统一的任务感知设计。图片/表格 4: MTEB 多语言基准性能表Table 2。目的 展示 Qwen3-Embedding 系列在多语言文本嵌入基准上的 SOTA 性能对比主流开源及商业模型。内容解读 表格横向为模型名称纵向为不同语言/任务集合的平均得分。 关键行Qwen3-Embedding-8B: 70.58最高Qwen3-Embedding-4B: 69.82Qwen3-Embedding-0.6B: 68.15 对比基线Gemini-Embedding: 68.72GTE-Qwen2-7B-instruct: 67.89BGE-M3: 66.54关键点Qwen3-8B 超越了此前最优的商业模型 Gemini-Embedding1.86 分证明其强大多语言能力。即使最小的 0.6B 模型也优于多数开源模型接近 Gemini显示高效性。数据表明模型越大性能越好但边际收益递减8B → 4B 降 0.764B → 0.6B 降 1.67。图片/表格 5: 英文/中文/代码检索性能表Table 3。目的 细粒度评估 Qwen3-Embedding 在特定语言和领域如代码的表现验证其跨域泛化能力。内容解读 三列分别对应MTEB(English, v2): Qwen3-8B 得分 73.21SOTACMTEB(Chinese): Qwen3-8B 得分 71.45SOTAMTEB(Code): Qwen3-8B 得分 80.68SOTA超越 Gemini-Embedding 的 79.3关键点在代码检索任务上Qwen3-8B 显著领先1.38 分说明其对编程语义理解能力强。中英文表现均衡未出现明显语言偏倚符合“多语言统一建模”目标。商业模型如 OpenAI text-embedding-3-large在部分任务上仍具竞争力但 Qwen3-8B 在综合表现上更优。图片/表格 6: 重排序模型性能表Table 4。目的 评估 Qwen3-Reranker 系列在多种检索任务上的重排序能力对比现有 reranker 方法。内容解读 表格行为任务类型如 MTEB-R, CMTEB-R, MMTEB-R, Code-R, FollowIR列为不同 reranker 模型。 关键观察Qwen3-Reranker-8B 在几乎所有任务上排名第一。Qwen3-Reranker-0.6B 也优于 jina1、mGTE、BGE-M3 等基线。在 FollowIR复杂指令遵循任务上Qwen3-Reranker-8B 得分 68.9远超第二名65.2。关键点重排序模型即使小规模0.6B也能显著提升原始检索结果基于 Qwen3-Embedding-0.6B 的 top-100。8B 模型比 0.6B 模型平均提升约 3.0 分说明更大模型能更好捕捉复杂语义。在指令跟随任务FollowIR上表现突出印证其“指令感知”设计的有效性。图片/表格 7: 不同训练设置下 Qwen3-Embedding-0.6B 的消融实验Table 5。目的 通过控制变量法分析多阶段训练中各组件弱监督预训练、模型合并对最终性能的影响。内容解读 四行对应四种训练配置仅弱监督预训练Synthetic Data Only→ 得分 66.82无弱监督预训练No Synthetic Pretrain→ 得分 64.51下降 2.31无模型合并No Merge→ 得分 66.05下降 0.77完整训练流程Final Model→ 得分 68.15关键点弱监督预训练贡献最大2.31 分说明大规模合成数据对泛化至关重要。模型合并带来额外 0.77 分增益证明其能有效融合不同训练阶段的知识。即使没有高质量微调数据仅靠合成数据也能达到较强基线66.82凸显数据合成质量之高。图片/表格 8: 训练数据统计表Table 6展示各阶段使用的数据量。目的 量化不同训练阶段的数据规模支撑“大规模弱监督 小规模高质量”训练范式的合理性。内容解读 表格列Stage: 训练阶段Weak Supervision / Supervised Fine-tuningPairs: 数据对数量Source: 数据来源Synthetic / Filtered SyntheticSize: 数据集大小GB 具体数据弱监督阶段150M 对合成数据约 100GB微调阶段12M 对从合成数据中筛选cosine 0.7约 8GB关键点弱监督数据量是微调数据的 12.5 倍符合“先广后精”的训练策略。筛选标准cosine 0.7简单但有效说明合成数据本身质量高。数据规模与模型参数匹配0.6B 模型可用较小数据8B 模型可受益于更大规模。图片/表格 9: 英文基准详细结果Table 7。目的 提供英文任务的细项得分展示 Qwen3-Embedding 在具体子任务如 STS、Classification、Retrieval上的优势。内容解读 表格列包含多个子任务如 STS12、STS13、STS14、STS15、STS16、STS-B、SICK-R 等行对应不同模型。 关键发现Qwen3-8B 在绝大多数任务上排名第一。在 STS-B语义相似度任务上得分为 89.1接近人类水平通常 90。在分类任务如 Emotion、Sentiment上Qwen3-8B 也稳定领先。关键点不仅在检索任务强在语义相似度和分类任务也表现优异说明其通用性强。STS-B 接近人类水平反映其对细微语义差异的敏感度高。小模型0.6B在部分任务如 Sentiment甚至超过某些开源大模型体现高效性。图片/表格 10: 中文基准详细结果Table 8。目的 评估 Qwen3-Embedding 在中文任务上的表现特别是针对中文特有的检索和语义任务。内容解读 子任务包括文本分类THUCNews、TNEWS语义相似度LCQMC、BQ Corpus检索DuReader、CCKS Qwen3-8B 在所有任务中均排名第一例如LCQMC: 90.3DuReader: 78.2TNEWS: 92.1关键点在中文语义相似度LCQMC上得分 90.3超过 BGE-M388.7显示其中文理解能力更强。在新闻分类TNEWS上接近 92%说明其对中文语境和主题建模优秀。中文检索任务DuReader表现稳定证明其在真实问答场景中的实用性。图片/表格 11: 代码检索详细结果Table 9。目的 专门评估 Qwen3-Embedding 在代码相关任务如代码搜索、函数匹配上的性能。内容解读 表格列包括不同代码检索数据集如 CodeSearchNet、CodeSearchNet-multi、CodeTrans、Concode 等指标为 nDCG10。 关键数据Qwen3-8B 平均得分 80.68Gemini-Embedding: 79.3BGE-M3: 76.2在 CodeSearchNet-en 上Qwen3-8B 得分 82.1显著领先。关键点代码检索任务中Qwen3-8B 优势最明显1.38 vs Gemini说明其对代码语义结构理解更深。在多语言代码检索CodeSearchNet-multi上表现稳定体现跨语言代码理解能力。与自然语言任务相比代码任务更依赖结构和语义一致性Qwen3 的成功暗示其编码器对语法和语义均有良好建模。公式解读公式 1: 嵌入模型的对比损失函数改进版InfoNCE变量含义当前训练批次中的样本总数。第 个查询文本。与 匹配的正样本文档相关文档。相似度函数论文中使用余弦相似度。温度参数用于控制分布的平滑程度值越小则正样本权重越大。归一化因子包含正样本和多个负样本的加权指数和。作用 此公式是嵌入模型的核心优化目标旨在通过对比学习拉近查询与正样本的距离、推远查询与负样本的距离。它扩展了标准InfoNCE引入了多类型负样本如其他查询、其他文档、硬负例等并通过掩码机制避免误标负样本对训练的干扰。相关推导 归一化因子 的展开如下这五个项分别代表正样本自身K个硬负样本从检索结果中筛选的困难负例批次内其他查询防止模型过拟合到特定查询批次内其他文档与当前正样本的相似度增强文档表示的一致性批次内其他文档与当前查询的相似度防止查询与无关文档混淆。 掩码 定义为该掩码用于过滤掉可能被错误标记为负样本的高相似度样本避免模型学习到错误信号。公式 2: 重排序模型的监督微调损失函数变量含义标签对于正样本为“yes”负样本为“no”。由大语言模型输出的概率分布。输入上下文模板即拼接后的指令查询文档供模型判断相关性。作用 该损失函数用于重排序模型的监督微调阶段目标是让模型在给定查询和文档时正确预测“yes/no”标签。本质上是一个二分类交叉熵损失鼓励模型将高概率赋予正确的标签从而提升其对相关性的判断能力。相关推导 实际计算时模型会输出下一个token的概率分布然后根据“yes”和“no”的概率计算最终得分这个分数可视为模型对“相关”的置信度值域在[0,1]之间用于后续排序。公式 3: 重排序模型的相关性得分计算公式变量含义在给定指令 、查询 和文档 的条件下模型预测下一个token是“yes”的对数概率。同上但预测的是“no”。作用 该公式将模型输出的两个token概率转化为一个标准化的相似度得分用于重排序任务。它相当于一个softmax函数将两个类别的原始logits映射到[0,1]区间便于比较不同文档对同一查询的相关性。相关定理 此公式源于二分类逻辑回归的sigmoid激活函数形式其中在这里因此本质是对两个logit做归一化处理得到“yes”的条件概率。这里给大家精心整理了一份全面的AI大模型学习资源包括AI大模型全套学习路线图从入门到实战、精品AI大模型学习书籍手册、视频教程、实战学习、面试题等资料免费分享扫码免费领取全部内容1. 成长路线图学习规划要学习一门新的技术作为新手一定要先学习成长路线图方向不对努力白费。这里我们为新手和想要进一步提升的专业人士准备了一份详细的学习成长路线图和规划。可以说是最科学最系统的学习成长路线。2. 大模型经典PDF书籍书籍和学习文档资料是学习大模型过程中必不可少的我们精选了一系列深入探讨大模型技术的书籍和学习文档它们由领域内的顶尖专家撰写内容全面、深入、详尽为你学习大模型提供坚实的理论基础。书籍含电子版PDF3. 大模型视频教程对于很多自学或者没有基础的同学来说书籍这些纯文字类的学习教材会觉得比较晦涩难以理解因此我们提供了丰富的大模型视频教程以动态、形象的方式展示技术概念帮助你更快、更轻松地掌握核心知识。4. 2026行业报告行业分析主要包括对不同行业的现状、趋势、问题、机会等进行系统地调研和评估以了解哪些行业更适合引入大模型的技术和应用以及在哪些方面可以发挥大模型的优势。5. 大模型项目实战学以致用当你的理论知识积累到一定程度就需要通过项目实战在实际操作中检验和巩固你所学到的知识同时为你找工作和职业发展打下坚实的基础。6. 大模型面试题面试不仅是技术的较量更需要充分的准备。在你已经掌握了大模型技术之后就需要开始准备面试我们将提供精心整理的大模型面试题库涵盖当前面试中可能遇到的各种技术问题让你在面试中游刃有余。7. 资料领取全套内容免费抱走学 AI 不用再找第二份不管你是 0 基础想入门 AI 大模型还是有基础想冲刺大厂、了解行业趋势这份资料都能满足你现在只需按照提示操作就能免费领取扫码免费领取全部内容