
手把手教你调用Nemotron-3-Embed-1B-BF16-4bit API查询/文档嵌入生成完整教程【免费下载链接】Nemotron-3-Embed-1B-BF16-4bit项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/Nemotron-3-Embed-1B-BF16-4bitNemotron-3-Embed-1B-BF16-4bit是一款专为Apple Silicon优化的高效嵌入模型基于NVIDIA Nemotron-3-Embed-1B-BF16版本转换而来采用MLX框架实现4-bit量化在保持99.3%检索质量的同时将模型体积压缩至0.64GB特别适合资源受限设备上的文档检索和语义理解任务。 准备工作环境搭建与依赖安装1. 克隆项目仓库首先需要获取模型文件和实现代码通过以下命令克隆完整项目git clone https://gitcode.com/hf_mirrors/mlx-community/Nemotron-3-Embed-1B-BF16-4bit cd Nemotron-3-Embed-1B-BF16-4bit2. 安装核心依赖该模型需要MLX框架及相关NLP工具库支持执行以下命令安装所需依赖pip install mlx mlx-lm transformers numpy huggingface_hub⚠️ 注意MLX框架仅支持Apple Silicon设备M1/M2/M3/M4系列芯片请确保在兼容硬件上运行 快速开始首次调用API生成嵌入向量基础使用示例以下代码展示如何加载模型并生成查询与文档的嵌入向量import sys from huggingface_hub import snapshot_download # 下载模型文件本地已克隆可跳过此步直接使用本地路径 path snapshot_download(mlx-community/Nemotron-3-Embed-1B-BF16-4bit) sys.path.insert(0, path) # 导入模型加载和编码函数 from nemotron3_embed_mlx import load, encode # 加载模型和分词器 model, tokenizer load(path) # 生成查询嵌入自动添加query: 前缀 query_embedding encode( model, tokenizer, [What is the refund policy?], input_typequery ) # 生成文档嵌入自动添加passage: 前缀 doc_embedding encode( model, tokenizer, [Full refunds are available within 14 days of purchase.], input_typepassage ) # 计算余弦相似度嵌入向量已L2归一化点积即余弦值 similarity float(query_embedding[0] doc_embedding[0]) print(f查询与文档相似度: {similarity:.4f}) # 输出示例0.8923关键参数说明input_type指定文本类型自动添加前缀query或passage若已手动添加前缀可设为Nonebatch_size批量处理大小默认8根据设备内存调整M1 Pro建议8-16max_length文本最大长度默认4096模型支持最长32k但受内存限制建议不超过4096 高级应用批量处理与性能优化批量文档嵌入生成处理大量文档时建议使用批量编码提升效率# 准备文档列表 documents [ Returns are processed within 3 business days., Shipping costs are non-refundable for international orders., Digital products are eligible for refund within 7 days of purchase. ] # 批量生成文档嵌入 doc_embeddings encode( model, tokenizer, documents, input_typepassage, batch_size4 # 根据设备调整批次大小 ) print(f生成 {len(doc_embeddings)} 个文档嵌入维度: {doc_embeddings.shape[1]})性能对比与选择建议根据官方测试数据不同精度版本性能对比如下模型变体大小吞吐量(文档/秒)NDCG10保留率BF162.28GB2.71100.0%8-bit1.21GB1.66100.0%4-bit0.64GB1.6599.3%选择建议追求速度选择BF16版本Nemotron-3-Embed-1B-BF16节省内存选择4-bit版本本项目在8GB内存设备上可同时运行多个任务 实际应用场景构建简易检索系统结合嵌入向量实现基础文档检索功能import numpy as np def retrieve_similar_docs(query, docs, model, tokenizer, top_k3): # 生成查询和文档嵌入 q_emb encode(model, tokenizer, [query], input_typequery) d_emb encode(model, tokenizer, docs, input_typepassage) # 计算余弦相似度 similarities np.dot(q_emb, d_emb.T).flatten() # 返回Top K结果 top_indices similarities.argsort()[-top_k:][::-1] return [(docs[i], similarities[i]) for i in top_indices] # 使用示例 docs [ Return policy: 14 days for physical products, Refund process takes 3-5 business days, Digital items are non-refundable after download, Shipping fees are refunded only for defective items ] results retrieve_similar_docs(How long to get refund?, docs, model, tokenizer) for doc, score in results: print(f相似度: {score:.4f} | 文档: {doc})⚠️ 注意事项与限制输入前缀要求必须为查询添加query: 前缀为文档添加passage: 前缀可通过input_type参数自动添加最大长度限制默认max_length4096虽支持32k长度但双向注意力计算复杂度为O(L²)长文本会导致内存不足变体兼容性不同量化版本的嵌入向量不可混用构建检索系统时需统一模型版本性能特性在1.1B参数规模下4-bit量化虽节省内存但吞吐量略低于BF16版本约1.6x slower 相关文件与资源模型实现代码nemotron3_embed_mlx.py性能测试脚本compare_backends.pyMTEB基准测试benchmark_mteb.py许可证信息LICENSE通过本教程你已掌握Nemotron-3-Embed-1B-BF16-4bit模型的基本调用方法和实际应用技巧。该模型特别适合在Apple设备上构建轻量级语义检索系统、文档嵌入生成工具或作为RAG应用的基础组件在有限资源下提供高质量的语义理解能力。【免费下载链接】Nemotron-3-Embed-1B-BF16-4bit项目地址: https://ai.gitcode.com/hf_mirrors/mlx-community/Nemotron-3-Embed-1B-BF16-4bit创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考