3分钟上手NVIDIA-Nemotron-Parse-v1.1-TC完整安装与图像解析教程【免费下载链接】NVIDIA-Nemotron-Parse-v1.1-TC项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/NVIDIA-Nemotron-Parse-v1.1-TCNVIDIA-Nemotron-Parse-v1.1-TC是一款强大的图像文本解析工具能够快速识别文档中的文本、表格和数学公式等元素并提取结构化信息。本教程将帮助你在3分钟内完成安装并掌握基本使用方法让文档处理效率提升20% 为什么选择NVIDIA-Nemotron-Parse-v1.1-TC这款工具基于Transformer架构的视觉编码器-解码器模型相比传统OCR技术它具有以下优势支持复杂文档布局解析包括标题、段落、表格、图片等语义分类能提取LaTeX格式的数学公式和多行列复杂表格通过4倍视觉 token 压缩技术比上一代版本提速20%保留表格、标题、图片、脚注等元素的页面顺序 快速安装步骤1️⃣ 克隆项目仓库git clone https://gitcode.com/hf_mirrors/nvidia/NVIDIA-Nemotron-Parse-v1.1-TC cd NVIDIA-Nemotron-Parse-v1.1-TC2️⃣ 安装依赖项目依赖已整理在requirements.txt中包含PyTorch、Transformers等核心库pip install -r requirements.txt 图像解析实战教程基础使用示例以下是使用example.py进行图像解析的核心代码# 加载模型和处理器 model_path nvidia/NVIDIA-Nemotron-Parse-v1.1-TC device cuda:0 model AutoModel.from_pretrained( model_path, trust_remote_codeTrue, torch_dtypetorch.bfloat16 ).to(device).eval() tokenizer AutoTokenizer.from_pretrained(model_path) processor AutoProcessor.from_pretrained(model_path, trust_remote_codeTrue) # 加载图像并设置任务提示 image Image.open(path/to/your/image.jpg) task_prompt /sspredict_bboxpredict_classesoutput_markdown # 处理图像并生成结果 inputs processor(images[image], texttask_prompt, return_tensorspt).to(device) outputs model.generate(**inputs, generation_configgeneration_config) generated_text processor.batch_decode(outputs, skip_special_tokensTrue)[0]输出后处理解析结果可以通过postprocessing.py进行格式化# 提取类别、边界框和文本 classes, bboxes, texts extract_classes_bboxes(generated_text) bboxes [transform_bbox_to_original(bbox, image.width, image.height) for bbox in bboxes] # 指定输出格式 table_format latex # 可选: latex | HTML | markdown text_format markdown # 可选: markdown | plain texts [postprocess_text(text, clscls, table_formattable_format, text_formattext_format) for text, cls in zip(texts, classes)] 高级功能VLLM加速推理对于大规模解析任务推荐使用VLLM进行加速# 安装VLLM依赖 uv venv --python 3.12 --seed source .venv/bin/activate uv pip install githttps://github.com/amalad/vllm.gitnemotron_parse uv pip install timm albumentations 模型能力展示NVIDIA-Nemotron-Parse-v1.1-TC在布局理解、表格提取和公式识别方面表现出色布局理解能够精准识别文档中的各类元素及其空间位置表格提取支持复杂表格结构包括合并单元格等格式公式识别能将数学公式转换为LaTeX格式保留完整数学符号和结构⚠️ 注意事项推荐使用NVIDIA GPUHopper/Ampere/Turing架构以获得最佳性能输入图像分辨率建议在1024×1280至1664×2048之间默认提示词/sspredict_bboxpredict_classesoutput_markdown适用于大多数场景如需仅输出边界框和类别可使用提示词/sspredict_bboxpredict_classesoutput_no_text通过本教程你已经掌握了NVIDIA-Nemotron-Parse-v1.1-TC的基本安装和使用方法。这款工具将帮助你轻松处理各类文档从学术论文到业务报表让文本提取和结构化变得前所未有的简单【免费下载链接】NVIDIA-Nemotron-Parse-v1.1-TC项目地址: https://ai.gitcode.com/hf_mirrors/nvidia/NVIDIA-Nemotron-Parse-v1.1-TC创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考