开源模型

腾讯混元 HunyuanOCR-1.5 1.5

HunyuanOCR-系列 · 腾讯混元 · 2026-07发布

开源支持本地部署多模态国内可直连有免费额度长上下文

模型介绍

腾讯开源轻量端到端 OCR 模型(约 1B 参数),统一文档解析、文字识别、信息抽取、图文翻译,支持 4K 分辨率与 128K 上下文,DFlash 投机解码最高提速 6.37 倍。

模型基础信息

模型系列HunyuanOCR-系列
开发机构腾讯混元
发布时间2026-07
参数规模约 1B
上下文窗口128K
模型类型多模态(OCR 端到端)
中文能力优秀
使用方式网页体验 / API调用 / 本地部署

免费额度与收费政策

在线 Demo 开源权重

免费规则详情

腾讯混元官方在线 Demo 免费体验;权重开源可自部署。

收费标准简介

开源权重免费;算力自备。

模型能力介绍

✅ 核心优势

  • 端到端统一 OCR 任务
  • 约 1B 轻量,PC 可部署
  • 128K 上下文
  • DFlash 投机解码提速显著

⚠️ 短板与局限

  • 需 CUDA 13 环境
  • 文档细粒度仍需人工复核

🎯 适用场景

  • 密集文档/表格/公式解析
  • 古籍与低资源语种 OCR
  • 多图文档问答
  • PC 端离线部署

模型使用教程

本章节整理 腾讯混元 HunyuanOCR-1.5 的在线体验、API调用、本地部署全套入门教程,快速上手使用该模型。

  • 体验网址:腾讯混元官方 [在线 Demo](https://hunyuan.tencent.com/chat/HunyuanDefault?modelId=HY-OCR-1.0) 体验;开源权重见 [Hugging Face](https://huggingface.co/tencent/HunyuanOCR)。
  • 能力简介:腾讯开源轻量端到端 OCR 模型(约 1B 参数),统一文档解析、文字识别、信息抽取、图文翻译,支持 4K 分辨率与 128K 上下文。
  • 适用场景:密集文档/表格/公式解析、古籍与低资源语种 OCR、多图文档问答、PC 端离线部署。
  • 使用建议:DFlash 投机解码最高提速 6.37x(transformers)/ 2.14x(vLLM)。
  • 开发接入:vLLM / DFlash / llama.cpp 多种方式,OpenAI 兼容接口。
  1. 从 [Hugging Face](https://huggingface.co/tencent/HunyuanOCR) 下载权重(含 base + dflash 草稿模型):
huggingface-cli download tencent/HunyuanOCR --local-dir ./HunyuanOCR --exclude "v1.0/*"
  1. 统一推理环境基于 uv,要求 CUDA 13。
  2. 许可为 Tencent Hunyuan Community License。

启动服务

uv sync --all-extras
uv run vllm serve tencent/HunyuanOCR --served-model-name hunyuan-ocr \
  -tp 1 --max-model-len 131072

curl 调用

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"hunyuan-ocr","temperature":0.0,"top_p":1.0,"messages":[{"role":"user","content":[{"type":"image_url","image_url":{"url":"https://example.com/doc.png"}}]}]}'

> 提示:推荐 sampling 为 temperature=0.0、top_p=1.0、repetition_penalty=1.08。

  • 部署方式:支持 vLLM(AR / DFlash)、原生 transformers、llama.cpp(PC/CPU)。
  • 硬件要求:1B 参数轻量模型,消费级 GPU 可运行;llama.cpp GGUF 版支持 CPU 与笔记本。
  • DFlash 启动:设置 DFLASH_PATH 指向 dflash 草稿模型目录后运行 serve_DFlash.sh
  • 参考:GitHub(Tencent-Hunyuan/HunyuanOCR)提供推理、训练(GRPO RL)与 benchmark 文档。

💡 使用小技巧

推荐 temperature=0.0、top_p=1.0、repetition_penalty=1.08;llama.cpp GGUF 版支持 CPU 与笔记本。

❓ 常见问题 FAQ

Q1:支持离线吗?

A1:支持,llama.cpp GGUF 版可 CPU/笔记本离线运行。

Q2:如何提速?

A2:DFlash 投机解码最高提速 6.37x(transformers)。

访问备注与注意事项