v1

latestOpenAPI 3.0.1ZHIPU AI 开发者协议和政策2026-07-2649130210.9 KB
模型 API

文档解析

使用 GLM-OCR 模型解析文档和图片的布局并提取文本内容。支持图片和PDF文档的OCR识别,返回详细的布局信息和可视化结果。点击 Try it 按钮可快速试用。

post/paas/v4/layout_parsing

Request body

model'glm-ocr' required

模型编码:glm-ocr

filestring required

需要识别的图片或者pdf文档,支持urlbase64。支持图片格式:PDFJPGPNG。单图≤10MB,PDF≤50MB,最大支持100页

return_crop_imagesboolean

是否需要截图信息

need_layout_visualizationboolean

是否需要详细布局图片结果信息

start_page_idinteger

传入pdf时,开始解析的页码

end_page_idinteger

传入pdf时,结束解析的页码

request_idstring

请求唯一标识符。由用户端传递,ID长度要求:最少6个字符,最多64个字符,建议使用UUID格式确保唯一性,若未提供平台将自动生成。

user_idstring

终端用户ID,用于滥用监控。长度:6-128字符

Example request

{
  "model": "glm-ocr",
  "file": "https://cdn.bigmodel.cn/static/logo/introduction.png",
  "user_id": "user_123456"
}

Response

业务处理成功

idstring required

任务 ID

createdinteger required

请求创建时间,是以秒为单位的 Unix 时间戳

modelstring required

模型名称

md_resultsstring

Markdown 格式的识别结果

layout_visualizationstring[]

识别结果图片url

request_idstring

请求ID

Example response

{
  "id": "task_123456789",
  "created": 1727156815,
  "model": "GLM-OCR",
  "md_results": "# 文档标题\n这是文档内容...",
  "layout_details": [
    [
      {
        "index": 1,
        "label": "text",
        "bbox_2d": [
          0.1,
          0.1,
          0.5,
          0.3
        ],
        "content": "这是文本内容",
        "height": 800,
        "width": 600
      }
    ]
  ],
  "data_info": {
    "num_pages": 5,
    "pages": [
      {
        "width": 600,
        "height": 800
      }
    ]
  },
  "request_id": "req_123456789"
}