智谱开源GLM-OCR模型:仅0.9B参数,多项基准取得SOTA表现

来源: 凤凰网
利好

  凤凰网科技讯2月3日,智谱宣布正式发布并开源GLM-OCR。据介绍,该模型仅0.9B参数规模,支持vLLM、SGLang和Ollama部署,在公式识别、表格识别、信息抽取的多项主流基准中均取得SOTA表现。

  据官方信息,GLM-OCR针对手写体、复杂表格、代码文档、印章识别及多语言混排等场景进行了优化。在效率方面,其处理PDF文档的吞吐量可达1.86页/秒。通过API调用,其定价为0.2元/百万Tokens。

  该模型采用“编码器-解码器”架构,集成了自研的CogViT视觉编码器,并采用“版面分析→并行识别”的两阶段技术流程。模型完整SDK与推理工具链已同步开源,适用于高并发及边缘计算场景。

关注同花顺财经(ths518),获取更多机会

0

+1
  • 北信源
  • 兆易创新
  • 科森科技
  • 卓翼科技
  • 天融信
  • 吉视传媒
  • 御银股份
  • 中油资本
  • 代码|股票名称 最新 涨跌幅