据VentureBeat报道(当地时间8月27日),Cohere发布了文档解析模型Parse 5。
Parse 5是一款23亿参数的视觉语言模型,可将PDF、幻灯片和图片转换为结构化Markdown。Cohere表示,这款模型并未一味追求最高准确率,而是更强调成本与性能之间的平衡。
在Cohere自建基准测试ParseBench中,Parse 5在“表格”“内容保真度”“语义格式”三项指标上的平均得分为79.2分,低于GPT-5.5的84.4分、Opus 4.8的84.3分以及Gemini 3.5 Flash的81.8分,但高于LlamaParse、Mistral OCR 4、Databricks AI Parse和Azure Document Intelligence。
价格方面,Parse 5的API定价为每千页1.50美元。Cohere同时提供单租户平台Model Vault,面向有大规模文档处理需求的企业客户。
在技术实现上,Parse 5以页面图像为输入,通过一次视觉语言模型调用即可完成解析并返回结果,将原本分开的OCR和模型推理流程合并为一轮处理。
Cohere AI搜索业务副总裁Nils Reimers表示,文档解析的难点在于同时保留结构和语义。“多数工具都会丢失结构,即便是最先进的模型,在版式复杂的页面上也会出错。”
他还表示,在一项模拟金融服务工作流的测试中,若按每年处理7.5亿份文档计算,与GPT-5.5相比,使用Parse 5可将成本压降逾98%。
记者信息