CC-OCR基准全面评估大型多模态模型识字能力的黄金标准 【免费下载链接】AdvancedLiterateMachineryA collection of original, innovative ideas and algorithms towards Advanced Literate Machinery. This project is maintained by the OCR Team in the Language Technology Lab, Tongyi Lab, Alibaba Group.项目地址: https://gitcode.com/gh_mirrors/ad/AdvancedLiterateMachinery在人工智能快速发展的今天大型多模态模型LMMs的识字能力评估成为了一个关键挑战。CC-OCR基准正是为解决这一问题而生的终极解决方案作为AdvancedLiterateMachinery项目的重要组成部分这个全面且具有挑战性的OCR基准测试为评估大型多模态模型的识字能力提供了黄金标准。为什么需要CC-OCR基准随着多模态AI技术的飞速发展模型需要处理越来越复杂的视觉文本识别任务。然而现有的评估标准往往过于简单无法全面反映模型在实际应用中的真实表现。CC-OCR基准应运而生它专门设计用于评估大型多模态模型的OCR中心化能力涵盖了多样化的场景、任务和挑战。CC-OCR基准展示了各大模型在四个核心赛道上的性能对比为开发者提供了清晰的评估参考CC-OCR基准的四大核心赛道 CC-OCR基准包含四个精心设计的OCR中心化赛道每个赛道都针对不同的应用场景1. 多场景文本阅读Multi-Scene Text Reading这个赛道评估模型在各种真实场景下的文本识别能力包括日常生活中的各种文本环境。2. 多语言文本阅读Multilingual Text Reading测试模型对不同语言文本的识别能力确保模型在全球范围内的适用性。3. 文档解析Document Parsing专门评估模型处理结构化文档的能力包括表格、公式等复杂元素的识别。4. 视觉信息提取Visual Information Extraction测试模型从图像中提取关键信息的能力如发票信息、名片内容等。CC-OCR基准的详细架构展示了39个子集和7,058张全标注图像的丰富数据集构成技术特色与创新亮点 ✨全面的数据集覆盖CC-OCR基准包含39个测试子集总计7,058张全标注图像其中41%的数据来自真实应用场景首次公开发布。这种丰富的多样性确保了评估结果的全面性和可靠性。精细化的视觉挑战基准特别关注细粒度的视觉挑战包括方向敏感性不同角度和方向的文本识别自然噪声真实环境中的干扰因素处理艺术字体各种艺术化字体的识别能力多样化的解码需求支持各种表达方式的解码包括结构化输入和输出满足不同应用场景的需求。快速上手指南 环境准备首先需要安装必要的依赖包可以通过以下命令完成cd Benchmarks/CC-OCR pip install -r requirements.txt数据集下载CC-OCR提供了完整的数据集包括图像和标注文件。具体下载方法请参考data/README.md文件中的详细说明。评估流程CC-OCR支持两种评估方式方式一使用VLMEvalKit推荐这是官方推荐的评估方式可以处理许多细节问题# 详细使用方法请参考官方文档 python evaluation/main.py index_path output_dir/model_name/方式二使用内置评估代码对于希望独立使用评估代码的用户可以参考evaluation/evaluator/common.py中的pick_response_text函数实现。示例评估脚本以下是一个完整的评估示例MODEL_NAMEqwen_vl_max OUTPUT_DIR/your/path/to/output_dir # 设置API密钥 export DASHBOARD_API_KEYyour_dashscope_api_key # 多场景OCR评估 SUB_OUTPUT_DIR${OUTPUT_DIR}/multi_scene_ocr python example.py ${MODEL_NAME} index/multi_scene_ocr.json ${SUB_OUTPUT_DIR} python evaluation/main.py index/multi_scene_ocr.json ${SUB_OUTPUT_DIR} # 多语言OCR评估 SUB_OUTPUT_DIR${OUTPUT_DIR}/multi_lan_ocr python example.py ${MODEL_NAME} index/multi_lan_ocr.json ${SUB_OUTPUT_DIR} python evaluation/main.py index/multi_lan_ocr.json ${SUB_OUTPUT_DIR}数据组织架构 CC-OCR基准采用清晰的数据组织结构CC-OCR/ ├── data/ # 数据文件 ├── evaluation/ # 评估代码 ├── index/ # 赛道索引文件 │ ├── doc_parsing.json │ ├── kie.json │ ├── multi_lan_ocr.json │ └── multi_scene_ocr.json └── requirements.txt # 项目依赖每个测试子集都遵循一致的组织结构。以data/kie/open_category/COLD_SIBR为例CC-OCR/data/kie/open_category/COLD_SIBR ├── images/ # 图像文件夹 ├── label.json # 标注文件 └── qa.jsonl # 测试用的QA信息模型性能排行榜 CC-OCR基准为各大主流模型提供了公平的性能对比平台。根据最新评估结果模型多场景文本阅读多语言文本阅读文档解析视觉信息提取总分Gemini-1.5-pro83.2578.9762.3767.2872.97Qwen-VL-72B77.9571.1453.7871.7668.66GPT-4o76.4073.4453.3063.4566.65Claude3.5-sonnet72.8765.6847.7964.5862.73评估时间2024年11月20日前后实际应用场景 文档数字化处理CC-OCR基准特别适合评估模型在文档数字化场景中的表现包括学术论文解析公式、表格、参考文献的准确识别商业文档处理合同、报告、发票的信息提取多语言文档跨语言文档的统一处理移动端OCR应用基准中的多场景测试集非常适合评估移动端OCR应用的性能包括手持设备拍摄不同角度、光照条件下的文本识别实时处理需求快速准确的文字提取能力资源受限环境在有限计算资源下的表现工业级应用验证对于需要高精度OCR的工业应用CC-OCR提供了严格的测试标准质量控制生产环境中的文本识别准确性自动化流程流水线中的文档处理效率合规性检查确保符合行业标准的识别精度技术文档与支持 CC-OCR提供了完整的技术文档支持数据集结构文档assets/doc/data_structure_en.md英文VLMEvalKit集成指南assets/doc/VLMEvalKit_en.md英文常见问题解答assets/doc/QA.mdCC-OCR基准的封面图展示了其在多模态模型评估中的重要地位未来发展方向 CC-OCR基准将持续更新和完善未来的发展方向包括更多语言支持计划增加更多小语种和方言的测试数据提升模型的全球化适应能力。更复杂的场景将引入更多真实世界的复杂场景如手写体识别、艺术字体处理等。实时性能评估增加对模型推理速度和资源消耗的评估指标为实际部署提供参考。结语 CC-OCR基准作为评估大型多模态模型识字能力的黄金标准为AI研究者和开发者提供了一个全面、公正、实用的评估平台。无论你是学术研究者还是工业应用开发者CC-OCR都能帮助你准确评估模型的真实能力推动OCR技术的发展。通过参与CC-OCR基准测试你不仅可以了解自己模型的性能水平还能为整个AI社区的发展做出贡献。立即开始使用CC-OCR让你的模型在真实的挑战中证明自己的价值小贴士建议在使用CC-OCR基准前详细阅读官方文档和示例代码确保正确理解评估流程和标准。同时关注项目的更新动态及时获取最新的测试集和评估方法。【免费下载链接】AdvancedLiterateMachineryA collection of original, innovative ideas and algorithms towards Advanced Literate Machinery. This project is maintained by the OCR Team in the Language Technology Lab, Tongyi Lab, Alibaba Group.项目地址: https://gitcode.com/gh_mirrors/ad/AdvancedLiterateMachinery创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考