平台功能

完整的文档处理流程, 尽在同一个平台。

从扫描到发布:Captika 从任意来源捕获,用 OCR 与 AI 提取并验证数据,识别文档类型,并将结果发布到你需要的地方。具备规则、.NET 脚本以及端到端的可追溯性。

01
📥
捕获
扫描仪、邮件、文件夹、FTP、SharePoint、Thuban
02
🏷️
元数据
按批次、文档和页面分级的字段,带验证
03
🔍
OCR 与 AI
Tesseract、Textract、Google Vision 与 OpenAI
04
🧠
识别
动态模板与提取规则
05
🚀
发布
SQL、SharePoint、S3、Thuban、FTP 与 FileSystem
01 · 捕获

从任意来源捕获

将 Captika 接入你已在使用的渠道,无需改变工作方式即可自动化文档录入。同一个流程,多个入口。

  • TWAIN 物理扫描仪,支持实时扫描和图像质量控制。
  • Office 365 邮件:直接处理云端企业邮箱中的附件。
  • 本地或网络 File System,支持文件夹与子文件夹、占用文件控制和自动重命名。
  • FTP / SFTP 服务器,非常适合自动化分布式环境。
  • 通过 ViewXML 搜索接入 SharePoint,并从工作托盘、查询和存储过程接入 Thuban

捕获来源

Escáner TWAIN Office 365 文件夹 / HotFolders FTP / SFTP SharePoint Thuban

为每个捕获作业配置一个或多个来源,并让它们自动运行。

脚本引擎

.NET 10 C# VB.NET WebServices / APIs

自定义流程中的每个事件,并连接到任意外部系统。集成可能性几乎无限。

02 · 元数据与验证

从源头保证数据正确

以完全灵活的方式定义元数据,并在发布前用你的系统验证信息。更少错误,更少返工。

  • 三级字段:按批次、按文档和按页面。
  • 智能下拉列表,可从数据库(动态 SQL)、Thuban 或 SharePoint 列表自动生成。
  • 自动验证与数据丰富,通过 SQL 查询、与 Thuban 的重新验证或定制脚本实现。
  • .NET 10 脚本引擎(C# / VB.NET),用于规则以及对 WebServices 或 API 的实时调用。
03 · OCR 与人工智能

顶级 OCR 与 AI

用市场上最强大的 OCR 引擎从任意文档中提取关键信息,并按文档类型选择最合适的引擎。

🔤

Tesseract 5x(本地)

本地 OCR,对每个词和每一行进行空间化捕获,避免重复读取并支持屏幕上的可视化验证。

☁️

Amazon Textract

云端 OCR,可识别印刷体和手写文本,并读取图像中的表格、表单、签名、人脸和标签。

👁️

Google Vision AI

通过 API 原生集成的识别能力,为你的流程再加入一款市场领先引擎。

🤖

OpenAI / Bedrock

对提取的文本执行智能提示(prompt),以提升数据提取与识别效果。

📄

带文本层的 PDF

借助 PDFBox 与 PDFIUM:拆分页面、检测签名,并利用原始文本层提升速度与质量。

条形码

读取 1D、2D 与 PatchCodes:CODE128、CODE39、DATAMATRIX、PDF417、EAN13、QR 等,实现自动分隔与分类。

04 · 智能识别

适用于任意文档的动态模板

Captika 既能识别结构化文档(发票、税务表单、本票),也能识别非结构化文档(会议记录、资产负债表、信函、合同),并为每个字段设置提取规则。

  • 通过条形码、提取的字段、页面顺序、大小、重量或形状(image fingerprint)识别文档。
  • 文本相似度:上传一张示例图片并设置最低相似度,即可识别未来的文档。
  • 按文档区块划分的词袋,可显著加快模板的搭建速度。
  • NLP 清洗规则:日期、邮箱、大写数字、税号(CUIT / CUIL / RUT)、数据掩码等。

应用型 AI(Amazon + OpenAI)

Comprehend — 实体、关键短语与情感
Comprehend Classification — 基于学习(ML)分类
Rekognition — 识别图像中的对象
OpenAI — 针对提取文本的提示

结合这些工具,你的捕获流程会随时间不断学习和改进。

05 · 发布

并行发布到多个目标

生成多页 PDF 或 TIF(在捕获时即创建文本层),并将文档与元数据同时发布到多个系统,每个系统都有独立配置。

📁

FileSystem

根据识别到的字段生成动态文件夹结构,文件名可配置,并支持可参数化的文本文件。

🗃️

SQL 数据库

发布所有捕获的数据,供分析、管理或后台系统使用。

🔒

FTP / SFTP

安全传输文档与数据,文件名和导出元数据完全可配置。

🌐

Thuban 门户

直接索引:上传新文档或更新已有记录。

🧩

Microsoft SharePoint

将 Captika 字段与你 SharePoint 列表中配置的元数据进行原生映射。

☁️

Amazon S3

在云端发布,选择目标 S3 存储桶和文件名。

两种模式,一套方案

Captika Desktop 与 Captika Service

人工辅助捕获与无人值守自动化。可分别使用,也可组合成混合方案。

🖥️ Captika Desktop

辅助捕获

面向以可视化方式验证文档的操作员:数字化中心、行政部门和分支机构。

  • TWAIN 扫描仪实时扫描。
  • 图像的可视化验证及 OCR 数据的人工校正。
  • 质量控制:空白页、旋转和分辨率。
  • 按文档或页面设置字段,多用户、带配置文件和可追溯性。
⚙️ Captika Service

7×24 自动化

Windows 服务,可 100% 自动处理大批量文档,无需人工干预。

  • 多线程并行处理多个作业。
  • 从文件夹、Thuban 和 Microsoft 365 邮件自动捕获。
  • 任务计划:定义执行内容与时间。
  • 错误处理、重试及完整日志,便于审计。
功能DesktopService
内置 OCR(Tesseract)
通过 API 的 OCR/ICR(Google Vision、Amazon Textract)
C# / .NET 10 脚本引擎
外部验证(DB / API)
详细审计日志
用户配置文件与角色
模板自动更新
可视化审核界面
横向扩展(多实例)
7×24 无人值守运行

云端引擎(Google Vision、Amazon Textract、OpenAI / Bedrock)使用客户自己的凭据运行,其用量由服务商直接向客户计费,Vivatia 不代收也不加价。使用 Tesseract 的本地 OCR 不按页计费。

如果你需要以下功能,请选择 Desktop…

  • 人工验证和实时数据校正。
  • 面向非技术用户的友好可视化界面。

如果你追求以下目标,请选择 Service…

  • 大规模、自动化、持续的处理。
  • 与多种来源和目标的无人值守集成。

用你自己的文档试用 Captika

从免费的 Free Edition 开始,或为大批量处理申请 Captika Server 的报价。