图书馆、档案馆、地方志机构,这几年都在试 AI 检索和智能问答。但这类机构的落地通常比预想慢,而且慢的原因很集中:不是模型不够强,而是数据太敏感、来源太杂、要求太细。
下面用一个市级档案馆的数字化项目为例,看它一路踩了哪些坑,以及为什么最后需要一层网关来收口。
坑一:读者问的,和库房藏的对不上
档案馆上线智能问答后,第一个问题是"答非所问"。读者问"某次洪水的赈灾档案在哪一卷",系统返回的是政策条文。
排查发现,检索索引是和图书馆通用资料混在一起建的,没有按"馆藏类型"区分。而档案的著录规则、分类法、开放年限,和公开图书完全不是一套体系。开发同学按通用知识库的做法搭了索引,检索质量自然上不去。
更深层的问题是:馆藏分古籍、民国档案、建国后档案、照片、音像多个大类,每一类的著录字段都不一样。这种"按类型分层"的需求,落在调用层面时,最初的架构里根本没有对应的控制点。
坑二:开放鉴定没做,敏感内容直接出去了
档案和图书最大的区别,是有一大批"控制使用"和"延期开放"的内容。读者检索时,系统不能把未开放部分的内容直接生成答案甩出来。
项目初期,开发同学的做法是把全部馆藏都喂进模型做问答。安全审查时发现,几段涉及个人身份、未公开事件的档案内容,已经被模型生成进了回答。虽然只是测试环境,但流程上的漏洞是真实的。
临时补了一个过滤逻辑,但审查组追问:另外三个准备接入的模块,是不是也都判断过了?答案是没有统一设计。
坑三:古籍 OCR 后的文本,质量参差
古籍和老报纸的扫描件 OCR 之后,错字、缺字、版式混乱是常态。直接拿去检索,召回率很低。
团队想用模型做后校正和实体抽取,但这部分任务量极大,全量跑在小几十万页上,成本完全不可控。最初没做任务分级,所有校正请求走同一个接口,预算一个月就见了底。
成本问题之外,还有稳定性:OCR 后处理对时延不敏感,但放在白天跑会和业务检索抢资源。
坑四:不同系统的模型接口各自为政
档案利用系统、编目辅助系统、公众网站问答、内部研究检索,四套系统四个开发方,接了三家不同的模型服务。年终做安全评估时,负责人才发现:连公司(机构)一共有几路模型在跑、各自账号谁在管,都说不清楚。
密钥散落在四个项目的配置文件里。其中一套的密钥还是实习生离职前留下的个人申请,早已没人认领。
四个坑,一个共同根子
分层检索、敏感内容管控、批量校正成本、接口与密钥失管——四个问题分属四个环节,但根子是同一个:各系统各自直连模型,机构没有一层自己能控制、能审计、能统一策略的东西。
这个档案馆最终的改造是引入魔芋企业AI网关(MAI Gateway),把所有 AI 调用收口到一处。其定位是:统一接入·智能路由·精准分账·安全脱敏·成本优化。
统一接入。网关纳管的模型来源包括魔芋 AI 自有平台、机构自建的开源模型、第三方 API 服务,以及阿里 tokenPlan 与火山 AgentPlan 模型的接入。四套系统只对接一个网关地址,来源怎么调整、密钥怎么轮转,业务系统全程无感。
智能路由,按馆藏类型分层。网关支持按调用方身份和任务类型选择不同的提示词模板与知识域:
- 公开图书、已开放档案的读者问答,走 Gemini 3 Flash 与 GPT-5-mini,配合高频问题缓存;
- 大批量 OCR 后文本校正、实体抽取,交给 DeepSeek V4 在夜间低峰队列跑,与在线检索物理隔离;
- 编目辅助、著录字段补全这类需要理解馆藏规则的任务,交给 Claude 4 Sonnet;
- 跨库专题研究、历史脉络梳理这类复杂分析,才用 GPT-5 或 Claude Opus 4.7。
"按馆藏类型分层"这件事,从开发同学在每个系统里各写一遍,收敛成了网关侧的一套配置。
安全脱敏与控制使用。个人身份信息、未开放档案标识、涉及未公开事件的字段,在请求出网前由网关统一识别处理;同时网关可对接馆藏的开放鉴定结果,未开放部分在问答链路上被隔离,不会进入生成。规则由一处维护,四套系统共享,新接入模块自动继承——审查组那个"另外三个模块呢"的问题,从此有了确定答案。
精准分账。按业务系统 + 任务类型归集用量。档案馆这类单位往往同时承担公众服务和内部研究,两类预算来源不同。分账表让每类任务的消耗第一次能算清,夜间批处理校正任务因此被主动调度到低峰,成本显著下降。
一句实话
档案机构的 AI 落地,难点从来不在"能不能答出来",而在于"该答的答、不该答的绝不放出去、成本还得算得清"。这三个要求同时成立时,需要的就不是更强的一个模型,而是一层把边界、账目、稳定性都前置的管理面。
一个朴素的自查标准:当有人问"我们到底有几路模型在跑、其中哪几路碰了敏感馆藏",负责技术的同事能不能立刻答上来。答不上来,网关就该上了。
声明:本文所述产品功能、特性与案例数据以魔芋企业AI网关(MAI Gateway)官方最新文档为准,文中示意性数据不构成采购或投资建议。企业AI网关属企业AI基础设施合规品类,部署与上线请结合所在行业等保、数据安全法等合规要求。