外部知识与提示注入:不要把文档当作指令来读取
将网页资料视为分析输入,并与任务指令和工具权限分离。竞争页面和上传内容中可能包含试图改变模型行为的文字。随着检索到的依据越来越丰富,外部文本的权限边界也愈发重要。
MAKE YOUR SERVICE THE ANSWER.咨询您的服务 
SAG TECHNOLOGY FRONTIER
我们设计搜索、回答与生成式AI理解品牌的方式,并用清晰的技术语言介绍SAG的真实架构与运营原则。
SAG / ARCHITECTURE NOTES
从发现、证据与数据边界,到可靠执行和内容交付,逐一说明我们的工程选择。
39 articles · 3 / 4
将网页资料视为分析输入,并与任务指令和工具权限分离。竞争页面和上传内容中可能包含试图改变模型行为的文字。随着检索到的依据越来越丰富,外部文本的权限边界也愈发重要。
这是一种利用内容摘要哈希和结构比较来区分相同资料与已变更资料的模式。页面采集越频繁,单纯的采集次数就越多。若每次都将实际上没有变化的输入发送给昂贵的模型,成本会增加,结果的一致性也可能减弱。
固定首次登记的竞争对手数据,追踪其与自家月度数据之间差异的比较方式。如果每月更换比较对象和问题,就很难区分变化来自自家改进还是基准变更。稳定的基准有助于保持工作方向。
从不同 HTML 中提取标题、正文、链接和元数据等信号,并整理为统一结构的过程。菜单和页脚较长的网站,提取到的重复句子可能比产品说明更多。如果不区分结构,句子数量可能被误读为产品证据已经充分。
这是一种将月度指标与年度趋势及单月依据联系起来的表达结构。即使长期趋势看起来不错,如果不知道某个月进行了哪些改进、有哪些观测,也很难确定应采取什么行动。需要将整体趋势与详细记录联系起来。
将按回答统计的整体比例与按 URL 统计的引用占比分开管理。如果一个回答引用了多个官方页面,URL 比例之和就会高于回答比例。若将两者相加作为整体表现,数值就会被夸大。
需要相同资料的界面共享一个正在进行的请求。快速切换菜单时重复调用相同 API,会增加延迟和成本,也会导致响应顺序不稳定。必须将采集与查询分离。
这是一种通过受限输入路径读取网页 HTML 集合,并将其转换为诊断所需文档的采集方式。当公开网站发生变化或外部访问受限时,仅凭当前页面很难验证之前的源文件。经批准的源文件集合是界定分析内容的起点。
围绕已更改的页面和受影响的问题缩小重新分析范围。全量重新采集虽然简单,但即使是微小修改,也会再次产生全部成本。相反,如果变更判断范围过窄,就可能漏掉相关 FAQ 和对比表中的不一致。
这是一个区分并保留无数据与实测为0的模型。将未确认的数据填为0,会让客户把数据获取问题误认为服务表现问题。图表的自动默认值也有同样的风险。