相关 ≠ 适用
同一事实可以与任务主题相关,却不适用于当前对象、空间、时间窗口或运行条件。
From 62562ef643dc0f0fe486bfc24feb561c90a202f8 Mon Sep 17 00:00:00 2001 From: stpku <83755634+stpku@users.noreply.github.com> Date: Thu, 27 Aug 2026 16:55:57 +0800 Subject: [PATCH 1/9] docs: compose WorldState and GeoTask public portal --- site/index.html | 159 ++++++++++-------------------------------------- 1 file changed, 31 insertions(+), 128 deletions(-) diff --git a/site/index.html b/site/index.html index a27a845..f1726a7 100644 --- a/site/index.html +++ b/site/index.html @@ -4,8 +4,8 @@ - - + + @@ -13,150 +13,53 @@ - - - + + + - - -
面向智能体的开放时空基础
WorldState 负责把现实状态表达得可信、可追溯、可重放;GeoTask 负责围绕当前任务,从这些现实信息和其他数据源中构造真正需要、适用且足够的上下文。
Problem
长上下文窗口、RAG、数据库和工具可以提供更多信息,但不会自动回答这些信息是否真的适用于当前任务。
同一事实可以与任务主题相关,却不适用于当前对象、空间、时间窗口或运行条件。
存在地图、气象、库存或传感器值,并不意味着空间、时间、精度和语义粒度足以支持任务。
大 payload 仍可能遗漏 critical requirement;大量可选信息也可能只增加 token、网络与认知成本。
为什么要分成两层
这两个问题紧密相连,但不是同一个问题。把它们混在一个模型、一个提示词或一个通用数据层里,往往会同时丢失现实可信度和任务针对性。
同一对象会变化、过期、冲突,也可能暂时未知。现实状态必须保留来源、有效期和不确定性。
同一事实对不同任务的重要性不同;相关 ≠ 适用,有数据 ≠ 分辨率足够。
大量上下文仍可能遗漏关键需求,也可能把无关信息、网络成本和 token 成本带入 Agent。
GeoTask 先从任务建立 Requirement,再评估候选信息;Relevance、Applicability、Resolution Adequacy 和 Sufficiency 保持分离。
WorldState 与 GeoTask 可以共享一个公共入口,因为二者组成了连续的认知链;但它们仍是两个独立 Foundation,各自拥有自己的语义、仓库、路线图和 Benchmark。
Boundary
上游负责现实候选信息,下游负责推理、领域判断与动作授权;GeoTask 拥有的是 Task-relative Context。
WorldState、GIS、API、Sensor、Database 或 Other Provider 提供候选事实与状态。
判断当前任务需要什么,哪些候选相关、适用、分辨率足够,以及上下文是否充分。
Agent Harness 运行推理;领域系统继续拥有专业判断、授权、执行与责任边界。
边界
它只负责事实、证据、未知、冲突、有效期、历史和变化。
它消费 WorldState、GIS、API、Sensor、Database 或其他 Provider,把信息变成任务相对上下文。
上下文充分不等于领域结论成立,更不等于现实动作已经获得授权。
Current Public Proof
公共 Core 已覆盖 Requirement、Candidate、Relevance / Applicability / Resolution、Sufficiency、Minimum Context 与 Temporal Reassessment。
室内 GIS、库存 API 与通道净宽传感器分别提供 ContextCandidate;GeoTask 构造 Requirement、判断充分性并在传感器变化后只刷新受影响 Requirement。
关键反例:即使通道实测宽度小于机器人宽度,只要测量本身相关、适用、新鲜且分辨率足够,GeoTask 仍可判断“上下文充分”;但不会判断“机器人可以通行”。
打开完整示例 →世界现在是什么?什么是真的、未知的、冲突的、过期的或已经变化?
WorldState 是开放、轻量、领域无关的世界状态基础,把观察、证据、权威记录和外部 Provider 组织为可追溯、可重放的现实状态。
当前任务真正需要知道什么?这些信息是否适用、分辨率足够,而且上下文已经充分?
GeoTask 是面向 AI Agent 的时空任务上下文引擎。它不是把整个世界塞进上下文,而是构造当前任务真正需要的最小充分上下文。
Measure
任何“减少上下文”的正指标都必须配反指标,避免系统通过漏掉关键事实获得漂亮数字。
组合方式
GeoTask 可以直接消费 WorldState,也可以消费 GIS、API、传感器、数据库或其他世界模型。WorldState 同样可以服务传统 GIS、数字孪生和其他应用,而不要求它们使用 GeoTask。
删除 GeoTask 后,WorldState 仍应能作为领域无关的世界状态基础运行。
不使用官方 WorldState,GeoTask 仍应能完成 Task → Context。
WorldState 提供可信现实,GeoTask 将现实裁剪成任务充分上下文,二者在动态任务中天然形成连续链路。
Research Roadmap
稳定的 Task → Requirement 方法与推导轨迹。
把对象、空间、时间、精度和语义分辨率变成显式要求。
在 Critical Context Miss 不上升的前提下降低上下文成本。
变化只触发有界重评和必要的最小重建。
用更多领域验证公共 Core 不被单一业务塑形。
长期公共资产是 Method、Engine、Benchmark 与开放合同。
实证
这个公开案例不依赖 Lowa,也不要求官方 WorldState。它从 Indoor GIS / Inventory API / Aisle Sensor 获取候选信息,再由 GeoTask 判断当前拣货任务真正需要什么。
例如:当“通道实测宽度小于机器人宽度”时,系统可以明确区分“上下文充分”和“机器人可以通行”这两个不同结论。
查看独立消费者 →WorldState 的独立消费者使用冷链状态证明现实状态语义可以脱离 GeoTask 和低空业务存在:状态、证据、有效期、未知与冲突仍然具有独立价值。
GT01—GT42证明单项能力;Reference Agent把新证据、World State、Discrepancy、Correction、Impact与Control串成一条可运行、可失败、可重放的设施评估更新链。它继续作为已发布兼容资产保留,但不再定义 GeoTask 的当前产品定位。
度量
关注 State Correctness、Provenance Coverage、Validity Accuracy、Conflict Preservation、Replayability;反指标是 Unsupported State Rate / False Resolution Rate。
关注 Critical Requirement Coverage、Sufficiency Accuracy、Context Reduction、Applicability Accuracy;反指标是 Critical Context Miss Rate / False Sufficiency Rate / Irrelevant Context Rate。
共42个可验证参考例,对应38个场景入口;GT38—GT42作为一个五阶段复合案例,完整展示无人机身份从证据审定到应用审批的治理链。
把容量、占用时间和优先级转化为可执行协调计划。
进入体验 → - GT11几何距离不等于对象在真实网络中的可达路线。
进入体验 → - GT12能到达目标不等于能保留安全余量完成任务。
进入体验 → - GT13道路状态与具体车辆的安全空间包络必须分别判断。
进入体验 → - GT14直线距离只是空间事实,派遣动作必须验证真实路线、准备时间和响应窗口。
进入体验 → - GT15静态地图描述结构可通行性,实时感知决定当前路线是否被障碍占据。
进入体验 → - GT16初始间隔满足要求,但A机延误40秒后预测间隔从120秒缩至80秒;结论仍可用,却必须持续监测并准备增量复核。
进入体验 → - GT17空间、时间和事件语义一致时,应合并处置任务并保留全部来源证据。
进入体验 → - GT18路线能够到达目标仍不足以执行,还必须核验危险区和具体设备耐受能力。
进入体验 → - GT19导航到达、高度和时间合规仍不足以释放载荷,还必须取得新鲜的地面净空证据。
进入体验 → - GT20信号许可仍不足以进入冲突区,还必须证明下游出口净空并能容纳完整车辆。
进入体验 → -同一架无人机的延误数据来自两个系统。直接覆盖、取平均或按到达顺序选择都会掩盖冲突,必须使用业务方明确声明的处理规则。
进入体验 → - GT22位置与电量分别到达时,不能简单拼接成“当前状态”。系统必须确认对象、时间和字段归属,才能形成可追溯的统一运行快照。
进入体验 → - GT23只覆盖最新值会丢失历史和变化依据。系统必须保留前后运行快照,绑定300秒时间差,并明确记录位置、电量和对象有效期变化。
进入体验 → - GT24医疗航线穿越临时禁飞区,巡检航线绕开。系统只将医疗航线、任务、审批和起飞动作纳入复核链,避免全量重算或只更新地图。
进入体验 → - GT25无人机从走廊100米移动到130米后,只重算与无人机位置相关的两项安全距离,同时保留固定设施间距和电池余量。
进入体验 → - GT26服务站营业计划从08:00—22:00调整为09:00—18:00,系统只允许替换营业计划,保留位置、频率、服务类型和联系方式,并阻断20:30任务直至复核。
进入体验 → - GT27东区风速由6升至12米/秒后,只复核同区域且处于更新生效时段的配送和应急任务;一个结果变为不适飞,另一个复核后仍适飞,西区和更新前任务继续复用。
进入体验 → - GT28路线、高度、天气窗口和风速预检全部通过,但空域、运营人、起降场、气象放行和任务授权仍缺失;预检结论可引用,自动起飞授权与起飞指令保持阻断。
进入体验 → -模拟气象服务给出8米/秒,现场传感器给出13米/秒。两个来源都新鲜且相互独立,但数值仍然冲突,因此天气结论保持未知,并请求第三个独立来源。
进入体验 → - GT30第三个独立来源也给出13米/秒,形成二比一;但可信保证策略没有声明多数表决规则,因此系统仍保持未知,不静默删除8米/秒来源,并请求显式气象审定。
进入体验 → - GT31人工复核精确绑定GT30冲突响应与虚构上下文证据,保留三份原始响应并将两份13米/秒读数限定为局部测试气流影响;8米/秒天气结论可用,但自动起飞授权与起飞指令继续阻断。
进入体验 → - GT32空域、运营人、起降场、气象放行和任务授权逐项到达,未知项从5降至0;最后两个起飞相关输出转为可用,但公共核心不发布结果、不发送指令,也不执行飞行动作。
进入体验 → -用移动对象引用、严格递增的带时区时间戳和三次二维观测建立离散轨迹,确定性计算持续300秒;不插值、不预测、不地图匹配,也不执行现实动作。
进入体验 → - GT34将三次明确观测按相邻顺序绑定为两个分段,分别计算持续120/180秒、距离60/90个文档水平单位和0.5水平单位/秒平均速度;不插值、不推断瞬时速度、不预测未来或执行动作。
进入体验 → - GT35使用调用方显式声明的5米停留半径、120秒最短时长、300秒最大观测间隔和缺口许可,将三个相邻分段分类为停留候选、已观测移动和观测缺口;不允许缺口标记时返回不可核验,不推断失联、异常或连续运动。
进入体验 → - GT36以相邻分段中点为代表时刻,在调用方声明的300秒最大观测间隔内计算平均速度变化率;输出零加速度、正加速度和缺口驱动的不可核验,不推断瞬时或向量加速度、方向变化、未来位置或现实动作。
进入体验 → - GT37比较前一轨迹末样本与后一轨迹首样本,在调用方声明的时间、距离和对象类别策略下输出对象同一性候选、不同对象候选或不可核验;不自动归并身份、不改写subject_ref,也不证明现实身份。
进入体验 → -虚构巡检无人机UAV-017进入建筑遮挡区后短暂失联,恢复观测时被系统建立为新的临时主体。资产登记证据与人工复核均支持“同一架无人机”,但GeoTask仍将审定、归并提案、提案审批、变更请求和应用审批拆成五个可审计阶段。
共同下一步
静态页面只是入口。长期共同主线应展示:现实发生变化后,WorldState 如何表达变化,GeoTask 如何只重评受影响的任务需求。
新的观察、证据、冲突、失效或 Provider 状态出现。
明确什么变了、何时变化、哪些旧状态不再成立,并保留来源与历史。
只识别受影响的 ContextRequirement,重新判断适用性、分辨率和充分性。
不受影响的上下文继续复用;只有必要部分刷新,避免全量重建。
历史资产
GT01—GT42 继续保留原有编号、URL 和可验证体验,不做“整包迁移到 WorldState”。它们记录了 GeoTask 0.x 从确定性空间计算、证据与世界状态逐步演化到任务上下文方法的历史。
文档与仓库
第一次访问者在这里理解整体关系;开发者随后进入各自 GitHub Repository 的 README、规范、Benchmark 与路线图。
GeoTask Core 采用 MIT License。可以从独立消费者、Python API 或公开案例开始接入自己的 GIS、API、Sensor 或 WorldState Provider。
需要可信、可追溯的现实状态,进入 WorldState;需要为 Agent 构造任务相对、可判断充分性的时空上下文,进入 GeoTask。两者可以独立使用,也可以自然组合。