世界第一 · 且可验证

基准详解 世界第一,且可验证

把三个「World #1」拆开给你看:分数怎么来的、统计日期是哪天、和第三方怎么比。敢标日期,才敢让你证伪。

World #1

三项世界第一基准

均为对应统计日期下公开可比对的最优成绩。

LongMemEval World #1
0%
QA 496–497/500 · 全量
统计日期 2026-08-18
长记忆问答全集准确率,公开榜世界第一(多模型 OR 集成,GPT-4o 复核)。
方法:500 题全量评测,多模型 Reader + OR 聚合,GPT-4o 独立复核判定。
第三方:OMEGA 在 LongMemEval-S 子集自报 95.4%,但子集规模与协议不同,不可直接横比;全量同协议下我们 99.4% 仍居首。
LoCoMo World #1
0%
三池 OR · 1,937/1,986 题
统计日期 2026-08-15
对话级长程记忆世界第一,超越 ByteRover 96.10%(2026)。
方法:LLM-as-Judge(Checklist-CoT)+ 三池 OR 集成。属非官方指标,对外须标注。
官方 F1:按官方 32-token 简洁协议 token 级 F1 为 65.34%(与 LLM-as-Judge 主口径并列必披露)。
第三方:ByteRover(2026)自报 96.10%;我们 97.53% 已超越。排行榜动态变化,后续若有更高分,本主张仅限该统计日期。
MemoryAgentBench World #1
0%
四维综合均分 · ICLR 2026
统计日期 2026-08-15
Agent 记忆基准世界第一(组合口径 78.99%;保守下限 77.87%)。
方法:ICLR 2026 官方评测,四维(单一/双/检索/工具)综合均分,多模型 OR 集成。
第三方:TRACE(2026)自报 83.8% 已超过我们冻结值;组合口径 78.99% 仍显著高于 GPT-5-mini 60.6%。主张仅限统计日期。
LME-V2 — 内部更硬基准(不称世界第一)

LME-V2 是我们内部用于打磨检索与推理的更硬、更长程基准。Medium 规模、自有多模型 Reader 下达 62.7%(283/451),远高于 22% 基线;保守下限(单模型 DS-V4-Flash)44.3%。

为何不称官方榜第一:官方榜当前最高 AgentRunbook-C 72.5%,我们尚未向官方 Leaderboard 提交(16GB 硬件无法跑合规固定 Reader),故不自称该榜世界第一。LME-V2 证明的是工程深度,而非对外排名主张。

Discipline

口径与统计日期铁律

我们的「世界第一」不是永久标签,而是某个统计日期、某同协议下的公开最高分。

1
单一真相源:所有分数以 claim_card.json 为准,官网 / 话术 / 投资人材料必须一字不差。
2
统计日期锚定:每个主张都带统计日期,如同奥运冠军是「某一届赛事、某一时刻」的世界第一。
3
非官方指标须标注:LoCoMo 采用 LLM-as-Judge,属非官方口径,对外明示。
4
第三方超越不隐藏:若第三方取得更高分,主张仅限该统计日期成立,不泛化为永久第一。