跳至主要内容
Finnox

Benchmark

EI Capability Ladder

这套框架说明每个等级能做什么,以及需要什么证据支持。

Benchmark

EI Capability Ladder

六个等级分别定义能力边界与相应证据要求。

EI-L0

无 · 情感盲区

只按指令或规则运行,人的情绪不会改变它的判断。 证据要求: 确认情感相关输入不会改变系统的判断或回应。

EI-L1

幼儿园 · 情感感知

能发现非常强烈的情感信号,并给出单一、固定的反馈。 证据要求: 说明识别了哪些强信号,并测试基础反馈在不同条件下是否稳定。

EI-L2

小学生 · 情感理解

融合不同模态,理解当下的基本情绪和明确表达的情绪意图。 证据要求: 分别测试各类输入及其组合,并说明信号缺失或冲突时会发生什么。

EI-L3

中学生 · 情感预判

形成更清晰的自我特征,并根据连续变化预判意图与可能的下一步行动。 证据要求: 使用连续交互测试意图和下一步状态的预测,并报告错误与适用范围。

EI-L4

大学生 · 情感共鸣

理解自我、他人与环境,主动营造更适合交流的情感氛围。 证据要求: 在不同时间、语境与人群中评估支持方式是否合适,并保留人工复核。

EI-L5

Beyond · 情感智慧

无需持续外部维护,也能凭计划、反馈与好奇心不断学习和适应。 证据要求: 开展长期评估,记录反馈、版本变化、伦理限制和需要停止使用的情况。

Evaluation dimensions

评估时会检查这六件事

单一输入或单次结果不足以定义能力;评估需要同时记录输入、理解、记忆、行动、不确定性与场景稳健性。

01

Sensing

输入模态、采集条件、缺失信号与噪声范围。

02

Understanding

状态定义、上下文使用、冲突处理与解释边界。

03

Memory

权限、相关性、保留期限、撤回与跨轮次行为。

04

Action

候选行动、产品规则、降级路径与人工介入。

05

Uncertainty

置信范围、未知情况、分布变化与拒绝输出条件。

06

Context Robustness

跨设备、环境、个体与时间变化的适用边界。

Protocol

评估怎么进行

协议先限定问题与数据,再重复评估、报告不确定性、记录版本并完成公开前复核。

  1. 01

    Scope Declaration

    声明研究问题、目标用途、排除用途与适用场景。

  2. 02

    Dataset and Protocol

    记录数据来源、同意基础、划分方式、任务与评估程序。

  3. 03

    Repeated Evaluation

    在预先声明的条件与变体下重复评估。

  4. 04

    Uncertainty Reporting

    同时报告误差、变化范围、未知情况与失败条件。

  5. 05

    Versioning

    记录模型、数据、协议、配置与解释规则的版本。

  6. 06

    Review

    在公开前复核方法、范围、结论措辞与责任边界。

Method disclosures

看结果时还要知道这些

EI Capability Ladder 用来统一能力定义和证据要求;Finnox-V2.0 的公开等级为 EI-L3。

适用范围

跨设备、环境、个体与时间变化的适用边界。 声明研究问题、目标用途、排除用途与适用场景。

不确定性

置信范围、未知情况、分布变化与拒绝输出条件。 同时报告误差、变化范围、未知情况与失败条件。

版本记录

记录模型、数据、协议、配置与解释规则的版本。

已知限制

首页、Research 与 Benchmark 使用同一套 EI-L0—EI-L5 定义。Finnox-V2.0 为 EI-L3 多模态情感智能模型;该等级描述其根据连续信息分析意图和未来动作序列的能力。

Benchmark

想讨论评估方法?

首页、Research 与 Benchmark 使用同一套 EI-L0—EI-L5 定义。Finnox-V2.0 为 EI-L3 多模态情感智能模型;该等级描述其根据连续信息分析意图和未来动作序列的能力。