Reaction
AI model success rates and safety declines in TerminalBench
A post argues that how often a model succeeds on TerminalBench does not, by itself, distinguish lack of capability from safety declines.
TLDR
A post argues that not every AI model failure reflects a lack of capability. It says TerminalBench success rates alone can hide a distinction between capability failures and safety declines.
Combined views
117
2 Sources, first seen 2h ago
2 likes
