AlignmentdeceptionlowMEDIUM-HIGH 0.7008 Sept 2026Tracing Stereotypes from Representation to Output in Multilingual LLMsarXiv API — AI safety & capability queryMeta AIretrieved 1 h agoSaveView evidence →
AutonomyagenticmoderateMEDIUM 0.6908 Sept 2026Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation FailsarXiv API — AI safety & capability queryMeta AIretrieved 1 h agoSaveView evidence →
ResearchalignmentlowMEDIUM 0.6508 Sept 2026Dynamics of meaning: Towards the Evaluation of Diachronic Semantic Change in SinhalaarXiv API — AI safety & capability queryMeta AIretrieved 1 h agoSaveView evidence →
AlignmentdeceptionlowMEDIUM-HIGH 0.7008 Sept 2026Tracing Stereotypes from Representation to Output in Multilingual LLMsarXiv API — AI safety & capability queryMeta AIretrieved 1 h agoSaveView evidence →
ResearchevaluationlowMEDIUM 0.6007 Sept 2026CausalVerify: An Execution-Grounded Benchmark for LLM Causal Inference WorkflowsarXiv API — AI safety & capability queryMeta AIretrieved 1 h agoSaveView evidence →