AutoLabarXiv · 2026Evaluation arXiv · 2026 AutoLab: Can Frontier Models Solve Long-Horizon Auto Research and Engineering Tasks? Autonomous ResearchAgent EvaluationLong-horizon Tasks Read paper Read the story
JobBencharXiv · 2026Evaluation arXiv · 2026 JobBench: Aligning Agent Work With Human Will General AgentWork AutomationAgent Evaluation Read paper
NARRA-GymarXiv · 2026Evaluation arXiv · 2026 NARRA-Gym for Evaluating Interactive Narrative Agents Interactive NarrativesPersonalizationAgent Evaluation Read paper
PersonaMem-v2arXiv · 2025Data arXiv · 2025 PersonaMem-v2: Towards Personalized Intelligence via Learning Implicit User Personas and Agentic Memory PersonalizationAgent MemoryLong-context Reasoning Read paper
SafironICLR · 2026Method ICLR · 2026 Building a Foundational Guardrail for General Agentic Systems via Synthetic Data Agent SafetyGuardrailsSynthetic Data Read paper
CoDAICLR · 2026Method ICLR · 2026 CoDA: Agentic Systems for Collaborative Data Visualization Multi-agent SystemsData VisualizationCode Generation Read paper
TOUCANEMNLP · 2026Data EMNLP · 2026 TOUCAN: Synthesizing 1.5M Tool-Agentic Data from Real-World MCP Environments Tool UseMCP EnvironmentsSynthetic Data Read paper
ChemOrchNeurIPS · 2025Data NeurIPS · 2025 ChemOrch: Empowering LLMs with Chemical Intelligence via Groundbreaking Synthetic Instructions ChemistrySynthetic DataTool Use Read paper
VisualSphinxarXiv · 2025Data arXiv · 2025 VisualSphinx: Large-Scale Synthetic Vision Logic Puzzles for RL Multimodal ReasoningVisual PuzzlesReinforcement Learning Read paper
KodCodeACL · 2025Data ACL · 2025 KodCode: A Diverse, Challenging, and Verifiable Synthetic Dataset for Coding Code GenerationSynthetic DataUnit Testing Read paper
CARNAACL · 2025Analysis NAACL · 2025 Stronger Models are NOT Stronger Teachers for Instruction Tuning Instruction TuningModel DistillationModel Compatibility Read paper
MagpieICLR · 2025Method ICLR · 2025 Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing Instruction TuningSynthetic DataModel Alignment Read paper