300 canonical paper links on this archive page.
- Language-Conditional Dequantization: Recovering What Quantization Steals from Non-English Languagesarxiv-2608.11786 Sparse Blocked context onlyAug 12, 2026
- Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correctionarxiv-2608.11772 Sparse Blocked context onlyAug 12, 2026
- LiveAnimate: Stable Long-Form Streaming Human Animation in Real-Timearxiv-2608.11745 Sparse Blocked context onlyAug 12, 2026
- Ripple-Pivot Search: Active Parallel Decoding for Diffusion Large Language Modelsarxiv-2608.11742 Sparse Blocked context onlyAug 12, 2026
- When the API Speaks the Wrong Language: Revisiting Post-Training for Multilingual Tool Usearxiv-2608.11715 Sparse Blocked context onlyAug 12, 2026
- Hybrid-Policy Self-Editing for Composable Unstructured Knowledge Editingarxiv-2608.11660 Sparse Blocked context onlyAug 12, 2026
- Who Would You Vote For? Auditing Political Alignment in LLMs: An Italian Case-Studyarxiv-2608.11649 Sparse Blocked context onlyAug 12, 2026
- Learning to Persuade Exposes How Easily LLMs Abandon Correct Beliefsarxiv-2608.11624 Sparse Blocked context onlyAug 12, 2026
- MBA: Multimodal Benchmark and Agents for Real-World Business Ideationarxiv-2608.11616 Sparse Blocked context onlyAug 12, 2026
- VideoGAIA: A Benchmark for General AI Assistants on Agentic Video Understandingarxiv-2608.14718 Sparse Blocked context onlyAug 12, 2026
- Reinforcing Step-level Reasoning for Effective Self-Correction in LLMsarxiv-2608.11573 Sparse Blocked context onlyAug 12, 2026
- Beyond Single-Turn Confidence: Trajectory-Adapted Uncertainty Quantification for LLM Agentsarxiv-2608.11552 Sparse Blocked context onlyAug 12, 2026
- Principal Trait Analysis: Towards Deriving "Skills" in Human-AI Collaborationarxiv-2608.11460 Sparse Blocked context onlyAug 11, 2026
- Benchmarking LLM Judges for Mobile Agent Evaluationarxiv-2608.11434 Sparse Blocked context onlyAug 11, 2026
- When Self-Consistency Backfires: Majority Vote Hurts the Majority of Hard Science Problems for Small LLMsarxiv-2608.11403 Sparse Blocked context onlyAug 11, 2026
- Self-Evolving Embodied Agents via Skill-Harness Evolutionarxiv-2608.11350 Sparse Blocked context onlyAug 11, 2026
- ReRound: Reconstructive Rounding to Resolve Midpoint Ambiguity in Calibration-Free LLM Quantizationarxiv-2608.11045 Sparse Blocked context onlyAug 11, 2026
- VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World?arxiv-2608.10875 Sparse Blocked context onlyAug 11, 2026
- UniProbe: A Learnable Token-Level Hallucination Detector for Large VLMs using Multi-Structural Internal Representationsarxiv-2608.10835 Sparse Blocked context onlyAug 11, 2026
- Reference-Free Post-Training of Open Large Language Models for Multilingual Machine Translationarxiv-2608.10812 Sparse Blocked context onlyAug 11, 2026
- SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Informationarxiv-2608.10692 Direct Blocked context onlyAug 11, 2026
- DistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student Distillationarxiv-2608.10636 Sparse Blocked context onlyAug 11, 2026
- InSight-doc: Agentic Visual Perception for Long-Document Understandingarxiv-2608.10628 Curated Related Blocked context onlyAug 11, 2026
- Agent Safety Should Be a Runtime Contractarxiv-2608.11274 Sparse Blocked context onlyAug 11, 2026
- SKILLER: Language-Level Reinforcement Learning for Reusable Skill Extraction in Small Language Modelsarxiv-2608.10538 Sparse Blocked context onlyAug 11, 2026
- From Reasoning Depth to Reasoning Breadth: Evaluating Multi-Point Associative Reasoning in Large Language Modelsarxiv-2608.10444 Sparse Blocked context onlyAug 11, 2026
- Power law graph attention: exact generalization of scaled dot-product attention, empirical collapse at inferencearxiv-2608.10288 Sparse Blocked context onlyAug 10, 2026
- Multimodal Model Diffing for Feature Discovery and Controlarxiv-2608.09928 Sparse Blocked context onlyAug 10, 2026
- Decoding-Level Taboo: A Diagnostic Stress Test for LLM Robustnessarxiv-2608.09900 Sparse Blocked context onlyAug 10, 2026
- Stealing Reasoning Traces from Proprietary LLM APIsarxiv-2608.09867 Sparse Blocked context onlyAug 10, 2026
- Parameter Exploration for RLVR via Variational Learningarxiv-2608.09805 Sparse Blocked context onlyAug 10, 2026
- Matryoshka Language Model Suitesarxiv-2608.09703 Sparse Blocked context onlyAug 10, 2026
- TCS-BENCH: Benchmarking State-of-the-Art Generative AI Theoretical Computer Science Research Abilityarxiv-2608.09538 Sparse Blocked context onlyAug 10, 2026
- Learning Preference Adaptation for Large Language Model Personalization via Verbal Reinforcement Learningarxiv-2608.09507 Sparse Blocked context onlyAug 10, 2026
- Intent Speaks Louder: Controllable User Simulation Beyond Response Imitationarxiv-2608.09420 Sparse Blocked context onlyAug 10, 2026
- Motif 3: Technical Reportarxiv-2608.09119 Sparse Blocked context onlyAug 10, 2026
- Evo-Bench: Can Language Models Improve Agent Harness?arxiv-2608.09096 Sparse Blocked context onlyAug 10, 2026
- Tied Trit-Planes: Constraining PTQTP to a Uniform Nine-Level Quantizer, with a Persistent Folded Format for Disk-Streamed Mixture-of-Experts Servingarxiv-2608.08910 Sparse Blocked context onlyAug 9, 2026
- Full-bandwidth transformerarxiv-2608.08888 Sparse Blocked context onlyAug 9, 2026
- SymDiag: Explainable Diagnosis for LLM Reasoning via Neuro-Symbolic Verificationarxiv-2608.08786 Sparse Blocked context onlyAug 9, 2026
- Can We Optimize the Performance-Carbon Emission Break-Even Point?: The Quest for Greener LLMsarxiv-2608.08744 Sparse Blocked context onlyAug 9, 2026
- VectraYX-Vision-1B: A Sub-2B Spanish/LATAM Cybersecurity Vision-Language Model with Structured Visual Reasoning and Native Tool Usearxiv-2608.08477 Sparse Blocked context onlyAug 9, 2026
- Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narrativesarxiv-2608.08160 Sparse Blocked context onlyAug 8, 2026
- NeuPAT: Neuron-aware Plasticity Allocation Tuning for Language-Preserving MLLMsarxiv-2608.08107 Sparse Blocked context onlyAug 8, 2026
- OasisKV: Scaling In-Decode KV Cache Beyond HBM with Lookahead Sparse Prefetchingarxiv-2608.08097 Sparse Blocked context onlyAug 8, 2026
- Evidence-RL: Towards Evidence-intensive Visual Reasoningarxiv-2608.08021 Sparse Blocked context onlyAug 8, 2026
- Mendel Gödel Machine: Recursive Self-Improving Coding Agents via Comparative Evolutionarxiv-2608.07645 Sparse Blocked context onlyAug 7, 2026
- $A^2E$ : An End-to-End Agent Auditing Enginearxiv-2608.07346 Sparse Blocked context onlyAug 7, 2026
- An AI4AI Framework for Visual Token Pruningarxiv-2608.07193 Sparse Blocked context onlyAug 7, 2026
- Agent Memory Distillation: Empowering Small LLM Agents with Hierarchical Teacher Memoryarxiv-2608.07169 Sparse Blocked context onlyAug 7, 2026
- Multi-Agent Forensic Reasoning for Generalizable Deepfake Video Detectionarxiv-2608.06865 Sparse Blocked context onlyAug 7, 2026
- Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligencearxiv-2608.06756 Sparse Blocked context onlyAug 7, 2026
- AtlasVLA: Persistent World-Ego State Modeling for Vision-Language-Action Modelsarxiv-2608.06729 Sparse Blocked context onlyAug 7, 2026
- Characterizing the Quality Profile of AI-Generated C++ in Productionarxiv-2608.06640 Sparse Blocked context onlyAug 6, 2026
- Do AI Personas Grow? Analyzing and Benchmarking Personality Evolution in LLM Agents After Life Eventsarxiv-2608.06485 Sparse Blocked context onlyAug 6, 2026
- DyPES-VLA: Learning Shared Dynamics Priors and Embodiment-Specific Control for Cross-Embodiment Manipulationarxiv-2608.06374 Sparse Blocked context onlyAug 6, 2026
- On-Policy Self-Distillation without Any Supervisionarxiv-2608.06296 Sparse Blocked context onlyAug 6, 2026
- MASS: Multiplayer World Models with Authoritative Shared Statearxiv-2608.06257 Sparse Blocked context onlyAug 6, 2026
- EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learningarxiv-2608.06197 Sparse Blocked context onlyAug 6, 2026
- PaDoc: Layout-Grounded Parallel Decoding for Document Parsingarxiv-2608.06146 Sparse Blocked context onlyAug 6, 2026
- Learning from Failures: Retrieval-Centric CoT via Hard Negatives for Unified Multimodal Retrievalarxiv-2608.06060 Sparse Blocked context onlyAug 6, 2026
- OneEmo: A Unified Multimodal Reasoning Model for Emotion Perception, Understanding, and Interactionarxiv-2608.06013 Curated Related Blocked context onlyAug 6, 2026
- AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learningarxiv-2608.05987 Direct Blocked context onlyAug 6, 2026
- Energy-Guided Flow Matchingarxiv-2608.05811 Sparse Blocked context onlyAug 6, 2026
- On-Policy Delta Distillation for Multilingual Math Reasoningarxiv-2608.05802 Sparse Blocked context onlyAug 6, 2026
- KVAE: Family of Tokenizers for Multimodal Generative Modelsarxiv-2608.05798 Sparse Blocked context onlyAug 6, 2026
- Activity Frames: Deterministic Screen-Activity Compilation for Agent Memory and Replayarxiv-2608.05784 Direct Blocked context onlyAug 6, 2026
- ChronoVision: Temporal Reasoning via Latent State Reconstructionarxiv-2608.05631 Sparse Blocked context onlyAug 6, 2026
- SkillZip: Contract-Preserving Graph Compression for Scalable Agent Skill Librariesarxiv-2608.05604 Sparse Blocked context onlyAug 6, 2026
- EffectLearner: World-Aware Object-Effect Reasoning for Real-World Video Object Removalarxiv-2608.05565 Sparse Blocked context onlyAug 6, 2026
- Recursive Synthesis for Long-Horizon Terminal Tasksarxiv-2608.05466 Sparse Blocked context onlyAug 5, 2026
- World-to-Wrist: Task-Conditioned Future Wrist Modeling for Fine-Grained Robot Manipulationarxiv-2608.05369 Sparse Blocked context onlyAug 5, 2026
- SmartMage: Dynamic Modality Orchestration for 3D Scene Understandingarxiv-2608.05137 Sparse Blocked context onlyAug 5, 2026
- OPD-V: Visual On-Policy Self-Distillation with Modality Balancearxiv-2608.05131 Sparse Blocked context onlyAug 5, 2026
- Agent Against Agent: An Agentic System for Automatic Prompt Injection Red Teamingarxiv-2608.05108 Sparse Blocked context onlyAug 5, 2026
- ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignmentarxiv-2608.05102 Sparse Blocked context onlyAug 5, 2026
- Poly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow Modelsarxiv-2608.04349 Sparse Blocked context onlyAug 5, 2026
- CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Modelsarxiv-2608.04302 Sparse Blocked context onlyAug 5, 2026
- SIGNPOST-Bench: Benchmarking Text-Vision Conflict Resolution in Multimodal Large Language Modelsarxiv-2608.04244 Sparse Blocked context onlyAug 4, 2026
- MatrAIx: Simulating the World with 8.3 Billion Persona Agentsarxiv-2608.04205 Direct Blocked context onlyAug 4, 2026
- TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoningarxiv-2608.04007 Sparse Blocked context onlyAug 4, 2026
- OneDayAgent: Towards a Long-Horizon Harness for Autonomous Agentsarxiv-2608.05013 Sparse Blocked context onlyAug 4, 2026
- Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agentarxiv-2608.03979 Direct Blocked context onlyAug 4, 2026
- JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusionarxiv-2608.03974 Direct Blocked context onlyAug 4, 2026
- ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoningarxiv-2608.03972 Sparse Blocked context onlyAug 4, 2026
- UniWorld-Design: From Pixel Generation to Layer-Native Designarxiv-2608.03971 Sparse Blocked context onlyAug 4, 2026
- Omega-S: A Functional Resilience Index for LLM Fine-Tuningarxiv-2608.03887 Sparse Blocked context onlyAug 4, 2026
- ContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities?arxiv-2608.03874 Sparse Blocked context onlyAug 4, 2026
- OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Modelsarxiv-2608.03812 Sparse Blocked context onlyAug 4, 2026
- Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Lossarxiv-2608.03796 Sparse Blocked context onlyAug 4, 2026
- Agents Catching Agents: Shortcut Cascades and Benchmark Gaming in Clinical Multi-Agent Systemsarxiv-2608.03744 Sparse Blocked context onlyAug 4, 2026
- When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillationarxiv-2608.03632 Sparse Blocked context onlyAug 4, 2026
- SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMsarxiv-2608.03573 Sparse Blocked context onlyAug 4, 2026
- LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Modelsarxiv-2608.03457 Sparse Blocked context onlyAug 4, 2026
- DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspacesarxiv-2608.03451 Sparse Blocked context onlyAug 4, 2026
- Self-Evolving Coding Agentsarxiv-2608.03392 Sparse Blocked context onlyAug 4, 2026
- iFAN: Inference-Aware Learning for Plain Mask Transformersarxiv-2608.03216 Sparse Blocked context onlyAug 4, 2026
- CURV: Enhancing Chart Understanding Through Curriculum Visual Grounded Reasoningarxiv-2608.02833 Sparse Blocked context onlyAug 3, 2026
- Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentationarxiv-2608.02791 Sparse Blocked context onlyAug 3, 2026
- WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivityarxiv-2608.02603 Sparse Blocked context onlyAug 3, 2026
- AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modelingarxiv-2608.02602 Sparse Blocked context onlyAug 3, 2026
- Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and Editingarxiv-2608.02711 Sparse Blocked context onlyAug 3, 2026
- GradCuit: Credit-Assigned Gradient Flow Enables Robust and Interpretable Test-Time Latent Reasoningarxiv-2608.02585 Sparse Blocked context onlyAug 3, 2026
- What to Edit Next: Visually Aligned Image-Editing Follow-Up Suggestions in Conversational Systemsarxiv-2608.07565 Sparse Blocked context onlyAug 3, 2026
- RoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility Statesarxiv-2608.02508 Sparse Blocked context onlyAug 3, 2026
- LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasksarxiv-2608.01964 Sparse Blocked context onlyAug 3, 2026
- PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learningarxiv-2608.01837 Sparse Blocked context onlyAug 3, 2026
- DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agentsarxiv-2608.01827 Sparse Blocked context onlyAug 3, 2026
- Interpretable MEG Decoding of Perceived Speech: Cortical Sources and the Stimulus Features That Drive Retrievalarxiv-2608.01481 Sparse Blocked context onlyAug 2, 2026
- FATE: Frame-Level Audio-Visual Temporal Embeddingarxiv-2608.01310 Sparse Blocked context onlyAug 2, 2026
- 3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answeringarxiv-2608.01185 Sparse Blocked context onlyAug 2, 2026
- MiniWorld: Democratizing the Training of Video World Models from Scratcharxiv-2608.01127 Sparse Blocked context onlyAug 2, 2026
- FactorJEPA: Factorizing Monolithic Futures into Layout-Agent-Interaction Channels for Crowded and Chaotic Global South Urban Worldsarxiv-2608.01049 Direct Blocked context onlyAug 2, 2026
- Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidancearxiv-2608.00782 Sparse Blocked context onlyAug 1, 2026
- OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolutionarxiv-2608.00677 Sparse Blocked context onlyAug 1, 2026
- Relax Within, Balance Across: Geometry-Guided Load Balancing for Vision-Language Mixture-of-Expertsarxiv-2608.00574 Sparse Blocked context onlyAug 1, 2026
- Decoding Children's Gait Behaviorarxiv-2608.00371 Sparse Blocked context onlyAug 1, 2026
- Verifier-Induced Support Reshaping in On-Policy Optimizationarxiv-2608.00220 Sparse Blocked context onlyJul 31, 2026
- ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extractionarxiv-2607.29677 Direct Blocked context onlyJul 31, 2026
- AgentStream: How Well Do Self-Evolving LLM Agents Perform Under Streaming Tasks?arxiv-2608.00155 Sparse Blocked context onlyJul 31, 2026
- DiffusionGemma Technical Reportarxiv-2608.00146 Sparse Blocked context onlyJul 31, 2026
- Zero-Mem: Zero-Token Memory Operations for LLM Agentsarxiv-2607.29377 Sparse Blocked context onlyJul 31, 2026
- Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoningarxiv-2607.29211 Sparse Blocked context onlyJul 31, 2026
- DarwinX: Evolving Agent Harnesses Through Natural Selectionarxiv-2608.07545 Sparse Blocked context onlyJul 31, 2026
- Evaluation-Verification Reward for Consistent Multi-Reference Image Editingarxiv-2607.29025 Sparse Blocked context onlyJul 31, 2026
- MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operationsarxiv-2607.28956 Sparse Blocked context onlyJul 31, 2026
- To Add Is Machine, To Delete Is Human: Measuring and Mitigating Deletion Avoidance in LLM Code Editingarxiv-2607.28887 Sparse Blocked context onlyJul 30, 2026
- OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Modelsarxiv-2607.28609 Sparse Blocked context onlyJul 30, 2026
- Beacon: Knowing When and How to Perform Agentic Visual Reasoningarxiv-2607.28595 Sparse Blocked context onlyJul 30, 2026
- $β$-OPSD: Deriving with Policy Optimization, Training with Self-Distillationarxiv-2607.28582 Sparse Blocked context onlyJul 30, 2026
- Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineeringarxiv-2607.28568 Direct Blocked context onlyJul 30, 2026
- Would You Walk to the Car Wash? Revealing the Salience Bias of Large Language Models in Commonsense Reasoningarxiv-2607.28478 Sparse Blocked context onlyJul 30, 2026
- Fairness Pruning: Locating Demographic Bias in GLU-MLP Layers via Differential Activationsarxiv-2607.28319 Sparse Blocked context onlyJul 30, 2026
- SKILL-KD: Contrastive Skill Distillation for LLM Agentsarxiv-2607.28048 Sparse Blocked context onlyJul 30, 2026
- $Σ$-Mem: An Online Reliability Memory for LLM-based Multi-Agent Systemsarxiv-2607.27958 Sparse Blocked context onlyJul 30, 2026
- ODEWorld: A Continuous Predictive Architecture via Physical-Time Flowarxiv-2607.27924 Sparse Blocked context onlyJul 30, 2026
- Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memoryarxiv-2607.27919 Sparse Blocked context onlyJul 30, 2026
- Beyond Borrowed Histories: Person-Aligned User Simulation for Interactive Role-Playing Evaluationarxiv-2607.27816 Sparse Blocked context onlyJul 30, 2026
- MMOOC: A Comprehensive Benchmark for Out-of-Context Evaluation in Multimodal Large Language Modelsarxiv-2607.27637 Sparse Blocked context onlyJul 30, 2026
- Subtract, Transport, or Replay? Auditable Deletion from Language-Model Memoryarxiv-2607.27539 Sparse Blocked context onlyJul 30, 2026
- TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAMarxiv-2607.27205 Direct Blocked context onlyJul 29, 2026
- Can AI agents conduct open-ended AI research? Early evidence from two case studiesarxiv-2607.27191 Sparse Blocked context onlyJul 29, 2026
- OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Groundingarxiv-2607.27155 Sparse Blocked context onlyJul 29, 2026
- SecRespond: Benchmarking AI Agents for Real-World Post-Compromise Incident Responsearxiv-2607.26791 Sparse Blocked context onlyJul 29, 2026
- SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolutionarxiv-2607.26784 Direct Blocked context onlyJul 29, 2026
- See2Think: Do Multimodal Models Really Use Intermediate Visual States?arxiv-2607.26769 Sparse Blocked context onlyJul 29, 2026
- Metis: Memory Foundation Modelarxiv-2607.26760 Sparse Blocked context onlyJul 29, 2026
- Enfold: Folding World Model Imagination into Predictive Representations for Ultra-Efficient Embodied Controlarxiv-2607.26657 Sparse Blocked context onlyJul 29, 2026
- Revisiting Lossy Verification in Speculative Decoding: Mechanisms, Trade-offs, and Failure Modesarxiv-2607.26627 Sparse Blocked context onlyJul 29, 2026
- BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigmsarxiv-2607.26497 Sparse Blocked context onlyJul 29, 2026
- ExplainBench: Evaluating Code Explanations from Agentsarxiv-2607.26451 Sparse Blocked context onlyJul 29, 2026
- Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Modelsarxiv-2607.26326 Sparse Blocked context onlyJul 28, 2026
- StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agentsarxiv-2607.26314 Sparse Blocked context onlyJul 28, 2026
- INTACT: Isomorphic Intent-to-Action Learning for Search-Free World Modelsarxiv-2607.26056 Direct Blocked context onlyJul 28, 2026
- Wonder: Video World Model Done Betterarxiv-2607.26037 Sparse Blocked context onlyJul 28, 2026
- MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalitiesarxiv-2607.25948 Sparse Blocked context onlyJul 28, 2026
- MemSFT: Mitigating Alignment Tax with an External Parametric Memoryarxiv-2607.25614 Sparse Blocked context onlyJul 28, 2026
- CAST: Game Solvers as Turn-Level Teachers for LLM Agentsarxiv-2607.25308 Sparse Blocked context onlyJul 28, 2026
- VisualPatchWorld: Code World Models as Latent Structured Representations for Planningarxiv-2607.25236 Sparse Blocked context onlyJul 28, 2026
- Towards Robust Reinforcement Learning for Small-Scale Language Model Agentsarxiv-2607.25091 Sparse Blocked context onlyJul 27, 2026
- ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understandingarxiv-2607.24743 Sparse Blocked context onlyJul 27, 2026
- The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillationarxiv-2607.24720 Sparse Blocked context onlyJul 27, 2026
- Kimi K3: Open Frontier Intelligencearxiv-2607.24653 Sparse Blocked context onlyJul 27, 2026
- Evidence Attribution in Visual Document Understanding without Coordinates or Region Labelsarxiv-2607.24651 Sparse Blocked context onlyJul 27, 2026
- From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Searcharxiv-2607.24280 Sparse Blocked context onlyJul 27, 2026
- FilmBench: A Film-Grade Benchmark for Cinematic Video Generationarxiv-2607.24241 Sparse Blocked context onlyJul 27, 2026
- Agent Retrieval Bench: Evaluating Repository Context Retrieval for Coding Agentsarxiv-2607.24882 Sparse Blocked context onlyJul 27, 2026
- WorldDiT: A Unified Diffusion Architecture for World and Action Modelingarxiv-2607.23909 Curated Related Blocked context onlyJul 27, 2026
- From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvementarxiv-2607.23802 Sparse Blocked context onlyJul 26, 2026
- ZenGen: Social Mind for LLMsarxiv-2607.23740 Sparse Blocked context onlyJul 26, 2026
- JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agentsarxiv-2607.23588 Direct Blocked context onlyJul 26, 2026
- UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Modelsarxiv-2607.23373 Sparse Blocked context onlyJul 25, 2026
- Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving Skillsarxiv-2607.22529 Sparse Blocked context onlyJul 24, 2026
- IDEAgent: Agentic Quality-Diversity Search for Research Idea Generationarxiv-2607.22375 Sparse Blocked context onlyJul 24, 2026
- StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agentsarxiv-2607.22798 Sparse Blocked context onlyJul 24, 2026
- Scaling Native Multimodal Pre-Training From Scratcharxiv-2607.22043 Sparse Blocked context onlyJul 24, 2026
- Streaming Multi-Agent Autoregressive Diffusion Model with World State Registersarxiv-2607.21594 Sparse Blocked context onlyJul 23, 2026
- OpenForgeRL: Train Harness-native Agents in Any Environmentarxiv-2607.21557 Sparse Blocked context onlyJul 23, 2026
- Visual Contrastive Self-Distillationarxiv-2607.21556 Sparse Blocked context onlyJul 23, 2026
- Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problemsarxiv-2607.21503 Sparse Blocked context onlyJul 23, 2026
- ICAE-Bench: Evaluating Coding Agents as Interactive Project Buildersarxiv-2607.21217 Sparse Blocked context onlyJul 23, 2026
- Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Textarxiv-2607.21072 Sparse Blocked context onlyJul 23, 2026
- Sample-Efficient Learning from Agent Experiencearxiv-2607.21051 Sparse Blocked context onlyJul 23, 2026
- Robostral Navigatearxiv-2607.20785 Sparse Blocked context onlyJul 22, 2026
- NVIDIA-labs OO Agents: Native Python Object-Oriented Agentsarxiv-2607.20709 Sparse Blocked context onlyJul 22, 2026
- Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learningarxiv-2607.21653 Direct Blocked context onlyJul 22, 2026
- SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPODarxiv-2607.20145 Sparse Blocked context onlyJul 22, 2026
- G-MAD: A Game-Based Data Generation Framework for Multi-View RGB-T Aerial Object Detectionarxiv-2607.19942 Sparse Blocked context onlyJul 22, 2026
- Are the Financial Reasoning from LLMs Credible? A Real World Test over Long-Horizon Statementsarxiv-2607.28661 Sparse Blocked context onlyJul 22, 2026
- Multi-Head Attention Residualsarxiv-2607.27230 Sparse Blocked context onlyJul 22, 2026
- Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoningarxiv-2607.19790 Sparse Blocked context onlyJul 22, 2026
- Beyond Relevance-Centric Retrieval: Rubric-Oriented Document Set Selection and Rankingarxiv-2607.19747 Sparse Blocked context onlyJul 22, 2026
- SLPO: Scaling Latent Reasoning via a Surrogate Policyarxiv-2607.19691 Sparse Blocked context onlyJul 22, 2026
- Scaling Laws for Hypernetwork-Based Knowledge Injection in Large Language Modelsarxiv-2607.19604 Sparse Blocked context onlyJul 21, 2026
- Appearance Pointers -- Multimodal Region Control of Diffusion Transformersarxiv-2607.19344 Sparse Blocked context onlyJul 21, 2026
- ISO: An RLVR-Native Optimization Stackarxiv-2607.19331 Sparse Blocked context onlyJul 21, 2026
- Text Template Tokens Are Implicit Semantic Registers in Diffusion Transformersarxiv-2607.19139 Sparse Blocked context onlyJul 21, 2026
- Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editingarxiv-2607.19064 Sparse Blocked context onlyJul 21, 2026
- Where Should Optimizer State Live? Tiered State Allocation for Memory-Efficient Mixture-of-Experts Trainingarxiv-2607.19058 Sparse Blocked context onlyJul 21, 2026
- H$^2$SD: Hybrid Hindsight Self-Distillationarxiv-2607.18955 Sparse Blocked context onlyJul 21, 2026
- AI Tour Meeting: Group Travel Planning by LLM Agentsarxiv-2607.18806 Sparse Blocked context onlyJul 21, 2026
- AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM Agentsarxiv-2607.18754 Direct Blocked context onlyJul 21, 2026
- EduPanel: A Three-Agent LLM Judge for Teaching Videos -- Reliability, Complementarity, and Human Trust Calibrationarxiv-2607.18529 Sparse Blocked context onlyJul 20, 2026
- SWE-Pruner Pro: The Coder LLM Already Knows What to Prunearxiv-2607.18213 Sparse Blocked context onlyJul 20, 2026
- AlayaWorld: Interactive Long-Horizon World Modeling -- Full Technical Reportarxiv-2607.18367 Sparse Blocked context onlyJul 20, 2026
- LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasksarxiv-2607.18110 Sparse Blocked context onlyJul 20, 2026
- SciForma: Structure-Faithful Generation of Scientific Diagramsarxiv-2607.18091 Sparse Blocked context onlyJul 20, 2026
- WorldCupArena: Fine-Grained Evaluation of Language Models and Deep-Research Agents on Football Forecastingarxiv-2607.18084 Direct Blocked context onlyJul 20, 2026
- Self-State Attacks on Self-Hosted AI Agents: How Far Can OS Defenses Go?arxiv-2607.17986 Sparse Blocked context onlyJul 20, 2026
- DiFA: Inference-Time Forward-Process Alignment for Diffusion Modelsarxiv-2607.17972 Sparse Blocked context onlyJul 20, 2026
- ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoningarxiv-2607.17599 Sparse Blocked context onlyJul 20, 2026
- TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMsarxiv-2607.17423 Curated Related Blocked context onlyJul 19, 2026
- Distilled Reinforcement Learning for LLM Post-trainingarxiv-2607.17247 Sparse Blocked context onlyJul 19, 2026
- Poor Man's Agentic Modeling: Simulating Large LLM-Agent Societies on a Laptoparxiv-2608.11215 Sparse Blocked context onlyJul 19, 2026
- Environment-free Synthetic Data Generation for API-Calling Agentsarxiv-2607.16900 Sparse Blocked context onlyJul 18, 2026
- Dataset Distillation by Influence Matchingarxiv-2607.16859 Sparse Blocked context onlyJul 18, 2026
- Group Entropy-Controlled Policy Optimizationarxiv-2607.16850 Sparse Blocked context onlyJul 18, 2026
- DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelinesarxiv-2607.16617 Sparse Blocked context onlyJul 18, 2026
- Can Multimodal Large Language Models Understand OCT?arxiv-2607.16609 Sparse Blocked context onlyJul 18, 2026
- An Exam for Active Observersarxiv-2607.16165 Sparse Blocked context onlyJul 17, 2026
- Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videosarxiv-2607.16107 Curated Related Blocked context onlyJul 17, 2026
- Understanding Reasoning from Pretraining to Post-Trainingarxiv-2607.16097 Sparse Blocked context onlyJul 17, 2026
- AVE-Compass: Towards Holistic Evaluation for Audio-Video Editing Abilitiesarxiv-2607.24821 Sparse Blocked context onlyJul 17, 2026
- DSWorld: A Data Science World Model for Efficient Autonomous Agentsarxiv-2607.15901 Sparse Blocked context onlyJul 17, 2026
- S1-Omni: A Unified Multimodal Reasoning Model for Scientific Understanding, Prediction, and Generationarxiv-2607.15686 Sparse Blocked context onlyJul 17, 2026
- RecGPT-V3 Technical Reportarxiv-2607.15591 Sparse Blocked context onlyJul 17, 2026
- SeerGuard: A Safety Framework for Mobile GUI Agents via World Model Predictionarxiv-2607.15550 Sparse Blocked context onlyJul 17, 2026
- Hierarchical Denoising For Multi-Step Visual Reasoningarxiv-2607.15278 Sparse Blocked context onlyJul 16, 2026
- SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaborationarxiv-2607.15257 Sparse Blocked context onlyJul 16, 2026
- On-Policy Delta Distillationarxiv-2607.15161 Sparse Blocked context onlyJul 16, 2026
- Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectoriesarxiv-2607.15330 Sparse Blocked context onlyJul 16, 2026
- SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignmentarxiv-2607.15058 Sparse Blocked context onlyJul 16, 2026
- SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learningarxiv-2607.14777 Direct Blocked context onlyJul 16, 2026
- WanSong v1.0 Technical Reportarxiv-2607.14749 Sparse Blocked context onlyJul 16, 2026
- VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistancearxiv-2607.14660 Sparse Blocked context onlyJul 16, 2026
- Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimizationarxiv-2607.14614 Sparse Blocked context onlyJul 16, 2026
- xHC: Expanded Hyper-Connectionsarxiv-2607.14530 Sparse Blocked context onlyJul 16, 2026
- Multi-Head Latent Control: A Unified Interface for LLM Agent Decision Makingarxiv-2607.14277 Sparse Blocked context onlyJul 15, 2026
- VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencodersarxiv-2607.14088 Sparse Blocked context onlyJul 15, 2026
- MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generationarxiv-2607.14189 Sparse Blocked context onlyJul 15, 2026
- GigaWorld-Policy-0.5: A Faster and Stronger WAM Empowered by AutoResearcharxiv-2607.13960 Direct Blocked context onlyJul 15, 2026
- RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imaginationarxiv-2607.14187 Sparse Blocked context onlyJul 15, 2026
- NexForge: Scaling Agent Capabilities through Requirement-Driven Task Synthesis for LLMsarxiv-2607.14186 Sparse Blocked context onlyJul 15, 2026
- AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilitiesarxiv-2607.13705 Sparse Blocked context onlyJul 15, 2026
- OvisOCR2 Technical Reportarxiv-2607.13639 Direct Blocked context onlyJul 15, 2026
- DeepLoop: Depth Scaling for Looped Transformersarxiv-2607.13491 Sparse Blocked context onlyJul 15, 2026
- Demystifying On-Policy Distillation: Roles, Pathologies, and Regulationsarxiv-2607.13399 Sparse Blocked context onlyJul 15, 2026
- DiffGI: Differentiable Geometry Images for High-Fidelity Thin-Shell 3D Generationarxiv-2607.13365 Sparse Blocked context onlyJul 15, 2026
- Harness Handbook: Making Evolving Agent Harnesses Readable,Navigable, and Editablearxiv-2607.13285 Direct Blocked context onlyJul 14, 2026
- From Human-Centric to Agentic Code Review: The Impact of Different Generations of Generative AI Technology on Review Qualityarxiv-2607.13196 Sparse Blocked context onlyJul 14, 2026
- Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processesarxiv-2607.13188 Sparse Blocked context onlyJul 14, 2026
- PalmClaw: A Native On-Device Agent Framework for Mobile Phonesarxiv-2607.13027 Sparse Blocked context onlyJul 14, 2026
- Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generationarxiv-2607.13125 Sparse Blocked context onlyJul 14, 2026
- VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compressionarxiv-2607.12756 Sparse Blocked context onlyJul 14, 2026
- Hallo4D: Multi-Modal Hallucination Mitigation for Consistent Spatio-Temporal Generationarxiv-2607.12752 Sparse Blocked context onlyJul 14, 2026
- Self in Space: Benchmarking Self-Awareness and Spatial Cognition in UAV Embodied Intelligencearxiv-2607.12477 Sparse Blocked context onlyJul 14, 2026
- Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoningarxiv-2607.12395 Sparse Blocked context onlyJul 14, 2026
- Rethinking the Evaluation of Harness Evolution for Agentsarxiv-2607.12227 Sparse Blocked context onlyJul 14, 2026
- Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generationarxiv-2607.11886 Sparse Blocked context onlyJul 13, 2026
- Evidence-Backed Video Question Answeringarxiv-2607.11862 Sparse Blocked context onlyJul 13, 2026
- AdvancedMathBench: A Benchmark Suite for Advanced Mathematical Proof Generation and Verificationarxiv-2607.11849 Sparse Blocked context onlyJul 13, 2026
- MET: Theory-Grounded and Culture-Aware Multilingual Moral Reasoningarxiv-2607.11736 Sparse Blocked context onlyJul 13, 2026
- Qwen-Music Technical Reportarxiv-2607.11699 Sparse Blocked context onlyJul 13, 2026
- RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLMarxiv-2607.11683 Direct Blocked context onlyJul 13, 2026
- Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Modelarxiv-2607.11643 Sparse Blocked context onlyJul 13, 2026
- MAGIC: Transition-Aware Generation of Navigable Multi-Scene Game Worlds with Large Language Modelsarxiv-2607.11594 Sparse Blocked context onlyJul 13, 2026
- MonkeyOCRv2: A Visual-Text Foundation Model for Document AIarxiv-2607.11562 Direct Blocked context onlyJul 13, 2026
- Proxy Exploration and Reusable Guidance: A Modular LLM Post-Training Paradigm via Proxy-Guided Update Signalsarxiv-2607.11505 Sparse Blocked context onlyJul 13, 2026
- See like a Robot: Robot-Centric Pointmaps for Vision-Language-Action Modelsarxiv-2607.11498 Sparse Blocked context onlyJul 13, 2026
- LightMem-Ego: Your AI Memory for Everyday Lifearxiv-2607.11487 Sparse Blocked context onlyJul 13, 2026
- Multi-Agent LLMs Fail to Explore Each Otherarxiv-2607.11250 Sparse Blocked context onlyJul 13, 2026
- Know Before Fix: QA-Driven Repository Knowledge Acquisition for Software Issue Resolutionarxiv-2607.11111 Sparse Blocked context onlyJul 13, 2026
- Towards Autonomous and Auditable Medical Imaging Model Developmentarxiv-2607.10522 Sparse Blocked context onlyJul 12, 2026
- GRASP: GRanularity-Aware Search Policy for Agentic RAGarxiv-2607.10463 Sparse Blocked context onlyJul 11, 2026
- ABot-N1: Toward a General Visual Language Navigation Foundation Modelarxiv-2607.10383 Sparse Blocked context onlyJul 11, 2026
- ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memoryarxiv-2607.10350 Sparse Blocked context onlyJul 11, 2026
- Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimizationarxiv-2607.10169 Sparse Blocked context onlyJul 11, 2026
- Index SLM Technical Reportarxiv-2607.09885 Direct Blocked context onlyJul 10, 2026
- Self-Guided Test-Time Training for Long-Context LLMsarxiv-2607.09415 Sparse Blocked context onlyJul 10, 2026
- On Locality and Length Generalization in Visual Reasoningarxiv-2607.09061 Sparse Blocked context onlyJul 10, 2026
- Video Generation Models are General-Purpose Vision Learnersarxiv-2607.09024 Sparse Blocked context onlyJul 10, 2026
- Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Gradingarxiv-2607.08964 Direct Blocked context onlyJul 9, 2026
- UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasksarxiv-2607.08768 Sparse Blocked context onlyJul 9, 2026
- OPSD-V: On-Policy Self-Distillation for Post-Training Few-Step Autoregressive Video Generatorsarxiv-2607.08766 Direct Blocked context onlyJul 9, 2026
- OpenCoF: Learning to Reason Through Video Generationarxiv-2607.08763 Sparse Blocked context onlyJul 9, 2026
- Remember When It Matters: Proactive Memory Agent for Long-Horizon Agentsarxiv-2607.08716 Sparse Blocked context onlyJul 9, 2026
- CausalDS: Benchmarking Causal Reasoning in Data-Science Agentsarxiv-2607.08093 Sparse Blocked context onlyJul 9, 2026
- What LLM Forecasters Know but Don't Say: Probing Internal Representations for Calibration and Faithfulnessarxiv-2607.08046 Sparse Blocked context onlyJul 9, 2026
- From Noisy Traces to Root Causes: Structural Trajectory Analysis and Causal Extraction for Agent Optimizationarxiv-2607.07702 Sparse Blocked context onlyJul 8, 2026
- Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoningarxiv-2607.07690 Sparse Blocked context onlyJul 8, 2026
- Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligencearxiv-2607.07675 Direct Blocked context onlyJul 8, 2026
- MedPMC: A Systematic Framework for Scaling High-Fidelity Medical Multimodal Data for Foundation Modelsarxiv-2607.07673 Sparse Blocked context onlyJul 8, 2026
- Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulationarxiv-2607.07608 Sparse Blocked context onlyJul 8, 2026
- Infinite Worlds with Versatile Interactionsarxiv-2607.07534 Direct Blocked context onlyJul 8, 2026
- Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learningarxiv-2607.07508 Sparse Blocked context onlyJul 8, 2026
- Length Penalties Make Chain-of-Thought Less Monitorablearxiv-2607.09786 Sparse Blocked context onlyJul 8, 2026
- Diagnosing and Calibrating Tool-Call Boundary Drift in Multi-Teacher On-Policy Distillationarxiv-2607.07050 Sparse Blocked context onlyJul 8, 2026
- UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemmaarxiv-2607.06987 Sparse Blocked context onlyJul 8, 2026
- Vision as Unified Multimodal Generationarxiv-2607.06560 Curated Related Blocked context onlyJul 7, 2026
- RynnWorld-4D: 4D Embodied World Models for Robotic Manipulationarxiv-2607.06559 Sparse Blocked context onlyJul 7, 2026