300 canonical paper links on this archive page.
- Crystalite: A Lightweight Transformer for Efficient Crystal Modelingarxiv-2604.02270 Sparse Blocked context onlyApr 2, 2026
- Answering the Wrong Question: Reasoning Trace Inversion for Abstention in LLMsarxiv-2604.02230 Sparse Blocked context onlyApr 2, 2026
- When to ASK: Uncertainty-Gated Language Assistance for Reinforcement Learningarxiv-2604.02226 Sparse Blocked context onlyApr 2, 2026
- Impact of Multimodal and Conversational AI on Learning Outcomes and Experiencearxiv-2604.02221 Sparse Blocked context onlyApr 2, 2026
- Towards Position-Robust Talent Recommendation via Large Language Modelsarxiv-2604.02200 Sparse Blocked context onlyApr 2, 2026
- Neuro-RIT: Neuron-Guided Instruction Tuning for Robust Retrieval-Augmented Language Modelarxiv-2604.02194 Sparse Blocked context onlyApr 2, 2026
- The Expert Strikes Back: Interpreting Mixture-of-Experts Language Models at Expert Levelarxiv-2604.02178 Sparse Blocked context onlyApr 2, 2026
- Adam's Law: Textual Frequency Law on Large Language Modelsarxiv-2604.02176 Sparse Blocked context onlyApr 2, 2026
- Quantifying Self-Preservation Bias in Large Language Modelsarxiv-2604.02174 Sparse Blocked context onlyApr 2, 2026
- MTI: A Behavior-Based Temperament Profiling System for AI Agentsarxiv-2604.02145 Sparse Blocked context onlyApr 2, 2026
- LLM-as-a-Judge for Time Series Explanationsarxiv-2604.02118 Sparse Blocked context onlyApr 2, 2026
- Reliable Control-Point Selection for Steering Reasoning in Large Language Modelsarxiv-2604.02113 Sparse Blocked context onlyApr 2, 2026
- Optimizing RAG Rerankers with LLM Feedback via Reinforcement Learningarxiv-2604.02091 Sparse Blocked context onlyApr 2, 2026
- Diff-KD: Diffusion-based Knowledge Distillation for Collaborative Perception under Corruptionsarxiv-2604.02061 Sparse Blocked context onlyApr 2, 2026
- ATBench: A Diverse and Realistic Trajectory Benchmark for Long-Horizon Agent Safetyarxiv-2604.02022 Direct Blocked context onlyApr 2, 2026
- $k$NNProxy: Efficient Training-Free Proxy Alignment for Black-Box Zero-Shot LLM-Generated Text Detectionarxiv-2604.02008 Sparse Blocked context onlyApr 2, 2026
- ProCeedRL: Process Critic with Exploratory Demonstration Reinforcement Learning for LLM Agentic Reasoningarxiv-2604.02006 Sparse Blocked context onlyApr 2, 2026
- SAFE: Stepwise Atomic Feedback for Error correction in Multi-hop Reasoningarxiv-2604.01993 Sparse Blocked context onlyApr 2, 2026
- RuleForge: Automated Generation and Validation for Web Vulnerability Detection at Scalearxiv-2604.01977 Sparse Blocked context onlyApr 2, 2026
- Ego-Grounding for Personalized Question-Answering in Egocentric Videosarxiv-2604.01966 Sparse Blocked context onlyApr 2, 2026
- Lifting Unlabeled Internet-level Data for 3D Scene Understandingarxiv-2604.01907 Sparse Blocked context onlyApr 2, 2026
- Bayesian Elicitation with LLMs: Model Size Helps, Extra "Reasoning" Doesn't Alwaysarxiv-2604.01896 Sparse Blocked context onlyApr 2, 2026
- PLOT: Enhancing Preference Learning via Optimal Transportarxiv-2604.01837 Sparse Blocked context onlyApr 2, 2026
- DEFT: Distribution-guided Efficient Fine-Tuning for Human Alignmentarxiv-2604.01787 Sparse Blocked context onlyApr 2, 2026
- DriveDreamer-Policy: A Geometry-Grounded World-Action Model for Unified Generation and Planningarxiv-2604.01765 Sparse Blocked context onlyApr 2, 2026
- FourierMoE: Fourier Mixture-of-Experts Adaptation of Large Language Modelsarxiv-2604.01762 Sparse Blocked context onlyApr 2, 2026
- LiveMathematicianBench: A Live Benchmark for Mathematician-Level Reasoning with Proof Sketchesarxiv-2604.01754 Sparse Blocked context onlyApr 2, 2026
- LiteInception: A Lightweight and Interpretable Deep Learning Framework for General Aviation Fault Diagnosisarxiv-2604.01725 Sparse Blocked context onlyApr 2, 2026
- Human-Guided Reasoning with Large Language Models for Vietnamese Speech Emotion Recognitionarxiv-2604.01711 Sparse Blocked context onlyApr 2, 2026
- Memory in the LLM Era: Modular Architectures and Strategies in a Unified Frameworkarxiv-2604.01707 Sparse Blocked context onlyApr 2, 2026
- Fragile Reasoning: A Mechanistic Analysis of LLM Sensitivity to Meaning-Preserving Perturbationsarxiv-2604.01639 Sparse Blocked context onlyApr 2, 2026
- OSCAR: Orchestrated Self-verification and Cross-path Refinementarxiv-2604.01624 Sparse Blocked context onlyApr 2, 2026
- Expert-Choice Routing Enables Adaptive Computation in Diffusion Language Modelsarxiv-2604.01622 Sparse Blocked context onlyApr 2, 2026
- DeltaMem: Towards Agentic Memory Management via Reinforcement Learningarxiv-2604.01560 Sparse Blocked context onlyApr 2, 2026
- Read More, Think More: Revisiting Observation Reduction for Web Agentsarxiv-2604.01535 Sparse Blocked context onlyApr 2, 2026
- Magic, Madness, Heaven, Sin: LLM Output Diversity is Everything, Everywhere, All at Oncearxiv-2604.01504 Sparse Blocked context onlyApr 2, 2026
- From SWE-ZERO to SWE-HERO: Execution-free to Execution-based Fine-tuning for Software Engineering Agentsarxiv-2604.01496 Sparse Blocked context onlyApr 2, 2026
- AgentSocialBench: Evaluating Privacy Risks in Human-Centered Agentic Social Networksarxiv-2604.01487 Sparse Blocked context onlyApr 1, 2026
- When Reward Hacking Rebounds: Understanding and Mitigating It with Representation-Level Signalsarxiv-2604.01476 Sparse Blocked context onlyApr 1, 2026
- Adaptive Stopping for Multi-Turn LLM Reasoningarxiv-2604.01413 Sparse Blocked context onlyApr 1, 2026
- Procedural Knowledge at Scale Improves Reasoningarxiv-2604.01348 Sparse Blocked context onlyApr 1, 2026
- Preference learning in shades of gray: Interpretable and bias-aware reward modeling for human preferencesarxiv-2604.01312 Sparse Blocked context onlyApr 1, 2026
- M2-Verify: A Large-Scale Multidomain Benchmark for Checking Multimodal Claim Consistencyarxiv-2604.01306 Sparse Blocked context onlyApr 1, 2026
- Scaling Reasoning Tokens via RL and Parallel Thinking: Evidence From Competitive Programmingarxiv-2604.01302 Sparse Blocked context onlyApr 1, 2026
- HippoCamp: Benchmarking Contextual Agents on Personal Computersarxiv-2604.01221 Sparse Blocked context onlyApr 1, 2026
- Universal YOCO for Efficient Depth Scalingarxiv-2604.01220 Sparse Blocked context onlyApr 1, 2026
- $\texttt{YC-Bench}$: Benchmarking AI Agents for Long-Term Planning and Consistent Executionarxiv-2604.01212 Sparse Blocked context onlyApr 1, 2026
- LLM REgression with a Latent Iterative State Headarxiv-2604.01206 Sparse Blocked context onlyApr 1, 2026
- Embarrassingly Simple Self-Distillation Improves Code Generationarxiv-2604.01193 Sparse Blocked context onlyApr 1, 2026
- True (VIS) Lies: Analyzing How Generative AI Recognizes Intentionality, Rhetoric, and Misleadingness in Visualization Liesarxiv-2604.01181 Sparse Blocked context onlyApr 1, 2026
- Online Reasoning Calibration: Test-Time Training Enables Generalizable Conformal LLM Reasoningarxiv-2604.01170 Sparse Blocked context onlyApr 1, 2026
- Brainstacks: Cross-Domain Cognitive Capabilities via Frozen MoE-LoRA Stacks for Continual LLM Learningarxiv-2604.01152 Sparse Blocked context onlyApr 1, 2026
- CARE: Privacy-Compliant Agentic Reasoning with Evidence Discordancearxiv-2604.01113 Sparse Blocked context onlyApr 1, 2026
- Uncertainty-Aware Variational Reward Factorization via Probabilistic Preference Bases for LLM Personalizationarxiv-2604.00997 Sparse Blocked context onlyApr 1, 2026
- Multimodal Analysis of State-Funded News Coverage of the Israel-Hamas War on YouTube Shortsarxiv-2604.00994 Sparse Blocked context onlyApr 1, 2026
- Dual Optimal: Make Your LLM Peer-like with Dignityarxiv-2604.00979 Sparse Blocked context onlyApr 1, 2026
- Benchmarking and Mechanistic Analysis of Vision-Language Models for Cross-Depiction Assembly Instruction Alignmentarxiv-2604.00913 Sparse Blocked context onlyApr 1, 2026
- Beyond Symbolic Solving: Multi Chain-of-Thought Voting for Geometric Reasoning in Large Language Modelsarxiv-2604.00890 Sparse Blocked context onlyApr 1, 2026
- PixelPrune: Pixel-Level Adaptive Visual Token Reduction via Predictive Codingarxiv-2604.00886 Sparse Blocked context onlyApr 1, 2026
- KUET at StanceNakba Shared Task: StanceMoE: Mixture-of-Experts Architecture for Stance Detectionarxiv-2604.00878 Sparse Blocked context onlyApr 1, 2026
- Agentic Tool Use in Large Language Modelsarxiv-2604.00835 Curated Related Blocked context onlyApr 1, 2026
- DVGT-2: Vision-Geometry-Action Model for Autonomous Driving at Scalearxiv-2604.00813 Direct Blocked context onlyApr 1, 2026
- Multimodal Language Models Cannot Spot Spatial Inconsistenciesarxiv-2604.00799 Sparse Blocked context onlyApr 1, 2026
- LangMARL: Natural Language Multi-Agent Reinforcement Learningarxiv-2604.00722 Sparse Blocked context onlyApr 1, 2026
- To Memorize or to Retrieve: Scaling Laws for RAG-Considerate Pretrainingarxiv-2604.00715 Sparse Blocked context onlyApr 1, 2026
- TRIMS: Trajectory-Ranked Instruction Masked Supervision for Diffusion Language Modelsarxiv-2604.00666 Sparse Blocked context onlyApr 1, 2026
- A Survey of On-Policy Distillation for Large Language Modelsarxiv-2604.00626 Sparse Blocked context onlyApr 1, 2026
- Speech LLMs are Contextual Reasoning Transcribersarxiv-2604.00610 Sparse Blocked context onlyApr 1, 2026
- More Human, More Efficient: Aligning Annotations with Quantized SLMsarxiv-2604.00586 Sparse Blocked context onlyApr 1, 2026
- Ontology-Constrained Neural Reasoning in Enterprise Agentic Systems: A Neurosymbolic Architecture for Domain-Grounded AI Agentsarxiv-2604.00555 Sparse Blocked context onlyApr 1, 2026
- MOON3.0: Reasoning-aware Multimodal Representation Learning for E-commerce Product Understandingarxiv-2604.00513 Sparse Blocked context onlyApr 1, 2026
- Adapting Text LLMs to Speech via Multimodal Depth Up-Scalingarxiv-2604.00489 Sparse Blocked context onlyApr 1, 2026
- Execution-Verified Reinforcement Learning for Optimization Modelingarxiv-2604.00442 Sparse Blocked context onlyApr 1, 2026
- TR-ICRL: Test-Time Rethinking for In-Context Reinforcement Learningarxiv-2604.00438 Sparse Blocked context onlyApr 1, 2026
- Locally Confident, Globally Stuck: The Quality-Exploration Dilemma in Diffusion Language Modelsarxiv-2604.00375 Sparse Blocked context onlyApr 1, 2026
- Signals: Trajectory Sampling and Triage for Agentic Interactionsarxiv-2604.00356 Sparse Blocked context onlyApr 1, 2026
- Agent Q-Mix: Selecting the Right Action for LLM Multi-Agent Systems through Reinforcement Learningarxiv-2604.00344 Sparse Blocked context onlyApr 1, 2026
- Large Language Models in the Abuse Detection Pipelinearxiv-2604.00323 Sparse Blocked context onlyMar 31, 2026
- Can Large Language Models Self-Correct in Medical Question Answering? An Exploratory Studyarxiv-2604.00261 Sparse Blocked context onlyMar 31, 2026
- A Taxonomy of Programming Languages for Code Generationarxiv-2604.00239 Sparse Blocked context onlyMar 31, 2026
- Do LLMs Know What Is Private Internally? Probing and Steering Contextual Privacy Norms in Large Language Model Representationsarxiv-2604.00209 Sparse Blocked context onlyMar 31, 2026
- Hierarchical Chain-of-Thought Prompting: Enhancing LLM Reasoning Performance and Efficiencyarxiv-2604.00130 Sparse Blocked context onlyMar 31, 2026
- Hierarchical Pre-Training of Vision Encoders with Large Language Modelsarxiv-2604.00086 Sparse Blocked context onlyMar 31, 2026
- One Panel Does Not Fit All: Case-Adaptive Multi-Agent Deliberation for Clinical Predictionarxiv-2604.00085 Sparse Blocked context onlyMar 31, 2026
- Cognitive Friction: A Decision-Theoretic Framework for Bounded Deliberation in Tool-Using Agentsarxiv-2603.30031 Sparse Blocked context onlyMar 31, 2026
- Less Is More? Selective Visual Attention to High-Importance Regions for Multimodal Radiology Summarizationarxiv-2603.29901 Sparse Blocked context onlyMar 31, 2026
- Training-Free Dynamic Upcycling of Expert Language Modelsarxiv-2603.29765 Sparse Blocked context onlyMar 31, 2026
- A Comprehensive Information-Decomposition Analysis of Large Vision-Language Modelsarxiv-2603.29676 Sparse Blocked context onlyMar 31, 2026
- Agenda-based Narrative Extraction: Steering Pathfinding Algorithms with Large Language Modelsarxiv-2603.29661 Sparse Blocked context onlyMar 31, 2026
- Learning Diagnostic Reasoning for Decision Support in Toxicologyarxiv-2603.29608 Sparse Blocked context onlyMar 31, 2026
- LLM Probe: Evaluating LLMs for Low-Resource Languagesarxiv-2603.29517 Sparse Blocked context onlyMar 31, 2026
- MemFactory: Unified Inference & Training Framework for Agent Memoryarxiv-2603.29493 Sparse Blocked context onlyMar 31, 2026
- M-MiniGPT4: Multilingual VLLM Alignment via Translated Dataarxiv-2603.29467 Sparse Blocked context onlyMar 31, 2026
- ELT-Bench-Verified: Benchmark Quality Issues Underestimate AI Agent Capabilitiesarxiv-2603.29399 Sparse Blocked context onlyMar 31, 2026
- Beyond Idealized Patients: Evaluating LLMs under Challenging Patient Behaviors in Medical Consultationsarxiv-2603.29373 Sparse Blocked context onlyMar 31, 2026
- Aligning Multimodal Sequential Recommendations via Robust Direct Preference Optimization with Sparse MoEarxiv-2603.29259 Sparse Blocked context onlyMar 31, 2026
- MemRerank: Preference Memory for Personalized Product Rerankingarxiv-2603.29247 Sparse Blocked context onlyMar 31, 2026
- Long-Document QA with Chain-of-Structured-Thought and Fine-Tuned SLMsarxiv-2603.29232 Sparse Blocked context onlyMar 31, 2026
- SyriSign: A Parallel Corpus for Arabic Text to Syrian Arabic Sign Language Translationarxiv-2603.29219 Sparse Blocked context onlyMar 31, 2026
- Xuanwu: Evolving General Multimodal Models into an Industrial-Grade Foundation for Content Ecosystemsarxiv-2603.29211 Sparse Blocked context onlyMar 31, 2026
- Dual Perspectives in Emotion Attribution: A Generator-Interpreter Framework for Cross-Cultural Analysis of Emotion in LLMsarxiv-2603.29077 Sparse Blocked context onlyMar 30, 2026
- Trojan-Speak: Bypassing Constitutional Classifiers with No Jailbreak Tax via Adversarial Finetuningarxiv-2603.29038 Sparse Blocked context onlyMar 30, 2026
- The Model Says Walk: How Surface Heuristics Override Implicit Constraints in LLM Reasoningarxiv-2603.29025 Sparse Blocked context onlyMar 30, 2026
- Human-Like Lifelong Memory: A Neuroscience-Grounded Architecture for Infinite Interactionarxiv-2603.29023 Sparse Blocked context onlyMar 30, 2026
- SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learningarxiv-2603.28730 Sparse Blocked context onlyMar 30, 2026
- Seeing with You: Perception-Reasoning Coevolution for Multimodal Reasoningarxiv-2603.28618 Sparse Blocked context onlyMar 30, 2026
- ResAdapt: Adaptive Resolution for Efficient Multimodal Reasoningarxiv-2603.28610 Sparse Blocked context onlyMar 30, 2026
- Moving Beyond Review: Applying Language Models to Planning and Translation in Reflectionarxiv-2603.28596 Sparse Blocked context onlyMar 30, 2026
- Courtroom-Style Multi-Agent Debate with Progressive RAG and Role-Switching for Controversial Claim Verificationarxiv-2603.28488 Sparse Blocked context onlyMar 30, 2026
- Kernel-Smith: A Unified Recipe for Evolutionary Kernel Optimizationarxiv-2603.28342 Sparse Blocked context onlyMar 30, 2026
- DongYuan: An LLM-Based Framework for Integrative Chinese and Western Medicine Spleen-Stomach Disorders Diagnosisarxiv-2603.28191 Sparse Blocked context onlyMar 30, 2026
- MOSS-VoiceGenerator: Create Realistic Voices with Natural Language Descriptionsarxiv-2603.28086 Sparse Blocked context onlyMar 30, 2026
- Efficient Inference of Large Vision Language Modelsarxiv-2603.27960 Sparse Blocked context onlyMar 30, 2026
- Top-down string-to-dependency Neural Machine Translationarxiv-2603.27938 Sparse Blocked context onlyMar 30, 2026
- ATLAS-RTC: Closing the Loop on LLM Agent Output with Token-Level Runtime Controlarxiv-2603.27905 Sparse Blocked context onlyMar 29, 2026
- EffiSkill: Agent Skill Based Automated Code Efficiency Optimizationarxiv-2603.27850 Sparse Blocked context onlyMar 29, 2026
- Model Capability Dominates: Inference-Time Optimization Lessons from AIMO 3arxiv-2603.27844 Sparse Blocked context onlyMar 29, 2026
- Q-Bridge: Code Translation for Quantum Machine Learning via LLMsarxiv-2603.27836 Sparse Blocked context onlyMar 29, 2026
- Improving Clinical Diagnosis with Counterfactual Multi-Agent Reasoningarxiv-2603.27820 Sparse Blocked context onlyMar 29, 2026
- KVSculpt: KV Cache Compression as Distillationarxiv-2603.27819 Sparse Blocked context onlyMar 29, 2026
- Conversational Agents and the Understanding of Human Language: Reflections on AI, LLMs, and Cognitive Sciencearxiv-2603.27809 Sparse Blocked context onlyMar 29, 2026
- Understanding Teacher Revisions of Large Language Model-Generated Feedbackarxiv-2603.27806 Sparse Blocked context onlyMar 29, 2026
- Emergent Social Intelligence Risks in Generative Multi-Agent Systemsarxiv-2603.27771 Sparse Blocked context onlyMar 29, 2026
- KAT-Coder-V2 Technical Reportarxiv-2603.27703 Sparse Blocked context onlyMar 29, 2026
- Can Large Language Models Simulate Human Cognition Beyond Behavioral Imitation?arxiv-2603.27694 Sparse Blocked context onlyMar 29, 2026
- PRBench: End-to-end Paper Reproduction in Physics Researcharxiv-2603.27646 Sparse Blocked context onlyMar 29, 2026
- LongCat-Next: Lexicalizing Modalities as Discrete Tokensarxiv-2603.27538 Direct Blocked context onlyMar 29, 2026
- Hidden Ads: Behavior Triggered Semantic Backdoors for Advertisement Injection in Vision Language Modelsarxiv-2603.27522 Sparse Blocked context onlyMar 29, 2026
- AgentSwing: Adaptive Parallel Context Management Routing for Long-Horizon Web Agentsarxiv-2603.27490 Sparse Blocked context onlyMar 29, 2026
- Multi-Agent Dialectical Refinement for Enhanced Argument Classificationarxiv-2603.27451 Sparse Blocked context onlyMar 29, 2026
- Improving Attributed Long-form Question Answering with Intent Awarenessarxiv-2603.27435 Sparse Blocked context onlyMar 28, 2026
- The Geometry of Harmful Intent: Training-Free Anomaly Detection via Angular Deviation in LLM Residual Streamsarxiv-2603.27412 Sparse Blocked context onlyMar 28, 2026
- Heterogeneous Debate Engine: Identity-Grounded Cognitive Architecture for Resilient LLM-Based Ethical Tutoringarxiv-2603.27404 Sparse Blocked context onlyMar 28, 2026
- PubMed Reasoner: Dynamic Reasoning-based Retrieval for Evidence-Grounded Biomedical Question Answeringarxiv-2603.27335 Sparse Blocked context onlyMar 28, 2026
- SACRED: A Faithful Annotated Multimedia Multimodal Multilingual Dataset for Classifying Connectedness Types in Online Spiritualityarxiv-2603.27331 Sparse Blocked context onlyMar 28, 2026
- Mitigating Hallucination on Hallucination in RAG via Ensemble Votingarxiv-2603.27253 Sparse Blocked context onlyMar 28, 2026
- Rethinking Easy-to-Hard: Limits of Curriculum Learning in Post-Training for Deductive Reasoningarxiv-2603.27226 Sparse Blocked context onlyMar 28, 2026
- daVinci-LLM:Towards the Science of Pretrainingarxiv-2603.27164 Curated Related Blocked context onlyMar 28, 2026
- Learning to Predict Future-Aligned Research Proposals with Language Modelsarxiv-2603.27146 Sparse Blocked context onlyMar 28, 2026
- ChartNet: A Million-Scale, High-Quality Multimodal Dataset for Robust Chart Understandingarxiv-2603.27064 Direct Blocked context onlyMar 28, 2026
- Debiasing Large Language Models toward Social Factors in Online Behavior Analytics through Prompt Knowledge Tuningarxiv-2603.27057 Sparse Blocked context onlyMar 28, 2026
- From Actions to Understanding: Conformal Interpretability of Temporal Concepts in LLM Agentsarxiv-2604.19775 Sparse Blocked context onlyMar 27, 2026
- The Last Fingerprint: How Markdown Training Shapes LLM Prosearxiv-2603.27006 Sparse Blocked context onlyMar 27, 2026
- Learning to Commit: Generating Organic Pull Requests via Online Repository Memoryarxiv-2603.26664 Sparse Blocked context onlyMar 27, 2026
- PerceptionComp: A Video Benchmark for Complex Perception-Centric Reasoningarxiv-2603.26653 Sparse Blocked context onlyMar 27, 2026
- JAL-Turn: Joint Acoustic-Linguistic Modeling for Real-Time and Robust Turn-Taking Detection in Full-Duplex Spoken Dialogue Systemsarxiv-2603.26515 Sparse Blocked context onlyMar 27, 2026
- ClimateCheck 2026: Scientific Fact-Checking and Disinformation Narrative Classification of Climate-related Claimsarxiv-2603.26449 Sparse Blocked context onlyMar 27, 2026
- CALRK-Bench: Evaluating Context-Aware Legal Reasoning in Korean Lawarxiv-2603.26332 Sparse Blocked context onlyMar 27, 2026
- From Human Cognition to Neural Activations: Probing the Computational Primitives of Spatial Reasoning in LLMsarxiv-2603.26323 Sparse Blocked context onlyMar 27, 2026
- Xpertbench: Expert Level Tasks with Rubrics-Based Evaluationarxiv-2604.02368 Sparse Blocked context onlyMar 27, 2026
- Ask or Assume? Uncertainty-Aware Clarification-Seeking in Coding Agentsarxiv-2603.26233 Sparse Blocked context onlyMar 27, 2026
- DataFlex: A Unified Framework for Data-Centric Dynamic Training of Large Language Modelsarxiv-2603.26164 Sparse Blocked context onlyMar 27, 2026
- Sustainable Hybrid Document-Routed Retrieval for Financial RAG: Resolving the Robustness-Precision Trade-offarxiv-2603.26815 Sparse Blocked context onlyMar 26, 2026
- Vega: Learning to Drive with Natural Language Instructionsarxiv-2603.25741 Sparse Blocked context onlyMar 26, 2026
- Training the Knowledge Base through Evidence Distillation and Write-Back Enrichmentarxiv-2603.25737 Sparse Blocked context onlyMar 26, 2026
- PackForcing: Short Video Training Suffices for Long Video Sampling and Long Context Inferencearxiv-2603.25730 Sparse Blocked context onlyMar 26, 2026
- R-C2: Cycle-Consistent Reinforcement Learning Improves Multimodal Reasoningarxiv-2603.25720 Sparse Blocked context onlyMar 26, 2026
- S2D2: Fast Decoding for Diffusion LLMs via Training-Free Self-Speculationarxiv-2603.25702 Sparse Blocked context onlyMar 26, 2026
- Self-Improvement of Large Language Models: A Technical Overview and Future Outlookarxiv-2603.25681 Sparse Blocked context onlyMar 26, 2026
- Is Mathematical Problem-Solving Expertise in Large Language Models Associated with Assessment Performance?arxiv-2603.25633 Sparse Blocked context onlyMar 26, 2026
- PICon: A Multi-Turn Interrogation Framework for Evaluating Persona Agent Consistencyarxiv-2603.25620 Sparse Blocked context onlyMar 26, 2026
- Demographic Fairness in Multimodal LLMs: A Benchmark of Gender and Ethnicity Bias in Face Verificationarxiv-2603.25613 Sparse Blocked context onlyMar 26, 2026
- Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixesarxiv-2603.25562 Direct Blocked context onlyMar 26, 2026
- EcoThink: A Green Adaptive Inference Framework for Sustainable and Accessible Agentsarxiv-2603.25498 Sparse Blocked context onlyMar 26, 2026
- Cross-Model Disagreement as a Label-Free Correctness Signalarxiv-2603.25450 Sparse Blocked context onlyMar 26, 2026
- From Manipulation to Mistrust: Explaining Diverse Micro-Video Misinformation for Robust Debunking in the Wildarxiv-2603.25423 Sparse Blocked context onlyMar 26, 2026
- Navigating the Prompt Space: Improving LLM Classification of Social Science Texts Through Prompt Engineeringarxiv-2603.25422 Sparse Blocked context onlyMar 26, 2026
- TAPO: Translation Augmented Policy Optimization for Multilingual Mathematical Reasoningarxiv-2603.25419 Sparse Blocked context onlyMar 26, 2026
- Beyond Content Safety: Real-Time Monitoring for Reasoning Vulnerabilities in Large Language Modelsarxiv-2603.25412 Sparse Blocked context onlyMar 26, 2026
- System Design for Maintaining Internal State Consistency in Long-Horizon Robotic Tabletop Gamesarxiv-2603.25405 Sparse Blocked context onlyMar 26, 2026
- Large Language Model as Token Compressor and Decompressorarxiv-2603.25340 Sparse Blocked context onlyMar 26, 2026
- AD-CARE: A Guideline-grounded, Modality-agnostic LLM Agent for Real-world Alzheimer's Disease Diagnosis with Multi-cohort Assessment, Fairness Analysis, and Reader Studyarxiv-2603.25322 Sparse Blocked context onlyMar 26, 2026
- Separate Before You Compress: The WWHO Tokenization Architecturearxiv-2603.25309 Sparse Blocked context onlyMar 26, 2026
- SliderQuant: Accurate Post-Training Quantization for LLMsarxiv-2603.25284 Sparse Blocked context onlyMar 26, 2026
- CRAFT: Grounded Multi-Agent Coordination Under Partial Informationarxiv-2603.25268 Sparse Blocked context onlyMar 26, 2026
- MolQuest: A Benchmark for Agentic Evaluation of Abductive Reasoning in Chemical Structure Elucidationarxiv-2603.25253 Sparse Blocked context onlyMar 26, 2026
- Probabilistic Concept Graph Reasoning for Multimodal Misinformation Detectionarxiv-2603.25203 Sparse Blocked context onlyMar 26, 2026
- Photon: Speedup Volume Understanding with Efficient Multimodal Large Language Modelsarxiv-2603.25155 Sparse Blocked context onlyMar 26, 2026
- OMIND: Framework for Knowledge Grounded Finetuning and Multi-Turn Dialogue Benchmark for Mental Health LLMsarxiv-2603.25105 Sparse Blocked context onlyMar 26, 2026
- An Explainable Ensemble Learning Framework for Crop Classification with Optimized Feature Pyramids and Deep Networksarxiv-2603.25070 Sparse Blocked context onlyMar 26, 2026
- TopoPilot: Reliable Conversational Workflow Automation for Topological Data Analysis and Visualizationarxiv-2603.25063 Sparse Blocked context onlyMar 26, 2026
- Closing the Confidence-Faithfulness Gap in Large Language Modelsarxiv-2603.25052 Sparse Blocked context onlyMar 26, 2026
- Intern-S1-Pro: Scientific Multimodal Foundation Model at Trillion Scalearxiv-2603.25040 Direct Blocked context onlyMar 26, 2026
- Can MLLMs Read Students' Minds? Unpacking Multimodal Error Analysis in Handwritten Matharxiv-2603.24961 Sparse Blocked context onlyMar 26, 2026
- Reaching Beyond the Mode: RL for Distributional Reasoning in Language Modelsarxiv-2603.24844 Sparse Blocked context onlyMar 25, 2026
- Prune as You Generate: Online Rollout Pruning for Faster and Better RLVRarxiv-2603.24840 Sparse Blocked context onlyMar 25, 2026
- MARCH: Multi-Agent Reinforced Self-Check for LLM Hallucinationarxiv-2603.24579 Sparse Blocked context onlyMar 25, 2026
- VFIG: Vectorizing Complex Figures in SVG with Vision-Language Modelsarxiv-2603.24575 Sparse Blocked context onlyMar 25, 2026
- Evaluating Chunking Strategies For Retrieval-Augmented Generation in Oil and Gas Enterprise Documentsarxiv-2603.24556 Sparse Blocked context onlyMar 25, 2026
- Representation Learning to Study Temporal Dynamics in Tutorial Scaffoldingarxiv-2603.24535 Sparse Blocked context onlyMar 25, 2026
- UI-Voyager: A Self-Evolving GUI Agent Learning via Failed Experiencearxiv-2603.24533 Sparse Blocked context onlyMar 25, 2026
- Multi-Agent Reasoning with Consistency Verification Improves Uncertainty Calibration in Medical MCQAarxiv-2603.24481 Sparse Blocked context onlyMar 25, 2026
- Mechanic: Sorrifier-Driven Formal Decomposition Workflow for Automated Theorem Provingarxiv-2603.24465 Sparse Blocked context onlyMar 25, 2026
- ClawKeeper: Comprehensive Safety Protection for OpenClaw Agents Through Skills, Plugins, and Watchersarxiv-2603.24414 Sparse Blocked context onlyMar 25, 2026
- PINGALA: Prosody-Aware Decoding for Sanskrit Poetry Generationarxiv-2603.24413 Sparse Blocked context onlyMar 25, 2026
- When AI Meets Early Childhood Education: Large Language Models as Assessment Teammates in Chinese Preschoolsarxiv-2603.24389 Sparse Blocked context onlyMar 25, 2026
- MolEvolve: LLM-Guided Evolutionary Search for Interpretable Molecular Optimizationarxiv-2603.24382 Sparse Blocked context onlyMar 25, 2026
- Large Language Model Guided Incentive Aware Reward Design for Cooperative Multi-Agent Reinforcement Learningarxiv-2603.24324 Sparse Blocked context onlyMar 25, 2026
- Semantic Alignment across Ancient Egyptian Language Stages via Normalization-Aware Multitask Learningarxiv-2603.24258 Sparse Blocked context onlyMar 25, 2026
- Invisible Threats from Model Context Protocol: Generating Stealthy Injection Payload via Tree-based Adaptive Searcharxiv-2603.24203 Sparse Blocked context onlyMar 25, 2026
- Alignment Reduces Expressed but Not Encoded Gender Bias: A Unified Framework and Studyarxiv-2603.24125 Sparse Blocked context onlyMar 25, 2026
- The Alignment Tax: Response Homogenization in Aligned LLMs and Its Implications for Uncertainty Estimationarxiv-2603.24124 Sparse Blocked context onlyMar 25, 2026
- LLMpedia: A Transparent Framework to Materialize an LLM's Encyclopedic Knowledge at Scalearxiv-2603.24080 Sparse Blocked context onlyMar 25, 2026
- Thinking with Tables: Enhancing Multi-Modal Tabular Understanding via Neuro-Symbolic Reasoningarxiv-2603.24004 Sparse Blocked context onlyMar 25, 2026
- The Price Reversal Phenomenon: When Cheaper Reasoning Models Cost Morearxiv-2603.23971 Sparse Blocked context onlyMar 25, 2026
- From AI Assistant to AI Scientist: Autonomous Discovery of LLM-RL Algorithms with LLM Agentsarxiv-2603.23951 Sparse Blocked context onlyMar 25, 2026
- OmniACBench: A Benchmark for Evaluating Context-Grounded Acoustic Control in Omni-Modal Modelsarxiv-2603.23938 Sparse Blocked context onlyMar 25, 2026
- Self-Distillation for Multi-Token Predictionarxiv-2603.23911 Sparse Blocked context onlyMar 25, 2026
- AnalogAgent: Self-Improving Analog Circuit Design Automation with LLM Agentsarxiv-2603.23910 Sparse Blocked context onlyMar 25, 2026
- DUPLEX: Agentic Dual-System Planning via LLM-Driven Information Extractionarxiv-2603.23909 Sparse Blocked context onlyMar 25, 2026
- SCoOP: Semantic Consistent Opinion Pooling for Uncertainty Quantification in Multiple Vision-Language Model Systemsarxiv-2603.23853 Sparse Blocked context onlyMar 25, 2026
- BeliefShift: Benchmarking Temporal Belief Consistency and Opinion Drift in LLM Agentsarxiv-2603.23848 Sparse Blocked context onlyMar 25, 2026
- Language Model Planners do not Scale, but do Formalizers?arxiv-2603.23844 Sparse Blocked context onlyMar 25, 2026
- VehicleMemBench: An Executable Benchmark for Multi-User Long-Term Memory in In-Vehicle Agentsarxiv-2603.23840 Sparse Blocked context onlyMar 25, 2026
- IslamicMMLU: A Benchmark for Evaluating LLMs on Islamic Knowledgearxiv-2603.23750 Sparse Blocked context onlyMar 24, 2026
- LLMs Do Not Grade Essays Like Humansarxiv-2603.23714 Sparse Blocked context onlyMar 24, 2026
- The Diminishing Returns of Early-Exit Decoding in Modern LLMsarxiv-2603.23701 Sparse Blocked context onlyMar 24, 2026
- Swiss-Bench SBP-002: A Frontier Model Comparison on Swiss Legal and Regulatory Tasksarxiv-2603.23646 Sparse Blocked context onlyMar 24, 2026
- Evaluating a Multi-Agent Voice-Enabled Smart Speaker for Care Homes: A Safety-Focused Frameworkarxiv-2603.23625 Sparse Blocked context onlyMar 24, 2026
- VISion On Request: Enhanced VLLM efficiency with sparse, dynamically selected, vision-language interactionsarxiv-2603.23495 Sparse Blocked context onlyMar 24, 2026
- SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planningarxiv-2603.23483 Sparse Blocked context onlyMar 24, 2026
- SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Schedulingarxiv-2603.23414 Sparse Blocked context onlyMar 24, 2026
- Off-Policy Value-Based Reinforcement Learning for Large Language Modelsarxiv-2603.23355 Sparse Blocked context onlyMar 24, 2026
- SafeSeek: Universal Attribution of Safety Circuits in Language Modelsarxiv-2603.23268 Sparse Blocked context onlyMar 24, 2026
- Is AI Catching Up to Human Expression? Exploring Emotion, Personality, Authorship, and Linguistic Style in English and Arabic with Six Large Language Modelsarxiv-2603.23251 Sparse Blocked context onlyMar 24, 2026
- Decoding AI Authorship: Can LLMs Truly Mimic Human Style Across Literature and Politics?arxiv-2603.23219 Sparse Blocked context onlyMar 24, 2026
- PersonalQ: Select, Quantize, and Serve Personalized Diffusion Models for Efficient Inferencearxiv-2603.22943 Sparse Blocked context onlyMar 24, 2026
- Optimizing Small Language Models for NL2SQL via Chain-of-Thought Fine-Tuningarxiv-2603.22942 Sparse Blocked context onlyMar 24, 2026
- The illusion of reasoning: step-level evaluation reveals decorative chain-of-thought in frontier language modelsarxiv-2603.22816 Sparse Blocked context onlyMar 24, 2026
- Language Models Can Explain Visual Features via Steeringarxiv-2603.22593 Sparse Blocked context onlyMar 23, 2026
- Lie to Me: How Faithful Is Chain-of-Thought Reasoning in Reasoning Models?arxiv-2603.22582 Curated Related Blocked context onlyMar 23, 2026
- CAPITU: A Benchmark for Evaluating Instruction-Following in Brazilian Portuguese with Literary Contextarxiv-2603.22576 Sparse Blocked context onlyMar 23, 2026
- Ego2Web: A Web Agent Benchmark Grounded in Egocentric Videosarxiv-2603.22529 Sparse Blocked context onlyMar 23, 2026
- Tiny Inference-Time Scaling with Latent Verifiersarxiv-2603.22492 Sparse Blocked context onlyMar 23, 2026
- LLM-guided headline rewriting for clickability enhancement without clickbaitarxiv-2603.22459 Sparse Blocked context onlyMar 23, 2026
- Sparse but Critical: A Token-Level Analysis of Distributional Shifts in RLVR Fine-Tuning of LLMsarxiv-2603.22446 Sparse Blocked context onlyMar 23, 2026
- WorldCache: Content-Aware Caching for Accelerated Video World Modelsarxiv-2603.22286 Sparse Blocked context onlyMar 23, 2026
- TiCo: Time-Controllable Training for Spoken Dialogue Modelsarxiv-2603.22267 Sparse Blocked context onlyMar 23, 2026
- From Static Templates to Dynamic Runtime Graphs: A Survey of Workflow Optimization for LLM Agentsarxiv-2603.22386 Sparse Blocked context onlyMar 23, 2026
- MemDLM: Memory-Enhanced DLM Trainingarxiv-2603.22241 Sparse Blocked context onlyMar 23, 2026
- Gumbel Distillation for Parallel Text Generationarxiv-2603.22216 Sparse Blocked context onlyMar 23, 2026
- Dual-Space Knowledge Distillation with Key-Query Matching for Large Language Models with Vocabulary Mismatcharxiv-2603.22056 Sparse Blocked context onlyMar 23, 2026
- SecureBreak -- A dataset towards safe and secure modelsarxiv-2603.21975 Sparse Blocked context onlyMar 23, 2026
- Demystifying Reinforcement Learning for Long-Horizon Tool-Using Agents: A Comprehensive Recipearxiv-2603.21972 Sparse Blocked context onlyMar 23, 2026
- Parameter-Efficient Fine-Tuning for Medical Text Summarization: A Comparative Study of Lora, Prompt Tuning, and Full Fine-Tuningarxiv-2603.21970 Sparse Blocked context onlyMar 23, 2026
- P^2O: Joint Policy and Prompt Optimizationarxiv-2603.21877 Sparse Blocked context onlyMar 23, 2026
- Manifold-Aware Exploration for Reinforcement Learning in Video Generationarxiv-2603.21872 Sparse Blocked context onlyMar 23, 2026
- Cycle Inverse-Consistent TransMorph: A Balanced Deep Learning Framework for Brain MRI Registrationarxiv-2603.21760 Sparse Blocked context onlyMar 23, 2026
- SemEval-2026 Task 12: Abductive Event Reasoning: Towards Real-World Event Causal Inference for Large Language Modelsarxiv-2603.21720 Sparse Blocked context onlyMar 23, 2026
- Rethinking Token Reduction for Large Vision-Language Modelsarxiv-2603.21701 Sparse Blocked context onlyMar 23, 2026
- Optimizing Multi-Agent Weather Captioning via Text Gradient Descent: A Training-Free Approach with Consensus-Aware Gradient Fusionarxiv-2603.21673 Sparse Blocked context onlyMar 23, 2026
- AgenticRec: End-to-End Tool-Integrated Policy Optimization for Ranking-Oriented Recommender Agentsarxiv-2603.21613 Sparse Blocked context onlyMar 23, 2026
- Riemannian Geometry Speaks Louder Than Words: From Graph Foundation Model to Next-Generation Graph Intelligencearxiv-2603.21601 Sparse Blocked context onlyMar 23, 2026
- Cerebra: A Multidisciplinary AI Board for Multimodal Dementia Characterization and Risk Assessmentarxiv-2603.21597 Sparse Blocked context onlyMar 23, 2026
- Spatio-Temporal Attention Enhanced Multi-Agent DRL for UAV-Assisted Wireless Networks with Limited Communicationsarxiv-2603.21594 Sparse Blocked context onlyMar 23, 2026
- Mind over Space: Can Multimodal Large Language Models Mentally Navigate?arxiv-2603.21577 Sparse Blocked context onlyMar 23, 2026
- PRISM: Breaking the O(n) Memory Wall in Long-Context LLM Inference via O(1) Photonic Block Selectionarxiv-2603.21576 Sparse Blocked context onlyMar 23, 2026
- Adaptive Robust Estimator for Multi-Agent Reinforcement Learningarxiv-2603.21574 Sparse Blocked context onlyMar 23, 2026
- Counterfactual Credit Policy Optimization for Multi-Agent Collaborationarxiv-2603.21563 Sparse Blocked context onlyMar 23, 2026
- What Do World Models Learn in RL? Probing Latent Representations in Learned Environment Simulatorsarxiv-2603.21546 Sparse Blocked context onlyMar 23, 2026
- SafePilot: A Framework for Assuring LLM-enabled Cyber-Physical Systemsarxiv-2603.21523 Sparse Blocked context onlyMar 23, 2026
- Efficient Failure Management for Multi-Agent Systems with Reasoning Trace Representationarxiv-2603.21522 Sparse Blocked context onlyMar 23, 2026
- Unified-MAS: Universally Generating Domain-Specific Nodes for Empowering Automatic Multi-Agent Systemsarxiv-2603.21475 Sparse Blocked context onlyMar 23, 2026
- Cross-Context Verification: Hierarchical Detection of Benchmark Contamination through Session-Isolated Analysisarxiv-2603.21454 Sparse Blocked context onlyMar 23, 2026
- KG-Hopper: Empowering Compact Open LLMs with Knowledge Graph Reasoning via Reinforcement Learningarxiv-2603.21440 Sparse Blocked context onlyMar 22, 2026
- LLM-Powered Workflow Optimization for Multidisciplinary Software Development: An Automotive Industry Case Studyarxiv-2603.21439 Sparse Blocked context onlyMar 22, 2026
- DomAgent: Leveraging Knowledge Graphs and Case-Based Reasoning for Domain-Specific Code Generationarxiv-2603.21430 Sparse Blocked context onlyMar 22, 2026
- PivotRL: High Accuracy Agentic Post-Training at Low Compute Costarxiv-2603.21383 Sparse Blocked context onlyMar 22, 2026
- A transformer architecture alteration to incentivise externalised reasoningarxiv-2603.21376 Sparse Blocked context onlyMar 22, 2026
- Cross-Family Speculative Decoding for Polish Language Models on Apple~Silicon: An Empirical Evaluation of Bielik~11B with UAG-Extended MLX-LMarxiv-2604.16368 Sparse Blocked context onlyMar 22, 2026
- AdaRubric: Task-Adaptive Rubrics for LLM Agent Evaluationarxiv-2603.21362 Direct Blocked context onlyMar 22, 2026
- RoboAlign: Learning Test-Time Reasoning for Language-Action Alignment in Vision-Language-Action Modelsarxiv-2603.21341 Sparse Blocked context onlyMar 22, 2026
- COINBench: Moving Beyond Individual Perspectives to Collective Intent Understandingarxiv-2603.21329 Sparse Blocked context onlyMar 22, 2026
- Improving Coherence and Persistence in Agentic AI for System Optimizationarxiv-2603.21321 Sparse Blocked context onlyMar 22, 2026
- Enhancing reasoning accuracy in large language models during inference timearxiv-2603.21301 Sparse Blocked context onlyMar 22, 2026
- More Than Sum of Its Parts: Deciphering Intent Shifts in Multimodal Hate Speech Detectionarxiv-2603.21298 Sparse Blocked context onlyMar 22, 2026
- When Models Judge Themselves: Unsupervised Self-Evolution for Multimodal Reasoningarxiv-2603.21289 Sparse Blocked context onlyMar 22, 2026
- WARBENCH: A Comprehensive Benchmark for Evaluating LLMs in Military Decision-Makingarxiv-2603.21280 Sparse Blocked context onlyMar 22, 2026
- Conversation Tree Architecture: A Structured Framework for Context-Aware Multi-Branch LLM Conversationsarxiv-2603.21278 Sparse Blocked context onlyMar 22, 2026
- Aggregation Alignment for Federated Learning with Mixture-of-Experts under Data Heterogeneityarxiv-2603.21276 Sparse Blocked context onlyMar 22, 2026
- The Library Theorem: How External Organization Governs Agentic Reasoning Capacityarxiv-2603.21272 Sparse Blocked context onlyMar 22, 2026
- Graph of States: Solving Abductive Tasks with Large Language Modelsarxiv-2603.21250 Sparse Blocked context onlyMar 22, 2026
- QMoP: Query Guided Mixture-of-Projector for Efficient Visual Token Compressionarxiv-2603.21232 Sparse Blocked context onlyMar 22, 2026
- When Convenience Becomes Risk: A Semantic View of Under-Specification in Host-Acting Agentsarxiv-2603.21231 Sparse Blocked context onlyMar 22, 2026
- ALMAB-DC: Active Learning, Multi-Armed Bandits, and Distributed Computing for Sequential Experimental Design and Black-Box Optimizationarxiv-2603.21180 Sparse Blocked context onlyMar 22, 2026
- SleepVLM: Explainable and Rule-Grounded Sleep Staging via a Vision-Language Modelarxiv-2603.26738 Sparse Blocked context onlyMar 22, 2026
- ReasonScaffold: A Scaffolded Reasoning-based Annotation Protocol for Human-AI Co-Annotationarxiv-2603.21094 Sparse Blocked context onlyMar 22, 2026
- Alignment Whack-a-Mole : Finetuning Activates Verbatim Recall of Copyrighted Books in Large Language Modelsarxiv-2603.20957 Sparse Blocked context onlyMar 21, 2026
- Clinical Cognition Alignment for Gastrointestinal Diagnosis with Multimodal LLMsarxiv-2603.20698 Sparse Blocked context onlyMar 21, 2026
- PAVE: Premise-Aware Validation and Editing for Retrieval-Augmented LLMsarxiv-2603.20673 Sparse Blocked context onlyMar 21, 2026
- Towards Intelligent Geospatial Data Discovery: a knowledge graph-driven multi-agent framework powered by large language modelsarxiv-2603.20670 Sparse Blocked context onlyMar 21, 2026
- MKA: Memory-Keyed Attention for Efficient Long-Context Reasoningarxiv-2603.20586 Sparse Blocked context onlyMar 21, 2026
- Permutation-Consensus Listwise Judging for Robust Factuality Evaluationarxiv-2603.20562 Sparse Blocked context onlyMar 20, 2026
- PersonaVLM: Long-Term Personalized Multimodal LLMsarxiv-2604.13074 Curated Related Blocked context onlyMar 20, 2026
- ReViSQL: Achieving Human-Level Text-to-SQLarxiv-2603.20004 Sparse Blocked context onlyMar 20, 2026
- When Contextual Inference Fails: Cancelability in Interactive Instruction Followingarxiv-2603.19997 Sparse Blocked context onlyMar 20, 2026
- Inducing Sustained Creativity and Diversity in Large Language Modelsarxiv-2603.19519 Sparse Blocked context onlyMar 19, 2026
- FinTradeBench: A Financial Reasoning Benchmark for LLMsarxiv-2603.19225 Sparse Blocked context onlyMar 19, 2026
- Nemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillationarxiv-2603.19220 Sparse Blocked context onlyMar 19, 2026
- Box Maze: A Process-Control Architecture for Reliable LLM Reasoningarxiv-2603.19182 Sparse Blocked context onlyMar 19, 2026