300 canonical paper links on this archive page.
- SOL-ExecBench: Speed-of-Light Benchmarking for Real-World GPU Kernels Against Hardware Limitsarxiv-2603.19173 Sparse Blocked context onlyMar 19, 2026
- ARIADNE: A Perception-Reasoning Synergy Framework for Trustworthy Coronary Angiography Analysisarxiv-2603.19169 Sparse Blocked context onlyMar 19, 2026
- Evaluating Counterfactual Strategic Reasoning in Large Language Modelsarxiv-2603.19167 Sparse Blocked context onlyMar 19, 2026
- cuGenOpt: A GPU-Accelerated General-Purpose Metaheuristic Framework for Combinatorial Optimizationarxiv-2603.19163 Sparse Blocked context onlyMar 19, 2026
- VEPO: Variable Entropy Policy Optimization for Low-Resource Language Foundation Modelsarxiv-2603.19152 Sparse Blocked context onlyMar 19, 2026
- D5P4: Partition Determinantal Point Process for Diversity in Parallel Discrete Diffusion Decodingarxiv-2603.19146 Sparse Blocked context onlyMar 19, 2026
- UGID: Unified Graph Isomorphism for Debiasing Large Language Modelsarxiv-2603.19144 Sparse Blocked context onlyMar 19, 2026
- How Uncertainty Estimation Scales with Sampling in Reasoning Modelsarxiv-2603.19118 Sparse Blocked context onlyMar 19, 2026
- CAMO: A Conditional Neural Solver for the Multi-objective Multiple Traveling Salesman Problemarxiv-2603.19074 Sparse Blocked context onlyMar 19, 2026
- Parallelograms Strike Back: LLMs Generate Better Analogies than Peoplearxiv-2603.19066 Sparse Blocked context onlyMar 19, 2026
- MoRI: Learning Motivation-Grounded Reasoning for Scientific Ideation in Large Language Modelsarxiv-2603.19044 Sparse Blocked context onlyMar 19, 2026
- What Really Controls Temporal Reasoning in Large Language Models: Tokenisation or Representation of Time?arxiv-2603.19017 Sparse Blocked context onlyMar 19, 2026
- Security awareness in LLM agents: the NDAI zone casearxiv-2603.19011 Sparse Blocked context onlyMar 19, 2026
- Hypothesis-Conditioned Query Rewriting for Decision-Useful Retrievalarxiv-2603.19008 Sparse Blocked context onlyMar 19, 2026
- AgentDS Technical Report: Benchmarking the Future of Human-AI Collaboration in Domain-Specific Data Sciencearxiv-2603.19005 Direct Blocked context onlyMar 19, 2026
- Evaluating 5W3H Structured Prompting for Intent Alignment in Human-AI Interactionarxiv-2603.18976 Sparse Blocked context onlyMar 19, 2026
- Entropy trajectory shape predicts LLM reasoning reliability: A diagnostic study of uncertainty dynamics in chain-of-thoughtarxiv-2603.18940 Sparse Blocked context onlyMar 19, 2026
- Characterizing Linear Alignment Across Language Modelsarxiv-2603.18908 Sparse Blocked context onlyMar 19, 2026
- I Can't Believe It's Corrupt: Evaluating Corruption in Multi-Agent Governance Systemsarxiv-2603.18894 Sparse Blocked context onlyMar 19, 2026
- Reasoning over mathematical objects: on-policy reward modeling and test time aggregationarxiv-2603.18886 Sparse Blocked context onlyMar 19, 2026
- Bridging Network Fragmentation: A Semantic-Augmented DRL Framework for UAV-aided VANETsarxiv-2603.18871 Sparse Blocked context onlyMar 19, 2026
- RewardFlow: Topology-Aware Reward Propagation on State Graphs for Agentic RL with Large Language Modelsarxiv-2603.18859 Sparse Blocked context onlyMar 19, 2026
- Motion-o: Trajectory-Grounded Video Reasoningarxiv-2603.18856 Sparse Blocked context onlyMar 19, 2026
- Mi:dm K 2.5 Proarxiv-2603.18788 Sparse Blocked context onlyMar 19, 2026
- Memento-Skills: Let Agents Design Agentsarxiv-2603.18743 Sparse Blocked context onlyMar 19, 2026
- CausalRM: Causal-Theoretic Reward Modeling for RLHF from Observational User Feedbacksarxiv-2603.18736 Sparse Blocked context onlyMar 19, 2026
- HISR: Hindsight Information Modulated Segmental Process Rewards For Multi-turn Agentic Reinforcement Learningarxiv-2603.18683 Sparse Blocked context onlyMar 19, 2026
- MOSAIC: Multi-Objective Slice-Aware Iterative Curation for Alignmentarxiv-2603.18637 Sparse Blocked context onlyMar 19, 2026
- Learning to Self-Evolvearxiv-2603.18620 Sparse Blocked context onlyMar 19, 2026
- Cross-Modal Rationale Transfer for Explainable Humanitarian Classification on Social Mediaarxiv-2603.18611 Sparse Blocked context onlyMar 19, 2026
- AutORAN: LLM-driven Natural Language Programming for Agile xApp Developmentarxiv-2603.18604 Sparse Blocked context onlyMar 19, 2026
- SpecForge: A Flexible and Efficient Open-Source Training Framework for Speculative Decodingarxiv-2603.18567 Direct Blocked context onlyMar 19, 2026
- UT-ACA: Uncertainty-Triggered Adaptive Context Allocation for Long-Context Inferencearxiv-2603.18446 Sparse Blocked context onlyMar 19, 2026
- TARo: Token-level Adaptive Routing for LLM Test-time Alignmentarxiv-2603.18411 Curated Related Blocked context onlyMar 19, 2026
- TopoChunker: Topology-Aware Agentic Document Chunking Frameworkarxiv-2603.18409 Sparse Blocked context onlyMar 19, 2026
- Unified Spatio-Temporal Token Scoring for Efficient Video VLMsarxiv-2603.18004 Sparse Blocked context onlyMar 18, 2026
- TDAD: Test-Driven Agentic Development - Reducing Code Regressions in AI Coding Agents via Graph-Based Impact Analysisarxiv-2603.17973 Sparse Blocked context onlyMar 18, 2026
- Efficient Training-Free Multi-Token Prediction via Embedding-Space Probingarxiv-2603.17942 Sparse Blocked context onlyMar 18, 2026
- IndicSafe: A Benchmark for Evaluating Multilingual LLM Safety in South Asiaarxiv-2603.17915 Sparse Blocked context onlyMar 18, 2026
- RAMP: Reinforcement Adaptive Mixed Precision Quantization for Efficient On Device LLM Inferencearxiv-2603.17891 Sparse Blocked context onlyMar 18, 2026
- Mitigating LLM Hallucinations through Domain-Grounded Tiered Retrievalarxiv-2603.17872 Sparse Blocked context onlyMar 18, 2026
- Text-to-Stage: Spatial Layouts from Long-form Narrativesarxiv-2603.17832 Sparse Blocked context onlyMar 18, 2026
- RPMS: Enhancing LLM-Based Embodied Planning through Rule-Augmented Memory Synergyarxiv-2603.17831 Sparse Blocked context onlyMar 18, 2026
- Process Supervision for Chain-of-Thought Reasoning via Monte Carlo Net Information Gainarxiv-2603.17815 Sparse Blocked context onlyMar 18, 2026
- Fine-Grained Post-Training Quantization for Large Vision Language Models with Quantization-Aware Integrated Gradientsarxiv-2603.17809 Sparse Blocked context onlyMar 18, 2026
- Governed Memory: A Production Architecture for Multi-Agent Workflowsarxiv-2603.17787 Sparse Blocked context onlyMar 18, 2026
- Facts as First Class Objects: Knowledge Objects for Persistent LLM Memoryarxiv-2603.17781 Sparse Blocked context onlyMar 18, 2026
- CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolutionarxiv-2603.17775 Sparse Blocked context onlyMar 18, 2026
- Post-Training Local LLM Agents for Linux Privilege Escalation with Verifiable Rewardsarxiv-2603.17673 Sparse Blocked context onlyMar 18, 2026
- VeriGrey: Greybox Agent Validationarxiv-2603.17639 Sparse Blocked context onlyMar 18, 2026
- Complementary Reinforcement Learningarxiv-2603.17621 Sparse Blocked context onlyMar 18, 2026
- VeriAgent: A Tool-Integrated Multi-Agent System with Evolving Memory for PPA-Aware RTL Code Generationarxiv-2603.17613 Sparse Blocked context onlyMar 18, 2026
- Inducing Epistemological Humility in Large Language Models: A Targeted SFT Approach to Reducing Hallucinationarxiv-2603.17504 Sparse Blocked context onlyMar 18, 2026
- Learning When to Attend: Conditional Memory Access for Long-Context LLMsarxiv-2603.17484 Sparse Blocked context onlyMar 18, 2026
- VirPro: Visual-referred Probabilistic Prompt Learning for Weakly-Supervised Monocular 3D Detectionarxiv-2603.17470 Sparse Blocked context onlyMar 18, 2026
- TRiMS: Real-Time Tracking of Minimal Sufficient Length for Efficient Reasoning via RLarxiv-2603.17449 Sparse Blocked context onlyMar 18, 2026
- InfoDensity: Rewarding Information-Dense Traces for Efficient Reasoningarxiv-2603.17310 Sparse Blocked context onlyMar 18, 2026
- Contrastive Reasoning Alignment: Reinforcement Learning from Hidden Representationsarxiv-2603.17305 Sparse Blocked context onlyMar 18, 2026
- SYMDIREC: A Neuro-Symbolic Divide-Retrieve-Conquer Framework for Enhanced RTL Synthesis and Summarizationarxiv-2603.17208 Sparse Blocked context onlyMar 17, 2026
- Ensemble Self-Training for Unsupervised Machine Translationarxiv-2603.17087 Sparse Blocked context onlyMar 17, 2026
- Online Experiential Learning for Language Modelsarxiv-2603.16856 Sparse Blocked context onlyMar 17, 2026
- Internalizing Agency from Reflective Experiencearxiv-2603.16843 Sparse Blocked context onlyMar 17, 2026
- Probing Cultural Signals in Large Language Models through Author Profilingarxiv-2603.16749 Direct Blocked context onlyMar 17, 2026
- IQuest-Coder-V1 Technical Reportarxiv-2603.16733 Sparse Blocked context onlyMar 17, 2026
- Fast-WAM: Do World Action Models Need Test-time Future Imagination?arxiv-2603.16666 Direct Blocked context onlyMar 17, 2026
- Omnilingual SONAR: Cross-Lingual and Cross-Modal Sentence Embeddings Bridging Massively Multilingual Text and Speecharxiv-2603.16606 Sparse Blocked context onlyMar 17, 2026
- AdaMem: Adaptive User-Centric Memory for Long-Horizon Dialogue Agentsarxiv-2603.16496 Sparse Blocked context onlyMar 17, 2026
- Capability-Guided Compression: Toward Interpretability-Aware Budget Allocation for Large Language Modelsarxiv-2603.16440 Sparse Blocked context onlyMar 17, 2026
- EngGPT2: Sovereign, Efficient and Open Intelligencearxiv-2603.16430 Sparse Blocked context onlyMar 17, 2026
- IndexRAG: Bridging Facts for Cross-Document Reasoning at Index Timearxiv-2603.16415 Sparse Blocked context onlyMar 17, 2026
- RECOVER: Robust Entity Correction via agentic Orchestration of hypothesis Variants for Evidence-based Recoveryarxiv-2603.16411 Sparse Blocked context onlyMar 17, 2026
- Fanar 2.0: Arabic Generative AI Stackarxiv-2603.16397 Sparse Blocked context onlyMar 17, 2026
- Offline Exploration-Aware Fine-Tuning for Long-Chain Mathematical Reasoningarxiv-2603.16206 Sparse Blocked context onlyMar 17, 2026
- Are Large Language Models Truly Smarter Than Humans?arxiv-2603.16197 Sparse Blocked context onlyMar 17, 2026
- Structured Semantic Cloaking for Jailbreak Attacks on Large Language Modelsarxiv-2603.16192 Sparse Blocked context onlyMar 17, 2026
- Parametric Social Identity Injection and Diversification in Public Opinion Simulationarxiv-2603.16142 Sparse Blocked context onlyMar 17, 2026
- SIA: A Synthesize-Inject-Align Framework for Knowledge-Grounded and Secure E-commerce Search LLMs with Industrial Deploymentarxiv-2603.16137 Sparse Blocked context onlyMar 17, 2026
- Understanding Moral Reasoning Trajectories in Large Language Models: Toward Probing-Based Explainabilityarxiv-2603.16017 Sparse Blocked context onlyMar 16, 2026
- BanglaSocialBench: A Benchmark for Evaluating Sociopragmatic and Cultural Alignment of LLMs in Bangladeshi Social Interactionarxiv-2603.15949 Sparse Blocked context onlyMar 16, 2026
- Persona-Conditioned Risk Behavior in Large Language Models: A Simulated Gambling Study with GPT-4.1arxiv-2603.15831 Sparse Blocked context onlyMar 16, 2026
- OpenSeeker: Democratizing Frontier Search Agents by Fully Open-Sourcing Training Dataarxiv-2603.15594 Direct Blocked context onlyMar 16, 2026
- NV-Bench: Benchmark of Nonverbal Vocalization Synthesis for Expressive Text-to-Speech Generationarxiv-2603.15352 Sparse Blocked context onlyMar 16, 2026
- To See is Not to Master: Teaching LLMs to Use Private Libraries for Code Generationarxiv-2603.15159 Curated Related Blocked context onlyMar 16, 2026
- Thinking in Latents: Adaptive Anchor Refinement for Implicit Reasoning in LLMsarxiv-2603.15051 Sparse Blocked context onlyMar 16, 2026
- RS-WorldModel: a Unified Model for Remote Sensing Understanding and Future Sense Forecastingarxiv-2603.14941 Sparse Blocked context onlyMar 16, 2026
- LLM as Graph Kernel: Rethinking Message Passing on Text-Rich Graphsarxiv-2603.14937 Sparse Blocked context onlyMar 16, 2026
- ExPosST: Explicit Positioning with Adaptive Masking for LLM-Based Simultaneous Machine Translationarxiv-2603.14903 Sparse Blocked context onlyMar 16, 2026
- Decision-Level Ordinal Modeling for Multimodal Essay Scoring with Large Language Modelsarxiv-2603.14891 Sparse Blocked context onlyMar 16, 2026
- Shopping Companion: A Memory-Augmented LLM Agent for Real-World E-Commerce Tasksarxiv-2603.14864 Sparse Blocked context onlyMar 16, 2026
- The Impact of Ideological Discourses in RAG: A Case Study with COVID-19 Treatmentsarxiv-2603.14838 Sparse Blocked context onlyMar 16, 2026
- RAZOR: Ratio-Aware Layer Editing for Targeted Unlearning in Vision Transformers and Diffusion Modelsarxiv-2603.14819 Sparse Blocked context onlyMar 16, 2026
- Universe Routing: Why Self-Evolving Agents Need Epistemic Controlarxiv-2603.14799 Sparse Blocked context onlyMar 16, 2026
- OpenHospital: A Thing-in-itself Arena for Evolving and Benchmarking LLM-based Collective Intelligencearxiv-2603.14771 Sparse Blocked context onlyMar 16, 2026
- POLCA: Stochastic Generative Optimization with LLMarxiv-2603.14769 Sparse Blocked context onlyMar 16, 2026
- BrainBench: Exposing the Commonsense Reasoning Gap in Large Language Modelsarxiv-2603.14761 Sparse Blocked context onlyMar 16, 2026
- GameUIAgent: An LLM-Powered Framework for Automated Game UI Design with Structured Intermediate Representationarxiv-2603.14724 Sparse Blocked context onlyMar 16, 2026
- Beyond Creed: A Non-Identity Safety Condition A Strong Empirical Alternative to Identity Framing in Low-Data LoRA Fine-Tuningarxiv-2603.14723 Sparse Blocked context onlyMar 16, 2026
- Towards Next-Generation LLM Training: From the Data-Centric Perspectivearxiv-2603.14712 Curated Related Blocked context onlyMar 16, 2026
- Beyond Local Code Optimization: Multi-Agent Reasoning for Software System Optimizationarxiv-2603.14703 Sparse Blocked context onlyMar 16, 2026
- Argumentation for Explainable and Globally Contestable Decision Support with LLMsarxiv-2603.14643 Sparse Blocked context onlyMar 15, 2026
- Nudging Hidden States: Training-Free Model Steering for Chain-of-Thought Reasoning in Large Audio-Language Modelsarxiv-2603.14636 Sparse Blocked context onlyMar 15, 2026
- PA3: Policy-Aware Agent Alignment through Chain-of-Thoughtarxiv-2603.14602 Sparse Blocked context onlyMar 15, 2026
- Parameter-Efficient Quality Estimation via Frozen Recursive Modelsarxiv-2603.14593 Sparse Blocked context onlyMar 15, 2026
- CausalEvolve: Towards Open-Ended Discovery with Causal Scratchpadarxiv-2603.14575 Sparse Blocked context onlyMar 15, 2026
- MALicious INTent Dataset and Inoculating LLMs for Enhanced Disinformation Detectionarxiv-2603.14525 Sparse Blocked context onlyMar 15, 2026
- CangjieBench: Benchmarking LLMs on a Low-Resource General-Purpose Programming Languagearxiv-2603.14501 Sparse Blocked context onlyMar 15, 2026
- Fine-tuning MLLMs Without Forgetting Is Easier Than You Thinkarxiv-2603.14493 Sparse Blocked context onlyMar 15, 2026
- Infinite Problem Generator: Verifiably Scaling Physics Reasoning Data with Agentic Workflowsarxiv-2603.14486 Sparse Blocked context onlyMar 15, 2026
- AI Can Learn Scientific Tastearxiv-2603.14473 Direct Blocked context onlyMar 15, 2026
- An Industrial-Scale Insurance LLM Achieving Verifiable Domain Mastery and Hallucination Control without Competence Trade-offsarxiv-2603.14463 Sparse Blocked context onlyMar 15, 2026
- Distilling Reasoning Without Knowledge: A Framework for Reliable LLMsarxiv-2603.14458 Sparse Blocked context onlyMar 15, 2026
- PARSA-Bench: A Comprehensive Persian Audio-Language Model Benchmarkarxiv-2603.14456 Direct Blocked context onlyMar 15, 2026
- Questionnaire Responses Do not Capture the Safety of AI Agentsarxiv-2603.14417 Sparse Blocked context onlyMar 15, 2026
- Extending Minimal Pairs with Ordinal Surprisal Curves and Entropy Across Applied Domainsarxiv-2603.14400 Sparse Blocked context onlyMar 15, 2026
- ECG-Reasoning-Benchmark: A Benchmark for Evaluating Clinical Reasoning Capabilities in ECG Interpretationarxiv-2603.14326 Sparse Blocked context onlyMar 15, 2026
- Mind the Shift: Decoding Monetary Policy Stance from FOMC Statements with Large Language Modelsarxiv-2603.14313 Sparse Blocked context onlyMar 15, 2026
- SemantiCache: Efficient KV Cache Compression via Semantic Chunking and Clustered Mergingarxiv-2603.14303 Sparse Blocked context onlyMar 15, 2026
- Seeking Physics in Diffusion Noisearxiv-2603.14294 Sparse Blocked context onlyMar 15, 2026
- MedPriv-Bench: Benchmarking the Privacy-Utility Trade-off of Large Language Models in Medical Open-End Question Answeringarxiv-2603.14265 Sparse Blocked context onlyMar 15, 2026
- Automatic Inter-document Multi-hop Scientific QA Generationarxiv-2603.14257 Sparse Blocked context onlyMar 15, 2026
- Why Do LLM-based Web Agents Fail? A Hierarchical Planning Perspectivearxiv-2603.14248 Sparse Blocked context onlyMar 15, 2026
- MMOU: A Massive Multi-Task Omni Understanding and Reasoning Benchmark for Long and Complex Real-World Videosarxiv-2603.14145 Sparse Blocked context onlyMar 14, 2026
- Understanding the Emergence of Seemingly Useless Features in Next-Token Predictorsarxiv-2603.14087 Sparse Blocked context onlyMar 14, 2026
- The Reasoning Bottleneck in Graph-RAG: Structured Prompting and Context Compression for Multi-Hop QAarxiv-2603.14045 Sparse Blocked context onlyMar 14, 2026
- Supervised Fine-Tuning versus Reinforcement Learning: A Study of Post-Training Methods for Large Language Modelsarxiv-2603.13985 Sparse Blocked context onlyMar 14, 2026
- FLUX: Data Worth Training Onarxiv-2603.13972 Sparse Blocked context onlyMar 14, 2026
- ToolFlood: Beyond Selection -- Hiding Valid Tools from LLM Agents via Semantic Coveringarxiv-2603.13950 Sparse Blocked context onlyMar 14, 2026
- OmniCompliance-100K: A Multi-Domain, Rule-Grounded, Real-World Safety Compliance Datasetarxiv-2603.13933 Sparse Blocked context onlyMar 14, 2026
- Step-CoT: Stepwise Visual Chain-of-Thought for Medical Visual Question Answeringarxiv-2603.13878 Direct Blocked context onlyMar 14, 2026
- GradMem: Learning to Write Context into Memory with Test-Time Gradient Descentarxiv-2603.13875 Sparse Blocked context onlyMar 14, 2026
- APEX-Searcher: Augmenting LLMs' Search Capabilities through Agentic Planning and Executionarxiv-2603.13853 Sparse Blocked context onlyMar 14, 2026
- DeceptGuard :A Constitutional Oversight Framework For Detecting Deception in LLM Agentsarxiv-2603.13791 Sparse Blocked context onlyMar 14, 2026
- Greedy Information Projection for LLM Data Selectionarxiv-2603.13790 Sparse Blocked context onlyMar 14, 2026
- Knowledge Distillation for Large Language Modelsarxiv-2603.13765 Sparse Blocked context onlyMar 14, 2026
- Can We Trust LLMs on Memristors? Diving into Reasoning Ability under Non-Idealityarxiv-2603.13725 Sparse Blocked context onlyMar 14, 2026
- SAATT Nav: a Socially Aware Autonomous Transparent Transportation Navigation Framework for Wheelchairsarxiv-2603.13698 Sparse Blocked context onlyMar 14, 2026
- NCCL EP: Towards a Unified Expert Parallel Communication API for NCCLarxiv-2603.13606 Sparse Blocked context onlyMar 13, 2026
- PrefPO: Pairwise Preference Prompt Optimizationarxiv-2603.19311 Sparse Blocked context onlyMar 13, 2026
- Semantic Invariance in Agentic AIarxiv-2603.13173 Sparse Blocked context onlyMar 13, 2026
- Beyond Final Answers: CRYSTAL Benchmark for Transparent Multimodal Reasoning Evaluationarxiv-2603.13099 Sparse Blocked context onlyMar 13, 2026
- daVinci-Env: Open SWE Environment Synthesis at Scalearxiv-2603.13023 Sparse Blocked context onlyMar 13, 2026
- Efficient and Interpretable Multi-Agent LLM Routing via Ant Colony Optimizationarxiv-2603.12933 Sparse Blocked context onlyMar 13, 2026
- I Know What I Don't Know: Latent Posterior Factor Models for Multi-Evidence Probabilistic Reasoningarxiv-2603.15670 Sparse Blocked context onlyMar 13, 2026
- Adaptive Vision-Language Model Routing for Computer Use Agentsarxiv-2603.12823 Sparse Blocked context onlyMar 13, 2026
- Altered Thoughts, Altered Actions: Probing Chain-of-Thought Vulnerabilities in VLA Robotic Manipulationarxiv-2603.12717 Sparse Blocked context onlyMar 13, 2026
- AI Planning Framework for LLM-Based Web Agentsarxiv-2603.12710 Sparse Blocked context onlyMar 13, 2026
- Cost-Efficient Multimodal LLM Inference via Cross-Tier GPU Heterogeneityarxiv-2603.12707 Curated Related Blocked context onlyMar 13, 2026
- FGTR: Fine-Grained Multi-Table Retrieval via Hierarchical LLM Reasoningarxiv-2603.12702 Sparse Blocked context onlyMar 13, 2026
- EvolveCoder: Evolving Test Cases via Adversarial Verification for Code Reinforcement Learningarxiv-2603.12698 Sparse Blocked context onlyMar 13, 2026
- AgentDrift: Unsafe Recommendation Drift Under Tool Corruption Hidden by Ranking Metrics in LLM Agentsarxiv-2603.12564 Sparse Blocked context onlyMar 13, 2026
- Spatio-Semantic Expert Routing Architecture with Mixture-of-Experts for Referring Image Segmentationarxiv-2603.12538 Sparse Blocked context onlyMar 13, 2026
- LLM BiasScope: A Real-Time Bias Analysis Platform for Comparative LLM Evaluationarxiv-2603.12522 Sparse Blocked context onlyMar 12, 2026
- Red-Teaming Vision-Language-Action Models via Quality Diversity Prompt Generation for Robust Robot Policiesarxiv-2603.12510 Sparse Blocked context onlyMar 12, 2026
- Shattering the Shortcut: A Topology-Regularized Benchmark for Multi-hop Medical Reasoning in LLMsarxiv-2603.12458 Sparse Blocked context onlyMar 12, 2026
- CSE-UOI at SemEval-2026 Task 6: A Two-Stage Heterogeneous Ensemble with Deliberative Complexity Gating for Political Evasion Detectionarxiv-2603.12453 Sparse Blocked context onlyMar 12, 2026
- NeuroLoRA: Context-Aware Neuromodulation for Parameter-Efficient Multi-Task Adaptationarxiv-2603.12378 Sparse Blocked context onlyMar 12, 2026
- Multi-Step Semantic Reasoning in Generative Retrievalarxiv-2603.12368 Sparse Blocked context onlyMar 12, 2026
- EndoCoT: Scaling Endogenous Chain-of-Thought Reasoning in Diffusion Modelsarxiv-2603.12252 Direct Blocked context onlyMar 12, 2026
- Sparking Scientific Creativity via LLM-Driven Interdisciplinary Inspirationarxiv-2603.12226 Sparse Blocked context onlyMar 12, 2026
- IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reusearxiv-2603.12201 Sparse Blocked context onlyMar 12, 2026
- Long-Context Encoder Models for Polish Language Understandingarxiv-2603.12191 Sparse Blocked context onlyMar 12, 2026
- BehaviorVLM: Unified Finetuning-Free Behavioral Understanding with Vision-Language Reasoningarxiv-2603.12176 Sparse Blocked context onlyMar 12, 2026
- QAQ: Bidirectional Semantic Coherence for Selecting High-Quality Synthetic Code Instructionsarxiv-2603.12165 Sparse Blocked context onlyMar 12, 2026
- GlyphBanana: Advancing Precise Text Rendering Through Agentic Workflowsarxiv-2603.12155 Sparse Blocked context onlyMar 12, 2026
- Automatic Generation of High-Performance RL Environmentsarxiv-2603.12145 Sparse Blocked context onlyMar 12, 2026
- TopoBench: Benchmarking LLMs on Hard Topological Reasoningarxiv-2603.12133 Sparse Blocked context onlyMar 12, 2026
- Increasing intelligence in AI agents can worsen collective outcomesarxiv-2603.12129 Sparse Blocked context onlyMar 12, 2026
- Cross-Context Review: Improving LLM Output Quality by Separating Production and Review Sessionsarxiv-2603.12123 Sparse Blocked context onlyMar 12, 2026
- On Information Self-Locking in Reinforcement Learning for Active Reasoning of LLM agentsarxiv-2603.12109 Sparse Blocked context onlyMar 12, 2026
- Resource-Efficient Iterative LLM-Based NAS with Feedback Memoryarxiv-2603.12091 Sparse Blocked context onlyMar 12, 2026
- LABSHIELD: A Multimodal Benchmark for Safety-Critical Reasoning and Planning in Scientific Laboratoriesarxiv-2603.11987 Sparse Blocked context onlyMar 12, 2026
- Think While Watching: Online Streaming Segment-Level Memory for Multi-Turn Video Reasoning in Multimodal Large Language Modelsarxiv-2603.11896 Sparse Blocked context onlyMar 12, 2026
- Bielik-Minitron-7B: Compressing Large Language Models via Structured Pruning and Knowledge Distillation for the Polish Languagearxiv-2603.11881 Sparse Blocked context onlyMar 12, 2026
- From Control to Foresight: Simulation as a New Paradigm for Human-Agent Collaborationarxiv-2603.11677 Sparse Blocked context onlyMar 12, 2026
- Multi-Task Reinforcement Learning for Enhanced Multimodal LLM-as-a-Judgearxiv-2603.11665 Sparse Blocked context onlyMar 12, 2026
- Nuanced Emotion Recognition Based on a Segment-based MLLM Framework Leveraging Qwen3-Omni for AH Detectionarxiv-2603.13406 Sparse Blocked context onlyMar 12, 2026
- Performance Evaluation of Open-Source Large Language Models for Assisting Pathology Report Writing in Japanesearxiv-2603.11597 Sparse Blocked context onlyMar 12, 2026
- Streaming Translation and Transcription Through Speech-to-Text Causal Alignmentarxiv-2603.11578 Sparse Blocked context onlyMar 12, 2026
- Where Matters More Than What: Decoding-aligned KV Cache Compression via Position-aware Pseudo Queriesarxiv-2603.11564 Sparse Blocked context onlyMar 12, 2026
- Try, Check and Retry: A Divide-and-Conquer Framework for Boosting Long-context Tool-Calling Performance of LLMsarxiv-2603.11495 Sparse Blocked context onlyMar 12, 2026
- BLooP: Zero-Shot Abstractive Summarization using Large Language Models with Bigram Lookahead Promotionarxiv-2603.11415 Sparse Blocked context onlyMar 12, 2026
- Speak or Stay Silent: Context-Aware Turn-Taking in Multi-Party Dialoguearxiv-2603.11409 Sparse Blocked context onlyMar 12, 2026
- Stop Listening to Me! How Multi-turn Conversations Can Degrade Diagnostic Reasoningarxiv-2603.11394 Sparse Blocked context onlyMar 12, 2026
- Evaluating Explainable AI Attribution Methods in Neural Machine Translation via Attention-Guided Knowledge Distillationarxiv-2603.11342 Sparse Blocked context onlyMar 11, 2026
- COMPASS: The explainable agentic framework for Sovereignty, Sustainability, Compliance, and Ethicsarxiv-2603.11277 Sparse Blocked context onlyMar 11, 2026
- LLMs Can Infer Political Alignment from Online Conversationsarxiv-2603.11253 Sparse Blocked context onlyMar 11, 2026
- Markovian Generation Chains in Large Language Modelsarxiv-2603.11228 Sparse Blocked context onlyMar 11, 2026
- DeReason: A Difficulty-Aware Curriculum Improves Decoupled SFT-then-RL Training for General Reasoningarxiv-2603.11193 Sparse Blocked context onlyMar 11, 2026
- COMIC: Agentic Sketch Comedy Generationarxiv-2603.11048 Sparse Blocked context onlyMar 11, 2026
- Instruction set for the representation of graphsarxiv-2603.11039 Sparse Blocked context onlyMar 11, 2026
- GroundCount: Grounding Vision-Language Models with Object Detection for Mitigating Counting Hallucinationsarxiv-2603.10978 Curated Related Blocked context onlyMar 11, 2026
- WebWeaver: Breaking Topology Confidentiality in LLM Multi-Agent Systems with Stealthy Context-Based Inferencearxiv-2603.11132 Sparse Blocked context onlyMar 11, 2026
- LLM2Vec-Gen: Generative Embeddings from Large Language Modelsarxiv-2603.10913 Sparse Blocked context onlyMar 11, 2026
- A Hybrid Knowledge-Grounded Framework for Safety and Traceability in Prescription Verificationarxiv-2603.10891 Sparse Blocked context onlyMar 11, 2026
- Dynamics-Predictive Sampling for Active RL Finetuning of Large Reasoning Modelsarxiv-2603.10887 Sparse Blocked context onlyMar 11, 2026
- Continuous Diffusion Transformers for Designing Synthetic Regulatory Elementsarxiv-2603.10885 Sparse Blocked context onlyMar 11, 2026
- From Images to Words: Efficient Cross-Modal Knowledge Distillation to Language Models from Black-box Teachersarxiv-2603.10877 Sparse Blocked context onlyMar 11, 2026
- GRACE: A Unified 2D Multi-Robot Path Planning Simulator & Benchmark for Grid, Roadmap, And Continuous Environmentsarxiv-2603.10858 Sparse Blocked context onlyMar 11, 2026
- Towards Cold-Start Drafting and Continual Refining: A Value-Driven Memory Approach with Application to NPU Kernel Synthesisarxiv-2603.10846 Sparse Blocked context onlyMar 11, 2026
- Nurture-First Agent Development: Building Domain-Expert AI Agents Through Conversational Knowledge Crystallizationarxiv-2603.10808 Sparse Blocked context onlyMar 11, 2026
- Risk-Adjusted Harm Scoring for Automated Red Teaming for LLMs in Financial Servicesarxiv-2603.10807 Sparse Blocked context onlyMar 11, 2026
- Word Recovery in Large Language Models Enables Character-Level Tokenization Robustnessarxiv-2603.10771 Sparse Blocked context onlyMar 11, 2026
- HeartAgent: An Autonomous Agent System for Explainable Differential Diagnosis in Cardiologyarxiv-2603.10764 Sparse Blocked context onlyMar 11, 2026
- Towards Robust Speech Deepfake Detection via Human-Inspired Reasoningarxiv-2603.10725 Sparse Blocked context onlyMar 11, 2026
- Structured Linked Data as a Memory Layer for Agent-Orchestrated Retrievalarxiv-2603.10700 Sparse Blocked context onlyMar 11, 2026
- Emulating Clinician Cognition via Self-Evolving Deep Clinical Researcharxiv-2603.10677 Sparse Blocked context onlyMar 11, 2026
- Does LLM Alignment Really Need Diversity? An Empirical Study of Adapting RLVR Methods for Moral Reasoningarxiv-2603.10588 Sparse Blocked context onlyMar 11, 2026
- CUAAudit: Meta-Evaluation of Vision-Language Models as Auditors of Autonomous Computer-Use Agentsarxiv-2603.10577 Sparse Blocked context onlyMar 11, 2026
- End-to-End Chatbot Evaluation with Adaptive Reasoning and Uncertainty Filteringarxiv-2603.10570 Sparse Blocked context onlyMar 11, 2026
- Tackling Length Inflation Without Trade-offs: Group Relative Reward Rescaling for Reinforcement Learningarxiv-2603.10535 Sparse Blocked context onlyMar 11, 2026
- IH-Challenge: A Training Dataset to Improve Instruction Hierarchy on Frontier LLMsarxiv-2603.10521 Direct Blocked context onlyMar 11, 2026
- PEEM: Prompt Engineering Evaluation Metrics for Interpretable Joint Evaluation of Prompts and Responsesarxiv-2603.10477 Sparse Blocked context onlyMar 11, 2026
- Learning to Negotiate: Multi-Agent Deliberation for Collective Value Alignment in LLMsarxiv-2603.10476 Sparse Blocked context onlyMar 11, 2026
- Aligning Large Language Models with Searcher Preferencesarxiv-2603.10473 Sparse Blocked context onlyMar 11, 2026
- Mitigating Translationese Bias in Multilingual LLM-as-a-Judge via Disentangled Information Bottleneckarxiv-2603.10351 Sparse Blocked context onlyMar 11, 2026
- Overcoming Visual Clutter in Vision Language Action Models via Concept-Gated Visual Distillationarxiv-2603.10340 Sparse Blocked context onlyMar 11, 2026
- Large language models can disambiguate opioid slang on social mediaarxiv-2603.10313 Sparse Blocked context onlyMar 11, 2026
- Is this Idea Novel? An Automated Benchmark for Judgment of Research Ideasarxiv-2603.10303 Sparse Blocked context onlyMar 11, 2026
- GR-SAP: Generative Replay for Safety Alignment Preservation during Fine-Tuningarxiv-2603.10243 Sparse Blocked context onlyMar 10, 2026
- S-GRADES -- Studying Generalization of Student Response Assessments in Diverse Evaluative Settingsarxiv-2603.10233 Sparse Blocked context onlyMar 10, 2026
- Adaptive Activation Cancellation for Hallucination Mitigation in Large Language Modelsarxiv-2603.10195 Sparse Blocked context onlyMar 10, 2026
- Video-Based Reward Modeling for Computer-Use Agentsarxiv-2603.10178 Sparse Blocked context onlyMar 10, 2026
- Calibration-Reasoning Framework for Descriptive Speech Quality Assessmentarxiv-2603.10175 Sparse Blocked context onlyMar 10, 2026
- CLIPO: Contrastive Learning in Policy Optimization Generalizes RLVRarxiv-2603.10101 Sparse Blocked context onlyMar 10, 2026
- Think Before You Lie: How Reasoning Improves Honestyarxiv-2603.09957 Sparse Blocked context onlyMar 10, 2026
- Towards a Neural Debugger for Pythonarxiv-2603.09951 Sparse Blocked context onlyMar 10, 2026
- PathMem: Toward Cognition-Aligned Memory Transformation for Pathology MLLMsarxiv-2603.09943 Sparse Blocked context onlyMar 10, 2026
- Model Merging in the Era of Large Language Models: Methods, Applications, and Future Directionsarxiv-2603.09938 Sparse Blocked context onlyMar 10, 2026
- MSSR: Memory-Aware Adaptive Replay for Continual LLM Fine-Tuningarxiv-2603.09892 Curated Related Blocked context onlyMar 10, 2026
- Influencing LLM Multi-Agent Dialogue via Policy-Parameterized Promptsarxiv-2603.09890 Sparse Blocked context onlyMar 10, 2026
- One-Eval: An Agentic System for Automated and Traceable LLM Evaluationarxiv-2603.09821 Sparse Blocked context onlyMar 10, 2026
- MITRA: An AI Assistant for Knowledge Retrieval in Physics Collaborationsarxiv-2603.09800 Sparse Blocked context onlyMar 10, 2026
- Quantifying the Necessity of Chain of Thought through Opaque Serial Deptharxiv-2603.09786 Sparse Blocked context onlyMar 10, 2026
- EPIC-EuroParl-UdS: Information-Theoretic Perspectives on Translation and Interpretingarxiv-2603.09785 Sparse Blocked context onlyMar 10, 2026
- Ego: Embedding-Guided Personalization of Vision-Language Modelsarxiv-2603.09771 Sparse Blocked context onlyMar 10, 2026
- EXPLORE-Bench: Egocentric Scene Prediction with Long-Horizon Reasoningarxiv-2603.09731 Sparse Blocked context onlyMar 10, 2026
- AutoAgent: Evolving Cognition and Elastic Memory Orchestration for Adaptive Agentsarxiv-2603.09716 Sparse Blocked context onlyMar 10, 2026
- Does the Question Really Matter? Training-Free Data Selection for Vision-Language SFTarxiv-2603.09715 Sparse Blocked context onlyMar 10, 2026
- OOD-MMSafe: Advancing MLLM Safety from Harmful Intent to Hidden Consequencesarxiv-2603.09706 Sparse Blocked context onlyMar 10, 2026
- Logics-Parsing-Omni Technical Reportarxiv-2603.09677 Sparse Blocked context onlyMar 10, 2026
- Surgical Repair of Collapsed Attention Heads in ALiBi Transformersarxiv-2603.09616 Sparse Blocked context onlyMar 10, 2026
- Reward Prediction with Factorized World Statesarxiv-2603.09400 Sparse Blocked context onlyMar 10, 2026
- TaSR-RAG: Taxonomy-guided Structured Reasoning for Retrieval-Augmented Generationarxiv-2603.09341 Sparse Blocked context onlyMar 10, 2026
- TA-Mem: Tool-Augmented Autonomous Memory Retrieval for LLM in Long-Term Conversational QAarxiv-2603.09297 Sparse Blocked context onlyMar 10, 2026
- SPAR-K: Scheduled Periodic Alternating Early Exit for Spoken Language Modelsarxiv-2603.09215 Sparse Blocked context onlyMar 10, 2026
- DEO: Training-Free Direct Embedding Optimization for Negation-Aware Retrievalarxiv-2603.09185 Sparse Blocked context onlyMar 10, 2026
- Bioalignment: Measuring and Improving LLM Disposition Toward Biological Systems for AI Safetyarxiv-2603.09154 Sparse Blocked context onlyMar 10, 2026
- Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewardsarxiv-2603.09117 Sparse Blocked context onlyMar 10, 2026
- Reading, Not Thinking: Understanding and Bridging the Modality Gap When Text Becomes Pixels in Multimodal LLMsarxiv-2603.09095 Sparse Blocked context onlyMar 10, 2026
- Learning When to Sample: Confidence-Aware Self-Consistency for Efficient LLM Chain-of-Thought Reasoningarxiv-2603.08999 Sparse Blocked context onlyMar 9, 2026
- BiCLIP: Domain Canonicalization via Structured Geometric Transformationarxiv-2603.08942 Sparse Blocked context onlyMar 9, 2026
- VoxEmo: Benchmarking Speech Emotion Recognition with Speech LLMsarxiv-2603.08936 Sparse Blocked context onlyMar 9, 2026
- PathoScribe: Transforming Pathology Data into a Living Library with a Unified LLM-Driven Framework for Semantic Retrieval and Clinical Integrationarxiv-2603.08935 Sparse Blocked context onlyMar 9, 2026
- SciTaRC: Benchmarking QA on Scientific Tabular Data that Requires Language Reasoning and Complex Computationarxiv-2603.08910 Sparse Blocked context onlyMar 9, 2026
- ConFu: Contemplate the Future for Better Speculative Samplingarxiv-2603.08899 Sparse Blocked context onlyMar 9, 2026
- Beyond Relevance: On the Relationship Between Retrieval and RAG Information Coveragearxiv-2603.08819 Sparse Blocked context onlyMar 9, 2026
- Agentic Critical Trainingarxiv-2603.08706 Sparse Blocked context onlyMar 9, 2026
- PostTrainBench: Can LLM Agents Automate LLM Post-Training?arxiv-2603.08640 Direct Blocked context onlyMar 9, 2026
- RetroAgent: From Solving to Evolving via Retrospective Dual Intrinsic Feedbackarxiv-2603.08561 Sparse Blocked context onlyMar 9, 2026
- Fanar-Sadiq: A Multi-Agent Architecture for Grounded Islamic QAarxiv-2603.08501 Sparse Blocked context onlyMar 9, 2026
- LycheeCluster: Efficient Long-Context Inference with Structure-Aware Chunking and Hierarchical KV Indexingarxiv-2603.08453 Sparse Blocked context onlyMar 9, 2026
- Can Vision-Language Models Solve the Shell Game?arxiv-2603.08436 Sparse Blocked context onlyMar 9, 2026
- One Model Is Enough: Native Retrieval Embeddings from LLM Agent Hidden Statesarxiv-2603.08429 Sparse Blocked context onlyMar 9, 2026
- Aligning to Illusions: Choice Blindness in Human and AI Feedbackarxiv-2603.08412 Sparse Blocked context onlyMar 9, 2026
- Sandpiper: Orchestrated AI-Annotation for Educational Discourse at Scalearxiv-2603.08406 Sparse Blocked context onlyMar 9, 2026
- Revealing Behavioral Plasticity in Large Language Models: A Token-Conditional Perspectivearxiv-2603.08398 Sparse Blocked context onlyMar 9, 2026
- Adaptive Loops and Memory in Transformers: Think Harder or Know More?arxiv-2603.08391 Sparse Blocked context onlyMar 9, 2026
- SPD-RAG: Sub-Agent Per Document Retrieval-Augmented Generationarxiv-2603.08329 Curated Related Blocked context onlyMar 9, 2026
- SlowBA: An efficiency backdoor attack towards VLM-based GUI agentsarxiv-2603.08316 Sparse Blocked context onlyMar 9, 2026
- LAMUS: A Large-Scale Corpus for Legal Argument Mining from U.S. Caselaw using LLMsarxiv-2603.08286 Sparse Blocked context onlyMar 9, 2026
- AdaCultureSafe: Adaptive Cultural Safety Grounded by Cultural Knowledge in Large Language Modelsarxiv-2603.08275 Sparse Blocked context onlyMar 9, 2026
- NCL-UoR at SemEval-2026 Task 5: Embedding-Based Methods, Fine-Tuning, and LLMs for Word Sense Plausibility Ratingarxiv-2603.08256 Sparse Blocked context onlyMar 9, 2026
- Not All Queries Need Deep Thought: CoFiCot for Adaptive Coarse-to-fine Stateful Refinementarxiv-2603.08251 Sparse Blocked context onlyMar 9, 2026
- Bootstrapping Audiovisual Speech Recognition in Zero-AV-Resource Scenarios with Synthetic Visual Dataarxiv-2603.08249 Sparse Blocked context onlyMar 9, 2026
- Fibration Policy Optimizationarxiv-2603.08239 Sparse Blocked context onlyMar 9, 2026
- DualTurn: Learning Turn-Taking from Dual-Channel Generative Speech Pretrainingarxiv-2603.08216 Curated Related Blocked context onlyMar 9, 2026
- RexDrug: Reliable Multi-Drug Combination Extraction through Reasoning-Enhanced LLMsarxiv-2603.08166 Sparse Blocked context onlyMar 9, 2026
- Gradually Excavating External Knowledge for Implicit Complex Question Answeringarxiv-2603.08148 Sparse Blocked context onlyMar 9, 2026
- EvoScientist: Towards Multi-Agent Evolving AI Scientists for End-to-End Scientific Discoveryarxiv-2603.08127 Direct Blocked context onlyMar 9, 2026
- UIS-Digger: Towards Comprehensive Research Agent Systems for Real-world Unindexed Information Seekingarxiv-2603.08117 Direct Blocked context onlyMar 9, 2026
- Deterministic Differentiable Structured Pruning for Large Language Modelsarxiv-2603.08065 Sparse Blocked context onlyMar 9, 2026
- DyLLM: Efficient Diffusion LLM Inference via Saliency-based Token Selection and Partial Attentionarxiv-2603.08026 Sparse Blocked context onlyMar 9, 2026
- ConflictBench: Evaluating Human-AI Conflict via Interactive and Visually Grounded Environmentsarxiv-2603.08024 Sparse Blocked context onlyMar 9, 2026
- \$OneMillion-Bench: How Far are Language Agents from Human Experts?arxiv-2603.07980 Sparse Blocked context onlyMar 9, 2026
- Reject, Resample, Repeat: Understanding Parallel Reasoning in Language Model Inferencearxiv-2603.07887 Sparse Blocked context onlyMar 9, 2026
- AI Steerability 360: A Toolkit for Steering Large Language Modelsarxiv-2603.07837 Sparse Blocked context onlyMar 8, 2026
- DistillGuard: Evaluating Defenses Against LLM Knowledge Distillationarxiv-2603.07835 Sparse Blocked context onlyMar 8, 2026
- Benchmarking Large Language Models for Quebec Insurance: From Closed-Book to Retrieval-Augmented Generationarxiv-2603.07825 Sparse Blocked context onlyMar 8, 2026
- Dual-Metric Evaluation of Social Bias in Large Language Models: Evidence from an Underrepresented Nepali Cultural Contextarxiv-2603.07792 Sparse Blocked context onlyMar 8, 2026
- Scaling Data Difficulty: Improving Coding Models via Reinforcement Learning on Fresh and Challenging Problemsarxiv-2603.07779 Sparse Blocked context onlyMar 8, 2026
- 3ViewSense: Spatial and Mental Perspective Reasoning from Orthographic Views in Vision-Language Modelsarxiv-2603.07751 Sparse Blocked context onlyMar 8, 2026
- Large Language Model for Discrete Optimization Problems: Evaluation and Step-by-step Reasoningarxiv-2603.07733 Sparse Blocked context onlyMar 8, 2026
- KCoEvo: A Knowledge Graph Augmented Framework for Evolutionary Code Generationarxiv-2603.07581 Sparse Blocked context onlyMar 8, 2026
- MAWARITH: A Dataset and Benchmark for Legal Inheritance Reasoning with LLMsarxiv-2603.07539 Sparse Blocked context onlyMar 8, 2026
- TableMind++: An Uncertainty-Aware Programmatic Agent for Tool-Augmented Table Reasoningarxiv-2603.07528 Sparse Blocked context onlyMar 8, 2026
- Skip to the Good Part: Representation Structure & Inference-Time Layer Skipping in Diffusion vs. Autoregressive LLMsarxiv-2603.07475 Sparse Blocked context onlyMar 8, 2026
- Dial: A Knowledge-Grounded Dialect-Specific NL2SQL Systemarxiv-2603.07449 Sparse Blocked context onlyMar 8, 2026
- Few Tokens, Big Leverage: Preserving Safety Alignment by Constraining Safety Tokens during Fine-tuningarxiv-2603.07445 Sparse Blocked context onlyMar 8, 2026
- Generalization in Online Reinforcement Learning for Mobile Agentsarxiv-2603.07432 Sparse Blocked context onlyMar 8, 2026
- Can Large Language Models Keep Up? Benchmarking Online Adaptation to Continual Knowledge Streamsarxiv-2603.07392 Sparse Blocked context onlyMar 8, 2026