300 canonical paper links on this archive page.
- HSSBench: Benchmarking Humanities and Social Sciences Ability for Multimodal Large Language Modelsarxiv-2506.03922 Sparse Blocked context onlyJun 4, 2025
- EuroGEST: Investigating gender stereotypes in multilingual language modelsarxiv-2506.03867 Sparse Blocked context onlyJun 4, 2025
- AssetOpsBench: Benchmarking AI Agents for Task Automation in Industrial Asset Operations and Maintenancearxiv-2506.03828 Direct Blocked context onlyJun 4, 2025
- Go-Browse: Training Web Agents with Structured Explorationarxiv-2506.03533 Sparse Blocked context onlyJun 4, 2025
- Beyond Memorization: A Rigorous Evaluation Framework for Medical Knowledge Editingarxiv-2506.03490 Sparse Blocked context onlyJun 4, 2025
- Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedbackarxiv-2506.03106 Sparse Blocked context onlyJun 3, 2025
- DiaBlo: Diagonal Blocks Are Sufficient For Finetuningarxiv-2506.03230 Sparse Blocked context onlyJun 3, 2025
- BitBypass: A New Direction in Jailbreaking Aligned Large Language Models with Bitstream Camouflagearxiv-2506.02479 Sparse Blocked context onlyJun 3, 2025
- Esoteric Language Models: Bridging Autoregressive and Masked Diffusion LLMsarxiv-2506.01928 Sparse Blocked context onlyJun 2, 2025
- iQUEST: An Iterative Question-Guided Framework for Knowledge Base Question Answeringarxiv-2506.01784 Sparse Blocked context onlyJun 2, 2025
- Synthesis of discrete-continuous quantum circuits with multimodal diffusion modelsarxiv-2506.01666 Direct Blocked context onlyJun 2, 2025
- SealQA: Raising the Bar for Reasoning in Search-Augmented Language Modelsarxiv-2506.01062 Direct Blocked context onlyJun 1, 2025
- Position: Agent Should Invoke External Tools ONLY When Epistemically Necessaryarxiv-2506.00886 Sparse Blocked context onlyJun 1, 2025
- DriveMind: A Dual Visual Language Model-based Reinforcement Learning Framework for Autonomous Drivingarxiv-2506.00819 Sparse Blocked context onlyJun 1, 2025
- Distillation of atomistic foundation models across architectures and chemical domainsarxiv-2506.10956 Direct Blocked context onlyJun 1, 2025
- $τ^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environmentarxiv-2506.07982 Direct Blocked context onlyJun 1, 2025
- ReasonFlux-PRM: Trajectory-Aware PRMs for Long Chain-of-Thought Reasoning in LLMsarxiv-2506.18896 Direct Blocked context onlyJun 1, 2025
- Time Series Forecasting as Reasoning: A Slow-Thinking Approach with Reinforced LLMsarxiv-2506.10630 Direct Blocked context onlyJun 1, 2025
- TRIDENT: Enhancing Large Language Model Safety with Tri-Dimensional Diversified Red-Teaming Data Synthesisarxiv-2505.24672 Sparse Blocked context onlyMay 30, 2025
- Beyond Exponential Decay: Rethinking Error Accumulation in Large Language Modelsarxiv-2505.24187 Sparse Blocked context onlyMay 30, 2025
- SwingArena: Competitive Programming Arena for Long-context GitHub Issue Solvingarxiv-2505.23932 Sparse Blocked context onlyMay 29, 2025
- Formula-R1: Incentivizing LLM Reasoning over Complex Tables with Numerical Computation via Formula-Driven Reinforcement Learningarxiv-2505.23667 Sparse Blocked context onlyMay 29, 2025
- AC-ODM: Actor--Critic Online Data Mixing for Sample-Efficient LLM Pretrainingarxiv-2505.23878 Sparse Blocked context onlyMay 29, 2025
- AJF: Adaptive Jailbreak Framework Based on the Comprehension Ability of Black-Box Large Language Modelsarxiv-2505.23404 Sparse Blocked context onlyMay 29, 2025
- Bayesian Attention Mechanism: A Probabilistic Framework for Positional Encoding and Context Length Extrapolationarxiv-2505.22842 Sparse Blocked context onlyMay 28, 2025
- Measuring Sycophancy of Language Models in Multi-turn Dialoguesarxiv-2505.23840 Sparse Blocked context onlyMay 28, 2025
- Flying Pigs, FaR and Beyond: Evaluating LLM Reasoning in Counterfactual Worldsarxiv-2505.22318 Sparse Blocked context onlyMay 28, 2025
- Mixture-of-Retrieval Experts for Reasoning-Guided Multimodal Knowledge Exploitationarxiv-2505.22095 Sparse Blocked context onlyMay 28, 2025
- Reviewing Scientific Papers for Critical Problems With Reasoning LLMs: Baseline Approaches and Automatic Evaluationarxiv-2505.23824 Sparse Blocked context onlyMay 28, 2025
- R1-Code-Interpreter: LLMs Reason with Code via Supervised and Multi-stage Reinforcement Learningarxiv-2505.21668 Sparse Blocked context onlyMay 27, 2025
- RefTool: Reference-Guided Tool Creation for Knowledge-Intensive Reasoningarxiv-2505.21413 Sparse Blocked context onlyMay 27, 2025
- RPM: Reasoning-Level Personalization for Black-Box Large Language Modelsarxiv-2505.21082 Sparse Blocked context onlyMay 27, 2025
- ChemAmp: Amplified Chemistry Tools via Composable Agentsarxiv-2505.21569 Sparse Blocked context onlyMay 27, 2025
- Do LLMs Understand Collaborative Signals? Diagnosis and Repairarxiv-2505.20730 Sparse Blocked context onlyMay 27, 2025
- FinTagging: Benchmarking LLMs for Extracting and Structuring Financial Informationarxiv-2505.20650 Sparse Blocked context onlyMay 27, 2025
- VisRet: Visualization Improves Knowledge-Intensive Text-to-Image Retrievalarxiv-2505.20291 Sparse Blocked context onlyMay 26, 2025
- VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstructionarxiv-2505.20279 Sparse Blocked context onlyMay 26, 2025
- It's High Time: A Survey of Temporal Question Answeringarxiv-2505.20243 Sparse Blocked context onlyMay 26, 2025
- Token Distillation: Attention-aware Input Embeddings For New Tokensarxiv-2505.20133 Sparse Blocked context onlyMay 26, 2025
- Inference-time Alignment in Continuous Spacearxiv-2505.20081 Sparse Blocked context onlyMay 26, 2025
- Incentivizing Strong Reasoning from Weak Supervisionarxiv-2505.20072 Sparse Blocked context onlyMay 26, 2025
- REA-RL: Reflection-Aware Online Reinforcement Learning for Efficient Reasoningarxiv-2505.19862 Sparse Blocked context onlyMay 26, 2025
- LLLMs: A Data-Driven Survey of Evolving Research on Limitations of Large Language Modelsarxiv-2505.19240 Sparse Blocked context onlyMay 25, 2025
- ReasonMap: Towards Fine-Grained Visual Reasoning from Transit Mapsarxiv-2505.18675 Sparse Blocked context onlyMay 24, 2025
- SEW: Self-Evolving Agentic Workflows for Automated Code Generationarxiv-2505.18646 Direct Blocked context onlyMay 24, 2025
- Knowledge Fusion of Large Language Models Via Modular SkillPacksarxiv-2505.18502 Sparse Blocked context onlyMay 24, 2025
- One RL to See Them All: Visual Triple Unified Reinforcement Learningarxiv-2505.18129 Direct Blocked context onlyMay 23, 2025
- Just as Humans Need Vaccines, So Do Models: Model Immunization to Combat Falsehoodsarxiv-2505.17870 Sparse Blocked context onlyMay 23, 2025
- HoloLLM: Multisensory Foundation Model for Language-Grounded Human Sensing and Reasoningarxiv-2505.17645 Sparse Blocked context onlyMay 23, 2025
- On the Design of KL-Regularized Policy Gradient Algorithms for LLM Reasoningarxiv-2505.17508 Direct Blocked context onlyMay 23, 2025
- Bottlenecked Transformers: Periodic KV Cache Consolidation for Generalised Reasoningarxiv-2505.16950 Sparse Blocked context onlyMay 22, 2025
- Accidental Vulnerability: Factors in Fine-Tuning that Shift Model Safeguardsarxiv-2505.16789 Sparse Blocked context onlyMay 22, 2025
- MTR-Bench: A Comprehensive Benchmark for Multi-Turn Reasoning Evaluationarxiv-2505.17123 Sparse Blocked context onlyMay 21, 2025
- VerifyBench: Benchmarking Reference-based Reward Systems for Large Language Modelsarxiv-2505.15801 Sparse Blocked context onlyMay 21, 2025
- Reward Is Enough: LLMs Are In-Context Reinforcement Learnersarxiv-2506.06303 Sparse Blocked context onlyMay 21, 2025
- HDLxGraph: Bridging Large Language Models and HDL Repositories via HDL Graph Databasesarxiv-2505.15701 Sparse Blocked context onlyMay 21, 2025
- SAKE: Structured Agentic Knowledge Extrapolation for Complex LLM Reasoning via Reinforcement Learningarxiv-2505.15062 Sparse Blocked context onlyMay 21, 2025
- MAS-ZERO: Designing Multi-Agent Systems with Zero Supervisionarxiv-2505.14996 Sparse Blocked context onlyMay 21, 2025
- REFLEX: Metacognitive Reasoning for Reflective Zero-Shot Robotic Planning with Large Language Modelsarxiv-2505.14899 Sparse Blocked context onlyMay 20, 2025
- Towards Reliable Proof Generation with LLMs: A Neuro-Symbolic Approacharxiv-2505.14479 Sparse Blocked context onlyMay 20, 2025
- Not Minds, but Signs: Reframing LLMs through Semioticsarxiv-2505.17080 Sparse Blocked context onlyMay 20, 2025
- Let's Verify Math Questions Step by Steparxiv-2505.13903 Sparse Blocked context onlyMay 20, 2025
- Structured Agent Distillation for Large Language Modelarxiv-2505.13820 Sparse Blocked context onlyMay 20, 2025
- Ice Cream Doesn't Cause Drowning: Benchmarking LLMs Against Statistical Pitfalls in Causal Inferencearxiv-2505.13770 Sparse Blocked context onlyMay 19, 2025
- Advancing Software Quality: A Standards-Focused Review of LLM-Based Assurance Techniquesarxiv-2505.13766 Sparse Blocked context onlyMay 19, 2025
- A Reality Check of Language Models as Formalizers on Constraint Satisfaction Problemsarxiv-2505.13252 Sparse Blocked context onlyMay 19, 2025
- What if Deception Cannot be Detected? A Cross-Linguistic Study on the Limits of Deception Detection from Textarxiv-2505.13147 Sparse Blocked context onlyMay 19, 2025
- FreeKV: Boosting KV Cache Retrieval for Efficient LLM Inferencearxiv-2505.13109 Curated Related Blocked context onlyMay 19, 2025
- LEXam: Benchmarking Legal Reasoning on 340 Law Examsarxiv-2505.12864 Sparse Blocked context onlyMay 19, 2025
- RAGXplain: From Explainable Evaluation to Actionable Guidance of RAG Pipelinesarxiv-2505.13538 Sparse Blocked context onlyMay 18, 2025
- Logic Jailbreak: Efficiently Unlocking LLM Safety Restrictions Through Formal Logical Expressionarxiv-2505.13527 Sparse Blocked context onlyMay 18, 2025
- Mitigating Content Effects on Reasoning in Language Models through Fine-Grained Activation Steeringarxiv-2505.12189 Sparse Blocked context onlyMay 18, 2025
- EVALOOOP: A Self-Consistency-Centered Framework for Assessing Large Language Model Robustness in Programmingarxiv-2505.12185 Sparse Blocked context onlyMay 18, 2025
- VisionReasoner: Unified Reasoning-Integrated Visual Perception via Reinforcement Learningarxiv-2505.12081 Direct Blocked context onlyMay 17, 2025
- AdaBoN: Adaptive Best-of-N Alignmentarxiv-2505.12050 Sparse Blocked context onlyMay 17, 2025
- EAMET: Robust Massive Model Editing via Embedding Alignment Optimizationarxiv-2505.11876 Sparse Blocked context onlyMay 17, 2025
- Talk to Your Slides: High-Efficiency Slide Editing via Language-Driven Structured Data Manipulationarxiv-2505.11604 Direct Blocked context onlyMay 16, 2025
- Stepwise Guided Policy Optimization: Coloring your Incorrect Reasoning in GRPOarxiv-2505.11595 Sparse Blocked context onlyMay 16, 2025
- Visual Planning: Let's Think Only with Imagesarxiv-2505.11409 Direct Blocked context onlyMay 16, 2025
- SelfBudgeter: Adaptive Token Allocation for Efficient LLM Reasoningarxiv-2505.11274 Curated Related Blocked context onlyMay 16, 2025
- Maximizing Asynchronicity in Event-based Neural Networksarxiv-2505.11165 Sparse Blocked context onlyMay 16, 2025
- REI-Bench: Can Embodied Agents Understand Vague Human Instructions in Task Planning?arxiv-2505.10872 Sparse Blocked context onlyMay 16, 2025
- Learning Virtual Machine Scheduling in Cloud Computing through Language Agentsarxiv-2505.10117 Sparse Blocked context onlyMay 15, 2025
- CodePDE: An Inference Framework for LLM-driven PDE Solver Generationarxiv-2505.08783 Direct Blocked context onlyMay 13, 2025
- Not that Groove: Zero-Shot Symbolic Music Editingarxiv-2505.08203 Sparse Blocked context onlyMay 13, 2025
- Multimodal Integrated Knowledge Transfer to Large Language Models through Preference Optimization with Biomedical Applicationsarxiv-2505.05736 Sparse Blocked context onlyMay 9, 2025
- Scalable LLM Reasoning Acceleration with Low-rank Distillationarxiv-2505.07861 Sparse Blocked context onlyMay 8, 2025
- RM-R1: Reward Modeling as Reasoningarxiv-2505.02387 Direct Blocked context onlyMay 5, 2025
- FineScope : SAE-guided Data Selection Enables Domain Specific LLM Pruning and Finetuningarxiv-2505.00624 Sparse Blocked context onlyMay 1, 2025
- LLM-Based Human-Agent Collaboration and Interaction Systems: A Surveyarxiv-2505.00753 Direct Blocked context onlyMay 1, 2025
- On Path to Multimodal Historical Reasoning: HistBench and HistAgentarxiv-2505.20246 Sparse Blocked context onlyMay 1, 2025
- Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPOarxiv-2505.17017 Direct Blocked context onlyMay 1, 2025
- Advancing Multimodal Reasoning via Reinforcement Learning with Cold Startarxiv-2505.22334 Direct Blocked context onlyMay 1, 2025
- FunReason: Enhancing Large Language Models' Function Calling via Self-Refinement Multiscale Loss and Automated Data Refinementarxiv-2505.20192 Direct Blocked context onlyMay 1, 2025
- Unsupervised Post-Training for Multi-Modal LLM Reasoning via GRPOarxiv-2505.22453 Direct Blocked context onlyMay 1, 2025
- Absolute Zero: Reinforced Self-play Reasoning with Zero Dataarxiv-2505.03335 Sparse Blocked context onlyMay 1, 2025
- From EduVisBench to EduVisAgent: A Benchmark and Multi-Agent Framework for Pedagogical Visualizationarxiv-2505.16832 Sparse Blocked context onlyMay 1, 2025
- Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solvingarxiv-2505.07773 Direct Blocked context onlyMay 1, 2025
- CLEVER: A Curated Benchmark for Formally Verified Code Generationarxiv-2505.13938 Direct Blocked context onlyMay 1, 2025
- SophiaVL-R1: Reinforcing MLLMs Reasoning with Thinking Rewardarxiv-2505.17018 Direct Blocked context onlyMay 1, 2025
- Efficient Agent Training for Computer Usearxiv-2505.13909 Direct Blocked context onlyMay 1, 2025
- Enhancing Visual Grounding for GUI Agents via Self-Evolutionary Reinforcement Learningarxiv-2505.12370 Sparse Blocked context onlyMay 1, 2025
- SimpleDeepSearcher: Deep Information Seeking via Web-Powered Reasoning Trajectory Synthesisarxiv-2505.16834 Direct Blocked context onlyMay 1, 2025
- R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPOarxiv-2505.16673 Sparse Blocked context onlyMay 1, 2025
- InfoChartQA: A Benchmark for Multimodal Question Answering on Infographic Chartsarxiv-2505.19028 Direct Blocked context onlyMay 1, 2025
- TopoPoint: Enhance Topology Reasoning via Endpoint Detection in Autonomous Drivingarxiv-2505.17771 Direct Blocked context onlyMay 1, 2025
- Reason Like a Radiologist: Chain-of-Thought and Reinforcement Learning for Verifiable Report Generationarxiv-2504.18453 Sparse Blocked context onlyApr 25, 2025
- Comparing Uncertainty Measurement and Mitigation Methods for Large Language Models: A Systematic Reviewarxiv-2504.18346 Sparse Blocked context onlyApr 25, 2025
- Aleph-Alpha-GermanWeb: Improving German-language LLM pre-training with model-based data curation and synthetic data generationarxiv-2505.00022 Sparse Blocked context onlyApr 24, 2025
- FLUKE: A Linguistically-Driven and Task-Agnostic Framework for Robustness Evaluationarxiv-2504.17311 Sparse Blocked context onlyApr 24, 2025
- Paper2Code: Automating Code Generation from Scientific Papers in Machine Learningarxiv-2504.17192 Sparse Blocked context onlyApr 24, 2025
- ReCellTy: Domain-Specific Knowledge Graph Retrieval-Augmented LLMs Reasoning Workflow for Single-Cell Annotationarxiv-2505.00017 Sparse Blocked context onlyApr 24, 2025
- GeneMamba: An Efficient and Effective Foundation Model on Single Cell Dataarxiv-2504.16956 Sparse Blocked context onlyApr 22, 2025
- TrustGeoGen: Formal-Verified Data Engine for Trustworthy Multi-modal Geometric Problem Solvingarxiv-2504.15780 Sparse Blocked context onlyApr 22, 2025
- DIP: Efficient Large Multimodal Model Training with Dynamic Interleaved Pipelinearxiv-2504.14145 Sparse Blocked context onlyApr 19, 2025
- Diffusion Generative Recommendation with Continuous Tokensarxiv-2504.12007 Sparse Blocked context onlyApr 16, 2025
- AgentA/B: Automated and Scalable Web A/BTesting with Interactive LLM Agentsarxiv-2504.09723 Sparse Blocked context onlyApr 13, 2025
- A Survey of Frontiers in LLM Reasoning: Inference Scaling, Learning to Reason, and Agentic Systemsarxiv-2504.09037 Sparse Blocked context onlyApr 12, 2025
- MCP Bridge: A Lightweight, LLM-Agnostic RESTful Proxy for Model Context Protocol Serversarxiv-2504.08999 Sparse Blocked context onlyApr 11, 2025
- Generating Fine Details of Entity Interactionsarxiv-2504.08714 Sparse Blocked context onlyApr 11, 2025
- Automating quantum feature map design via large language modelsarxiv-2504.07396 Sparse Blocked context onlyApr 10, 2025
- CAReDiO: Cultural Alignment via Representativeness and Distinctiveness Guided Data Optimizationarxiv-2504.08820 Sparse Blocked context onlyApr 9, 2025
- Can LLMs Simulate Personas with Reversed Performance? A Systematic Investigation for Counterfactual Instruction Following in Math Reasoning Contextarxiv-2504.06460 Sparse Blocked context onlyApr 8, 2025
- Don't Let It Hallucinate: Premise Verification via Retrieval-Augmented Logical Reasoningarxiv-2504.06438 Sparse Blocked context onlyApr 8, 2025
- BiasCause: Evaluate Socially Biased Causal Reasoning of Large Language Modelsarxiv-2504.07997 Sparse Blocked context onlyApr 8, 2025
- SkillFlow: Scalable and Efficient Agent Skill Retrieval Systemarxiv-2504.06188 Sparse Blocked context onlyApr 8, 2025
- NativQA Framework: Enabling LLMs and VLMs with Native, Local, and Everyday Knowledgearxiv-2504.05995 Sparse Blocked context onlyApr 8, 2025
- SCAM: A Real-World Typographic Robustness Evaluation for Multimodal Foundation Modelsarxiv-2504.04893 Sparse Blocked context onlyApr 7, 2025
- Beyond Single-Turn: A Survey on Multi-Turn Interactions with Large Language Modelsarxiv-2504.04717 Direct Blocked context onlyApr 7, 2025
- Multi-SWE-bench: A Multilingual Benchmark for Issue Resolvingarxiv-2504.02605 Direct Blocked context onlyApr 3, 2025
- AnesSuite: A Comprehensive Benchmark and Dataset Suite for Anesthesiology Reasoning in LLMsarxiv-2504.02404 Direct Blocked context onlyApr 3, 2025
- LearNAT: Learning NL2SQL with AST-guided Task Decomposition for Large Language Modelsarxiv-2504.02327 Sparse Blocked context onlyApr 3, 2025
- Chain of Correction for Full-text Speech Recognition with Large Language Modelsarxiv-2504.01519 Curated Related Blocked context onlyApr 2, 2025
- m1: Unleash the Potential of Test-Time Scaling for Medical Reasoning with Large Language Modelsarxiv-2504.00869 Sparse Blocked context onlyApr 1, 2025
- The AI Scientist-v2: Workshop-Level Automated Scientific Discovery via Agentic Tree Searcharxiv-2504.08066 Direct Blocked context onlyApr 1, 2025
- Relevance Isn't All You Need: Scaling RAG Systems With Inference-Time Compute Via Multi-Criteria Rerankingarxiv-2504.07104 Direct Blocked context onlyApr 1, 2025
- RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learningarxiv-2504.20073 Sparse Blocked context onlyApr 1, 2025
- Why We Feel: Breaking Boundaries in Emotional Reasoning with Multimodal Large Language Modelsarxiv-2504.07521 Direct Blocked context onlyApr 1, 2025
- Kimina-Prover Preview: Towards Large Formal Reasoning Models with Reinforcement Learningarxiv-2504.11354 Sparse Blocked context onlyApr 1, 2025
- Planet as a Brain: Towards Internet of AgentSites based on AIOS Serverarxiv-2504.14411 Direct Blocked context onlyApr 1, 2025
- SpaceR: Reinforcing MLLMs in Video Spatial Reasoningarxiv-2504.01805 Direct Blocked context onlyApr 1, 2025
- WebThinker: Empowering Large Reasoning Models with Deep Research Capabilityarxiv-2504.21776 Sparse Blocked context onlyApr 1, 2025
- Graph-to-Vision: Multi-graph Understanding and Reasoning using Vision-Language Modelsarxiv-2503.21435 Sparse Blocked context onlyMar 27, 2025
- EconEvals: Benchmarks and Litmus Tests for Economic Decision-Making by LLM Agentsarxiv-2503.18825 Sparse Blocked context onlyMar 24, 2025
- Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignmentarxiv-2503.18991 Sparse Blocked context onlyMar 23, 2025
- MedPlan: A Two-Stage RAG-Based System for Personalized Medical Plan Generationarxiv-2503.17900 Sparse Blocked context onlyMar 23, 2025
- Fin-R1: A Large Language Model for Financial Reasoning through Reinforcement Learningarxiv-2503.16252 Sparse Blocked context onlyMar 20, 2025
- Imitating AI agents increase diversity in homogeneous information environments but can reduce it in heterogeneous onesarxiv-2503.16021 Sparse Blocked context onlyMar 20, 2025
- More Women, Same Stereotypes: Unpacking the Gender Bias Paradox in Large Language Modelsarxiv-2503.15904 Sparse Blocked context onlyMar 20, 2025
- What Makes a Reward Model a Good Teacher? An Optimization Perspectivearxiv-2503.15477 Direct Blocked context onlyMar 19, 2025
- xLSTM 7B: A Recurrent LLM for Fast and Efficient Inferencearxiv-2503.13427 Direct Blocked context onlyMar 17, 2025
- KARL: Knowledge-Aware Reasoning and Reinforcement Learning for Knowledge-Intensive Visual Groundingarxiv-2503.12797 Direct Blocked context onlyMar 17, 2025
- Towards Hierarchical Multi-Step Reward Models for Enhanced Reasoning in Large Language Modelsarxiv-2503.13551 Sparse Blocked context onlyMar 16, 2025
- A Survey on the Optimization of Large Language Model-based Agentsarxiv-2503.12434 Direct Blocked context onlyMar 16, 2025
- Beyond Final Code: A Process-Oriented Error Analysis of Software Development Agents in Real-World GitHub Scenariosarxiv-2503.12374 Sparse Blocked context onlyMar 16, 2025
- Integrating Chain-of-Thought and Retrieval Augmented Generation Enhances Rare Disease Diagnosis from Clinical Notesarxiv-2503.12286 Sparse Blocked context onlyMar 15, 2025
- Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Modelsarxiv-2503.06749 Direct Blocked context onlyMar 9, 2025
- Green Prompting: Characterizing Prompt-driven Energy Costs of LLM Inferencearxiv-2503.10666 Sparse Blocked context onlyMar 9, 2025
- InftyThink: Breaking the Length Limits of Long-Context Reasoning in Large Language Modelsarxiv-2503.06692 Sparse Blocked context onlyMar 9, 2025
- Shifting Perspectives: Steering Vectors for Robust Bias Mitigation in LLMsarxiv-2503.05371 Sparse Blocked context onlyMar 7, 2025
- Collaborative Evaluation of Deepfake Text with Deliberation-Enhancing Dialogue Systemsarxiv-2503.04945 Sparse Blocked context onlyMar 6, 2025
- Semantic Parallelism: Redefining Efficient MoE Inference via Model-Data Co-Schedulingarxiv-2503.04398 Sparse Blocked context onlyMar 6, 2025
- HoT: Highlighted Chain of Thought for Referencing Supporting Facts from Inputsarxiv-2503.02003 Sparse Blocked context onlyMar 3, 2025
- $\texttt{SEM-CTRL}$: Semantically Controlled Decodingarxiv-2503.01804 Sparse Blocked context onlyMar 3, 2025
- LLM-Advisor: An LLM Benchmark for Cost-efficient Path Planning across Multiple Terrainsarxiv-2503.01236 Sparse Blocked context onlyMar 3, 2025
- Distributionally Robust Reinforcement Learning with Human Feedbackarxiv-2503.00539 Sparse Blocked context onlyMar 1, 2025
- Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Modelsarxiv-2503.21380 Direct Blocked context onlyMar 1, 2025
- Rank-R1: Enhancing Reasoning in LLM-based Document Rerankers via Reinforcement Learningarxiv-2503.06034 Direct Blocked context onlyMar 1, 2025
- $φ$-Decoding: Adaptive Foresight Sampling for Balanced Inference-Time Exploration and Exploitationarxiv-2503.13288 Direct Blocked context onlyMar 1, 2025
- Generalized Few-shot 3D Point Cloud Segmentation with Vision-Language Modelarxiv-2503.16282 Direct Blocked context onlyMar 1, 2025
- BixBench: a Comprehensive Benchmark for LLM-based Agents in Computational Biologyarxiv-2503.00096 Direct Blocked context onlyMar 1, 2025
- Steering Dialogue Dynamics for Robustness against Multi-turn Jailbreaking Attacksarxiv-2503.00187 Sparse Blocked context onlyFeb 28, 2025
- MAMUT: A Novel Framework for Modifying Mathematical Formulas for the Generation of Specialized Datasets for Language Model Trainingarxiv-2502.20855 Sparse Blocked context onlyFeb 28, 2025
- Protecting multimodal large language models against misleading visualizationsarxiv-2502.20503 Sparse Blocked context onlyFeb 27, 2025
- HaLoRA: Hardware-aware Low-Rank Adaptation for Large Language Models Based on Hybrid Compute-in-Memory Architecturearxiv-2502.19747 Sparse Blocked context onlyFeb 27, 2025
- Stay Focused: Problem Drift in Multi-Agent Debatearxiv-2502.19559 Sparse Blocked context onlyFeb 26, 2025
- The Mighty ToRR: A Benchmark for Table Reasoning and Robustnessarxiv-2502.19412 Direct Blocked context onlyFeb 26, 2025
- Beyond In-Distribution Success: Scaling Curves of CoT Granularity for Language Model Generalizationarxiv-2502.18273 Sparse Blocked context onlyFeb 25, 2025
- Connecting Voices: LoReSpeech as a Low-Resource Speech Parallel Corpusarxiv-2502.18215 Sparse Blocked context onlyFeb 25, 2025
- Can Multimodal LLMs Perform Time Series Anomaly Detection?arxiv-2502.17812 Direct Blocked context onlyFeb 25, 2025
- LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verificationarxiv-2502.17421 Direct Blocked context onlyFeb 24, 2025
- HIPPO: Enhancing the Table Understanding Capability of LLMs through Hybrid-Modal Preference Optimizationarxiv-2502.17315 Sparse Blocked context onlyFeb 24, 2025
- Distributional Vision-Language Alignment by Cauchy-Schwarz Divergencearxiv-2502.17028 Sparse Blocked context onlyFeb 24, 2025
- Make LoRA Great Again: Boosting LoRA with Adaptive Singular Values and Mixture-of-Experts Optimization Alignmentarxiv-2502.16894 Direct Blocked context onlyFeb 24, 2025
- Less is More: Improving LLM Alignment via Preference Data Selectionarxiv-2502.14560 Sparse Blocked context onlyFeb 20, 2025
- LaVCa: LLM-assisted Visual Cortex Captioningarxiv-2502.13606 Sparse Blocked context onlyFeb 19, 2025
- MKE-Coder: Multi-Axial Knowledge with Evidence Verification in ICD Coding for Chinese EMRsarxiv-2502.14916 Sparse Blocked context onlyFeb 19, 2025
- SEFL: A Framework for Generating Synthetic Educational Assignment Feedback with LLM Agentsarxiv-2502.12927 Sparse Blocked context onlyFeb 18, 2025
- Integrating Arithmetic Learning Improves Mathematical Reasoning in Smaller Modelsarxiv-2502.12855 Sparse Blocked context onlyFeb 18, 2025
- MathFimer: Enhancing Mathematical Reasoning by Expanding Reasoning Steps through Fill-in-the-Middle Taskarxiv-2502.11684 Sparse Blocked context onlyFeb 17, 2025
- Enhancing Multilingual LLM Pretraining with Model-Based Data Selectionarxiv-2502.10361 Sparse Blocked context onlyFeb 14, 2025
- Mask-Enhanced Autoregressive Prediction: Pay Less Attention to Learn Morearxiv-2502.07490 Sparse Blocked context onlyFeb 11, 2025
- Maximal Brain Damage Without Data or Optimization: Disrupting Neural Networks via Sign-Bit Flipsarxiv-2502.07408 Sparse Blocked context onlyFeb 11, 2025
- Ask Patients with Patience: Enabling LLMs for Human-Centric Medical Dialogue with Grounded Reasoningarxiv-2502.07143 Sparse Blocked context onlyFeb 11, 2025
- Byte-token Enhanced Language Models for Temporal Point Processes Analysisarxiv-2502.07139 Sparse Blocked context onlyFeb 11, 2025
- MoEMba: A Mamba-based Mixture of Experts for High-Density EMG-based Hand Gesture Recognitionarxiv-2502.17457 Sparse Blocked context onlyFeb 9, 2025
- A Systematic Survey of Semantic Role Labeling in the Era of Pretrained Language Modelsarxiv-2502.08660 Sparse Blocked context onlyFeb 9, 2025
- Unbiased Sliced Wasserstein Kernels for High-Quality Audio Captioningarxiv-2502.05435 Sparse Blocked context onlyFeb 8, 2025
- Improving Language Models with Intentional Analysisarxiv-2502.04689 Sparse Blocked context onlyFeb 7, 2025
- AStar: Boosting Multimodal Reasoning with Automated Structured Thinkingarxiv-2502.02339 Sparse Blocked context onlyFeb 4, 2025
- Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generationarxiv-2502.02088 Sparse Blocked context onlyFeb 4, 2025
- FinBloom: Knowledge Grounding Large Language Model with Real-time Financial Dataarxiv-2502.18471 Sparse Blocked context onlyFeb 4, 2025
- Semantic Integrity Matters: Benchmarking and Preserving High-Density Reasoning in KV Cache Compressionarxiv-2502.01941 Sparse Blocked context onlyFeb 4, 2025
- Intrinsic Entropy of Context Length Scaling in LLMsarxiv-2502.01481 Sparse Blocked context onlyFeb 3, 2025
- A Single Model Ensemble Framework for Neural Machine Translation using Pivot Translationarxiv-2502.01182 Sparse Blocked context onlyFeb 3, 2025
- FastKV: Decoupling of Context Reduction and KV Cache Compression for Prefill-Decoding Accelerationarxiv-2502.01068 Direct Blocked context onlyFeb 3, 2025
- Safety at Scale: A Comprehensive Survey of Large Model and Agent Safetyarxiv-2502.05206 Direct Blocked context onlyFeb 2, 2025
- ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templatesarxiv-2502.06772 Sparse Blocked context onlyFeb 1, 2025
- Magma: A Foundation Model for Multimodal AI Agentsarxiv-2502.13130 Direct Blocked context onlyFeb 1, 2025
- A-MEM: Agentic Memory for LLM Agentsarxiv-2502.12110 Direct Blocked context onlyFeb 1, 2025
- FinRL-DeepSeek: LLM-Infused Risk-Sensitive Reinforcement Learning for Trading Agentsarxiv-2502.07393 Direct Blocked context onlyFeb 1, 2025
- ITBench: Evaluating AI Agents across Diverse Real-World IT Automation Tasksarxiv-2502.05352 Direct Blocked context onlyFeb 1, 2025
- Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learningarxiv-2502.14768 Direct Blocked context onlyFeb 1, 2025
- SPECTRE: An FFT-Based Efficient Drop-In Replacement to Self-Attention for Long Contextsarxiv-2502.18394 Sparse Blocked context onlyFeb 1, 2025
- REALM-Bench: A Real-World Planning Benchmark for LLMs and Multi-Agent Systemsarxiv-2502.18836 Sparse Blocked context onlyFeb 1, 2025
- LIMO: Less is More for Reasoningarxiv-2502.03387 Direct Blocked context onlyFeb 1, 2025
- The Jumping Reasoning Curve? Tracking the Evolution of Reasoning Performance in GPT-[n] and o-[n] Models on Multimodal Puzzlesarxiv-2502.01081 Sparse Blocked context onlyFeb 1, 2025
- Should You Use Your Large Language Model to Explore or Exploit?arxiv-2502.00225 Sparse Blocked context onlyJan 31, 2025
- TableMaster: A Recipe to Advance Table Understanding with Language Modelsarxiv-2501.19378 Sparse Blocked context onlyJan 31, 2025
- Representing data in words: A context engineering approacharxiv-2503.15509 Sparse Blocked context onlyJan 27, 2025
- Humanity's Last Examarxiv-2501.14249 Sparse Blocked context onlyJan 24, 2025
- Benchmarking LLMs' Mathematical Reasoning with Unseen Random Variables Questionsarxiv-2501.11790 Sparse Blocked context onlyJan 20, 2025
- Agentic Retrieval-Augmented Generation: A Survey on Agentic RAGarxiv-2501.09136 Direct Blocked context onlyJan 15, 2025
- Cosmos World Foundation Model Platform for Physical AIarxiv-2501.03575 Sparse Blocked context onlyJan 7, 2025
- A Survey of World Models for Autonomous Drivingarxiv-2501.11260 Sparse Blocked context onlyJan 1, 2025
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learningarxiv-2501.12948 Direct Blocked context onlyJan 1, 2025
- VARGPT: Unified Understanding and Generation in a Visual Autoregressive Multimodal Large Language Modelarxiv-2501.12327 Direct Blocked context onlyJan 1, 2025
- AffectGPT: A New Dataset, Model, and Benchmark for Emotion Understanding with Multimodal Large Language Modelsarxiv-2501.16566 Direct Blocked context onlyJan 1, 2025
- FairCoder: Evaluating Social Bias of LLMs in Code Generationarxiv-2501.05396 Curated Related Blocked context onlyJan 1, 2025
- Search-o1: Agentic Search-Enhanced Large Reasoning Modelsarxiv-2501.05366 Direct Blocked context onlyJan 1, 2025
- InfiGUIAgent: A Multimodal Generalist GUI Agent with Native Reasoning and Reflectionarxiv-2501.04575 Sparse Blocked context onlyJan 1, 2025
- Eliza: A Web3 friendly AI Agent Operating Systemarxiv-2501.06781 Sparse Blocked context onlyJan 1, 2025
- Aviary: training language agents on challenging scientific tasksarxiv-2412.21154 Direct Blocked context onlyDec 30, 2024
- Exploring Embedding Priors in Prompt-Tuning for Improved Interpretability and Controlarxiv-2412.18582 Sparse Blocked context onlyDec 24, 2024
- Extracting and Following Paths for Robust Relational Reasoning with Large Language Modelsarxiv-2412.17963 Sparse Blocked context onlyDec 23, 2024
- Multi-modal, Multi-task, Multi-criteria Automatic Evaluation with Vision Language Modelsarxiv-2412.14613 Sparse Blocked context onlyDec 19, 2024
- Exploiting Vision Encoder Vulnerabilities for Universal Adversarial Perturbations on Large Vision-Language Modelsarxiv-2412.08108 Sparse Blocked context onlyDec 11, 2024
- SpecFuse: Ensembling Large Language Models via Next-Segment Predictionarxiv-2412.07380 Sparse Blocked context onlyDec 10, 2024
- LLMs Faithfully and Iteratively Compute Answers During CoT: A Systematic Analysis With Multi-step Arithmeticsarxiv-2412.01113 Sparse Blocked context onlyDec 2, 2024
- Gramian Multimodal Representation Learning and Alignmentarxiv-2412.11959 Direct Blocked context onlyDec 1, 2024
- TheAgentCompany: Benchmarking LLM Agents on Consequential Real World Tasksarxiv-2412.14161 Direct Blocked context onlyDec 1, 2024
- Remote Sensing Temporal Vision-Language Models: A Comprehensive Surveyarxiv-2412.02573 Direct Blocked context onlyDec 1, 2024
- Offline Reinforcement Learning for LLM Multi-Step Reasoningarxiv-2412.16145 Direct Blocked context onlyDec 1, 2024
- Evaluating LLM Reasoning in the Operations Research Domain with ORQAarxiv-2412.17874 Direct Blocked context onlyDec 1, 2024
- TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generationarxiv-2412.03069 Direct Blocked context onlyDec 1, 2024
- The BrowserGym Ecosystem for Web Agent Researcharxiv-2412.05467 Direct Blocked context onlyDec 1, 2024
- BatchLLM: Optimizing Large Batched LLM Inference with Global Prefix Sharing and Throughput-oriented Token Batchingarxiv-2412.03594 Sparse Blocked context onlyNov 29, 2024
- Just KIDDIN: Knowledge Infusion and Distillation for Detection of INdecent Memesarxiv-2411.12174 Sparse Blocked context onlyNov 19, 2024
- LLMPhy: Parameter-Identifiable Physical Reasoning Combining Large Language Models and Physics Enginesarxiv-2411.08027 Sparse Blocked context onlyNov 12, 2024
- LLM2CLIP: Powerful Language Model Unlocks Richer Cross-Modality Representationarxiv-2411.04997 Sparse Blocked context onlyNov 7, 2024
- RE-Bench: Evaluating frontier AI R&D capabilities of language model agents against human expertsarxiv-2411.15114 Direct Blocked context onlyNov 1, 2024
- Enhancing Reasoning Capabilities of LLMs via Principled Synthetic Logic Corpusarxiv-2411.12498 Direct Blocked context onlyNov 1, 2024
- Procedural Knowledge in Pretraining Drives Reasoning in Large Language Modelsarxiv-2411.12580 Direct Blocked context onlyNov 1, 2024
- Game-theoretic LLM: Agent Workflow for Negotiation Gamesarxiv-2411.05990 Direct Blocked context onlyNov 1, 2024
- Semantic-Aligned Adversarial Evolution Triangle for High-Transferability Vision-Language Attackarxiv-2411.02669 Direct Blocked context onlyNov 1, 2024
- SimSiam Naming Game: A Unified Approach for Representation Learning and Emergent Communicationarxiv-2410.21803 Sparse Blocked context onlyOct 29, 2024
- ExpertFlow: Efficient Mixture-of-Experts Inference via Predictive Expert Caching and Token Schedulingarxiv-2410.17954 Sparse Blocked context onlyOct 23, 2024
- Scaling Knowledge Graph Construction through Synthetic Data Generation and Distillationarxiv-2410.16597 Sparse Blocked context onlyOct 22, 2024
- LLM4AD: Large Language Models for Autonomous Driving -- Concept, Review, Benchmark, Experiments, and Future Trendsarxiv-2410.15281 Sparse Blocked context onlyOct 20, 2024
- LightTransfer: Your Long-Context LLM is Secretly a Hybrid Model with Effortless Adaptationarxiv-2410.13846 Direct Blocked context onlyOct 17, 2024
- Embodied Agent Interface: Benchmarking LLMs for Embodied Decision Makingarxiv-2410.07166 Sparse Blocked context onlyOct 9, 2024
- Superficial Safety Alignment Hypothesisarxiv-2410.10862 Sparse Blocked context onlyOct 7, 2024
- GLEE: A Unified Framework and Benchmark for Language-based Economic Environmentsarxiv-2410.05254 Sparse Blocked context onlyOct 7, 2024
- Code Comprehension then Auditing for Unsupervised LLM Evaluationarxiv-2410.03131 Sparse Blocked context onlyOct 4, 2024
- AutoML-Agent: A Multi-Agent LLM Framework for Full-Pipeline AutoMLarxiv-2410.02958 Direct Blocked context onlyOct 3, 2024
- GraphTeam: Facilitating Large Language Model-based Graph Analysis via Multi-Agent Collaborationarxiv-2410.18032 Direct Blocked context onlyOct 1, 2024
- AutoDAN-Turbo: A Lifelong Agent for Strategy Self-Exploration to Jailbreak LLMsarxiv-2410.05295 Direct Blocked context onlyOct 1, 2024
- MoE++: Accelerating Mixture-of-Experts Methods with Zero-Computation Expertsarxiv-2410.07348 Direct Blocked context onlyOct 1, 2024
- OV-MER: Towards Open-Vocabulary Multimodal Emotion Recognitionarxiv-2410.01495 Direct Blocked context onlyOct 1, 2024
- ImProver: Agent-Based Automated Proof Optimizationarxiv-2410.04753 Direct Blocked context onlyOct 1, 2024
- R-CoT: Reverse Chain-of-Thought Problem Generation for Geometric Reasoning in Large Multimodal Modelsarxiv-2410.17885 Direct Blocked context onlyOct 1, 2024
- Adversarial Score identity Distillation: Rapidly Surpassing the Teacher in One Steparxiv-2410.14919 Direct Blocked context onlyOct 1, 2024
- SWE-Search: Enhancing Software Agents with Monte Carlo Tree Search and Iterative Refinementarxiv-2410.20285 Direct Blocked context onlyOct 1, 2024
- Improve Vision Language Model Chain-of-thought Reasoningarxiv-2410.16198 Direct Blocked context onlyOct 1, 2024
- Edu-Values: Towards Evaluating the Chinese Education Values of Large Language Modelsarxiv-2409.12739 Sparse Blocked context onlySep 19, 2024
- E2LLM: Encoder Elongated Large Language Models for Long-Context Understanding and Reasoningarxiv-2409.06679 Sparse Blocked context onlySep 10, 2024
- Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolutionarxiv-2409.12191 Sparse Blocked context onlySep 1, 2024
- M$^2$PT: Multimodal Prompt Tuning for Zero-shot Instruction Learningarxiv-2409.15657 Direct Blocked context onlySep 1, 2024
- Whisper in Medusa's Ear: Multi-head Efficient Decoding for Transformer-based ASRarxiv-2409.15869 Sparse Blocked context onlySep 1, 2024
- Simple and Fast Distillation of Diffusion Modelsarxiv-2409.19681 Direct Blocked context onlySep 1, 2024
- Language agents achieve superhuman synthesis of scientific knowledgearxiv-2409.13740 Direct Blocked context onlySep 1, 2024
- OLMoE: Open Mixture-of-Experts Language Modelsarxiv-2409.02060 Direct Blocked context onlySep 1, 2024
- Underwater Camouflaged Object Tracking Meets Vision-Language SAM2arxiv-2409.16902 Direct Blocked context onlySep 1, 2024
- Planning In Natural Language Improves LLM Search For Code Generationarxiv-2409.03733 Curated Related Blocked context onlySep 1, 2024
- Cascade Prompt Learning for Vision-Language Model Adaptationarxiv-2409.17805 Sparse Blocked context onlySep 1, 2024
- HyperAgent: Generalist Software Engineering Agents to Solve Coding Tasks at Scalearxiv-2409.16299 Sparse Blocked context onlySep 1, 2024
- LongGenBench: Benchmarking Long-Form Generation in Long Context LLMsarxiv-2409.02076 Direct Blocked context onlySep 1, 2024
- MathScape: Benchmarking Multimodal Large Language Models in Real-World Mathematical Contextsarxiv-2408.07543 Sparse Blocked context onlyAug 14, 2024
- Beyond Mimicry to Contextual Guidance: Knowledge Distillation for Interactive AIarxiv-2408.07238 Sparse Blocked context onlyAug 13, 2024
- Causal Agent based on Large Language Modelarxiv-2408.06849 Sparse Blocked context onlyAug 13, 2024
- Generative Dataset Distillation Based on Diffusion Modelarxiv-2408.08610 Direct Blocked context onlyAug 1, 2024
- Multi-Agent Reinforcement Learning for Autonomous Driving: A Surveyarxiv-2408.09675 Direct Blocked context onlyAug 1, 2024
- MuChoMusic: Evaluating Music Understanding in Multimodal Audio-Language Modelsarxiv-2408.01337 Sparse Blocked context onlyAug 1, 2024
- Writing in the Margins: Better Inference Pattern for Long Context Retrievalarxiv-2408.14906 Direct Blocked context onlyAug 1, 2024
- MuMA-ToM: Multi-modal Multi-Agent Theory of Mindarxiv-2408.12574 Direct Blocked context onlyAug 1, 2024
- The Llama 3 Herd of Modelsarxiv-2407.21783 Sparse Blocked context onlyJul 31, 2024
- Reinforcement Learning for LLM Post-Training: A Surveyarxiv-2407.16216 Sparse Blocked context onlyJul 23, 2024
- SemioLLM: Evaluating Large Language Models for Diagnostic Reasoning from Unstructured Clinical Narratives in Epilepsyarxiv-2407.03004 Sparse Blocked context onlyJul 3, 2024
- LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Modelsarxiv-2407.07895 Direct Blocked context onlyJul 1, 2024
- VISA: Reasoning Video Object Segmentation via Large Language Modelsarxiv-2407.11325 Sparse Blocked context onlyJul 1, 2024