LIVE · refreshes every 20 min
updated Sep 16, 04:23 UTC
110010
.art
(ificial intelligence)
AI products, research, and launches — clustered and ranked, not just re-blogged.
All stories
Research
Discussion
RSS
⌕
Search
/
☾
110010
.art
/
archive
/
research
/ 2026-08
Research — August 2026
Aug 19
PIKFNO: an interpretable neural operator that uses physics informed kernel functions derived from governing equations to constrain the trunk network.
arXiv cs.LG
source ↗
Aug 19
DUET: Dual-Teacher On-Policy Distillation via Same-Weight Disagreement for Prohibition Compliance
arXiv cs.LG
source ↗
Aug 19
Pushing the limits of high-resolution weather forecasting through data scaling
arXiv cs.LG
source ↗
Aug 19
Early cycle charge trajectory generative prediction and full life cycle health management of iron-chromium flow batteries using FlowBD-E1
arXiv cs.LG
source ↗
Aug 19
Randomly initialized autoencoders: fixed points and edge-of-chaos
arXiv cs.LG
source ↗
Aug 19
DumpsterCluster: using retired GPUs to serve LLaMA-70B on 60 GPUs
arXiv cs.LG
source ↗
Aug 19
Efficient neural-network-based high-resolution radiative transfer for CO2 retrieval, and application to interferometric sensing
arXiv cs.LG
source ↗
Aug 19
iFuzz-Meta: an interpretable fuzzy rule-based learning framework bridging top-down and bottom-up knowledge integration
arXiv cs.LG
source ↗
Aug 19
Training and evaluating ethical reinforcement learning agents on per-episode distributions
arXiv cs.LG
source ↗
Aug 19
Coarse-to-fine multi-resolution diffusion models for trajectory generation in urban systems
arXiv cs.LG
source ↗
Aug 19
Forward Pass Domain Adaptation (Without Cross-Layer Backpropagation) achieves 2.7–3.2x throughput and ~40% lower peak memory for fine-tuning without backward passes; off-domain benchmarks remain within seed-noise of baseline.
arXiv cs.LG
source ↗
Aug 19
Valid per-field selective risk control for document extraction; three failure modes, a validity ladder, and when conditioning pays
arXiv cs.LG
source ↗
Aug 19
Discrete diffusion language models are training-free multi-label classifiers
arXiv cs.LG
source ↗
Aug 19
Metaplasticity as adaptive gradient preconditioning for incremental learning
arXiv cs.LG
source ↗
Aug 19
Explanations using Alternative Realities for Reinforcement Learning (EARL) introduced for self-adaptive systems
arXiv cs.LG
source ↗
Aug 19
Learning discrete Riemannian metrics for physical fields with cochain-frame equivariance
arXiv cs.LG
source ↗
Aug 19
Geometry Is Not Robustness: a trajectory-level study of PGD evaluation
arXiv cs.LG
source ↗
Aug 19
Calibrated trust, not sharper prediction, shown in uncertainty fusion for legal outcome predictions
arXiv cs.LG
source ↗
Aug 19
Paired exact-reset evaluation of a prediction-derived medium-to-full world-model cascade
arXiv cs.LG
source ↗
Aug 19
Fractional optimizers meet fractal activation functions: an empirical study of multi-scale optimization in neural networks
arXiv cs.LG
source ↗
Aug 19
BDIP-Net: dual-interaction graph learning for property prediction of bilayer materials
arXiv cs.LG
source ↗
Aug 19
LiveHouse-TS: an open-world living benchmark for time series foundation models
arXiv cs.AI
source ↗
Aug 19
KernelArc: a multi-agent framework for autonomous GPU kernel optimization across heterogeneous workloads
arXiv cs.AI
source ↗
Aug 19
Fool's Gold: Defensive deception against safety-removal attacks on open-weight models
arXiv cs.AI
source ↗
Aug 19
Institution-specific LLM prompting recovers PHI that de-identification systems and their gold standards miss
arXiv cs.CL
source ↗
Aug 19
Token optimization and context-window management in multi-agent AI workflows
arXiv cs.CL
source ↗
Aug 19
Synthesizing feature extractors: an agentic approach for algorithm selection.
arXiv cs.AI
source ↗
Aug 19
TileMix: Tile-Centric mixed-precision attention for LLM inference acceleration
arXiv cs.AI
source ↗
Aug 19
Can LLMs reason in a legally meaningful manner? A small-scale study on European Court of Human Rights cases
arXiv cs.CL
source ↗
Aug 19
Margin-regularized structured semantic alignment for brain-language correspondence
arXiv cs.CL
source ↗
Aug 19
Temporal leakage in financial news NLP: a multi-architecture audit with a regime-specific M&A signal
arXiv cs.CL
source ↗
Aug 19
KnowSim: evaluating information calibration in LLM assistants with user simulators that learn
arXiv cs.AI
source ↗
Aug 19
Wuying-Browser-Agent: real-world centric, long-horizon browser agents for sustained decision making on live websites
arXiv cs.AI
source ↗
Aug 19
Which source wins? Task-dependent reliance in vision-language models
arXiv cs.CL
source ↗
Aug 19
ICD-Deepre predicts future diagnosis codes from longitudinal records using structured EHR foundation models and language models
arXiv cs.CL
source ↗
Aug 19
ArguLens: an open-source system for automated essay scoring and label-aware feedback generation
arXiv cs.CL
source ↗
Aug 19
From entity mentions to tone: an LLM-based pipeline for media bias analysis
arXiv cs.CL
source ↗
Aug 19
Polaris: learning to generate table descriptions from retrieval feedback
arXiv cs.CL
source ↗
Aug 19
LLMs for medical consultation evaluated after problem framing; study analyzes three API models across multi-turn vignettes and standardized-patient simulations
arXiv cs.AI
source ↗
Aug 19
AISA: AI Safety Assistant Framework for Continuous Improvement of Highway Construction
arXiv cs.CL
source ↗
Aug 19
The plot thins: uniformity and linearity in literary summaries
arXiv cs.CL
source ↗
Aug 19
Explicit state elicitation is not enough: a controlled audit of memory-policy classification
arXiv cs.AI
source ↗
Aug 19
Benchmarking the Benchmarks: evaluating automated safety benchmarks for small language models
arXiv cs.AI
source ↗
Aug 19
DeAR: decentralized agentic reasoning via capability grounding and collaborative thought navigation
arXiv cs.AI
source ↗
Aug 19
GxP-Agent: Process-DAG topologies for reliable clinical trial programming with LLM agents
arXiv cs.AI
source ↗
Aug 19
Cross-model memory transfer via target-side reader adaptation
arXiv cs.CL
source ↗
Aug 19
There is no theoretical curse of multilinguality for embedding space structure.
arXiv cs.CL
source ↗
Aug 19
PlanPO: Group planning-aware policy optimization for multi-turn agentic LLMs
arXiv cs.AI
source ↗
Aug 19
Logit-based energy scoring outperforms prompted LLM-as-judge for ranking scientific hypotheses
arXiv cs.AI
source ↗
Aug 19
Towards Safer RAG: only agents capable of System 2 thinking may access untrusted documents
arXiv cs.CL
source ↗
Aug 19
Memory Is Communication: allocation of memory and messaging under resource limits in bounded agents
arXiv cs.AI
source ↗
Aug 19
DiSCO: Defending text-to-image generation through distribution-guided contrastive prompt optimization
arXiv cs.AI
source ↗
Aug 19
ArborMem: navigating interaction states with memory forests
arXiv cs.CL
source ↗
Aug 19
Emotion Across Speech and Faces: Shared Affective Mechanisms in Multimodal Foundation Models
arXiv cs.CL
source ↗
Aug 19
SignalReasoner: assessing the upper bound of 3B models for signal mathematical reasoning
arXiv cs.AI
source ↗
Aug 19
A glyph is not a letter, a token is not a word, and a space is not a space in Voynichese units; study tests three assumptions against Zandbergen-Landini transliteration
arXiv cs.CL
source ↗
Aug 19
FedPref: federated preference learning for structured radiology report extraction
arXiv cs.AI
source ↗
Aug 19
Q-Interference: memory-efficient phase-aware quantum-inspired attention for autoregressive language modeling
arXiv cs.CL
source ↗
Aug 19
The problem is the problem: towards scalable mathematical discovery
arXiv cs.AI
source ↗
Aug 19
The price of thinking: reasoning effort as a model-specific API contract
arXiv cs.AI
source ↗
Aug 19
PTXBench benchmarks and adapts LLMs to architecture-specific PTX for GPU kernel optimization, measuring functional correctness and speedup on GEMM and attention workloads across H100 and B200 GPUs.
arXiv cs.CL
source ↗
Aug 19
Toward personal intelligence through cooperative observation
arXiv cs.AI
source ↗
Aug 19
Children accelerate word learning while language models do not
arXiv cs.CL
source ↗
Aug 19
SkillEffect: Checked lowering for memory-bounded agent tools
arXiv cs.AI
source ↗
Aug 19
ASI-Bench: at the dawn of artificial superintelligence
arXiv cs.AI
source ↗
Aug 18
Study finds generated AI art often cannot be traced to training data when authors are removed from the dataset
MIT News (AI)
source ↗
Aug 18
TeachMateGPT: a multi-agent knowledge-grounded framework for pedagogical assessment generation from science curriculum materials
arXiv cs.CL
source ↗
Aug 18
Jais 2 is a family of Arabic-centric large language models developed by MBZUAI, Cerebras, and Inception, including a 70B open LLM and an 8B-parameter variant.
arXiv cs.CL
source ↗
Aug 18
StreamHear: domain-adapted pseudo-labeling for semi-supervised streaming speech recognition
arXiv cs.CL
source ↗
Aug 18
Legal RAG systems still hallucinate, study finds across eight systems on English GDPR and French civil-law corpora
arXiv cs.CL
source ↗
Aug 18
Repair, not improvement: decomposing constrained decoding in tool-call abstention
arXiv cs.CL
source ↗
Aug 18
When lexical change misleads: evaluating dynamic topic models with traditional and LLM-based metrics across NYT, DBLP, and arXiv topics
arXiv cs.CL
source ↗
Aug 18
S2Dialog: Multimodal dialogue retrieval with semantic and acoustic-style modeling
arXiv cs.CL
source ↗
Aug 18
The conditional superiority of fast silicon sampling
arXiv cs.CL
source ↗
Aug 18
Leading-Silence augmentation and multi-stage synthetic supervision used for the second MLC-SLM challenge
arXiv cs.CL
source ↗
Aug 18
Not all tokens are equal: inflation-aware routing for agentic LLM systems
arXiv cs.CL
source ↗
Aug 18
Does a Language Server save tokens for coding agents? A measurement methodology and preliminary study
arXiv cs.CL
source ↗
Aug 18
GALA: Generation-Aware Cross-Modal Alignment for Text-to-Time-Series Synthesis
arXiv cs.CL
source ↗
Aug 18
Scaling creative writing beyond story-centric data with attribute-guided genre expansion
arXiv cs.CL
source ↗
Aug 18
Amplified does not mean predictive: reasoning behaviors in thinking models
arXiv cs.CL
source ↗
Aug 18
GRPO beyond English: a large-scale study of GRPO in non-English and multilingual settings
arXiv cs.CL
source ↗
Aug 18
Bootstrapping niche multilingual code translation via reinforcement learning with execution-based verifiable supervision
arXiv cs.CL
source ↗
Aug 18
IterCOMP: reasoning-aware adaptive prompt compression for multi-hop question answering
arXiv cs.CL
source ↗
Aug 18
Blockwise Causal Memory Transformer aims to model long-context language with local block attention and block-level global context propagation
arXiv cs.CL
source ↗
Aug 18
CLAIR-Fin: an adversarial multi-agent framework for claim-level verification and adaptive debate in cross-modal financial QA
arXiv cs.CL
source ↗
Aug 18
ASSERT: A measurement pipeline for GenAI audits
arXiv cs.CL
source ↗
Aug 18
BM25-augmented many-shot translation for low-resource north-eastern Indian languages
arXiv cs.CL
source ↗
Aug 18
Measuring fairness in large audio language models via semantic-aware bias estimation
arXiv cs.CL
source ↗
Aug 18
Think in latent, explain in language: self-explainable latent reasoning
arXiv cs.CL
source ↗
Aug 18
Medical AI neglects actual treatment outcomes in favor of opinions and syntheses, hindering its ability to predict treatment effectiveness.
arXiv cs.AI
source ↗
Aug 18
Longitudinal and graph-augmented prediction of adolescent substance use onset in the ABCD study.
arXiv cs.AI
source ↗
Aug 18
Do LLM agents negotiate rationally? A mechanism-design framework for verifiable multi-agent interaction over A2A/MCP
arXiv cs.AI
source ↗
Aug 18
FLOPs do not reliably predict execution time; replication is important for AI efficiency assessment
arXiv cs.AI
source ↗
Aug 18
Learning agent execution for KV-cache management in agentic serving
arXiv cs.AI
source ↗
Aug 18
MecEng benchmark measures large language models on creating multibody simulation models from parameterized text descriptions
arXiv cs.AI
source ↗
Aug 18
Global AI regulations for FAIR and ethics in high-risk use cases: a comparative review
arXiv cs.AI
source ↗
Aug 18
A human-centred approach to benchmarking LLMs for parenting advice
arXiv cs.AI
source ↗
Aug 18
Euclid-Omni: a unified neuro-symbolic framework for plane geometry
arXiv cs.AI
source ↗
Aug 18
Auxiliary uncertainty signals improve LLM-assisted systematic review screening; benchmark across eight Cohen drug-class reviews shows improved efficiency
arXiv cs.CL
source ↗
Aug 18
AI governance needs ISO-like interoperability protocols, not just laws
arXiv cs.AI
source ↗
Aug 18
Toward Safe LLM agents: a survey of specification, verification, and enforcement
arXiv cs.AI
source ↗
Aug 18
AI lock-in is in progress, and we must be prepared
arXiv cs.AI
source ↗
Aug 18
The Hallucination Snowball: modeling error propagation as state transitions in multi-agent LLM pipelines
arXiv cs.AI
source ↗
Aug 18
Agentic framework using rules and LLMs for embedding and annotating descriptive document layouts in plant science use case
arXiv cs.AI
source ↗
Aug 18
The Unwritten Benchmark: a new challenge for multimodal machine learning in abstract perceptual reasoning
arXiv cs.AI
source ↗
Aug 18
Characterizing rhetorical misalignment in decision-making with language models
arXiv cs.CL
source ↗
Aug 18
OGX: an open-source, vendor-neutral Generative AI application server implements APIs of major labs with pluggable backends
arXiv cs.AI
source ↗
Aug 18
SKILL: Self-correcting knowledge-guided iterative LLM agent for logic optimization
arXiv cs.AI
source ↗
Aug 18
Neural constraint reasoning should prioritize symbolic integration over pure learning to ensure certified correctness under distribution shifts.
arXiv cs.AI
source ↗
Aug 18
From Doyle to AGM: a survey and an implementation roadmap for belief change
arXiv cs.AI
source ↗
Aug 18
When do LLMs apply the wrong law? Diagnosing temporal applicable-law failures in legal reasoning
arXiv cs.AI
source ↗
Aug 18
Want better ML reviews? switch to a credit-based incentivization system
arXiv cs.AI
source ↗
Aug 18
Evaluations of AI moral reasoning still miss half the picture
arXiv cs.AI
source ↗
Aug 18
When to communicate: belief distributions and KL divergence for principled gating in multi-agent RL
arXiv cs.AI
source ↗
Aug 18
Which question is your attention metric answering? attention rows as compositional data
arXiv cs.CL
source ↗
Aug 18
Wiola 13M, a gated spiral attention architecture for parameter efficient small language models
arXiv cs.CL
source ↗
Aug 18
DeMTS: denoising trajectories as multivariate time series for hallucination detection in diffusion language models
arXiv cs.CL
source ↗
Aug 18
Automatic or controlled? Repetition priming reveals divergent processing in base LLMs, Instruct LLMs, and humans
arXiv cs.CL
source ↗
Aug 18
Multi-modal generative fuzzy system: fuzzy inference guides large model interactive question answering framework
arXiv cs.CL
source ↗
Aug 18
Evaluation of retrieval failure in RAG architectures for Bengali agricultural advisory; study analyzes query-type and language-condition gaps across 1,000 farmer queries and 2,882 knowledge nodes
arXiv cs.CL
source ↗
Aug 18
Training leaves traces: centered residual signatures for language model lineage verification
arXiv cs.CL
source ↗
Aug 18
Beyond the pale: assessing prevalence and contents of extremist speech in LLM training data
arXiv cs.CL
source ↗
Aug 18
HarmProfile benchmarks harmful outputs of frontier LLMs by characterizing distributions of misbehavior and related content.
arXiv cs.CL
source ↗
Aug 18
How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks
arXiv cs.CL
source ↗
Aug 18
What to Forget in Unlearning? Forget Set Curation for Language Models
arXiv cs.CL
source ↗
Aug 18
Beyond tokens: a survey on decoding methods for large language and vision-language models
arXiv cs.CL
source ↗
Aug 18
Interpretable cross-lingual alignment in small language models; probing cultural and pragmatic reasoning in Japanese-English bilingual LLMs
arXiv cs.CL
source ↗
Aug 18
Domain Agnostic text redaction from natural language rules using instruction tuning
arXiv cs.CL
source ↗
Aug 18
LLM safety alignment in low-resource languages: a systematic literature review
arXiv cs.CL
source ↗
Aug 18
RamseyGadgets: a graph construction dataset for LLMs
arXiv cs.CL
source ↗
Aug 18
Prompting is not enough: supervised baselines and leakage control for measuring shared decision-making with LLMs in pediatric encounters
arXiv cs.CL
source ↗
Aug 18
Writing style similarity reflects academic genealogy
arXiv cs.CL
source ↗
Aug 18
DA-RAC: distance-aware calibration of LLM judges for trustworthy AI auditing
arXiv cs.CL
source ↗
Aug 17
Rethinking how innovation happens: The Invisible Engine argues that innovation unfolds through the integration of market applications, technology, and implementation; Eugene Fitzgerald discusses how society should invest in it.
MIT News (AI)
source ↗
Aug 17
Agentao: a governed local-first runtime for tool-using LLM agents
arXiv cs.AI
source ↗
Aug 17
Training-free knowledge transfer across model scales through activation-guided pruning
arXiv cs.LG
source ↗
Aug 17
Depth-Aware sensitivity analysis of mixture-of-experts models via magnitude-based expert masking
arXiv cs.AI
source ↗
Aug 17
Don't claim benchmark-oriented optimization improves general coding capability; diverse evaluation is required
arXiv cs.LG
source ↗
Aug 17
Fashion outfit generation via unified sequential composition models
arXiv cs.LG
source ↗
Aug 17
Coverage aware active evaluation for failure discovery with paired systems
arXiv cs.AI
source ↗
Aug 17
Stable miscalibration in large language models: a practical view of high-confidence errors
arXiv cs.AI
source ↗
Aug 17
ConceptFlow: a scikit-learn-compatible Python library for Formal Concept Analysis builds nested line diagrams from many-valued contexts and outputs interactive visualizations
arXiv cs.AI
source ↗
Aug 17
Query-derived erase direction (QED) added to mitigate interference in linear attention reads
arXiv cs.LG
source ↗
Aug 17
Inducing reward-free judging rubrics that reduce over-crediting in agent evaluation
arXiv cs.AI
source ↗
Aug 17
ARC: Fair relative advantage comparison in open-ended real-world interaction
arXiv cs.AI
source ↗
Aug 17
Robust XGBoosting for regression
arXiv cs.LG
source ↗
Aug 17
Geometric filtering of LLM-generated samples for few-shot text classification
arXiv cs.LG
source ↗
Aug 17
Advances in deep learning-based drug-target binding affinity prediction
arXiv cs.LG
source ↗
Aug 17
HI-MeshGraphNets: Efficient and accurate mesh-based physics learning with hierarchical multi-scale graph neural networks
arXiv cs.LG
source ↗
Aug 17
Capacity-dependent effects of data selection for reasoning
arXiv cs.LG
source ↗
Aug 17
Robust dual-model collaborative random vector functional link network
arXiv cs.LG
source ↗
Aug 17
From BERT to frontier agents: eight years of language-model progress, the collapse of the capability-cost curve, and the rise of task-targeted models
arXiv cs.LG
source ↗
Aug 17
Localizing cross-kernel divergence in INT8-quantized LLM inference across CUTLASS and Triton kernels
arXiv cs.LG
source ↗
Aug 17
A year in LLM serving: workload evolution, caching and load-balancing
arXiv cs.AI
source ↗
Aug 17
Reward machines for signal temporal logic
arXiv cs.AI
source ↗
Aug 17
AI evaluation should focus on human–AI teams rather than autonomous superhuman performance
arXiv cs.AI
source ↗
Aug 17
Learning to assemble novel structures with unfamiliar parts under semantic constraints
arXiv cs.AI
source ↗
Aug 17
Active perception for embodied disambiguation
arXiv cs.AI
source ↗
Aug 17
Evaluating agentic learning harness capabilities without labels via the scaling hypothesis
arXiv cs.AI
source ↗
Aug 17
Dynamic multi-depot vehicle routing with online requests using event-driven transformer--DRL and rolling-horizon benchmarking
arXiv cs.LG
source ↗
Aug 17
Measuring cross-task behavioral consistency in language model agents.
arXiv cs.AI
source ↗
Aug 17
Algorithm design and physician liability for disparate AI clinical algorithms</analysis>
arXiv cs.AI
source ↗
Aug 17
Cross-disciplinary taxonomy and modeling of misunderstanding generation, amplification, and detection, from pragmatics to AI agents
arXiv cs.AI
source ↗
Aug 17
L-FNO: Lorentzian Fourier Neural Operator for stochastic event dynamics
arXiv cs.LG
source ↗
Aug 17
Federated prompt learning: a unified framework, empirical analysis, and future directions
arXiv cs.LG
source ↗
Aug 17
How compliant is sepsis treatment? An expert-guided neuro-symbolic pipeline for generating clinical compliance insights
arXiv cs.AI
source ↗
Aug 17
Contrastive learning for interpretable anomaly detection at collider experiments
arXiv cs.LG
source ↗
Aug 17
No universal signal predicts sample-level LLM regression under version updates
arXiv cs.AI
source ↗
Aug 17
CutClean: neural network pruning for privacy-preserving inference
arXiv cs.LG
source ↗
Aug 17
SAGE: Surrogate-gradient adaptation via attention-guided entropy for spiking transformers
arXiv cs.LG
source ↗
Aug 17
Second Thought: reasoning in parallel as LLM agents act and observe
arXiv cs.AI
source ↗
Aug 17
Modular cognitive architecture emerges in large language models
arXiv cs.AI
source ↗
Aug 17
PPAPlace: Differentiable cross-stage objectives for chip placement optimization
arXiv cs.LG
source ↗
Aug 17
EEG-PRISM: physiologically grounded interpretability of predictions by EEG foundation models
arXiv cs.LG
source ↗
Aug 17
Stochastic control policies for robust molecular transition path sampling.
arXiv cs.LG
source ↗
Aug 17
Your Probabilistic JEPA is secretly a hidden Markov model: a state-space interpretation of Joint-Embedding Predictive Learning
arXiv cs.AI
source ↗
Aug 17
SemPlan benchmarks structured semantic planning for LLM-based queries over enterprise data with a bilingual synthetic benchmark and a frozen scientific evaluation subset
arXiv cs.AI
source ↗
Aug 17
Hybrid Quantum-inspired Kolmogorov-Arnold networks for privacy-aware federated biosignal learning
arXiv cs.LG
source ↗
Aug 17
MobileMem: learning from a year of mobile experiences
arXiv cs.AI
source ↗
Aug 17
Variation Brownian Kernel Ladder introduces a path-atomic function-space framework that separates nonlinear recursive dictionary construction from linear variation, using Brownian RKHS unit-ball profiles to build VBKL space.
arXiv cs.LG
source ↗
Aug 17
MedMix: specialization-consistent federated sparse MoEs under modality heterogeneity
arXiv cs.LG
source ↗
Aug 17
Hard Cases, Bad Labels: Testing error exposure and error location in uncertainty sampling under bounded label noise
arXiv cs.LG
source ↗
Aug 15
CAS: a causal attribution score for local and global explainable AI
arXiv cs.AI
source ↗
Aug 15
Auditable agentic AI coordinates diagnostic tools and stores outputs as auditable case-level evidence for thyroid ultrasound diagnosis and reporting
arXiv cs.AI
source ↗
Aug 15
Learning to adapt cross-domain preferences via meta-LoRA for LLM personalization
arXiv cs.AI
source ↗
Aug 15
Alignment methods can be misused for censorship and manipulation, as a position paper argues that modern AI alignment is dual-use and may provide malicious actors with better tools.
arXiv cs.AI
source ↗
Aug 15
AstraZeneca develops Research Assistant, an internal LLM-based system to explore biomedical questions across literature, knowledge graphs, chemistry, and clinical data
arXiv cs.AI
source ↗
Aug 15
Trie automata for constrained decoding over large finite sets
arXiv cs.AI
source ↗
Aug 15
SteerBench-Work: a benchmark for agent steering at action boundaries across workplace domains
arXiv cs.AI
source ↗
Aug 15
Dual-flow transformers decouple the primary prefill path from additional decode computation
arXiv cs.AI
source ↗
Aug 15
Governed Persistent Memory introduces a source-bound, auditable bitemporal state-transition model with fail-closed release for long-horizon agents
arXiv cs.AI
source ↗
Aug 15
Epsilon-MemEvo enables cross-task memory transfer in LLM program evolution by storing prior experience as task-agnostic tactic memories
arXiv cs.AI
source ↗
Aug 15
IntegrityBench benchmarks LLMs on misconduct classification, ethical action reasoning, and artifact-grounded decision making across 36 paired tasks under pressure; evaluates 18 frontier model variants
arXiv cs.AI
source ↗
Aug 15
Dead text or binding clause? Measuring and restoring constraint influence in black-box LLM dialogues
arXiv cs.AI
source ↗
Aug 15
MindMemOS: a portable and self-evolving memory operating layer for AI agents
arXiv cs.AI
source ↗
Aug 15
DiG-bench: discovery in games
arXiv cs.AI
source ↗
Aug 15
Jagged judges: Epistemic stability under silence, pressure, and persistence
arXiv cs.AI
source ↗
Aug 15
Designing AI pipelines for decision-ready ITSM intelligence
arXiv cs.AI
source ↗
Aug 15
Reasoning is a learnable rule-based process
arXiv cs.AI
source ↗
Aug 15
Asking an LLM in Japanese can change its willingness to advise a nuclear strike, study finds
arXiv cs.AI
source ↗
Aug 15
Multi-Agent Scheduling with LLM-assisted contract net negotiation for stream processing in mobile edge computing
arXiv cs.AI
source ↗
Aug 15
Agreement is not alignment: divergent moral grounds in human and LLM ethical judgments
arXiv cs.AI
source ↗
Aug 15
Probabilities of causation with causal knowledge tightened for binary PNS bounds by incorporating additional information
arXiv cs.AI
source ↗
Aug 15
Reasoning Jury: multi-model consensus for evaluating reasoning traces
arXiv cs.AI
source ↗
Aug 15
Attention is all you have; arXiv:2608.12610v1 reports that 56,804 public agent skills exist and installation bundles content, persistence, and trigger management, limiting long-tail usage.
arXiv cs.AI
source ↗
Aug 15
Large language models can follow instructions, but struggle with many constraints simultaneously; phase transitions in compositional constraint satisfaction
arXiv cs.AI
source ↗
Aug 14
InfraBench: evaluating infrastructure agents across layers, lifecycle, and risk; building infrastructure for financially autonomous AI agents
arXiv cs.AI
source ↗
Aug 14
RecSys Factory: bounding LLM agent autonomy to decision points in the industrial recommender lifecycle
arXiv cs.AI
source ↗
Aug 14
Towards query-agnostic RAG evaluation via query coverage and claim verifiability
arXiv cs.AI
source ↗
Aug 14
From monolithic to modular: segment-level automatic prompt optimization
arXiv cs.AI
source ↗
Aug 14
Cutting AI datacenter energy with reinforcement learning: measured power control of LLM training from one GPU to the fleet
arXiv cs.AI
source ↗
Aug 14
Detecting a route flip is easier than knowing whether to fix it; causal route-mediated damage in quantized mixture-of-experts
arXiv cs.AI
source ↗
Aug 14
Distribird automates literature-informed prior distribution design for Bayesian model calibration.
arXiv cs.AI
source ↗
Aug 14
VQ-bench: a composable vector quantization framework
arXiv cs.AI
source ↗
Aug 14
Harnessing agent memory to build lifelong AI partners for materials scientists
arXiv cs.AI
source ↗
Aug 14
Edge-based contiguous p-median problem with connections to logistics districting
arXiv cs.AI
source ↗
Aug 14
MaSRead addresses the read to content in replicated latent stores; content-addressed reading improves access in a conflict-free replicated cache
arXiv cs.AI
source ↗
Aug 14
Identity from the outside: a framework for AI personality clones and observed identity factors
arXiv cs.AI
source ↗
Aug 14
Geometry-aware Incremental Neural Operator for Long-Horizon PDE prediction
arXiv cs.AI
source ↗
Aug 14
Forced-Structure reduction shows no circulant graph on Z/99 satisfies more than 68.0% of constraints for Conway's 99-graph; verifiable bounds presented
arXiv cs.AI
source ↗
Aug 14
Poor Man's Agentic Modeling: simulating large LLM-agent societies on a laptop
arXiv cs.AI
source ↗
Aug 14
A Conceptual Framework for Refining Influence Knowledge from Simulation Evidence in Cyber-Physical Systems
arXiv cs.AI
source ↗
Aug 14
Synchronizing beliefs with second-order theory-of-mind in human-autonomy teams (extended version)
arXiv cs.AI
source ↗
Aug 14
Forecasting side effects of activation steering
arXiv cs.AI
source ↗
Aug 14
LinearKV: One cached state suffices for position-independent caching in hybrid LLMs
arXiv cs.AI
source ↗
Aug 14
AutoWorldModel-Bench: a state-centric benchmark for automated world-model research
arXiv cs.AI
source ↗
Aug 14
Dynamic governance of multi-LLM agent systems for collaborative conversational outcomes
arXiv cs.AI
source ↗
Aug 14
LLMs in process diagram engineering: from optimal PFDs to validated P&IDs
arXiv cs.AI
source ↗
Aug 14
BEST-KAG: Enhancing question answering of building engineering standards with multimodal knowledge graph modeling and large language model
arXiv cs.AI
source ↗
Aug 14
Off-support barrier: semantic safety constraints are not learning-problem invariants and implications for design, containment, and verification
arXiv cs.AI
source ↗
Aug 14
The Boolean power of ReLU: ReLU-MPLang expresses more Boolean queries than Σ-MPLang with eventually constant activations on finite graphs, resolving an open question
arXiv cs.LG
source ↗
Aug 14
Geometric and behavioral stratification in transformer residual streams
arXiv cs.LG
source ↗
Aug 14
LoKiFormer: Locality-aware attention with decoupled knowledge memory for efficient large language model pretraining
arXiv cs.LG
source ↗
Aug 14
Dual spatial-temporal attribution for architecture-aligned post-hoc explainability in recurrent graph anomaly detection
arXiv cs.LG
source ↗
Aug 14
Learning under treatment-induced label indeterminacy with expert annotations of counterfactual outcomes in neurological prognostication
arXiv cs.LG
source ↗
Aug 14
Scaling recurrent memory with content-routed state anchors
arXiv cs.LG
source ↗
Aug 14
Unifying generative models with path integrals
arXiv cs.LG
source ↗
Aug 14
Finding the Needle in a Haystack: Test-time analog circuit representation adaptation for Bayesian optimization
arXiv cs.LG
source ↗
Aug 14
GENADA: efficient generative time series adversarial attack framework
arXiv cs.LG
source ↗
Aug 14
Demand transfer estimation at scale via restricted logit modeling
arXiv cs.LG
source ↗
Aug 14
Prob-K: probabilistic one-pass filtering for efficient top-k selection
arXiv cs.LG
source ↗
Aug 14
Predicting when random low-dimensional reparameterizations train neural networks
arXiv cs.LG
source ↗
Aug 14
Free satellite signals indicate glacial-lake destabilization and timing of risk in Nepal Himalaya, using radar interferometry and weather data
arXiv cs.LG
source ↗
Aug 14
Impact of temporal context length and encoding strategies on self-supervised ECG representation learning
arXiv cs.LG
source ↗
Aug 14
Personalized scorer modeling: a learning-based framework for deriving robust sleep stage labels from multiple experts
arXiv cs.LG
source ↗
Aug 14
Multi-AUV ad-hoc network-based target tracking via a value gradient guidance multi-agent diffusion reinforcement learning approach
arXiv cs.LG
source ↗
Aug 14
Interpretable causal discovery via causal-effect constraints
arXiv cs.LG
source ↗
Aug 14
Training Under Challenge: Executable certificates and challenge-closed optimality for neural networks
arXiv cs.LG
source ↗
Aug 14
Represent, then generate: multimodal-conditioned time-series generation under irregular missingness
arXiv cs.LG
source ↗
Aug 14
Exemplar-based objective classification of gust-induced loads across multiple flight conditions
arXiv cs.LG
source ↗
Aug 14
Exploring oversmoothing with Householder matrices.
arXiv cs.LG
source ↗
Aug 14
When can you trust offline evaluation of equal-cost top-k allocation? a controlled, reproducible benchmark and practitioner's guide
arXiv cs.LG
source ↗
Aug 14
CAKE: compiler-agent co-design for frontier kernel evolution
arXiv cs.LG
source ↗
Aug 14
Structure-preserving uncertainty quantification for GENERIC dynamics
arXiv cs.LG
source ↗
Aug 13
Basin: efficient and extensible numerical optimization in Rust
arXiv cs.LG
source ↗
Aug 13
Gloss-free representation learning for cross-dataset sign spotting
arXiv cs.CL
source ↗
Aug 13
Dual-primal graph VAEs for noisy label aggregation
arXiv cs.LG
source ↗
Aug 13
Diffuse to compress: leveraging diffusion LMs for lossless compression
arXiv cs.CL
source ↗
Aug 13
Trajectory-adapted uncertainty quantification for LLM agents
arXiv cs.CL
source ↗
Aug 13
Click2Poly: a VLM for vector mapping of buildings and walls
arXiv cs.LG
source ↗
Aug 13
Weak reversible bisimilarities in CCSK: two variants (directional and mixed) proposed for tau actions; study differences among strong/weak and forward-only/reversible notions.
arXiv cs.CL
source ↗
Aug 13
Market-information-aware gated-LoRA of foundation models for transferable day-ahead electricity price forecasting
arXiv cs.LG
source ↗
Aug 13
Hybrid-Policy Self-Editing for Composable Unstructured Knowledge Editing
arXiv cs.CL
source ↗
Aug 13
XGBoost outperforms LSTM in forecasting transmitted heat energy in district heating systems, with lower computational cost and environmental impact.
arXiv cs.LG
source ↗
Aug 13
Learning to persuade exposes how easily LLMs abandon correct beliefs
arXiv cs.CL
source ↗
Aug 13
AutoGrable proposes a minimal table-to-graph abstraction where each row becomes a node; no trained graph model required
arXiv cs.LG
source ↗
Aug 13
PAC-Bayes beyond parameter space: behavioral equivalence, Z-information, and exact complexity decomposition
arXiv cs.LG
source ↗
Aug 13
PAIR: Pairwise-aware inclusion reweighting for adaptive rollout allocation in RLVR
arXiv cs.LG
source ↗
Aug 13
Federated learning for distributed CNC tool wear prediction
arXiv cs.LG
source ↗
Aug 13
DonorRank: learning-to-rank donor language suitability for low-resource cross-lingual speech recognition
arXiv cs.CL
source ↗
Aug 13
Convergence is likely learned during pretraining, with semantic convergence observed from the first alignment stage (instruction-tuning); output homogeneity traces back to base models
arXiv cs.CL
source ↗
Aug 13
Three tokens force exponential feature rank in nonnegative kernel attention
arXiv cs.LG
source ↗
Aug 13
Stigma and support in online sexual violence narratives on Reddit
arXiv cs.CL
source ↗
Aug 13
CT-ΔBench: a benchmark for longitudinal 3D medical imaging difference reporting with vision-language models
arXiv cs.CL
source ↗
Aug 13
Reoptimization algorithms for contextual bandits with knapsack constraints
arXiv cs.LG
source ↗
Aug 13
Principal Trait Analysis: deriving “skills” for human-AI collaboration
arXiv cs.CL
source ↗
Aug 13
TRACE Bench evaluates task-driven agentic roleplay using a fixed checklist and a user agent to reveal tested requirements, failures, and supporting dialogue evidence.
arXiv cs.CL
source ↗
Aug 13
Weightless fine-tuning uses logit-space transport to personalize LLMs without weight updates
arXiv cs.LG
source ↗
Aug 13
Unmasking Toxic Mimicry in medical offline reinforcement learning for ICU sepsis management via counterfactual clinical audits
arXiv cs.LG
source ↗
Aug 13
Self-Evolving Embodied Agents via Skill-Harness Evolution
arXiv cs.CL
source ↗
Aug 13
Easper: an accessible ASR pipeline for language documentation
arXiv cs.CL
source ↗
Aug 13
Mechanism design for generative engines: from exploitation toward win-win outcomes
arXiv cs.LG
source ↗
Aug 13
Backtrader-Bench benchmarks LLM agents on algorithmic trading with self-generated MCQs
arXiv cs.CL
source ↗
Aug 13
Programmatic skill learning best reduces agent cost, the arXiv paper argues, by treating skills as programs to improve cost efficiency.
arXiv cs.CL
source ↗
Aug 13
FarSky: Task-aware latent-space coupling for generative intra-hour solar forecasting
arXiv cs.LG
source ↗
Aug 13
Federated aggregation robustness evaluated across five methods, five datasets, five architectures, and four attack conditions including clean, sign-flipping, Gaussian, and BadNets (reconstructed 500-cell seed-1 evaluation).
arXiv cs.LG
source ↗
Aug 13
Auditing political alignment in LLMs: an Italian case-study
arXiv cs.CL
source ↗
Aug 13
Retrofitting recurrent depth into a pretrained language model improves iterative latent transitions at two parameter budgets; Qwen2.5-0.5B-Instruct uses a recurrent block with an identity-preserving loop.
arXiv cs.CL
source ↗
Aug 13
Physics-aware latent-space surrogates enable variational parameter calibration
arXiv cs.LG
source ↗
Aug 13
Group Alignment-Induced Sycophancy: A Two-Sided Evaluation of Steerable Pluralistic Alignment
arXiv cs.CL
source ↗
Aug 13
Measure, Don't Optimize: Forecasting Recovery in LLM Unlearning
arXiv cs.CL
source ↗
Aug 13
Semantic Lenia: emergence of homeostatic solitons within the semantic space of large language models
arXiv cs.CL
source ↗
Aug 13
The Wording Effect: rephrasing a problem with the same meaning can flip an LLM’s answer, causing bidirectional drift in benchmark performance.
arXiv cs.CL
source ↗
Aug 13
Diffusion-based data-driven assortment optimization
arXiv cs.LG
source ↗
Aug 13
Terminal symmetry as a decision resource: statewise refinement for anytime verified construction
arXiv cs.LG
source ↗
Aug 13
Multivariate outlier detection methods tested on district heating system data, including temperature and energy transmission indicators
arXiv cs.LG
source ↗
Aug 13
Lifecycle-Optimal Tokenization: vocabulary size is deployment-regime dependent infrastructure parameter
arXiv cs.LG
source ↗
Aug 13
Contextual quality-diversity evolutionary reinforcement learning for HVAC control in tropical commercial buildings
arXiv cs.LG
source ↗
Aug 13
Self-Fix Step-DPO strengthens step-level reasoning for self-correction in LLMs using reinforcement learning
arXiv cs.CL
source ↗
Aug 13
ODE-based transformer decoders improve iterative sign language translation without increasing model size
arXiv cs.CL
source ↗
Aug 13
Evaluating side-constraint loss under context compaction; COMPINT assesses how session constraints are dropped during context compression
arXiv cs.CL
source ↗
Aug 13
Dynamics models for offline hyperparameter selection in real-world RL
arXiv cs.LG
source ↗
Aug 13
Long-horizon forecasting of complete financial statements with Forma
arXiv cs.LG
source ↗
Aug 12
MindTopo reveals VLMs’ spatial reasoning abilities
Microsoft Research
source ↗
Aug 12
Recall is the bottleneck for parametric factuality in generative AI
Google Research
source ↗
Aug 12
Controlled memory interference in continual LLM agents
arXiv cs.AI
source ↗
Aug 12
Towards an argumentative foundation for evaluative AI
arXiv cs.AI
source ↗
Aug 12
IntelliAudit: using large language models to evaluate audit controls
arXiv cs.AI
source ↗
Aug 12
Emotion in an active inference model of human driving
arXiv cs.AI
source ↗
Aug 12
Linear probes detect corrupted context in language models but do not reliably predict final answer correctness across multi-hop arithmetic chains.
arXiv cs.AI
source ↗
Aug 12
Towards researcher agents for knowledge-graph question answering
arXiv cs.AI
source ↗
Aug 12
When LLM agents negotiate: private information and dynamic bargaining in supply chains
arXiv cs.AI
source ↗
Aug 12
QuantumMind proposes an auditable agentic workflow to generate and conservatively screen quantum-acceleration hypotheses for speedup analysis in quantum computing
arXiv cs.AI
source ↗
Aug 12
MetaSpace: metamorphic testing for spatial cognition in embodied agents
arXiv cs.AI
source ↗
Aug 12
Determinization in structure theories: a unified framework via closure, comparability, and joint admissibility
arXiv cs.AI
source ↗
Aug 12
CMU-Drive and V2V-VLA: cooperative multi-agent unified driving with reasoning benchmark and vehicle-to-vehicle vision-language-action models
arXiv cs.AI
source ↗
Aug 12
Dynamic coalition formation and communication pricing in skill-based agentic AI systems
arXiv cs.AI
source ↗
Aug 12
Cross-dimensional geometry from navigation to black holes: a continuous metric field learned via causal contrastive loss encodes scenes into Lie algebra elements and yields Riemannian or Lorentzian metrics
arXiv cs.AI
source ↗
Aug 12
Contextual value alignment via multilayer combinatorial fusion
arXiv cs.AI
source ↗
Aug 12
Mendel Gödel Machine: self-improving coding agents use comparative evolution to rewrite their own source code
arXiv cs.AI
source ↗
Aug 12
AI scientist for studying generalization in quadruped robot navigation policies in simulation; addresses drift in autonomous research loops
arXiv cs.AI
source ↗
Aug 12
Training Variable Long Sequences with Data-Centric Parallel
arXiv cs.AI
source ↗
Aug 12
From single chatbots to governed agent ecosystems: an agentic AI pattern catalogue and orchestration framework for mission-critical hospital information management systems
arXiv cs.AI
source ↗
Aug 12
Flow-by-Flow: Content-Judgment Bypass for Governing AI Output in High-Loss Domains
arXiv cs.AI
source ↗
Aug 12
TeXFix-Bench: an empirically grounded multi-format benchmark for LLM-based full-source document repair
arXiv cs.AI
source ↗
Aug 12
NL2SHACL-Bench: a benchmark suite for translating natural language to SHACL shapes
arXiv cs.AI
source ↗
Aug 12
TREAT: evaluating access to formal knowledge across equivalent mathematical representations
arXiv cs.AI
source ↗
Aug 12
Protecting patient privacy in clinical foundation models: technical and legal perspectives
arXiv cs.AI
source ↗
Aug 12
Agent-MD: Selective LLM intervention with event-driven escalation for stateful GCMC–MD campaigns
arXiv cs.AI
source ↗
Aug 12
TAF-MED measures multi-turn safety refusal collapse in LLMs when users express self-treatment intent
arXiv cs.CL
source ↗
Aug 12
Boundary-Seeking Policy Gradient for safe reinforcement learning
arXiv cs.LG
source ↗
Aug 12
MD-ProTector: positioning multiple data-driven prototypes for LLM-generated text detection
arXiv cs.CL
source ↗
Aug 12
ChronoSSM: training for temporally aware representations in autoregressive state space models
arXiv cs.LG
source ↗
Aug 12
Transformer Geometry Observatory TGO-IV: Developmental topology of representations across transformer layers explored via inductive analysis
arXiv cs.LG
source ↗
Aug 12
Similarity gates approve reversals: a validity audit of embedding-cosine thresholds in agent systems
arXiv cs.CL
source ↗
Aug 12
REATS: LLM reasoning-based ensemble learning for adaptive time series forecasting
arXiv cs.LG
source ↗
Aug 12
PERCEPT: a corpus for POS tagging and analysis of Persian-English code-mixing
arXiv cs.CL
source ↗
Aug 12
ASR-roundtrip evaluation can mask context- and convention-dependent reading errors in Chinese news TTS
arXiv cs.CL
source ↗
Aug 12
Procedural fairness failures in RLHF from preference averaging
arXiv cs.LG
source ↗
Aug 12
Sheaf-based federated representation learning
arXiv cs.LG
source ↗
Aug 12
Matched-integrator evaluation of Hamiltonian neural networks on pendulum and Kepler dynamics
arXiv cs.LG
source ↗
Aug 12
Finding the signal in the spam: jointly learning rewards and worker reliability from pairwise comparisons
arXiv cs.LG
source ↗
Aug 12
Power law graph attention: exact generalization of scaled dot-product attention; empirical collapse at inference
arXiv cs.LG
source ↗
Aug 12
Cross-contextual consistency as a measure of LLM credibility
arXiv cs.CL
source ↗
Aug 12
When chain-of-thought helps and when it hurts: an empirical investigation of the serial-depth bottleneck in LLM reasoning
arXiv cs.CL
source ↗
Aug 12
Multimodal item parameter estimation using simulated response probabilities
arXiv cs.CL
source ↗
Aug 12
DOCSCHISEL: Adaptive tool documentation optimization framework for LLM agents
arXiv cs.LG
source ↗
Aug 12
Simplex Relaxation for Discrete Diffusion; arXiv:2608.10615 introduces Simplax, an exact Dirichlet–categorical augmentation that enriches training objectives and reverse transitions without changing the underlying corruption process
arXiv cs.CL
source ↗
Aug 12
ELMER: Evolutionary Language Model that explores and refines
arXiv cs.LG
source ↗
Aug 12
How robust are LLMs to Vietnamese dialects?
arXiv cs.CL
source ↗
Aug 12
SeFoRA uses sketch-aggregated federated LoRA to handle heterogeneous client ranks in federated parameter-efficient fine-tuning with low-rank adaptation.
arXiv cs.LG
source ↗
Aug 12
Position encoding in transformers: from absolute and relative methods to rotary position embeddings and long-context scaling
arXiv cs.CL
source ↗
Aug 12
UserToolBench tests personalized decision making in tool-use LLMs by inferring latent user preferences from interaction history
arXiv cs.LG
source ↗
Aug 12
Analyzing LLM alignment across single- and multi-cultural settings using cultural consensus theory
arXiv cs.CL
source ↗
Aug 12
Detecting soft skills in ML engineering roles CVs
arXiv cs.LG
source ↗
Aug 12
FlowScout: from execution feedback to reliable tool-using agent workflows
arXiv cs.LG
source ↗
Aug 12
From prediction to incrementality: causal optimization for large-scale targeting and recommendation
arXiv cs.LG
source ↗
Aug 12
Calibrating post-training feature shifts for LLM data contamination detection
arXiv cs.CL
source ↗
Aug 12
Dual-Loop Self-Evolution via Verifiable Emotion Feedback for Multi-Turn Empathetic Dialogue
arXiv cs.CL
source ↗
Aug 12
CurveFP: rational-radix logarithmic datatypes with closed products for language models
arXiv cs.LG
source ↗
Aug 12
Asymmetric framing of La France insoumise and Rassemblement National in French news headlines, 2022–2025
arXiv cs.CL
source ↗
Aug 12
Every Token Counts: exact Likert-scale distributions for measuring LLM attitudes and biases
arXiv cs.CL
source ↗
Aug 12
Lightweight bias correction in constrained decoding for grammar-constrained decoding masks; online sampling reduces distortion in LM outputs
arXiv cs.CL
source ↗
Aug 12
Independent reproduction of LeWorldModel achieves 94.0% goal offset in TwoRoom; evaluation on a single laptop CPU is reported
arXiv cs.LG
source ↗
Aug 12
Uncertainty-aware ensemble deep randomized neural networks for classification
arXiv cs.LG
source ↗
Aug 12
Physics-informed machine learning in prognostics and health management: a systematic literature review
arXiv cs.LG
source ↗
Aug 12
STCAD: scalable trajectory clustering and anomaly detection on terabyte-scale AIS data
arXiv cs.LG
source ↗
Aug 12
Off-Axis, On Purpose: where a Transformer computes concepts and why it does so
arXiv cs.CL
source ↗
Aug 12
Multilingual quantization tax: edge SLMs suffer performance degradation from 4-bit weight quantization across languages, study finds across Gemma 4 and Qwen 3.5 using MMLU ProX Lite and GlobalPIQA
arXiv cs.CL
source ↗
Aug 12
Toward human rights benchmarking for LLMs: a pilot methodology
arXiv cs.LG
source ↗
Aug 12
Observational policy ranking for SMB financial guidance from multi-action accounting logs
arXiv cs.LG
source ↗
Aug 12
CRHT: A Continuous Regression Hybrid Transformer for vessel trajectory prediction with online cluster sampling
arXiv cs.LG
source ↗
Aug 12
LLM Agents Factory: retrieval-based framework builds domain-specific, Wikipedia-grounded agents on demand
arXiv cs.CL
source ↗
Aug 12
Intrinsic Structure: Spectral identifiability for mechanistic interpretability
arXiv cs.LG
source ↗
Aug 12
Cracks in the foundation: four minor architectural decisions reduce long context extensibility across Olmo, Llama, and Qwen dense models
arXiv cs.CL
source ↗
Aug 12
Edge Phoneme Recognition for Children's Speech through Age-Aware Training
arXiv cs.AI
source ↗
Aug 12
Mitigating bus bunching with reinforcement learning enhanced by semantic stop embedding
arXiv cs.AI
source ↗
Aug 12
MESA: Task-adaptive multi-structure evidence selection for long-horizon agent memory
arXiv cs.AI
source ↗
Aug 12
CHORUS: complementary experts for high-coverage testbench stimulus generation
arXiv cs.AI
source ↗
Aug 12
MIDAS: mutual information disentanglement with uncertainty-aware fusion for incomplete multimodal sentiment analysis
arXiv cs.AI
source ↗
Aug 12
Automating and scaling behavioral scientific research on AI agents with AEROBAT
arXiv cs.AI
source ↗
Aug 12
Closed-loop LLM co-pilots for digital agriculture
arXiv cs.AI
source ↗
Aug 12
ReCBM: uncertainty-gated relational reasoning for concept bottleneck models
arXiv cs.AI
source ↗
Aug 12
TRACE: Trustworthy retrieval-augmented conversational engine discusses improving reliability of public-service chatbot recommendations with retrieval augmentation
arXiv cs.AI
source ↗
Aug 12
Decodable but not detachable: training data granularity determines parametric modularity in large language models
arXiv cs.AI
source ↗
Aug 12
Logit-boundary geometric belief interfaces and sparse sheaf-enclave protocols for secure EHR interoperability
arXiv cs.AI
source ↗
Aug 12
SPOT: Sampling Policy Observation Tree provides lookahead explanations for deep reinforcement learning policies.
arXiv cs.AI
source ↗
Aug 12
Mind viruses: self-propagating ideas in multi-agent LLM systems
arXiv cs.AI
source ↗
Aug 12
Interpreting language model hidden states at scale
arXiv cs.AI
source ↗
Aug 12
Post-hoc sparse coding of latent communication between vision-language model agents
arXiv cs.AI
source ↗
Aug 12
Beyond detection: evaluating defensive LLMs against AI-generated social engineering in live turn-by-turn interaction
arXiv cs.AI
source ↗
Aug 12
Generating attacks for LLMs with GFlowNets
arXiv cs.AI
source ↗
Aug 12
Evaluation-Conditioned Training: teaching models to generalize to stronger oversight regimes
arXiv cs.AI
source ↗
Aug 12
Towards Sustainable AI: a comprehensive review and comparative analysis of deep learning models’ carbon footprint
arXiv cs.AI
source ↗
Aug 12
Relational geometry attacks on contrastive embedding manifolds emerge in new study
arXiv cs.AI
source ↗
Aug 12
Neuroevolution Arena: nested ecological evaluation of update-and-inheritance regimes across neural architectures
arXiv cs.AI
source ↗
Aug 12
LinkedIn presents a self-evolving agentic support system that uses retrieval-augmented generation, evolutionary auto-prompting, and a modular evaluation framework for continuous, production-aligned improvement.
arXiv cs.AI
source ↗
Aug 11
CARE-X aims for clinically useful radiology VLMs with auxiliary supervision, reward-aligned learning, and tool-augmented measurement
Microsoft Research
source ↗
Aug 11
LLMCompiler generates program embeddings from source and IR code for program analysis and optimization tasks.
arXiv cs.LG
source ↗
Aug 11
WuYuEval: a multi-level benchmark for evaluating large language models in solid waste management across foundational knowledge, domain reasoning, and expert decision-making
arXiv cs.CL
source ↗
Aug 11
STEMMA: an adversarial multi-agent framework for evaluating self-identity consistency in LLMs
arXiv cs.CL
source ↗
Aug 11
Scaling inherently interpretable language models by training with interpretability as a constraint alongside language modeling objective
arXiv cs.CL
source ↗
Aug 11
Grounded search agents use representation-based intrinsic rewards to guide retrieval and grounding of language model outputs
arXiv cs.CL
source ↗
Aug 11
LUCID: Latent-Skill Unified Control via Imagined Dynamics for long-horizon humanoid loco-manipulation
arXiv cs.LG
source ↗
Aug 11
DialectS2S: End-to-end speech dialogue modeling for low-resource Chinese dialects
arXiv cs.CL
source ↗
Aug 11
From token probabilities to calibrated confidence: an empirical study of mathematical question answering
arXiv cs.LG
source ↗
Aug 11
Many Are My Names": The Anatomy of the Assistant and Its Personas via Sparse Autoencoders
arXiv cs.CL
source ↗
Aug 11
Data-driven fire-zone segmentation improves short-term wildfire prediction
arXiv cs.LG
source ↗
Aug 11
Multilingual supervision improves figurative language identification in proverbs, evaluated across seven languages and 742 proverb concepts
arXiv cs.CL
source ↗
Aug 11
Adaptive KappaSharp: Condition-Number Shaping for Preferential Bayesian Optimization
arXiv cs.LG
source ↗
Aug 11
Information Routing across Batch Boundaries: Memory–Batch Tradeoffs in Lipschitz Bandits
arXiv cs.LG
source ↗
Aug 11
DocAtlas treats long-document understanding as mutable-state interaction
arXiv cs.CL
source ↗
Aug 11
Finite constant frontiers and auditable regret certificates for average-reward reinforcement learning
arXiv cs.LG
source ↗
Aug 11
Interpreting reasoning mechanisms of large language models via sparse autoencoders: separating Thinking from NoThinking in CoT-enabled models
arXiv cs.CL
source ↗
Aug 11
Polish vision-language evaluation PoVisLE assesses cultural grounding in vision-language models
arXiv cs.CL
source ↗
Aug 11
Foundation models in cognitive science: evaluating their cognitive alignment and developmental trajectories
arXiv cs.CL
source ↗
Aug 11
Tracing sources of epistemic uncertainty in deep learning predictions with homo- and heteroscedastic linearized estimators
arXiv cs.LG
source ↗
Aug 11
Policy learning with mu-resets: the sample complexity under policy realizability for the Kakade–Langford interaction protocol
arXiv cs.LG
source ↗
Aug 11
Trace-driven evaluation can mislead MoE expert caching due to replay semantics, workload contamination, and operating regimes.
arXiv cs.LG
source ↗
Aug 11
NeuPAT: neuron-aware plasticity allocation tuning for language-preserving mllms
arXiv cs.CL
source ↗
Aug 11
Neural operators for immersed-boundary soft swimmers locomotion
arXiv cs.LG
source ↗
Aug 11
From benchmark performance to tool deployment: human-in-the-loop anomaly detection
arXiv cs.LG
source ↗
Aug 11
Spectral outliers reveal dominant learned structure in transformer attention.
arXiv cs.LG
source ↗
Aug 11
CODS: Iterative Bellman-residual data selection for reusable offline reinforcement learning
arXiv cs.LG
source ↗
Aug 11
APEX-VW: a document-level English-Spanish post-editing dataset in the healthcare domain
arXiv cs.CL
source ↗
Aug 11
SkillConsist detects inconsistencies in agent skills via bidirectional graph alignment
arXiv cs.LG
source ↗
Aug 11
SPECTRA: pushing the KV cache beyond the 2-bit cliff via spectral transform coding
arXiv cs.LG
source ↗
Aug 11
SurakshaEval: a safety benchmark for multilingual LLMs covering ten major Indian languages
arXiv cs.CL
source ↗
Aug 11
Applying artificial intelligence to recognize fraudulent banking operations; arXiv:2608.07471v1 discusses using machine learning for online banking fraud detection
arXiv cs.LG
source ↗
Aug 11
TEMPER: Tensorized Efficient Manifold-constrained Parameterization for Expressive Residual Routing
arXiv cs.LG
source ↗
Aug 11
V-Simba improves architectural efficiency for reinforcement learning in visual continuous control
arXiv cs.LG
source ↗
Aug 11
Shape mutating expert compression: LorExperts and BTExperts
arXiv cs.LG
source ↗
Aug 11
CONFER: conflict-aware evidence negotiation for regime-calibrated weak supervision in multimodal emotion recognition
arXiv cs.LG
source ↗
Aug 11
Evaluating dedicated monolingual and joint multilingual causal models for Dravidian languages
arXiv cs.CL
source ↗
Aug 11
SurveyReview: a reviewer-aligned benchmark for survey evaluators
arXiv cs.CL
source ↗
Aug 11
Unified hallucination fuzzing for multimodal large language models
arXiv cs.CL
source ↗
Aug 11
Prompt Embedding Probes detects hallucinations from hidden states of a frozen LLM
arXiv cs.CL
source ↗
Aug 11
Reasoning models fail to ration test-time compute across questions
arXiv cs.CL
source ↗
Aug 11
Embedding initialization for unseen low-resource languages in multilingual NMT: a case study on Limbum-English translation
arXiv cs.CL
source ↗
Aug 11
Classifier-free guidance becomes unnecessary at times in masked diffusion language models, study finds
arXiv cs.CL
source ↗
Aug 11
Detection of self-introductions in legislative testimony
arXiv cs.CL
source ↗
Aug 11
PhysAttNet: enhancing predictive performance in industrial and astrophysical time series via physics-informed attention
arXiv cs.LG
source ↗
Aug 11
The no-meaning falsity: the structural impossibility of the arbitrary sign in Classical Arabic
arXiv cs.CL
source ↗
Aug 10
AI models simulate a wider range of real-world scenarios with a physics feel, enabling engineers to test vehicle blueprints with fewer physical experiments, says MIT CSAIL researcher Haixu Wu
MIT News (AI)
source ↗
Aug 10
From cheap fakes to pure synthesis: addressing the new era of T2V fake news videos
arXiv cs.AI
source ↗
Aug 10
Can MLLMs decode the creative leap? Introducing C4 for cross-concept understanding
arXiv cs.AI
source ↗
Aug 10
The optimizer is the agent: reasoning-driven search across prompts, programs, and ML workflows
arXiv cs.AI
source ↗
Aug 10
Theoretical foundations of communication-efficient, robust, and practical distributed and federated optimization
arXiv cs.LG
source ↗
Aug 10
Measuring the cross-lingual comprehension gap: how the language of the evidence shapes what language models understand
arXiv cs.CL
source ↗
Aug 10
MolBioKG grounds out-of-graph molecules in biomedical knowledge graphs via multi-resolution structural anchoring.
arXiv cs.AI
source ↗
Aug 10
NxN E-valuation uses e-value-based hypothesis certification to verify hypotheses without case-specific procedures, given a large dataset; suited for LLM-based exploration systems to mitigate hallucination.
arXiv cs.AI
source ↗
Aug 10
ADIAS: Automated Design of Interactive Agentic Systems
arXiv cs.AI
source ↗
Aug 10
Cryptanalytic extraction of isolated bias-free GLU feed-forward blocks by antipodal separation demonstrated for bias-free GLU blocks in language-model components.
arXiv cs.LG
source ↗
Aug 10
Learning to predict middle-layer attention in MLLMs for visual token pruning
arXiv cs.AI
source ↗
Aug 10
Sharding prevents LLM oversight failures and adversarial exploitation
arXiv cs.LG
source ↗
Aug 10
Recovering lesion parameters from aphasic picture naming error profiles in large language models
arXiv cs.CL
source ↗
Aug 10
Shape your feed: an LLM-based agentic system for conversational recommendation
arXiv cs.AI
source ↗
Aug 10
FutureBridge ranks joint LLM-SLM token candidates for collaborative decoding beyond local preference
arXiv cs.CL
source ↗
Aug 10
Selection-aware backdoor attacks in federated learning bypass Krum via Krum-Proxy attack
arXiv cs.LG
source ↗
Aug 10
Divergent response modes in frontier language models under steering pressure.
arXiv cs.AI
source ↗
Aug 10
Sparsity-aware pruning preserves differences between outputs in sparsity-sensitive neurons, not just activations, for large language model pruning
arXiv cs.LG
source ↗
Aug 10
Stockmark-Nemotron-3-Nano-Omni-JapanDocReader enables structured document parsing via capability injection and forgetting control in a Japanese document understanding model built from Nemotron-3-Nano-Omni-30B-A3B-Reasoning-BF16
arXiv cs.CL
source ↗
Aug 10
EntropyMoE: entropy-aware sparse expert routing for tokenizer-free LLMs
arXiv cs.AI
source ↗
Aug 10
WebGrader: Training LLMs for web development with self-evolving programmatic grader
arXiv cs.AI
source ↗
Aug 10
Interpretable unsupervised community detection with LLM-symbolized structured processes
arXiv cs.AI
source ↗
Aug 10
Knowledge-Driven AI agents for smart degree pathway planning; arXiv study describes solving curriculum reconstruction and path optimization with prerequisite logic
arXiv cs.AI
source ↗
Aug 10
Autonomy-of-Heads introduces data-free sparse attention from frozen query-key geometry to reduce long-context inference costs
arXiv cs.CL
source ↗
Aug 10
CertBind: certifiable composition for frozen multimodal connector graphs
arXiv cs.LG
source ↗
Aug 10
Beyond “AI Language”: the idiolectal nature of LLM output across six models in 2024 and 2026 corpora
arXiv cs.CL
source ↗
Aug 10
WebRider: persona-conditioned intent controllers for live-web assistance
arXiv cs.AI
source ↗
Aug 10
Pre-inference routing for cost-efficient document field extraction improves cost when a cheaper model fails often enough to justify routing, according to arXiv:2608.06607v1
arXiv cs.CL
source ↗
Aug 10
TRACE: A multi-layer benchmark for human AI controller coordination under drift and failure
arXiv cs.AI
source ↗
Aug 10
bioMoR applies mixture-of-recursions to gene- and pathway-level learning for efficient genomic analysis
arXiv cs.AI
source ↗
Aug 10
Soft-masking accelerates convergence in Masked Diffusion Language Models; the paper argues that linear interpolation in the embedding space is flawed due to near-constant token/mask embedding angles during training.
arXiv cs.CL
source ↗
Aug 10
MTI-GNN models Beck's cognitive triad for distortion detection in text classification
arXiv cs.CL
source ↗
Aug 10
The horizon gap: planning, memory, execution, training, and evaluation for long-horizon LLM agents
arXiv cs.CL
source ↗
Aug 10
Online security learning in cooperative multi-agent systems under hidden Byzantine attacks.
arXiv cs.LG
source ↗
Aug 10
Bootstrap-conditioned action selection with tabular foundation models
arXiv cs.LG
source ↗
Aug 10
AgentPatch: coarse-to-fine weak-task repair for merging agentic multimodal large language models
arXiv cs.AI
source ↗
Aug 10
Flowing through States: Neural ODE regularization for reinforcement learning
arXiv cs.LG
source ↗
Aug 10
Vehicle routing problem using deep reinforcement learning; a case study on truck planning in industry
arXiv cs.AI
source ↗
Aug 10
Faithful response-level interpretation of mixture-of-experts reward models via contribution contrast
arXiv cs.AI
source ↗
Aug 10
TradeVerse: a longitudinal benchmark of political negotiation in international trade
arXiv cs.CL
source ↗
Aug 10
Factorized hypothesis search for evidence-to-taxonomy retrieval
arXiv cs.CL
source ↗
Aug 10
GRASP: Reinforcing language model anonymizers with group relative policy optimization
arXiv cs.CL
source ↗
Aug 10
CrystalGRPO: Target-aligned and coverage-preserving reinforcement learning for flow-based crystal structure prediction
arXiv cs.LG
source ↗
Aug 10
Latent fact-checking: detecting misinformation through activation engineering
arXiv cs.LG
source ↗
Aug 10
Weak presupposition verification degrades general QA performance
arXiv cs.CL
source ↗
Aug 10
Separating decision-rule misalignment from readout-coverage limitations in speech language models
arXiv cs.CL
source ↗
Aug 10
CellWorld: latent-space predictive pretraining enables foundation models for spatial transcriptomics
arXiv cs.AI
source ↗
Aug 10
IB-RL: Isolated bilateral reinforcement learning for strategic dialogue agents
arXiv cs.AI
source ↗
Aug 10
Robust average-reward Markov decision processes: minimax-optimal learning via plug-in reductions
arXiv cs.LG
source ↗
Aug 10
NTDH: Complex reasoning for comprehensive affective analysis
arXiv cs.CL
source ↗
Aug 10
Beyond attention: signed integrated gradients attribution in a BiomeGPT-style microbiome transformer
arXiv cs.LG
source ↗
Aug 10
ConstructCIE: a dataset for extracting causal information from construction accident narratives
arXiv cs.CL
source ↗
Aug 10
Towards multi-label graph foundation models: from single-vector representation learning to multi-semantic basis learning
arXiv cs.AI
source ↗
Aug 10
ED-CSP: crystal structure prediction from electron diffraction
arXiv cs.LG
source ↗
Aug 10
TA-RAG: Tone Awareness as a Design Imperative for Retrieval-Augmented Generation
arXiv cs.CL
source ↗
Aug 10
SNI-GNN: SmartNIC-assisted full-graph GNN training with in-network embedding prediction
arXiv cs.LG
source ↗
Aug 10
MiGHT-EHR: a multi-task graph transformer for heterogeneous temporal electronic health records
arXiv cs.LG
source ↗
Aug 10
Discovering conceptual metaphors across topics and media types
arXiv cs.CL
source ↗
Aug 10
Do AI personas grow? Analyzing and benchmarking personality evolution in LLM agents after life events
arXiv cs.CL
source ↗
Aug 10
Progressive content refinement with decaying reward joint LinUCB
arXiv cs.CL
source ↗
Aug 10
Risk-aware decision policies for agents under noisy perception
arXiv cs.LG
source ↗
Aug 10
TaskSense: focusing on what matters in world models
arXiv cs.AI
source ↗
Aug 10
CGMas: a multi-agent framework that automates topology construction, equilibration, mapping, and potential derivation for coarse-grained molecular dynamics of polymers
arXiv cs.AI
source ↗
Aug 10
Newton-Schulz retraction-based inference enables hidden quantum Markov models to outperform classical HMMs
arXiv cs.LG
source ↗
Aug 10
Toward reliable context compression for long-horizon agents: an empirical study of execution instability
arXiv cs.LG
source ↗
Aug 10
Quantization damage is multiplicative, not additive
arXiv cs.LG
source ↗
Aug 10
Unmasking removal-budget confounding: a matched operating-point evaluation framework for adaptive data cleaning
arXiv cs.LG
source ↗
Aug 10
Confidence estimation for financial vision-language models in chart and document understanding
arXiv cs.CL
source ↗
Aug 10
Adversarial causal intervention falsification
arXiv cs.LG
source ↗
Aug 10
Fixed and adaptive topological DeepONets use functional measurements on Hausdorff locally convex spaces
arXiv cs.LG
source ↗
Aug 10
Automated item evaluation predicts item acceptance and rejection from item text using historical rejection data and LLM-generated critiques.
arXiv cs.AI
source ↗
Aug 10
Simple-OPD: Demystifying warm-up for on-policy distillation
arXiv cs.CL
source ↗
Aug 10
Target-weighted Neyman allocation uses pilot variances to design experiments for heterogeneous treatment effects under population shift
arXiv cs.LG
source ↗
Aug 7
Graph-Guided Project-Level Planning for Autonomous Research identifies a method to decompose long-horizon research projects into bound tasks with dependency-aware sequencing.
arXiv cs.AI
source ↗
Aug 7
Matrix Zonotopic Attention: a context-adaptive value projection for set transformers
arXiv cs.LG
source ↗
Aug 7
ASR adaptation and representation dimensionality reduction for Persian speech emotion recognition using Whisper
arXiv cs.CL
source ↗
Aug 7
Spectral Distillation enables learning a compact linear state-space model from nonlinear dynamics using an implicit spectral predictor via Observation Spectral Filtering.
arXiv cs.LG
source ↗
Aug 7
ConWriter: transition-constrained Stateful long-form story generation with lightweight neuro-symbolic consistency control
arXiv cs.CL
source ↗
Aug 7
Expl explorative modeling (XM) introduces a third pretraining axis by producing multiple outputs per comparison to enhance generative expressivity
arXiv cs.LG
source ↗
Aug 7
CASCADE: an agentic regulatory network framework predicts downstream transcriptional effects of gene perturbation using ARACNe networks and MCP exposure
arXiv cs.AI
source ↗
Aug 7
Constraint-First Reasoning: a training-free protocol for exploiting answer-space constraints in mathematical problem solving
arXiv cs.CL
source ↗
Aug 7
Analysis of numerical localisation in LLM translations
arXiv cs.CL
source ↗
Aug 7
When privileged guidance misaligns: state-matched routing and contextualized self-distillation for multi-turn agents
arXiv cs.AI
source ↗
Aug 7
Where privacy risk lives in English-source multilingual RAG: a stage-decomposed audit across five query languages
arXiv cs.CL
source ↗
Aug 7
Counterfactual analysis via large language models in online lending using GPT-3.5 to assess counterfactual ROI under different interest rate schemes
arXiv cs.AI
source ↗
Aug 7
Simulator-grounded LLMs for industrial causal reasoning in wastewater treatment use a live simulator oracle, structured parameter injection, and plant-portable retrieval to support decision making.
arXiv cs.CL
source ↗
Aug 7
LUNAR benchmarks personalized large language models on universal daily-life logs by evaluating responses from longitudinal app interaction histories across domains
arXiv cs.AI
source ↗
Aug 7
From continuous predictors to clinical thresholds: early evidence on performance trade-offs of guideline-based categorisation for ischaemic stroke outcome prediction
arXiv cs.AI
source ↗
Aug 7
KV-Skill enables a frozen language model to read external factorized operators via a lightweight interface; introduces a design space for external knowledge in the model’s native language
arXiv cs.LG
source ↗
Aug 7
PD-GS: Phoneme-driven 3DGS for audio-driven talking heads
arXiv cs.AI
source ↗
Aug 7
MS-MLB: An Open Machine Learning Benchmark for Blood-Based MS Classification
arXiv cs.LG
source ↗
Aug 7
The interface of intonation and lexical tone in Mandarin varieties: boundary phenomena between intonation and tone detect and convey sentence type and attitudinal information
arXiv cs.CL
source ↗
Aug 7
Universal Pathologies, Conditional Consequences: A triple-robustness analysis of RAG for multi-hop traceability
arXiv cs.CL
source ↗
Aug 7
An emerging retail portfolio management application: personalized, tax-aware reinforcement learning with natural language goals
arXiv cs.LG
source ↗
Aug 7
EvoHarness-RL: learning a self-evolving runtime harness for long-horizon LLM agents
arXiv cs.LG
source ↗
Aug 7
SkillTrace: multi-trace provenance auditing for LLM-agent skill reuse
arXiv cs.AI
source ↗
Aug 7
DG-FedReuse enables cached updates from selected clients based on age-decayed proxy-gradient discrepancy in federated learning, with cache-age limits and fresh-client quotas
arXiv cs.LG
source ↗
Aug 7
When do corrective features help? An agent for corrective feature discovery on black-box forecasters
arXiv cs.LG
source ↗
Aug 7
Hybrid probabilistic zonotopes for identifiable and refinable predictive uncertainty
arXiv cs.LG
source ↗
Aug 7
LLM-based flows modeled as probabilistic programs reveal uncertainty in multi-call LLM pipelines
arXiv cs.LG
source ↗
Aug 7
The Ignition Index measures global workspace dynamics in transformer language models across 11 models
arXiv cs.AI
source ↗
Aug 7
Example-guided prompting for document-level text simplification shows improved consistency with retrieved examples
arXiv cs.CL
source ↗
Aug 7
DREAM: LLM-based dynamic role-playing via event-aware memory graph
arXiv cs.CL
source ↗
Aug 7
RIG-RoPE: Relation- and instance-gated rotary positional encoding with duration-aware temporal coordinates
arXiv cs.CL
source ↗
Aug 7
PRISM: Priority-aware rubric internalization via structured multimodal data synthesis
arXiv cs.LG
source ↗
Aug 7
OrchestraBench evaluates failure, recovery, and decomposition in multi-agent orchestration with a seed-reproducible failure-injection framework over templated enterprise workflows
arXiv cs.AI
source ↗
Aug 7
Evaluating machine learning models for post-wildfire debris-flow prediction
arXiv cs.LG
source ↗
Aug 7
C3PO benchmark evaluates cross-modal composition and counterfactual conflict in omnimodal models
arXiv cs.AI
source ↗
Aug 7
DBLAST: Dependent Block Drafting for Stochastic Speculative Decoding
arXiv cs.CL
source ↗
Aug 7
CNM-BERT: a drop-in structural embedding for Chinese characters via Ideographic Description Sequences
arXiv cs.CL
source ↗
Aug 7
Coherence-Oriented Dream Scene Visualisation: a system that turns written dream descriptions into a four-panel, temporally coherent sequence of images using a four-part prompt and text-to-image models.
arXiv cs.AI
source ↗
Aug 7
Conditional cognitive biases in LLMs: biased user turns modulate in-context reasoning
arXiv cs.CL
source ↗
Aug 7
Skill distillation beyond knowledge boundaries via rubric-based reinforcement learning
arXiv cs.AI
source ↗
Aug 7
Disentangling 3D modeling from spatial reasoning.
arXiv cs.LG
source ↗
Aug 7
Abstract Event Causal Rules: induction and application
arXiv cs.AI
source ↗
Aug 7
Decoupling perception from description: computation-grounded representation alignment between multivariate time series and language
arXiv cs.LG
source ↗
Aug 7
Small foundation models of human cognition and behaviour show in-distribution performance insensitive to scale across a 14B-parameter range
arXiv cs.AI
source ↗
Aug 7
Rectifying geometric misalignment: online source-free adaptation for class-imbalanced EEG
arXiv cs.LG
source ↗
Aug 7
Mood matters: syntactic sensitivity undermines safety alignment
arXiv cs.CL
source ↗
Aug 7
CANOE: a multi-agent neuro-symbolic framework for contestable care plan coordination with adaptive team recruitment and role-based modules
arXiv cs.AI
source ↗
Aug 7
WorldClaw releases a fully agentic, coarse-to-fine framework for open-world 3D scene generation
arXiv cs.AI
source ↗
Aug 7
AuroSFT for adapter-state multi-task fine-tuning replaces full-model rollback with adapter-state scheduling for multi-task fine-tuning
arXiv cs.LG
source ↗
Aug 7
Safe evolution with circuit anchors
arXiv cs.CL
source ↗
Aug 7
Beyond Rotations: AuroOFT enables expressive quantized orthogonal fine-tuning with gated low-rank corrections
arXiv cs.LG
source ↗
Aug 7
Evidence lock before commitment: a frozen interface degrades LLM-as-judge evaluation
arXiv cs.CL
source ↗
Aug 7
Align-RAG: Alignment is all you need for TSFM in-context learning
arXiv cs.LG
source ↗
Aug 7
LC-GRPO: Bridging train-inference gap for flow-based GRPO with Langevin correction
arXiv cs.LG
source ↗
Aug 7
TriQua: reconciling granularity and context in factuality evaluation
arXiv cs.AI
source ↗
Aug 7
SearchAuditor: auditing and attributing failures in long-horizon search agents
arXiv cs.AI
source ↗
Aug 7
Large language models threaten double-blind review by enabling author identification from titles and content.
arXiv cs.CL
source ↗
Aug 7
Quantum-Structured World Models (QSWMs) for predictive latent dynamics.
arXiv cs.LG
source ↗
Aug 7
Agentic self-driving microscopy benchmarks support qualification but do not necessarily generalize to unseen tasks
arXiv cs.AI
source ↗
Aug 7
SemiAdapt-Instruct enables extensible instruction tuning with latent domain-specific adapters and parameter-free routing
arXiv cs.CL
source ↗
Aug 7
QEvict: recoverable quantized KV eviction for attention-drift-robust long-context decoding
arXiv cs.LG
source ↗
Aug 7
DoctorAgents: an agentic framework to iteratively refine AutoML pipeline for small clinical temporal data
arXiv cs.AI
source ↗
Aug 7
Scaffold-mediated post-training: co-evolving model parameters and procedural scaffold graphs
arXiv cs.CL
source ↗
Aug 7
Otter: a time-aware, history-conditioned human chess AI uses move history and time control signals to predict human move selection
arXiv cs.AI
source ↗
Aug 7
Perturbation sensitivity at convergence identifies spuriously correlated samples without group annotations
arXiv cs.LG
source ↗
Aug 7
Cross-architecture steering transfer in language models: a systematic empirical study
arXiv cs.CL
source ↗
Aug 7
Posture and sustainment optimization under adversarial uncertainty
arXiv cs.AI
source ↗
Aug 7
Beyond sentiment: comparing traditional NLP and LLM-based multi-dimensional framing analysis for political news evaluation
arXiv cs.CL
source ↗
Aug 7
Position: it's time to optimize LLMs for self-consistency
arXiv cs.CL
source ↗
Aug 7
Agentic nesting: a new methodology for existing enterprise application integration and services
arXiv cs.AI
source ↗
Aug 7
PoolBench: a benchmark for pooling strategies in concept representation evaluation for decoder-only LLMs
arXiv cs.CL
source ↗
Aug 7
Woodpecker Distillation shows weak models diagnose reasoning bugs in strong models
arXiv cs.AI
source ↗
Aug 7
IFlowNets: Extending Generative Samplers to Learn Strategies in Incomplete Information Games
arXiv cs.LG
source ↗
Aug 7
Auditing conditional style leakage in factorized generative models shows marginal matching does not guarantee independence between style and class information
arXiv cs.LG
source ↗
Aug 6
JudgeArena: a unified framework for reproducible LLM-judge evaluation
arXiv cs.CL
source ↗
Aug 6
Learning a vector-symbolic model for socio-cultural tasks
arXiv cs.CL
source ↗
Aug 6
Evaluating OpenAI's Privacy Filter across 42 benchmarks: cross-lingual and cross-domain PII detection
arXiv cs.CL
source ↗
Aug 6
ARCHead: Activation-Metric Residual Correction for large language model output heads
arXiv cs.CL
source ↗
Aug 6
Emulate or estimate? The divergent strengths of base and post-trained language models for opinion simulation
arXiv cs.CL
source ↗
Aug 6
OncoTriad-QA: a patient-level radiology-pathology-genomics benchmark for pan-cancer reasoning
arXiv cs.CL
source ↗
Aug 6
Crayotter: Learning long-horizon video editing agents via group-relative preference backpropagation
arXiv cs.CL
source ↗
Aug 6
FLARE: Few-shot learning-based adaptive reflective engine
arXiv cs.CL
source ↗
Aug 6
Aligned in form, not in meaning: the comprehension–containment decoupling of LLM safety in low-resource Bangla derogatory speech
arXiv cs.CL
source ↗
Aug 6
TabletCraft enables bidirectional Akkadian NMT and cuneiform rendering to bridge a 4,000-year cultural gap.
arXiv cs.CL
source ↗
Aug 6
Knowing the form, not the function: automatically auditing answer–authority decoupling in legal benchmarks
arXiv cs.CL
source ↗
Aug 6
TQLite: multi-LLM jury-guided distillation for real-time MQM translation quality evaluation
arXiv cs.CL
source ↗
Aug 6
BBOWP-Bench: Evaluating LLMs on Black-Box Optimization Word Problems
arXiv cs.CL
source ↗
Aug 6
Character iconicity vs. arbitrariness: an Arabic NLP perspective
arXiv cs.CL
source ↗
Aug 6
Study questions reliability of statistical measures in script decipherment; SIGIL shows 3,000-text corpus with explicit compositional meanings but undeciphered signs
arXiv cs.CL
source ↗
Aug 6
MemArena: an ego-centric benchmark for on-device agentic personal memory assistants at scale
arXiv cs.CL
source ↗
Aug 6
Language models encode contextual truth of propositions along linear activation directions across output policies
arXiv cs.CL
source ↗
Aug 6
Preferred, not safer: pairwise preference is a poor proxy for clinical safety
arXiv cs.CL
source ↗
Aug 6
Language models reveal urban profiles from anonymized city references using 40 indicators across seven domains
arXiv cs.CL
source ↗
Aug 6
Stuck on "A": diagnosing and repairing interface injury in attention-to-KDA linearization of a 0.6B language model
arXiv cs.CL
source ↗
Aug 6
BODHI: do LLMs branch out and discover heterogeneous inferences?
arXiv cs.CL
source ↗
Aug 6
A long-run persistence theory for AI systems under the redundancy-adjusted artificial age score (AAS)
arXiv cs.AI
source ↗
Aug 6
Leak-Resistant unlearning: a new benchmark for evaluating multi-hop reasoning consistency and recovery robustness
arXiv cs.AI
source ↗
Aug 6
Agreement-before-Diversity: a verification-first criterion for heterogeneous language-model coordination
arXiv cs.AI
source ↗
Aug 6
CAMP: a cycle-aware multi-scale patch mixer for time series forecasting
arXiv cs.LG
source ↗
Aug 6
Calibrating artificial guilt: neurally grounded reward shaping for prosocial multi-agent reinforcement learning.
arXiv cs.AI
source ↗
Aug 6
On Hamming-Lipschitz type stability of the subdominant (minmax) ultrametric: theory and simple proofs
arXiv cs.LG
source ↗
Aug 6
Understanding fault tolerance of adversarially robust pruned models
arXiv cs.LG
source ↗
Aug 6
Monte Carlo Tree Search for table-to-multimodal report generation
arXiv cs.AI
source ↗
Aug 6
Trust-region framework for moment estimation constrains update steps in Adam-like optimizers; derives a family of learning-rate mechanisms based on moment constraints
arXiv cs.LG
source ↗
Aug 6
Interoceptive attention as dynamic homeostatic prioritization in a foraging agent
arXiv cs.AI
source ↗
Aug 6
C2MOE uses consistency and complementarity-guided mixture of experts to handle incomplete multimodal emotion learning.
arXiv cs.LG
source ↗
Aug 6
Recurrent Residual Quantization: a PTQ framework for progressive multi-precision LLM representation
arXiv cs.LG
source ↗
Aug 6
Improving auto-design of neural PDE solvers with a domain-specific language
arXiv cs.AI
source ↗
Aug 6
Joint UAV flight and opportunistic routing under reinforcement learning for delay-tolerant networks
arXiv cs.AI
source ↗
Aug 6
From non-convex self-concordant regularization to scalable quasi-Newton training of PINNs
arXiv cs.LG
source ↗
Aug 6
SpecDrop: parameter-free routing for modular specialization in mixture-of-experts networks
arXiv cs.LG
source ↗
Aug 6
Tactus: Open-vocabulary object recognition from low-cost pressure arrays
arXiv cs.LG
source ↗
Aug 6
Lindblad-inspired multi-timescale reservoir computing with separable rotation and dissipation
arXiv cs.LG
source ↗
Aug 6
NeuMoSync integrates neuron-specific neuromodulation into deep networks to improve plasticity and adaptability in continual learning.
arXiv cs.AI
source ↗
Aug 6
Random features for Grassmannian kernel approximation with bounded rank-one projections
arXiv cs.LG
source ↗
Aug 6
Unscented KalmanNet: a hybrid deep learning filter with calibrated posterior covariance for nonlinear state estimation
arXiv cs.LG
source ↗
Aug 6
AI literacy for legal translation: developing digital resilience
arXiv cs.AI
source ↗
Aug 6
Comparative study of feature selection methods for EHR diagnosis codes in opioid use disorder prediction
arXiv cs.LG
source ↗
Aug 6
Attention-Only white-box transformer via LeJEPA-based self-supervised pretraining
arXiv cs.LG
source ↗
Aug 6
Spatiotemporal graph transformer for traffic intelligence in edge computing
arXiv cs.LG
source ↗
Aug 6
RAIL Principles for Neurosymbolic AI: Reasoning, Assurances, Interfacing and Learning
arXiv cs.AI
source ↗
Aug 6
What Is a Skill Worth? Structure-aware Shapley valuation of agent skills
arXiv cs.AI
source ↗
Aug 6
FinProBench provides a benchmark for professional financial tasks and RGRC derives rubrics from practitioner deliverables to evaluate financial AI agents.
arXiv cs.AI
source ↗
Aug 6
The LLM proposes, the executive disposes: a self-verifying agent instrument that dissociates commitment drift from binding drift in long-horizon agents.
arXiv cs.AI
source ↗
Aug 6
CARGO-VL: a group-relative framework for counterfactual arbitration with risk-constrained optimization in vision-language models
arXiv cs.AI
source ↗
Aug 6
Adversarially robust abductive fusion of pre-trained transformer-based perception models
arXiv cs.AI
source ↗
Aug 6
Traceable LLM-generated hazard scenarios from ASRS reports for aviation safety analysis
arXiv cs.AI
source ↗
Aug 6
LiNC: Lightweight Noise Correction via per-sample trust and Gaussian mixture modeling
arXiv cs.LG
source ↗
Aug 6
Robust and personalized federated learning for aircraft-engine prognostics under benign and adversarial client heterogeneity
arXiv cs.LG
source ↗
Aug 6
Learning to resolve neutron resonances with fully convolutional neural networks
arXiv cs.LG
source ↗
Aug 6
MatrAIx: Simulating the world with 8.3 billion persona agents
arXiv cs.AI
source ↗
Aug 6
MINT: tensor decomposition on stacked recurrence matrices for time series data mining
arXiv cs.LG
source ↗
Aug 6
LaPrune: controllable differentiable sparsity at million scale.
arXiv cs.LG
source ↗
Aug 6
BrainBench benchmarks large language models for comprehensive EEG understanding
arXiv cs.AI
source ↗
Aug 6
SJEPA: learning elegant latent dynamics with hybrid symbolic-neural predictors
arXiv cs.LG
source ↗
Aug 6
TS2TabPFN: time series classification and extrinsic regression through feature extraction and a tabular foundation model
arXiv cs.LG
source ↗
Aug 6
Architectural implications of agentic AI workflows; study characterizes fragmentation and heterogeneity in agentic execution across production Azure workflows and open-source frameworks
arXiv cs.AI
source ↗
Aug 6
A/B Agent: a self-evolving agent for strategy iteration in industrial A/B testing
arXiv cs.AI
source ↗
Aug 6
An explainable LLM agent layer for open-world anomaly detection in oil wells
arXiv cs.LG
source ↗
Aug 6
When prompts become pixels: prompt-region grounding for multimodal reasoning
arXiv cs.AI
source ↗
Aug 6
SafeCommit introduces a risk-controlled layer to certify memory-grounded agents before action under memory uncertainty
arXiv cs.AI
source ↗
Aug 6
MERaLiON-GR: a speech gender recognition model for English and SEA languages uses LoRA fine-tuning on MERaLiON-SpeechEncoder-2
arXiv cs.CL
source ↗
Aug 6
Towards end-to-end multilingual metaphor processing: integrating detection, translation, and evaluation
arXiv cs.CL
source ↗
Aug 6
Output-budget regimes change the measured multilingual reasoning gap in MGSM for Qwen3-8B and Llama-3.1-8B-Instruct across prompting budgets
arXiv cs.CL
source ↗
Aug 6
Eliciting intrinsic hallucinations in LLMs via semantically equivalent adversarial attacks
arXiv cs.CL
source ↗
Aug 6
DataRx: missingness-aware sampling for safer large language model task-specific fine-tuning
arXiv cs.CL
source ↗
Aug 6
Visualizing graph-to-answer mechanism recovery in materials-science hypothesis generation
arXiv cs.CL
source ↗
Aug 6
MAP-PO: learning sexism detection by preserving perspectivist annotations on EXIST 2024 tweets
arXiv cs.CL
source ↗
Aug 6
Large Language Models for low-resource languages: a conceptual framework for an electronic explanatory dictionary of the Tajik language
arXiv cs.CL
source ↗
Aug 6
Right Reset: Chunking by Prefix Removal
arXiv cs.CL
source ↗
Aug 6
The Calibration Floor: format repair can masquerade as self-correction at small-to-mid scale
arXiv cs.CL
source ↗
Aug 6
Patients-like-me: a variational LM–GNN framework for explainable clinical prediction
arXiv cs.CL
source ↗
Aug 6
Searching for sound-meaning collisions: graph-based affordance retrieval and multi-evaluator ranking for pun translation at CLEF 2026 JOKER Task 2
arXiv cs.CL
source ↗
Aug 6
Test whether language models implement an in-context conditional rule via a runtime circuit across models and languages
arXiv cs.CL
source ↗
Aug 6
Reconstructing persistent worlds from narratives for narrative-grounded interactive experiences
arXiv cs.CL
source ↗
Aug 6
Hallucinations on the board: tool-augmented evaluation of LLM chess commentary
arXiv cs.CL
source ↗
Aug 6
FinReportBench benchmarks and improves institution-grade financial report generation using a 35-item rubric
arXiv cs.CL
source ↗
Aug 6
EdgeLM uses edge demonstrations for improving table understanding in language models
arXiv cs.CL
source ↗
Aug 6
NOLLI: a procedurally generated English-Korean puzzle benchmark for diagnosing the English-Korean performance gap.
arXiv cs.CL
source ↗
Aug 6
Equitable system-prompt selection via constrained mixed-strategy groupDRO
arXiv cs.CL
source ↗
Aug 6
When more becomes less: position-dependent repetition effects in language models
arXiv cs.CL
source ↗
Aug 6
Social pressure breaks majority voting in LLM safety panels
arXiv cs.CL
source ↗
Aug 6
The fairness collapse phenomenon: bias amplification in language models trained on synthetic data
arXiv cs.CL
source ↗
Aug 6
Transfer learning for named entity recognition of classical Latin through LLM prompting
arXiv cs.CL
source ↗
Aug 6
MIDAS: Multi-LLM Iterative Data-Adaptive Summarization
arXiv cs.CL
source ↗
Aug 5
Shared organizational memory for enterprise coding agents: system design and deployment snapshot
arXiv cs.AI
source ↗
Aug 5
SIRIN: a unified toolkit for detecting contextual hallucinations in retrieval-augmented and memory-grounded LLM systems
arXiv cs.AI
source ↗
Aug 5
Energy efficiency of locally deployed LLMs: a preliminary quantitative GPU power benchmark on consumer hardware
arXiv cs.AI
source ↗
Aug 5
Personalizing large language model agents with small policy models
arXiv cs.AI
source ↗
Aug 5
Linguistic context recodes visual representations in vision-language models
arXiv cs.AI
source ↗
Aug 5
H+ Embedding: harmonizing global and token-level retrieval with context-dependent phrases
arXiv cs.AI
source ↗
Aug 5
CoT-Core: accelerating LLM evaluation via CoT-aware coreset selection
arXiv cs.AI
source ↗
Aug 5
TRACE-TS: attribution-grounded and traceable sensor-language reasoning for human activity understanding
arXiv cs.AI
source ↗
Aug 5
Motif-Mamba: network motif improved mamba for long-range sequence modeling
arXiv cs.AI
source ↗
Aug 5
Nova: an end-to-end MLIR compiler for deep learning
arXiv cs.AI
source ↗
Aug 5
Agentic coding in the wild: characterization of GitHub Copilot traces at production scale
arXiv cs.AI
source ↗
Aug 5
Request-level energy attribution for batched LLM serving
arXiv cs.AI
source ↗
Aug 5
Geometric self-supervised pre-training improves neural combinatorial optimization generalization to larger TSP instances
arXiv cs.AI
source ↗
Aug 5
Structural limits persist for homogeneous multi-agent groundedness verification, even with a three-agent panel across six benchmarks.
arXiv cs.AI
source ↗
Aug 5
Optimization and constraint modeling using LLMs with a retrieval augmented generation process
arXiv cs.AI
source ↗
Aug 5
AgentStream evaluates self-evolving LLM agents under streaming tasks
arXiv cs.AI
source ↗
Aug 5
Revisiting classic thought experiments to measure consciousness for artificial intelligence safety
arXiv cs.AI
source ↗
Aug 5
RF-HOI uses radio frequency signals to recognize human-object interactions (HOI) without vision-based inputs
arXiv cs.AI
source ↗
Aug 5
WM-Cov: Test adequacy for interactive world-model-style autonomous driving simulation
arXiv cs.AI
source ↗
Aug 5
RAG-TESTER: automated end-to-end testing of retrieval-augmented large language models
arXiv cs.AI
source ↗
Aug 5
Enhancing LLMs with context-specific knowledge for mitigating misinformation in SMEs using RAG-based modeling and analysis
arXiv cs.AI
source ↗
Aug 5
Wiring beats blending: what transfers between transformer sizes — and what doesn’t
arXiv cs.LG
source ↗
Aug 5
Population-robust feature selection via generalized welfare optimization
arXiv cs.LG
source ↗
Aug 5
Designing a good virtual node: addressable and cardinality-preserving global memory for message passing architectures
arXiv cs.LG
source ↗
Aug 5
Geodesic Normalization keeps hidden states on a hypersphere by orthogonalizing layer outputs and updating via the Riemannian exponential map
arXiv cs.LG
source ↗
Aug 5
Measuring explainer stability via attribution separability
arXiv cs.LG
source ↗
Aug 5
Topological simplification in predictive coding networks across layers measured with persistent homology on MNIST and synthetic data
arXiv cs.LG
source ↗
Aug 5
LLMs can annotate attribution graphs
arXiv cs.LG
source ↗
Aug 5
NANQ: Noise-floor-aware mixed-precision non-uniform quantization for analog compute-in-memory
arXiv cs.LG
source ↗
Aug 5
Adaptive sampling for automated post-disaster rapid damage assessment via level-set cost-aware Bayesian optimization
arXiv cs.LG
source ↗
Aug 5
Evaluation blindness: silent measurement failures can hide AI system faults from training to deployment
arXiv cs.LG
source ↗
Aug 5
Can training logs make model comparisons more precise?
arXiv cs.LG
source ↗
Aug 5
PatTree: a novel approach for automated creation of multimodal, graph-based patient representations for medical classification tasks
arXiv cs.LG
source ↗
Aug 5
Verifier-Guided model discovery for physical dynamical systems with pretrained symbolic transformers
arXiv cs.LG
source ↗
Aug 5
Deep Divide-and-Reduce in Symbolic Regression
arXiv cs.LG
source ↗
Aug 5
Neural networks with local converging inputs improve efficiency of multi-asset options pricing by locally correcting coarse-mesh solutions with a minimal high-precision input.
arXiv cs.LG
source ↗
Aug 5
GeoID-PINN models identifiability-aware regional epidemic inference with geographic coupling using a physics-informed neural network for SIRD dynamics
arXiv cs.LG
source ↗
Aug 5
PhenMol: a structure-preserving framework for phenotypic drug discovery in learning molecular representations from cellular phenotypes
arXiv cs.LG
source ↗
Aug 5
Contrast-invariant deep ptychography neural networks
arXiv cs.LG
source ↗
Aug 5
Output-Aware Rotation for INT2 KV-Cache Quantization
arXiv cs.LG
source ↗
Aug 5
CT-HEG: a bidirectional, timestamp-attributed event graph for ICU in-hospital mortality prediction; an architectural ablation study
arXiv cs.LG
source ↗
Aug 5
Multimodal auto-regressive transformer surrogate models variable well operations and quantifies uncertainty in geological carbon storage
arXiv cs.LG
source ↗
Aug 5
Maglev: Sliding Recurrent Memory uses a recurrent Transformer with fixed-size memory to generalize sliding-window attention; introduces a two-model architecture with a prefiller and memory model
arXiv cs.LG
source ↗
Aug 5
GoT-CD: Graph-of-thoughts causal discovery and the fragility of post-hoc path-specific fairness audits
arXiv cs.LG
source ↗
Aug 5
NOMADD: numerical optimization of models adapting to data drift
arXiv cs.LG
source ↗
Aug 5
Globe: Trajectory-aligned gradient matching with structured sparse optimization for coreset selection
arXiv cs.LG
source ↗
Aug 5
MedPIC-Bench benchmark evaluates counterfactual sensitivity to patient information in medication-safety reasoning
arXiv cs.AI
source ↗
Aug 5
PULSE: an executable contract language for spatiotemporal knowledge graph engineering
arXiv cs.AI
source ↗
Aug 5
ISEE: Interactive Semantic Enrichment for Database Fields enhances data sense-making by improving semantic clarity of field descriptions through LLM-based agents.
arXiv cs.AI
source ↗
Aug 5
Information boundaries for group-robust LLM pruning; a reproducible compression statistic can select the wrong candidate, with a conic law modeling the pooling price for positive linear fixed-candidate damage.
arXiv cs.AI
source ↗
Aug 5
HyperAgent: planning and acting over tool-schema hypergraphs for tool-use LLM agents
arXiv cs.AI
source ↗
Aug 5
Beyond the hivemind: escaping LLM homogeneity via meta-persona anchoring and sequential temperature scaling
arXiv cs.AI
source ↗
Aug 5
Predictive set theory: a generative framework for cognitive architecture with operationalized core mechanisms
arXiv cs.AI
source ↗
Aug 5
Towards a new paradigm of scientific discovery with socialized artificial intelligence
arXiv cs.AI
source ↗
Aug 5
BAP-SQL: Budget-aware observation planning for agentic text-to-SQL
arXiv cs.AI
source ↗
Aug 5
Hypercubes, hyperplanes, and constraint-induced complexity collapse in atomic concept learning
arXiv cs.AI
source ↗
Aug 5
DiffImaginE introduces a multimodal named entity recognition verifier using diffusion imagery to assess entity-type compatibility
arXiv cs.AI
source ↗
Aug 5
AI Agent Economics: can autonomous economic behavior emerge among AI agents under minimal external conditions?
arXiv cs.AI
source ↗
Aug 5
TraceCAD: trace-guided repair for agentic CAD generation
arXiv cs.AI
source ↗
Aug 5
LoCA: Forward-only LLM tuning after one-shot calibration with local credit assignment
arXiv cs.AI
source ↗
Aug 5
ProPRL: property-aware prerequisite relation learning in educational knowledge graphs.
arXiv cs.AI
source ↗
Aug 5
Getting the parameters right: a difficulty-graded benchmark and probe-guided training for LLM tool calls
arXiv cs.AI
source ↗
Aug 5
Missing data layer in Latin American AI infrastructure; proposes DataHub to address dataset discovery and supply challenges
arXiv cs.AI
source ↗
Aug 5
Interpreting black-box large language models with sentence-level energy landscapes
arXiv cs.AI
source ↗
Aug 5
VeriTrace: human-like temporal exploration completes agentic action space
arXiv cs.AI
source ↗
Aug 5
Explainable AI for the EU Right to Explanation: a systematic review of the law–XAI translation gap
arXiv cs.AI
source ↗
Aug 5
UrbanAgent: a tool-augmented agent for cross-system urban tasks
arXiv cs.AI
source ↗
Aug 5
Self-Organising Digital Circuits demonstrate meta-learning-based functional logic generation on graphs for adaptive circuit maintenance
arXiv cs.AI
source ↗
Aug 4
Machine-learning-guided pipeline enables on-demand solvent candidate generation and testing of electrolyte recipes; SEM images show sodium-metal deposit morphologies for three candidates
MIT News (AI)
source ↗
Aug 4
Benefits of medical AI assistance vary by user expertise, with non-experts trusting AI advice more than clinicians who recognize AI mistakes.
MIT News (AI)
source ↗
Aug 4
Dual-penalty evasion framework to fool white-box explainable AI auditors; arXiv:2608.00566v1 reports attacks on post-hoc explainers like LIME, SHAP, and Integrated Gradients
arXiv cs.LG
source ↗
Aug 4
RubricReviewer: converting direct critique into rubric-driven peer review to make reviews objective and comprehensive
arXiv cs.CL
source ↗
Aug 4
Response magnitude as a dominant signal for held-out CRISPRi perturbation effect prediction
arXiv cs.LG
source ↗
Aug 4
Cost-effective automated judging of natural-language mathematical proofs using open-weight models aligns with human grading decisions on IMO-GradingBench instances
arXiv cs.CL
source ↗
Aug 4
DLLM-TTS: Block discrete diffusion language model for text-to-speech synthesis
arXiv cs.CL
source ↗
Aug 4
Obshazard-bench: benchmarking multimodal foundation models for real-time disaster intelligence from raw earth observation streams
arXiv cs.CL
source ↗
Aug 4
SLMs as multi-agent routers: a progressive SFT and reinforcement learning approach
arXiv cs.CL
source ↗
Aug 4
A Constitution-Grid instrument for data-efficient RL alignment (C-Guard)
arXiv cs.CL
source ↗
Aug 4
MemoryForge: Synthesize lifelong memory for human-like LLM agents
arXiv cs.CL
source ↗
Aug 4
Ensemble of unsupervised deep learning for clustering imbalanced tabular data
arXiv cs.LG
source ↗
Aug 4
Boosting diversity in text diffusion models via entropy-based guidance
arXiv cs.CL
source ↗
Aug 4
Modeling unknown nonlocal PDE systems via flow-map learning
arXiv cs.LG
source ↗
Aug 4
Verifier-induced support reshaping in on-policy optimization shows verifiable rewards shaping trajectories and reducing successful behaviors for later objectives in RLVR
arXiv cs.LG
source ↗
Aug 4
Targeted low-rank adaptation via causal layer selection to bridge English-Arabic medical knowledge gap
arXiv cs.CL
source ↗
Aug 4
Averaging bias: human faithfulness annotations are not locally faithful
arXiv cs.CL
source ↗
Aug 4
Agentic Graph Token Reasoning
arXiv cs.LG
source ↗
Aug 4
Textual descriptors predict early-stage startup exit using a 850-feature text-based framework on 7,419 startups over 20 years.
arXiv cs.CL
source ↗
Aug 4
CoSynFlow: conformal symplectic neural flows for cross-system prediction of dissipative Hamiltonian dynamics
arXiv cs.LG
source ↗
Aug 4
Agentic Bayesian Optimization through surrogate-augmented autoresearch
arXiv cs.LG
source ↗
Aug 4
SeDeM: selective decompression of hidden-state memories for long-context question answering
arXiv cs.CL
source ↗
Aug 4
Similarity-aware machine unlearning
arXiv cs.LG
source ↗
Aug 4
Fairness auditing: quantify unavoidable post-audit manipulation under finite resources
arXiv cs.LG
source ↗
Aug 4
Stabilized best-of-K training for neural combinatorial optimization improves Leader Reward with a stabilized rank signal for POMO on TSP-100; achieves 7.7662 under 100-start, 8-augmentation greedy decoding
arXiv cs.LG
source ↗
Aug 4
Trustworthiness costs of domain adaptation in small language models; a cross-architecture empirical study
arXiv cs.CL
source ↗
Aug 4
Neural operator learning for collision-aware trajectory planning of spacecraft swarms
arXiv cs.LG
source ↗
Aug 4
DSETA: a dual-stage continual learning framework for travel time prediction in dynamic traffic environments
arXiv cs.LG
source ↗
Aug 4
Inference-time policy alignment for fair reinforcement learning
arXiv cs.LG
source ↗
Aug 4
Comparing and modeling argumentation in German political communication across arenas
arXiv cs.CL
source ↗
Aug 4
LLantia: an LLM-based method for automated neural circuit inference and analysis
arXiv cs.CL
source ↗
Aug 4
What transfers from text to vision? Capability-Driven Multimodal Scaling Law and transfer dynamics for VLMs
arXiv cs.CL
source ↗
Aug 4
Learning compositional meta-routing for agentic workflows; an executable benchmark
arXiv cs.LG
source ↗
Aug 4
HP-JEPA: hierarchical partitioning for multi-resolution graph joint-embedding predictive learning
arXiv cs.LG
source ↗
Aug 4
AutoCause is an open-source Python workflow that automates expert decisions in environmental time-series causal discovery.
arXiv cs.LG
source ↗
Aug 4
Role steering of language models for social simulations
arXiv cs.CL
source ↗
Aug 4
Cross-task dissociation in frontier vision-language model theory of mind
arXiv cs.CL
source ↗
Aug 4
Sixteen language models yield 1.69 distinct formulations on a psychotherapeutic case; ensembles offer multiple perspectives before a decision
arXiv cs.CL
source ↗
Aug 4
Leak It: a probabilistic approach to training-data extraction from black-box language models
arXiv cs.LG
source ↗
Aug 4
Rethinking pretraining for specialized design data: evidence from the JONES-19 cultural design dataset
arXiv cs.LG
source ↗
Aug 4
LLM-OSDA: an optimal-stopping dynamic auction for native advertising in multi-turn LLM conversations
arXiv cs.CL
source ↗
Aug 4
Progressive^2: a teacher-student progressive co-evolving knowledge distillation method for substantial model compression
arXiv cs.LG
source ↗
Aug 4
Physics-chemistry-informed neural network (PCINN) enables real-time SALD surface coverage prediction and reliable kinetics inversion
arXiv cs.LG
source ↗
Aug 4
A Few Neurons Reveal When LLMs Misuse Tools: Sparse Detection and Selective Steering for Reliable Tool Use
arXiv cs.CL
source ↗
Aug 4
CurveShift: Is Agent Progress Scalar? Separating Level from Shape
arXiv cs.CL
source ↗
Aug 4
Abstention as an action can kill both the reward gradient and the KL anchor: collapse law and repair for error-penalized reinforcement learning
arXiv cs.LG
source ↗
Aug 4
DiffusionGemma: an experimental open-weight language model uses discrete diffusion to generate text in parallel by refining blocks of 256 tokens; authors fine-tune mixture-of-e gates? Wait ensure accuracy. We must avoid inventing. The abstract ends with "fine-tuning the mixture-of-e" truncated. We can't infer. So craft headline: "DiffusionGemma introduces an experimental open-weight language model that uses discrete diffusion to generate text in parallel by refining blocks of 256 tokens." That stays within provided. Might be okay. Include arXiv 2608.00146? Not necessary. It's a headline style. Keep sentence case. Under ~200 chars. Let's produce: "DiffusionGemma introduces an experimental open-weight language model that uses discrete diffusion to generate text in parallel by refining blocks of 256 tokens." DiffusionGemma introduces an experimental open-weight language model that uses discrete diffusion to generate text in parallel by refining blocks of 256 tokens.
arXiv cs.CL
source ↗
Aug 3
Alexander Rakhlin named director of the MIT Statistics and Data Science Center.
MIT News (AI)
source ↗
Aug 3
Orchard: an open framework for scalable agentic AI
Microsoft Research
source ↗
Aug 3
Safety, or just capability? A validity audit of agent-safety benchmarks
arXiv cs.AI
source ↗
Aug 3
SEDR-Seq2P: a lightweight dilated residual sequence-to-point network for multi-task industrial NILM
arXiv cs.LG
source ↗
Aug 3
Benchmarks are not monolithic: sample-level auditing and orchestration for LLM evaluation show dataset-centric meta-evaluation along five latent dimensions
arXiv cs.CL
source ↗
Aug 3
Representations from pretrained machine-learning interatomic potentials as coarse coordinates for material generation and evaluation
arXiv cs.LG
source ↗
Aug 3
Mitigating class-tail undercoverage in medical vision-language models under clinical shift
arXiv cs.LG
source ↗
Aug 3
MPP-GNN: Subject-Adaptive Community Detection for fMRI-Based Alzheimer's Disease Classification
arXiv cs.LG
source ↗
Aug 3
Knowledge distillation in small instruction-tuned LMs has asymmetric effects on bias, improving context-following for unambiguous tasks but degrading calibration for ambiguous tasks.
arXiv cs.CL
source ↗
Aug 3
EarlyDx: an admission-anchored benchmark for open-ended generation of evidence-supported ED-encounter diagnoses
arXiv cs.AI
source ↗
Aug 3
TextCloak defends against unauthorized LLM exploitation by RL-driven unlearnable text
arXiv cs.CL
source ↗
Aug 3
Self-Supervised Skill Optimization learns reusable agent skills from unlabeled task instances alone
arXiv cs.CL
source ↗
Aug 3
Fast rates for swap-agnostic learning of proper losses
arXiv cs.LG
source ↗
Aug 3
Predicting steel fatigue life from micrographs using physics-informed deep learning
arXiv cs.LG
source ↗
Aug 3
Reasoning in real world clinical care: why large language models are not yet safe for autonomous clinical decision support; corroborating coverage notes real-world credibility tests of LLM reasoning
arXiv cs.AI
source ↗
Aug 3
Sensitivity analysis of GRU, LSTM and Transformer encoder in classification of automated driving systems
arXiv cs.LG
source ↗
Aug 3
PARALLEL: a prefrontal-aligned reinforcement-inspired approach for language-model learning under explicit limits
arXiv cs.CL
source ↗
Aug 3
Fragility of value under imperfect alignment; model analyzes how optimizing for an imperfect proxy can yield catastrophic outcomes
arXiv cs.AI
source ↗
Aug 3
Machine learning approaches for enhancing decision-making in complex discrete choice tasks show potential for policy-based preference elicitation over traditional parametric models
arXiv cs.LG
source ↗
Aug 3
Adaptivity via a parallel architecture for stochastic gradient methods
arXiv cs.LG
source ↗
Aug 3
Reflection or re-generation? Why LLM revision fails where human revision succeeds
arXiv cs.LG
source ↗
Aug 3
Topology-aware data movement for disaggregated GPU inference
arXiv cs.LG
source ↗
Aug 3
Distilling knowledge from large language models into lightweight reinforcement learning agents for autonomous cyber operations
arXiv cs.LG
source ↗
Aug 3
LARA: Lightweight Additive Residual Adaptation operates in the residual stream for model adaptation without updating base weights; evaluated on a code fine-tuning task and on preference optimization (DPO)
arXiv cs.LG
source ↗
Aug 3
ViSAGE: constructing self-correcting memories for long-form video understanding
arXiv cs.AI
source ↗
Aug 3
The Morphological core of Dungan: a two-dialect finite-state model and a multi-genre evaluation
arXiv cs.CL
source ↗
Aug 3
Identifying informative environments for cognition parameter inference via Bayesian experimental design.
arXiv cs.AI
source ↗
Aug 3
Ontology-guided deduplication-aware extraction layer for knowledge graph construction from heterogeneous documents
arXiv cs.AI
source ↗
Aug 3
Gated Q-learning: add off-policy bias to taste
arXiv cs.LG
source ↗
Aug 3
Model or harness? An interaction-centric taxonomy for localizing agent failures
arXiv cs.AI
source ↗
Aug 3
Feature interaction modeling for physics-informed neural networks and neural operators
arXiv cs.LG
source ↗
Aug 3
Can AI evaluate AI scientists? A benchmarking study of autonomous research generation systems using automated multi-model review
arXiv cs.AI
source ↗
Aug 3
TAPR: a task-aware prompt rewriter improves downstream LLM performance by reformulating user prompts into task-optimized prompts using reinforcement learning with GRPO
arXiv cs.AI
source ↗
Aug 3
MMFGU: Multimodal Federated Graph Unlearning enables fine-grained deletion in multimodal federated learning; arXiv paper outlines approach
arXiv cs.LG
source ↗
Aug 3
ZeroR@CHiPSAL 2026: two-stage vision-language adaptation with contrastive learning for Nepali meme classification
arXiv cs.CL
source ↗
Aug 3
Entropy-based CoT pruning offers no advantage over random pruning; low-entropy token retention is only briefly effective, per tests across models and tasks.
arXiv cs.CL
source ↗
Aug 3
Mixture-of-Translators: translating KV caches across heterogeneous large language models
arXiv cs.CL
source ↗
Aug 3
What must be true before AI ships in a regulated firm
arXiv cs.CL
source ↗
Aug 3
Token-Level diagnosis of sycophancy in LLMs with attribution-guided steering
arXiv cs.CL
source ↗
Aug 3
NeSyFS: A Neuro-symbolic fast-slow thinking framework for LLM agent under partial observability
arXiv cs.AI
source ↗
Aug 3
MerchantBench benchmarks LLM agents for long-term coherence in e-commerce operations
arXiv cs.AI
source ↗
Aug 3
Preference-Optimized LLM counselors trade goal persistence for relational attunement in motivational interviewing
arXiv cs.CL
source ↗
Aug 3
LLMs tested for predicting item difficulty levels in large-scale tests; study compares prompting strategies and models across LLMs and encoder-only baselines.
arXiv cs.CL
source ↗
Aug 3
MMShopBench: a real-log benchmark for multimodal, multi-turn shopping agents
arXiv cs.AI
source ↗
Aug 3
Flow matching with missing data
arXiv cs.LG
source ↗
Aug 3
TAGTorch: a PyTorch library for geometry, topology, and symmetry-aware machine learning
arXiv cs.LG
source ↗
Aug 3
Evidence-grounded constraint checking in construction documents uses a pipeline that normalizes facts, applies four-state rules, and retains source spans; evaluated on 160 reference-based tasks from 29 projects.
arXiv cs.AI
source ↗
Aug 3
Guarantees on dynamical system distinguishability for LLM token generation
arXiv cs.LG
source ↗
Aug 3
Lawful: Law-aligned witness for faithful use of latents explores interpretability gaps in physics-law representations
arXiv cs.LG
source ↗
Aug 3
BLADE: Boundary-expanded and layer-adaptive dynamic exit for efficient LLM reasoning
arXiv cs.CL
source ↗
Aug 3
How hard does it think? Analyzing step-aware reasoning energy in LLM chain-of-thought trajectories
arXiv cs.AI
source ↗
Aug 3
Empowering cross-domain sequential recommendation with hybrid tokenization and serial-parallel decoding
arXiv cs.AI
source ↗
Aug 3
Mirror learning: acquiring actionable policies from passive observation through third-person demonstrations
arXiv cs.LG
source ↗
Aug 3
Stateful knowledge learning enables LLM agents to move from trajectory-level reflection to predictive foresight
arXiv cs.CL
source ↗
Aug 3
LLM framework for discovering major mathematical conjectures: AI's quest for the next Riemann hypothesis
arXiv cs.AI
source ↗
Aug 3
Evaluating federated pre-training: reliability of downstream fine-tuning and intrinsic evaluation
arXiv cs.CL
source ↗
Aug 3
Multi-agent planning with spatio-temporal and topological constraints using STL-GO
arXiv cs.AI
source ↗
Aug 3
On the generalization of steering vectors for chain-of-thought faithfulness
arXiv cs.AI
source ↗
Aug 3
Context-preserving organization of inline notes and collected commentaries in classical Chinese texts for exegetical knowledge; NLP framework proposes preserving contextual dependencies while automated compilation
arXiv cs.CL
source ↗
Aug 3
Chain-of-Models: cross-model auditing for bias-robust LLM judges
arXiv cs.CL
source ↗
Aug 3
Hypergradient-based bilevel reinforcement learning with improved sample complexity
arXiv cs.LG
source ↗
Aug 3
Hierarchical Copula-Gumbel-Top-K routing: two-sided dependence control for frozen mixture-of-experts at fixed per-token routing laws
arXiv cs.LG
source ↗
Aug 3
TELLER: Dual-Path Iterative Preference Optimization for Table Entity Linking
arXiv cs.CL
source ↗
Aug 3
Imbalanced data clustering via targeted data augmentation using GMM and LLM
arXiv cs.CL
source ↗
Aug 3
Scaling scientific discovery environments for turn-level agentic RL
arXiv cs.AI
source ↗
Aug 3
ThinkReset: Learnable intermediate interface construction for bounded-context long-horizon reasoning
arXiv cs.AI
source ↗
Aug 3
TokenSwap benchmarks and reduces the modality gap in multimodal LLMs
arXiv cs.CL
source ↗
Aug 3
Technological advances in detecting and managing cognitive impairment in older adults: trends, challenges, and future directions
arXiv cs.LG
source ↗
Aug 3
OpenClaw and Ollama in agentic AI: toward fully autonomous and scalable AI agent systems
arXiv cs.AI
source ↗
Aug 3
Best Friends, Not Forever: Evaluating long-horizon persona collapse and behavioral drift in AI companions
arXiv cs.AI
source ↗
Aug 3
Learning optimal dynamic matching via graph neural networks
arXiv cs.LG
source ↗
Aug 3
Library reachability in LSR-Synth: anti-memorization design changes measurement of symbolic discovery
arXiv cs.AI
source ↗
Aug 3
FairFund-Bench evaluates distributive bias in LLM resource allocation.
arXiv cs.CL
source ↗
Aug 3
SciToolAgent-Evo: an ontology-aware self-evolving agent for open-world scientific tool acquisition
arXiv cs.AI
source ↗
Aug 3
The Formalism Trap: LLM-as-a-Judge evaluators conflating proceduralism with semantic truth under social load
arXiv cs.CL
source ↗
2026-07 →