# Capital One Science > Advancing the frontier of AI and scientific discovery in finance. ## Pages - [Advancing the frontier of AI and scientific discovery in finance - Capital One](https://capitalone.science): Explore research, publications and open-source contributions from Capital One's scientists and engineers. - [Academia & Science Community Partnerships|Capital One Science](https://capitalone.science/academia): Partnering with academia and the science community for real-world impact. - [andrzej-test](https://capitalone.science/andrzej-test) - [AI Research | Capital One Science](https://capitalone.science/research): Learn how we are advancing the state of the art in AI for financial services. ## Blog - [Highlights from MLSys 2026 | Capital One Science](https://capitalone.science/blog/highlights-from-mlsys-2026): Capital One’s AI research team recaps MLSys 2026, including optimizing serving LLMs, RAG and agentic AI. - [Capital One at ICML 2026 | Capital One Tech](https://capitalone.science/blog/llm-reasoning-and-agentic-safety-at-icml-2026): Discover Capital One’s latest AI/ML research being presented at ICML 2026 in Seoul, covering critique-guided distillation and trajectory risk in agentic reasoning. - [UIUC 2026 Agentic AI Research Awardees | Capital One Science](https://capitalone.science/blog/uiuc-ai-research-awardees-2026-2027): Capital One announces the 20262027 UIUC research and fellowship awardees pushing frontiers in Agentic AI through collaborative scientific research. - [Capital One at ACL 2026 | Capital One Tech](https://capitalone.science/blog/capital-one-at-acl-2026): Capital One presents its latest AI/ML and NLP research at ACL 2026, highlighting multi-sector collaboration and innovations in LLMs and red teaming. - [UVA School of Engineering: Capital One Fellows 2026-2027 | Capital One Tech](https://capitalone.science/blog/uva-capital-one-fellows-2026-2027): Capital One and the University of Virginia celebrate the 2026-2027 engineering fellowship awardees. - [Ablation Studies: XAI Methods for Tabular Data | Capital One](https://capitalone.science/blog/xai-ablation-study): Using XAI (Explainable Artificial Intelligence) methods for tabular data, Capital One aims to build trust in performant black box models. - [Capital One Sessions & Speakers at NVIDIA GTC 2025 | Capital One](https://capitalone.science/blog/sessions-and-speakers-at-nvidia-gtc-2025): Discover Capital One's AI sessions and speakers at NVIDIA GTC 2025 in San Jose, CA. See how we use data and multi-agent workflows to drive innovation. - [Advancing AI Research at NeurIPS 2024 | Capital One](https://capitalone.science/blog/neurips-2024): Capital One is back at NeurIPS 2024 - the world's premier AI research conference. Read about our contributions to this year's accepted papers. - [KDD 2025: advancing AI & data science | Capital One](https://capitalone.science/blog/kdd-2025): Join Capital One at KDD 2025 to explore cutting-edge AI, data science and financial modeling innovations through talks, workshops and research insights. - [Introduction to deep tabular models | Capital One](https://capitalone.science/blog/introduction-to-deep-tabular-models): Learn about recent advancements to machine learning in the tabular domain and find out how deep tabular models can improve model performance. - [Input guardrails for safer LLM applications | Capital One](https://capitalone.science/blog/input-guardrails-llm-safety-chain-of-thought): Explore how Capital One improves LLM guardrails using chain-of-thought prompting and fine-tuning to boost safety, accuracy and adversarial robustness. - [Secure IAM for AI-driven LLM applications | Capital One](https://capitalone.science/blog/identity-access-management-llm): Learn how identity access management (IAM) can help you leverage the advanced capabilities of LLMs while securing sensitive data and assets. - [ICML 2025: Advancing Machine Learning | Capital One](https://capitalone.science/blog/icml-2025): Explore Capital One’s latest machine learning research, collaborations and workshops featured at ICML 2025, one of the world’s leading AI conferences. - [Advancing generative AI partnerships with UIUC | Capital One](https://capitalone.science/blog/generative-ai-partnerships-with-uiuc): Capital One and UIUC establish the ASKS Center to accelerate generative AI research, drive innovation and shape the future of AI technologies. - [CREDIF Spring '25: USC AI Fellows & Awards | Capital One](https://capitalone.science/blog/credif-spring-2025-ai-award-fellowship-recipients): Capital One and USC announce Spring 2025 CREDIF awards for breakthrough AI research in finance. Discover awardees and opportunities. - [Advancing U.S. AI for Societal Good | Capital One](https://capitalone.science/blog/capital-one-nsf-partnership-advances-ai-leadership): Capital One partners with the National Science Foundation (NSF) to advance science for societal good and U.S. AI leadership. - [Advancing AI research: industry & academia collaborations | Capital One](https://capitalone.science/blog/ai-research-industry-academia): Explore how Capital One fuels AI innovation with strategic academic partnerships, research internships, fellowships and funding for AI solutions. - [AI Agents vs. Predefined Workflows: A Guide | Capital One](https://capitalone.science/blog/ai-agents-vs-predefined-workflows-practical-decision-guide): Learn how to choose between an AI agent workflow and a predefined workflow based on task type, reliability and resource needs. - [Advancing AI Research at NAACL 2025 | Capital One](https://capitalone.science/blog/advancing-ai-research-naacl-2025): Explore Capital One’s latest NLP and AI research at NAACL 2025, from multilingual benchmarks to AI safety innovations and trusted model evaluation. - [Capital One at ACL 2025: Advancing NLP and AI Research | Capital One](https://capitalone.science/blog/acl-2025): Discover Capital One’s accepted papers at ACL 2025 exploring NLP scaling laws, multilingual AI and inclusive datasets through collaborative research. - [2025 CAIRFI AI Research Awardees Announced | Capital One](https://capitalone.science/blog/2025-cairfi-award-recipients): Capital One and Columbia University name 2025 CAIRFI research awardees advancing responsible AI, synthetic data and financial services innovation. - [Inside the World of AI Tech Incubators | Capital One](https://capitalone.science/blog/tech-incubator-program): Discover how tech incubators are reshaping AI education, providing students with hands-on experiences, industry mentorship and pathways to rewarding careers. - [Capital One & Columbia University Responsible AI Partnership | Capital One](https://capitalone.science/blog/responsible-ai-partnership-columbia-university): Capital One and Columbia University launch CAIRFI to promote responsible AI in finance, investing $3M for research and education. - [Transformers in NLP: Definitions & Advantages | Capital One](https://capitalone.science/blog/transformer-nlp): Transformer models are used to solve many types of natural language processing tasks. Learn about transformers and their use in NLP here. - [AI Readiness Survey: Are Companies Prepared for AI Adoption? | Capital One](https://capitalone.science/blog/ai-readiness-survey): Capital One’s AI readiness survey explores the gap between business leaders’ confidence in AI adoption and technical teams’ operational reality. - [Launching the Capital One Hub at UVA School of Data Science | Capital One](https://capitalone.science/blog/uva-school-of-data-science-capital-one-hub): The University of Virginia’s School of Data Science celebrates the opening of the Capital One Hub, a central space for the data science community. - [Stimulating STEM Summer Program at USC | Capital One](https://capitalone.science/blog/usc-stimulating-stem-summer-program): USC’s Stimulating STEM Summer Program, supported by Capital One, welcomed students for STEM education, workshops and mentorship. - [Capital One & USC Partner to Drive Responsible AI (CREDIF) | Capital One](https://capitalone.science/blog/responsible-ai-partnership-usc): Capital One & University of Southern California launch CREDIF to promote responsible AI and decision making in finance, advancing the future of AI. - [Positional Encoding in Graph Transformers | Capital One](https://capitalone.science/blog/positional-encoding-in-graph-transformers): Read about Capital One’s research on how graph models are used in finance and how positional encodings affect different graph transformers. - [Partnering with AI alongside industry leaders | Capital One](https://capitalone.science/blog/partnership-ai): Capital One is proud to announce our partnership with AI (PAI), a tremendous opportunity to deliver value to customers in ways never possible before. - [Highlights From the NeurIPS 2023 Conference | Capital One](https://capitalone.science/blog/neurips-applied-research): NeurIPS highlights our dedication to solving challenges and advancing responsible AI applications. Experience the forefront of AI in finance with Capital One. - [NeurIPS 2025 | Capital One Tech](https://capitalone.science/blog/neurips-2025): Discover our latest advancements at Capital One in AI efficiency, safety and scale presented at the leading global AI research conference. - [Highlights From the NAACL 2024 Conference | Capital One](https://capitalone.science/blog/naacl-2024): Review favorite papers and explore additional research presented at the NAACL 2024 conference, attended and sponsored by Capital One. - [LLM security and safety: responsible AI at NeurIPS 2024 | Capital One](https://capitalone.science/blog/llm-safety-security-neurips-2024): Discover cutting-edge research on LLM security and safety from NeurIPS 2024. Learn about innovations in responsible AI and secure LLM practices. - [Highlights from ICML 2024 | Capital One](https://capitalone.science/blog/icml-2024): Capital One’s AI research team recaps ICML 2024, highlighting papers on supervising sophisticated LLMs and discussions to advance ML. - [EMNLP 2025 Conference | Capital One](https://capitalone.science/blog/emnlp-2025): Learn how Capital One research presented at EMNLP 2025 addresses foundational problems in AI safety, model deployment and real-world system reliability. - [USC CREDIF AI Fellow Awardees Fall 2025 | Capital One](https://capitalone.science/blog/credif-fall-2025-ai-award-fellowship-recipients): Capital One is proud to announce the Fall 2025 AI fellows for the Center for AI and Responsible Decision-Making in Finance (CREDIF) at the University of Southern California. - [Investing in AI Research at UVA | Capital One](https://capitalone.science/blog/capital-one-uva-engineering-partnership): Capital One partners with the University of Virginia (UVA) School of Engineering and Applied Science to advance AI research and education - [Capital One Fellows for AI 2025-2026 | Capital One](https://capitalone.science/blog/capital-one-fellows-2025-2026): Capital One proudly supports our 2025-2026 PhD fellowship award recipients across multiple top universities advancing research in AI. - [ARIMA model tips for time series forecasting | Capital One](https://capitalone.science/blog/arima-model-time-series-forecasting): Learn how to use ARIMA models for time series forecasting in Python. Create and check the accuracy of your model with this comprehensive guide - [Applied AI Research | Capital One Tech](https://capitalone.science/blog/applied-ai-research): Learn about how Capital One’s Applied AI research is fueling the frontier of AI. - [2024 CAIRFI Awards for AI Fellowships & Research | Capital One](https://capitalone.science/blog/2024-cairfi-award-recipients): The Columbia Center of AI and Responsible Financial Innovation (CAIRFI) awarded funding support to two PhD fellowships & two AI research projects. - [Inside LLMs: SPARKLE Framework & Model Design | Capital One](https://capitalone.science/blog/how-llms-work-sparkle-framework): Learn how large language models operate through the SPARKLE framework with insights on transformer design, training, tokenization and inference. - [Creating a Vespa Vector Database | Capital One](https://capitalone.science/blog/vector-database-intro): Unstructured data proving difficult to search? Discover how vector databases and similarity search with kNN can assist search in complex data types. - [UVA School of Data Science: Capital One Fellows 2025-2027 | Capital One](https://capitalone.science/blog/uva-capital-one-data-science-fellows-2025-2027): Capital One and the University of Virginia celebrate the 2025-2027 data science fellowship awardees. - [Applied Research and Product Management | Capital One](https://capitalone.science/blog/applied-research-and-product-management-fueling-scientific-innovation): Applied research and product management - fueling innovation. At Capital One, cross-functional collaboration is advancing Applied AI Research outcomes. - [University of Illinois 2025 AI Awardees Announced | Capital One Tech](https://capitalone.science/blog/uiuc-2025-2026-ai-awardees): The Capital One Center at UIUC announces 2025-2026 faculty research awards and PhD fellowships, focusing on Generative AI Safety, Knowledge Systems, and Cybersecurity. - [Transfer learning for deep tabular models | Capital One](https://capitalone.science/blog/transfer-learning-tabular-models): Exploring the cutting-edge world of transfer learning for deep tabular models with Capital One's machine learning experts. ## Publications - [AREAs-Lab Requirement Elicitation | Capital One Science](https://capitalone.science/publications/areas-lab-an-interactive-environment-for-ai-driven-requirement-elicitation-for-ai-systems): Discover AREAs-Lab, an interactive benchmark for evaluating AI assistants as they uncover latent user intent and refine task requirements. - [Validity-Aware Jailbreak Eval | Capital One Science](https://capitalone.science/publications/validity-aware-jailbreak-evaluation-for-large-language-models): Learn about SEAV, a jailbreak evaluation framework verifying the factual correctness and procedural validity of LLM safety responses. - [PingPong Multilingual Benchmark | Capital One Science](https://capitalone.science/publications/pingpong-a-natural-benchmark-for-multi-turn-code-switching-dialogues): Discover PingPong, a multi-party benchmark designed to evaluate language models on authentic, multi-turn code-switching conversations. - [Visually Grounded GUI Critic | Capital One Science](https://capitalone.science/publications/a-history-aware-visually-grounded-critic-for-computer-use-agents): Discover HiViG, a test-time intervention framework combining goal-progress summaries and visual feedback for long-horizon GUI agents. - [Segment Credit for Overthinking | Capital One Science](https://capitalone.science/publications/know-when-to-stop-segment-level-credit-assignment-for-reducing-overthinking): Explore DASH, a segment-level credit assignment method that reduces overthinking and improves reasoning accuracy in language models. - [Assessing User Confidence in AI | Capital One Science](https://capitalone.science/publications/assessing-user-confidence-and-acceptance-of-ai-enhanced-through-multi-llm-consensus-mechanisms): Explore how multi-LLM consensus mechanisms enhance trust, output consistency, and explainability for AI system adoption. - [SPARC-RAG Adaptive Scaling | Capital One Science](https://capitalone.science/publications/sparc-rag-adaptive-sequential-parallel-scaling-with-context-management-for-retrieval-augmented-generation): Explore SPARC-RAG, a multi-agent framework that balances sequential and parallel inference-time scaling for retrieval-augmented generation. - [MEMGUARD Memory Framework | Capital One Science](https://capitalone.science/publications/memguard-preventing-memory-contamination-in-long-term-memory-augmented-large-language-models): Learn how MEMGUARD uses type-aware memory isolation to prevent contamination and boost reliability in long-term LLM reasoning. - [T1-Bench Agentic Benchmark | Capital One Science](https://capitalone.science/publications/t1-bench-benchmarking-multi-scenario-agents-in-large-scale-real-world-domains): Explore T1-Bench, a high-fidelity benchmark for evaluating agentic LLMs on long-horizon reasoning across interconnected web domains. - [RECAP Prompt Adaptation | Capital One Science](https://capitalone.science/publications/recap-regression-evaluation-for-continual-adaptation-of-prompts): Discover RECAP, a benchmark measuring continual-learning performance, forgetting, and regression when LLMs adapt to evolving prompts. - [RL for Agentic Tool-Use | Capital One Science](https://capitalone.science/publications/efficient-reinforcement-learning-for-long-horizon-tool-use-agentic-tasks): Discover SINKFLEX-RL, a modular system optimizing memory and attention for reinforcement learning in long-horizon agent environments. - [Decomposing Preference Delta | Capital One Science](https://capitalone.science/publications/decomposing-the-delta-what-do-models-actually-learn-from-preference-pairs): Learn how generator-level and sample-level quality deltas in preference data drive downstream reasoning gains in language models. - [Policy Gradient Foundations | Capital One Science](https://capitalone.science/publications/on-the-policy-gradient-foundations-of-group-relative-policy-optimization-credit-assignment-gradient-sparsity-and-rank-collapse): Read a derivation of GRPO from policy gradient theory, revealing token-level credit bottlenecks and rank-2 gradient structure. - [Robust Reward Models | Capital One Science](https://capitalone.science/publications/r3-robust-rubric-agnostic-reward-models): Discover R3, a rubric-agnostic reward modeling framework providing interpretable, reasoned score assignments for LLM alignment. - [LLM Compliance Demonstrations | Capital One Science](https://capitalone.science/publications/what-do-safety-aligned-llms-learn-from-mixed-compliance-demonstrations): Read our hypothesis-testing study on how mixed benign and harmful in-context demonstrations impact safety alignment and jailbreaking in LLMs. - [EconWebArena Benchmark | Capital One Science](https://capitalone.science/publications/econwebarena-benchmarking-autonomous-agents-on-economic-tasks-in-realistic-web-environments): Discover EconWebArena, a benchmark evaluating autonomous AI agents on complex, multimodal economic tasks across 82 authoritative web environments. - [SAFARI Fault Attribution | Capital One Science](https://capitalone.science/publications/safari-scaling-long-horizon-agentic-fault-attribution-via-active-investigation): Explore SAFARI, a tool-augmented diagnostic framework that scales long-horizon agentic fault attribution beyond single LLM context window limits. - [SEAD On-Policy Distillation | Capital One Science](https://capitalone.science/publications/sead-competence-aware-on-policy-distillation-via-entropy-guided-supervision): Explore SEAD, a competence-aware on-policy distillation framework that uses entropy-guided supervision to eliminate redundant training waste. - [REVEAL VidLM Stress Tests | Capital One Science](https://capitalone.science/publications/stress-tests-reveal-fragile-temporal-and-visual-grounding-in-video-language-models): Discover REVEAL, a diagnostic benchmark uncovering key weaknesses in video-language models across temporal, visual, and motion grounding tasks. - [Interpretable LLM Evaluation | Capital One Science](https://capitalone.science/publications/ask-don-t-judge-binary-questions-for-interpretable-llm-evaluation-and-self-improvement): Learn about BinEval, a framework decomposing evaluation criteria into atomic binary questions for transparent LLM scoring and prompt optimization. - [TRACER Trajectory Risk | Capital One Science](https://capitalone.science/publications/tracer-trajectory-risk-aggregation-for-critical-episodes-in-agentic-reasoning): Discover TRACER, a trajectory-level uncertainty metric designed to detect failure risk and critical episode breakdowns in agentic reasoning. - [RouteHead LLM Re-Ranking | Capital One Science](https://capitalone.science/publications/learning-to-route-queries-to-heads-for-attention-based-re-ranking-with-large-language-models): Discover RouteHead, a query-dependent head selection router that optimizes attention-based document re-ranking using large language models. - [QDBO Quantum Optimizer | Capital One Science](https://capitalone.science/publications/qdbo-a-real-time-quantum-augmented-database-system-optimizer): Explore QDBO, a quantum-augmented database optimizer leveraging quantum annealing and sample feedback for real-time join order optimization. - [Open-Weight Models for DBs | Capital One Science](https://capitalone.science/publications/large-databases-need-small-open-weight-language-models): See how local, quantized open-weight language models match proprietary API accuracy while drastically reducing query latency and cost in databases. - [Adaptive LLM Red Teaming | Capital One Science](https://capitalone.science/publications/adaptive-instruction-composition-for-automated-llm-red-teaming): Discover Adaptive Instruction Composition, a framework combining reinforcement learning and contextual bandits to optimize automated LLM red teaming. - [Evaluating LLM Simulators | Capital One Science](https://capitalone.science/publications/evaluating-llm-simulators-as-differentially-private-data-generators): Explore how agentic financial simulators reproduce statistical distributions from differentially private data and where LLM biases create failure modes. - [Enhancing Trust in LLMs | Capital One Science](https://capitalone.science/publications/enhancing-rrust-in-large-language-models-via-uncertainty-calibrated-fine-tuning): Learn how an uncertainty-calibrated fine-tuning approach improves LLM reliability, helps detect hallucinations, and identifies out-of-domain prompts. - [Temporal Tokenization | Capital One Science ](https://capitalone.science/publications/temporal-tokenization-strategies-for-event-sequence-modeling-with-large-language-models): A study of temporal tokenization for modeling event sequences with LLMs, comparing distinct encoding strategies. - [Your Model Diversity Strategy | Capital One Science ](https://capitalone.science/publications/model-diversity): Framework decomposing reasoning uncertainty and deriving conditions under which depth refinement outperforms parallel sampling. - [μLO: Meta-Generalization | Capital One Science ](https://capitalone.science/publications/compute-efficient-meta-generalization-of-learned-optimizers): μLO: Compute-Efficient Meta-Generalization. A simple meta-training recipe for μ-parameterized LOs (μLOs). - [BioTamperNet Model | Capital One Science ](https://capitalone.science/publications/biotampernet-affinity-guided-state-space-model-detecting-tampered-biomedical-images): Framework for detecting duplicated regions in tampered biomedical images, leveraging affinity-guided attention. - [Zero-shot Time Series | Capital One Science ](https://capitalone.science/publications/zero-shot-multivariate-time-series-forecasting-using-tabular-prior-fitted-networks): Framework for multivariate time series forecasting using tabular foundation models. - [Alignment-Weighted DPO | Capital One Science ](https://capitalone.science/publications/alignment-weighted-dpo-a-novel-way-to-improve-alignment-in-llms-via-reasoning): DPO that targets problem parts of an output by assigning different preference weights to the reasoning and final-answer segments. - [TimeSqueeze: Dynamic Patching | Capital One Science ](https://capitalone.science/publications/timesqueeze-dynamic-patching-for-efficient-long-context-time-series-forecasting): Dynamic patching mechanism that adaptively selects patch boundaries within each sequence based on local signal complexity. - [EPSVec: Data Generation | Capital One Science ](https://capitalone.science/publications/epsvec-efficient-and-private-synthetic-data-generation-via-dataset-vectors): Private text generation method that steers LLM generation using dataset vectors. - [Critique-Guided Distillation | Capital One Science ](https://capitalone.science/publications/critique-guided-distillation-for-robust-reasoning-via-refinement): Critique-guided sistillation. A training framework that decouples critique consumption from critique generation. - [Macaron: Controlled Benchmark | Capital One Science ](https://capitalone.science/publications/macaron-controlled-human-written-benchmark-for-multilingual-and-multicultural-reasoning-via-template-filling): Template-first benchmark that factorizes reasoning type and cultural aspect across question languages. - [Re-evaluating CommonLID | Capital One Science ](https://capitalone.science/publications/commonlid-re-evaluating-state-of-the-art-language-identification-performance-on-web-data): A community-driven, human-annotated LID benchmark for the web domain, covering 109 languages. - [Routing with Generated Data | Capital One Science ](https://capitalone.science/publications/routing-with-generated-data-annotation-free-llm-skill-estimation-and-expert-selection): Routers are trained exclusively on generated queries and answers produced from high-level task descriptions by generator LLMs. - [Distillation Versus Contrastive Learning | Capital One Tech](https://capitalone.science/publications/distillation-versus-contrastive-learning): How to train your rerankers. An empirical comparison of contrastive learning and knowledge distillation. (AACL) - [Scalable Graph Embeddings](https://capitalone.science/publications/graph-embeddings-at-scale): Scalable graph embeddings. A distributed infrastructure for training graph embeddings on massive datasets without graph partitioning. - [SAINT for Tabular Data](https://capitalone.science/publications/saint-improved-neural-networks-for-tabular-data): SAINT: improved neural networks for tabular data. A novel deep learning model with row attention and contrastive pre-training enhances tabular data task performance. - [SAE classification models I Capital One Tech](https://capitalone.science/publications/saefarer-exploring-text-classification-models): SAEfarer: exploring text classification models. Leveraging SAEs to analyze the behavior of text classification LMs. - [Readability Factors I Capital One Tech](https://capitalone.science/publications/readability-reconsidered-a-cross-dataset-analysis): Readability reconsidered: a cross-dataset analysis. An investigation of factors shaping human perceptions of text readability and comprehensibility. (EMNLP) - [FinTRec: Transformer Based Ads Targeting and Personalization | Capital One Tech](https://capitalone.science/publications/fintrec-transformer-based-ads-targeting-and-personalization): Transformer based ads targeting. A study of unified sequential recommendation modeling in FS that addresses both technical and business considerations. (RecSys) - [BEDTIME: A Unified Benchmark I Capital One Tech](https://capitalone.science/publications/bedtime-a-unified-benchmark): BEDTime: a unified benchmark. The first benchmark dataset to assess models on each task, comprising four datasets reformatted for these tasks. (NeurIPS) - [BioTamperNet | Capital One Tech](https://capitalone.science/publications/biotampernet-affinity-guided-state-space-model): BioTamperNet: Affinity-Guided State-Space Model. A framework for detecting duplicated regions in tampered biomedical images, leveraging affinity-guided attention inspired by State Space Model approximations. (ICLR) - [EPSVec | Capital One Tech](https://capitalone.science/publications/epsvec-efficient-and-private-synthetic-data-generation): EPSVec: Efficient and Private Synthetic Data Generation. A private text generation method that steers LLM generation using dataset vectors. (ICLR) - [TimeSqueeze | Capital One Tech](https://capitalone.science/publications/timesqueeze-dynamic-patching): TimeSqueeze: Dynamic patching. A mechanism that adaptively selects patch boundaries within each sequence based on local signal complexity. (NeurIPS) - [Label Influence Propagation](https://capitalone.science/publications/lip-graph-node-classification-via-label-influence): LIP: Graph node classification via label influence. A novel GNN-based model for multi-label node classification that propagates label influences on graphs. - [Rule-based Model Explanations](https://capitalone.science/publications/visual-exploration-of-machine-learning-model-behavior): Visual exploration of machine learning model behavior. New algorithm and visual system interpret ML models using hierarchical surrogate rule sets. (IEEE) - [Evaluating Explainable AI](https://capitalone.science/publications/based-xai-evaluating-explainable-ai): This framework enables rigorous ablation studies to better understand and evaluate explainable AI method performance. (KDD) - [Topological Explanations](https://capitalone.science/publications/topological-representations-of-local-explanations): Topological representations of local explanations. A topology-based framework for comparing and understanding local explainability methods in machine learning. (ICML) - [Model Analysis](https://capitalone.science/publications/calibrate-analyzing-model-output): Calibrate: analyzing model output. Interactive tool visualizes and analyzes probabilistic model calibration, enabling deeper understanding and trust. (IEEE) - [Black Box Model Explanations](https://capitalone.science/publications/subplex-understanding-model-explanations): SUBPLEX: understanding model explanations. A visual analytics system for exploring black-box model explanations at the subpopulation level. (IEEE) - [Dynamic Customer Embeddings](https://capitalone.science/publications/dynamic-customer-embeddings-for-fs-application): Dynamic customer embeddings for FS application. Learning dynamic customer representations from digital activity and financial context. (ICML) - [MetaBalance for Imbalanced Data](https://capitalone.science/publications/high-performance-neural-networks-for-class-imbalanced-data): High-performance neural networks for class-imbalanced data. A meta-learning approach improves neural network performance on class-imbalanced data, relevant for fraud detection. - [Sensitive Data Detection](https://capitalone.science/publications/sensitive-data-detection-in-finance): Sensitive data detection in finance. Deep learning models are evaluated for sensitive financial data detection, boosting security and privacy. - [Challenges in GRL](https://capitalone.science/publications/quantifying-challenges-in-graph-representation-learning): Quantifying challenges in graph representation learning. Analyzing the limitations of graph embedding approaches in capturing real-world properties. - [Latent-CF Explanations](https://capitalone.science/publications/latent-cf-counterfactual-explanations): Latent-CF: counterfactual explanations. A simple and effective baseline method for generating counterfactual explanations using latent space search with autoencoders. - [RNNs for Purchase Prediction](https://capitalone.science/publications/mixed-membership-rnns-for-modeling-customer-purchases): Mixed membership RNNs for modeling customer purchases. A mixed membership RNN approach for modeling customer purchase behavior with varying time intervals between purchases. - [Temporal Financial Data](https://capitalone.science/publications/machine-learning-temporal-data-finance): Machine Learning for temporal data in finance. Examining the challenges and opportunities of applying machine learning to time-indexed financial data. - [Financial Embeddings Over Time](https://capitalone.science/publications/navigating-the-dynamics-of-financial-embeddings-over-time): Navigating the dynamics of financial embeddings over time. Graph representation learning captures evolving financial transaction patterns to understand economic dynamics. - [Explainable Tabular Data](https://capitalone.science/publications/towards-ground-truth-explainability-on-tabular-data): Towards ground truth explainability on tabular data. Using copulas to generate synthetic tabular data with ground truth explanations for enhanced interpretability of AI models. - [Dense Backpropagation I Capital One Tech](https://capitalone.science/publications/dense-backpropagation-improves-training-for-sparse-moes): Dense backpropagation improves training for sparse MoEs. A lightweight approximation method that gives the MoE router a dense gradient update. (NeurIPS) - [Understanding Graph Embeddings](https://capitalone.science/publications/interpretability-of-graph-representation-learning): Interpretability of graph representation learning. Exploring methods for interpreting and evaluating graph representation learning algorithms. - [AutoML Tools Compared](https://capitalone.science/publications/evaluation-and-comparison-of-automl-approaches-and-tools): Evaluation and comparison of AutoML approaches and tools. A comparative study of automated machine learning tools and their performance on various datasets and tasks. - [GAM Explains Neural Networks](https://capitalone.science/publications/global-explanations-of-neural-networks-mapping-predictions): Global explanations of neural networks: mapping predictions. A new approach for generating global attributions that explain neural network predictions across different subpopulations. - [Counterfactual Explanations](https://capitalone.science/publications/sharpshooter-counterfactual-explanations): SharpShooter: counterfactual explanations. New method generates counterfactual explanations efficiently via latent space projection and interpolation. - [Counterfactual explanations | Capital One](https://capitalone.science/publications/interpretable-deep-classifier-for-counterfactual-generation): Interpretable deep classifier for counterfactual generation. Framework using a supervised VAE with Normalizing Flow to generate counterfactual explanations in deep learning models. (ICAIF) - [Evaluating Counterfactuals](https://capitalone.science/publications/understanding-counterfactual-generation-using-mmd): Understanding counterfactual generation using MMD. A quantitative MMD approach evaluates and compares counterfactual explanation methods. (ICAIF) - [Deep Tabular Models](https://capitalone.science/publications/transfer-learning-with-deep-tabular-models): Transfer learning with deep tabular models. Research shows deep tabular models help bridge gaps between decision trees and neural networks for tabular data. - [Ethics in AI Benchmarks](https://capitalone.science/publications/making-intelligence-ethical-values-in-iq-and-ml-benchmarks): Making intelligence: ethical values in IQ and ML benchmarks. Highlighting the ethical considerations and value judgments embedded in the design of AI benchmarks and datasets. - [GOAT for Graph Learning](https://capitalone.science/publications/goat-a-global-transformer-on-large-scale-graphs): GOAT: A global transformer on large-scale graphs. A new scalable global graph transformer model that effectively handles both homophilious and heterophilious graphs. - [FALCON Explains Image Features](https://capitalone.science/publications/identifying-interpretable-subspaces-in-image-representations): Identifying interpretable subspaces in image representations. An interpretability framework for explaining features of image representations using contrasting concepts and captions. - [Multi-Domain Self-Supervision](https://capitalone.science/publications/adapting-self-supervised-representations): Adapting self-supervised representations. A Domain Disentanglement Module (DDM) improves self-supervised learning for multi-domain setups, enhancing generalization. - [Anomaly Detection](https://capitalone.science/publications/from-explanation-to-action-an-end-to-end-human-in-the-loop-framework-for-anomaly-reasoning-and-management): ALARM: human-in-the-loop anomaly detection. Detect, explain, and manage anomalies with this end-to-end framework, featuring human-in-the-loop for action. - [Imbalanced Data Training](https://capitalone.science/publications/simplifying-neural-network-training-under-class-imbalance): Simplifying neural network training under class imbalance. Tune standard components for better neural network performance on imbalanced datasets. - [GP-NAM: explainable AI](https://capitalone.science/publications/gaussian-process-neural-additive-models): GP-NAM: Explainable AI. New Gaussian Process Neural Additive Models enhance explainability in deep learning for tabular data. Publication. - [DNS Exfiltration ](https://capitalone.science/publications/dns-exfiltration-guided-by-generative-adversarial-networks): DNS exfiltration guided by generative adversarial networks. A novel DNS exfiltration attack using GANs evades detection and speeds up data theft. - [Preference tuning survey](https://capitalone.science/publications/preference-tuning-with-human-feedback-a-survey): Preference Tuning with Human Feedback: A Survey. A survey of recent advancements in aligning deep generative models with human preferences across language, speech and vision. Article - [TIMeSynC for Intent Prediction](https://capitalone.science/publications/timesync-understanding-customer-intent): TIMeSynC: understanding customer intent. A novel transformer model for predicting customer intent in financial services by analyzing multi-channel interactions. - [Mountaineer for XAI](https://capitalone.science/publications/mountaineer-comparing-local-explanations): Mountaineer: comparing local explanations. A topology-driven visual analytics tool for comparing and understanding local explanations of black-box machine learning models. - [Watch Buddy (AR)](https://capitalone.science/publications/watch-buddy-expressive-agents-enhance-ar-video): Watch buddy: expressive agents enhance AR video. Expressive AR virtual agent improves video viewing satisfaction and social connection compared to inexpressive or no agents. - [Focus on Domain LMs](https://capitalone.science/publications/domain-specific-lms-a-key-role-for-academics): Domain-Specific LMs: a key role for academics. Argues for academic focus on domain-specific language models, where they can excel beyond general-purpose leaderboards. - [SEACrowd](https://capitalone.science/publications/seacrowd-sea-multilingual-multimodal-data-hub): SEACrowd: SEA multilingual multimodal data hub. A multilingual, multimodal hub with benchmarks for nearly 1,000 Southeast Asian languages across text, image, and audio. - [Multilingual summarization](https://capitalone.science/publications/re-evaluating-evaluation-for-multilingual-summarization): Re-evaluating evaluation for multilingual summarization. Standard metrics fail in non-English summarization, prompting a need for more nuanced evaluation frameworks. - [MINERS: multilingual LMs](https://capitalone.science/publications/miners-multilingual-language-models-as-semantic-retrievers): MINERS: multilingual language models as semantic retrievers. A benchmark to evaluate multilingual language models for retrieving semantic similarities across 200+ languages. - [LANCER: multilingual NLP](https://capitalone.science/publications/lancer-language-invariant-retrieval): LANCER: language-invariant retrieval. A multi-task learning framework reduces language-specific signals for improved multilingual dense retrieval. - [LLMs: Negotiation Skills](https://capitalone.science/publications/are-llms-effective-negotiators): Are LLMs Effective Negotiators? Systematic evaluation of LLMs reveals their negotiation strengths and limitations in complex dialogue scenarios. - [Time-series scaling laws](https://capitalone.science/publications/scaling-laws-for-large-time-series-models): Scaling-laws for large time-series models. Discovering power-law scaling relationships in large time-series transformer models, analogous to those found in language models. - [Efficient data augmentation](https://capitalone.science/publications/mycroft-effective-and-efficient-external-data-augmentation): MyCroft: effective and efficient external data augmentation. A data-efficient method for evaluating and acquiring external data for machine learning with minimal exposure. - [LLM scaling laws](https://capitalone.science/publications/language-model-scaling-laws-and-zero-sum-learning): Language model scaling laws and zero-sum learning. Investigating the relationship between language model size, training dynamics and the phenomenon of zero-sum learning. - [Enhancing table representations](https://capitalone.science/publications/llm-driven-table-representations): LLM-Driven table representations. Enhancing table representations with LLM-based synthetic data for improved table recommendation and analysis. - [Efficient linear layers](https://capitalone.science/publications/efficient-linear-layers-for-neural-networks): Efficient linear layers for neural networks. Searching for efficient linear operators with optimal scaling laws leading to the development of the BTT-MoE architecture. - [StructMoE for efficient MoEs](https://capitalone.science/publications/structmoe-efficient-moe-scaling): StructMoE: efficient MoE scaling. Introducing hierarchical routing and low-rank experts to enhance the efficiency and performance of MoE models. - [Refusal tokens for safer LLMs](https://capitalone.science/publications/refusal-tokens-a-simple-way-to-calibrate-refusals-in-llms): Refusal tokens: a simple way to calibrate refusals in LLMs. A simple technique using refusal tokens to control and calibrate refusal behavior in large language models. - [Estimating RAG correctness](https://capitalone.science/publications/an-automatic-method-to-estimate-correctness-of-rag): An automatic method to estimate correctness of RAG. This method predicts the correctness of retrieval-augmented generation by analyzing uncertainty. - [Secure LLMs with CoT](https://capitalone.science/publications/enhancing-llm-security-with-chain-of-thought-fine-tuning): Enhancing LLM security with chain-of-thought fine-tuning. Fine-tuning and aligning Chain-of-Thought responses in LLMs for safer conversational AI. - [LLMs: Copyright & Watermarks I Capital One Tech](https://capitalone.science/publications/can-watermarking-llms-prevent-copyrighted-text-generation): Can watermarking LLMs prevent copyrighted text generation. An adaptive technique to improve the success rate of recent Membership Inference Attacks (MIAs) under watermarking. - [Poisoning threats to LLMs I Capital One Tech](https://capitalone.science/publications/is-poisoning-a-real-threat-to-llm-alignment): Is poisoning a real threat to LLM alignment? The vulnerabilities of DPO to poisoning attacks and the effectiveness of preference poisoning. - [Visagreement](https://capitalone.science/publications/visagreement-visualizing-and-exploring-explanations-disagreement): Visagreement: visualizing explanations (dis)agreement. A visualization tool for tabular data, exploring where and why local feature importance explanations agree or disagree. - [Recognition error correction I Capital One Tech](https://capitalone.science/publications/retrieval-augmented-correction): Retrieval augmented correction. A RAG-like technique for correcting speech recognition entity name errors. - [Web AI agents vulnerability I Capital One Tech](https://capitalone.science/publications/why-are-web-ai-agents-more-vulnerable-than-standalone-llms): Why are web AI agents more vulnerable than standalone LLMs? A component-level analysis and a more granular, systematic evaluation framework of Web AI agents and standalone LLMs. - [Guided generation alignment I Capital One Tech](https://capitalone.science/publications/genarm-reward-guided-generation): GenARM: reward guided generation. A test-time alignment approach that leverages the Autoregressive Reward Model. - [VLA in robotics I Capital One Tech](https://capitalone.science/publications/tracevla-visual-trace-prompting): TraceVLA: visual trace prompting. An effective approach to facilitate VLA models' spatial-temporal awareness for action prediction. - [MetaMetrics for AI Evaluation](https://capitalone.science/publications/metametrics-calibrating-metrics-for-generation-tasks): MetaMetrics: Calibrating metrics for generation tasks. MetaMetrics aligns evaluation metrics with human preferences for better AI assessment. - [RainbowPO for AI alignment](https://capitalone.science/publications/rainbowpo-unified-preference-optimization): RainbowPO: unified preference optimization. This new framework enhances preference optimization for better AI alignment with human values. - [Copyright poisoning attacks I Capital One Tech](https://capitalone.science/publications/poisoned-parrot-subtle-data-poisoning-attacks): PoisonedParrot: subtle data poisoning attacks. A stealthy data poisoning attack that induces an LLM to generate copyrighted content. - [Multicultural dispute diaglogues I Capital One Tech](https://capitalone.science/publications/kodis-a-multicultural-dispute-resolution-dialogue-corpus): KODIS: a multicultural dispute resolution dialogue corpus. A dyadic dispute resolution corpus containing thousands of dialogues from over 75 countries. - [T-Explainer](https://capitalone.science/publications/t-explainer-stable-gradient-based-model-explanations): T-Explainer: stable gradient-based model explanations. A novel, stable, local additive attribution XAI framework based on Taylor expansion. - [VQA Benchmark](https://capitalone.science/publications/worldcuisines-a-vqa-benchmark): WorldCuisines: A VQA benchmark. A massive multilingual and multicultural visual question answering benchmark for evaluating VLMs on global cuisines. - [LLM red teaming](https://capitalone.science/publications/red-teaming-llms-an-end-to-end-safety-overview): Red teaming LLMs: an end-to-end safety overview. A survey covering attack methods, evaluation, metrics and tools for identifying and mitigating GenAI application vulnerabilities. - [Predicting LM performance](https://capitalone.science/publications/predicting-language-model-performance-on-multilingual-tasks): Predicting LM performance. A scalable framework using proxy models to efficiently predict the performance of multilingual language models on NLP tasks. - [Jailbreak safety in LLMs I Capital One Tech](https://capitalone.science/publications/immune-improving-safety-against-jailbreaks): Immune: improving safety against jailbreaks. An inference-time defense framework that leverages a safe reward model to defend against jailbreak attacks. - [Zero-shot tabular prediction](https://capitalone.science/publications/zero-shot-tabular-prediction-via-adversarial-transformer): Zero-shot tabular prediction via adversarial transformer. Introducing APT, an Adversarially Pre-trained Transformer achieving SOTA on small tabular tasks. - [OOD detection: wrong questions I Capital One Tech](https://capitalone.science/publications/position-supervised-classifiers-answer-the-wrong-questions): Position: supervised classifiers answer the wrong questions. A critical re-examination of popular out-of-distribution (OOD) detection procedures. - [New benchmark with LLMs I Capital One Tech](https://capitalone.science/publications/llm-srbench-a-new-benchmark): LLM-SRBench: a new benchmark. A comprehensive benchmark designed to evaluate LLM-based scientific equation discovery methods. - [Dynamic content moderation I Capital One Tech](https://capitalone.science/publications/dynamic-guardian-models-realtime-content-moderation): Dynamic guardian models: realtime content moderation. Specialized classifiers that evaluate text based on predefined trustworthiness objectives. - [Bridging a multicutural VL gap I Capital One Tech](https://capitalone.science/publications/crowdsource-crawl-or-generate): Crowdsource, crawl, or generate? An open-source initiative dedicated to developing high-quality, culturally relevant data for SEA languages. - [Honorific systems in LMs I Capital One Tech](https://capitalone.science/publications/do-language-models-understand-honorific-systems-in-javanese): Do language models understand honorific systems in Javanese? The ability of LMs to process Javanese honorifics through classification and machine translation tasks. - [MLM knowledge loss I Capital One Tech](https://capitalone.science/publications/what-causes-knowledge-loss-in-multilingual-language-models): What causes knowledge loss in multilingual language models? Exploring knowledge loss in multilingual LMs, focusing on linguistic differences affecting representational learning. - [Scaling language models I Capital One Tech](https://capitalone.science/publications/training-dynamics-underlying-language-model-scaling-laws): Training dynamics underlying language model scaling laws. Loss deceleration and ZSL provide new insights into the training dynamics underlying language model scaling laws. - [DeepTrax for Fraud Detection](https://capitalone.science/publications/deeptrax-embedding-graphs-of-financial-transactions): DeepTrax: embedding graphs of financial transactions. Novel approach to learning embeddings of financial transactions using graph representation learning for improved fraud detection. - [Guided agentic exploration I Capital One Tech](https://capitalone.science/publications/imagine-verify-execute-memory-guided-agentic-exploration): An agentic exploration framework inspired by human curiosity. - [LLM refusal tokens I Capital One Tech](https://capitalone.science/publications/refusal-tokens-a-simple-way-to-calibrate-refusals): Refusal tokens: a simple way to calibrate refusals. Refusal tokens enable controlling a single model's refusal rates without the need of any further fine-tuning. - [Tunable Benchmark for LLMs I Capital One Tech](https://capitalone.science/publications/seqbench-a-tunable-benchmark): seqBench: a tunable benchmark. A parametrized benchmark for probing sequential reasoning limits in LLMs. (EMNLP) - [Layer-wise Merging Strategy I Capital One Tech](https://capitalone.science/publications/harmonizing-diverse-models-a-layer-wise-merging-strategy): Harmonizing diverse models: a layer-wise merging strategy. An approach combining systematic synthetic data generation, triplet loss for embeddings and layer-wise model merging. (EMNLP) - [Language Surgery in LLMs I Capital One Tech](https://capitalone.science/publications/language-surgery-in-multilingual-large-language-models): Language surgery in multilingual Large Language Models. A novel method that leverages latent injection to enable cross-lingual language control and mitigate language confusion. (EMNLP) - [Fine-Tuning Comparison I Capital One Tech](https://capitalone.science/publications/a-comparison-of-strategies-for-rag): A comparison of strategies for RAG. Evaluation and comparison of multiple RAG fine-tuning strategies. (EMNLP) - [Predicting Truthfulness I Capital One Tech](https://capitalone.science/publications/truthtorchlm-predicting-truthfulness-in-llm-outputs): TruthTorchLM: predicting truthfulness in LLM outputs. An open-source, comprehensive Python library featuring over 30 truthfulness prediction methods. (EMNLP) - [Improving LLM Trustworthiness I Capital One Tech](https://capitalone.science/publications/confidence-based-response-abstinence-llm-trustworthiness): Confidence-based response abstinence: LLM trustworthiness. A method for confidence estimation in RAG systems that aligns closely with the correctness of LLM outputs. (EMNLP) - [Harmful AI data detection I Capital One Tech](https://capitalone.science/publications/graid-synthetic-data-generation): GRAID: synthetic data generation. A novel pipeline that leverages Large Language Models (LLMs) for dataset augmentation. - [AutoBnB-RAG I Capital One Tech](https://capitalone.science/publications/autobnb-rag-enhancing-multi-agent-incident-response): AutoBnB-RAG: enhancing multi-agent incident response. An extension of AutoBnB that incorporates RAG into multi-agent incident response simulations. (ICDM) - [Open-Ended Scientific Discovery via Bayesian Surprise | Capital One Tech](https://capitalone.science/publications/open-ended-scientific-discovery-via-bayesian-surprise): Bayesian surprise. A method for open-ended ASD that instead drives scientific exploration using Bayesian surprise. (NeurIPS) - [MoE Continual Pre-Training I Capital One Tech](https://capitalone.science/publications/continual-pre-training-of-moes-how-robust-is-your-router): Continual pre-training of MoEs: how robust is your router? A systematic study of Mixture of Experts (MoE) continual pre-training. (NeurIPS) - [Conversational Dataset I Capital One Tech](https://capitalone.science/publications/t1-a-tool-oriented-conversational-dataset): T1: a tool-oriented conversational dataset. A conversational dataset specifically designed to capture and manage inter-tool dependencies across diverse domains. (NeurIPS) - [Rubric-Agnostic Reward Models I Capital One Tech](https://capitalone.science/publications/r3-robust-rubric-agnostic-reward-model): R3: robust rubric-agnostic reward models. A novel reward modeling framework that is rubric-agnostic, generalizable and provides reasoned score assignments. (NeurIPS) - [Visual Reasoning Performance I Capital One Tech](https://capitalone.science/publications/sota-with-less-mcts-guided-sample-selection): SoTA with less: MCTS-guided sample selection. Visual reasoning models that achieve SoTA performance using an order of magnitude fewer training samples. (NeurIPS) - [Test-Time Scaling I Capital One Tech](https://capitalone.science/publications/does-thinking-more-always-help): Does thinking more always help? A study across models and benchmarks and an alternative test-time scaling approach. (NeurIPS) - [Visual Perception Learning I Capital One Tech](https://capitalone.science/publications/vicrit-a-verifiable-reinforcement-learning-proxy-task): ViCrit: a verifiable reinforcement learning proxy task. An RL proxy task that trains VLMs to localize synthetic hallucinations injected into human-written captions. (NeurIPS) - [Group Similarity Reward I Capital One Tech](https://capitalone.science/publications/improving-consistency-in-retrieval-augmented-systems): Improving consistency in retrieval-augmented systems. An RL approach that leverages multiple rollouts across paraphrased set to assign group similarity rewards. (NeurIPS) - [Scalable Meta-Learning I Capital One Tech](https://capitalone.science/publications/towards-scalable-meta-learning): Towards scalable meta-learning. An efficient, scalable method for generating synthetic pre-training data to enable meta-learning of decision trees. (NeurIPS) - [Sequence Graph Learning I Capital One Tech](https://capitalone.science/publications/bridging-the-divide-end-to-end-sequence-graph-learning): Bridging the divide: end-to-end sequence–graph learning. A unified end-to-end architecture that couples a sequence encoder with a GNN. (NeurIPS) - [Reasoning Through Prediction I Capital One Tech](https://capitalone.science/publications/optimizing-reasoning-efficiency): Optimizing reasoning efficiency. A routing approach that assigns each problem to the smallest model likely to solve it, reducing compute. (NeurIPS) - [Spatio-Temporal Graph Learning I Capital One Tech](https://capitalone.science/publications/spatio-temporal-directed-graph-learning-for-fraud-detection): Spatio-temporal directed graph learning for fraud detection. A framework that reformulates ATO detection as spatio-temporal node classification. (NeurIPS) - [Improve LLM Reasoning I Capital One Tech](https://capitalone.science/publications/gpo-learning-from-critical-steps-to-improve-llm-reasoning): GPO: learning from critical steps to improve LLM reasoning. A novel fine-tuning strategy designed to improve LLM multi-step reasoning capabilities by focusing on pivotal moments. (NeurIPS) - [Caching and Prefetching I Capital One Tech](https://capitalone.science/publications/joint-learning-approach-to-hardware-caching-and-prefetching): Joint learning approach to hardware caching and prefetching. Joint encoding and contrastive learning for developing shared representations. (NeurIPS) - [EraseFlow I Capital One Tech](https://capitalone.science/publications/eraseflow-learning-concept-erasure-policies): EraseFlow: learning concept erasure policies. The first framework that casts concept unlearning as exploration and optimizes it with GFlowNets. (NeurIPS) - [EconWebArena I Capital One Tech](https://capitalone.science/publications/econwebarena-benchmarking-autonomous-agents): EconWebArena: benchmarking autonomous agents. A benchmark for evaluating autonomous agents on complex, multimodal economic tasks in realistic web environments. (NeurIPS) - [Gradient-Guided Resources I Capital One Tech](https://capitalone.science/publications/ai-progress-should-be-measured-by-capability-per-resource): AI progress should be measured by capability-per-resource. A theoretical framework demonstrating that decisions guided by gradient influence patterns can improve efficiency. (NeurIPS) - [Fairness Notions Hierarchies I Capital One Tech](https://capitalone.science/publications/on-hierarchies-of-fairness-notions-in-cake-cutting): On hierarchies of fairness notions in cake-cutting. Introducing hierarchies of new fairness notions: complement harmonically bounded and complement linearly bounded. (NeurIPS) - [Influence Functions I Capital One Tech](https://capitalone.science/publications/influence-functions-for-efficient-data-selection): Influence functions for efficient data selection. A proposal to define reasoning data quality using influence functions. (NeurIPS) - [Parameter Space Symmetries | Capital One Tech](https://capitalone.science/publications/leveraging-parameter-space-symmetries): Utilizing an alignment-first strategy to transfer advanced reasoning skills to a non-reasoning model (NeurIPS). - [Play By the Type Rules I Capital One Tech](https://capitalone.science/publications/play-by-the-type-rules-inferring-constraints-for-small-lms): Play by the type rules: inferring constraints for small LMs. An efficient solution to enforce the well-typedness of LLM functions. (EurIPS) - [SPEAR-MM: Selective Parameter Evaluation and Restoration | Capital One Tech](https://capitalone.science/publications/spear-mm-selective-parameter-evaluation-and-restoration): Selective parameter evaluation. A practical framework that preserves critical general skills while enabling domain adaptation in LLMs. (IEEE BigData) - [Datasets and Prediction Tasks I Capital One Tech](https://capitalone.science/publications/integrating-sequential-and-relational-modeling): Integrating sequential and relational modeling. A collection of public datasets and prediction tasks that incorporate personal and relational events. (LoG) - [Tuning-Free LLM Recommender I Capital One Tech](https://capitalone.science/publications/tuning-free-llm-can-build-a-strong-recommender): Tuning-free LLM can build a strong recommender. A novel framework that constructs an intent-centric knowledge graph where both users and items are explicitly linked. (LoG) - [FB-RAG: Improving RAG I Capital One Tech](https://capitalone.science/publications/fb-rag-improving-rag-with-forward-and-backward-lookup): FB-RAG: improving RAG with forward and backward lookup. A new training-free framework based on a simple yet powerful forward-looking strategy. (AACL) - [GRAVITY: A Framework for Personalized Text Generation | Capital One Tech](https://capitalone.science/publications/gravity-framework-for-personalized-text-generation): Personalized text generation. A framework for generating synthetic, preference data that captures users' interests, values, beliefs & personality traits. (EACL) - [An Approach to Applied Dialogue Summarization | Capital One Tech](https://capitalone.science/publications/an-approach-to-applied-dialogue-summarization): Applied dialogue summarization. An industry case study on developing an agentic system to summarize multi-party interactions. (EACL) - [ART: Adaptive Reasoning Trees | Capital One Tech](https://capitalone.science/publications/art-adaptive-reasoning-trees): ART: Adaptive reasoning trees. A hierarchical method for claim verification in Large Language Models. (EACL) - [Deconstructing Instruction-Following | Capital One Tech](https://capitalone.science/publications/deconstructing-instruction-following): LLM instruction compliance. A modular framework that uses a dynamically generated dataset to evaluate the capability of Large Language Models. (EACL) - [DF-RAG: Enhancing RAG for Question Answering | Capital One Tech](https://capitalone.science/publications/df-rag-enhancing-rag-for-question-answering): DF-RAG: Enhancing RAG. A pipeline that dynamically adapts the level of diversity for each query at test time without requiring prior information. (EACL) - [Reasoning-Based Attribution I Capital One Tech](https://capitalone.science/publications/raffles-reasoning-based-attribution-of-faults): RAFFLES: reasoning-based attribution of faults. An evaluation architecture that incorporates reasoning and iterative refinement. (NeurIPS) - [LLM Reasoning for Cold-Start Item Recommendation | Capital One Tech](https://capitalone.science/publications/llm-reasoning-for-cold-start-item-recommendation): Cold-start item recommendation. Novel reasoning strategies designed for cold-start item recommendations within the Netflix domain. (WWW) - [DynaGuard: A Dynamic Guardian Model | Capital One Tech](https://capitalone.science/publications/dynaguard-a-dynamic-guardian-model): Dynamic guardian model. A suite of dynamic guardian models offering novel flexibility by evaluating text based on user-defined policies. (ICLR) - [MR3: Multilingual Rubric-Agnostic Reward Reasoning Models | Capital One Tech](https://capitalone.science/publications/mr3-reward-reasoning-models): MR3: Reward reasoning models. A multilingual, rubric-agnostic reward reasoning model achieving the broadest language coverage in reward modeling to date. (ICLR) - [Uncertainty as Feature Gaps I Capital One Tech](https://capitalone.science/publications/uncertainty-as-feature-gaps): Uncertainty as feature gaps. An uncertainty measure defined as the cross-entropy between predictive distribution and unknown true distribution. (NeurIPS) - [VLMs are Confused Tourists | Capital One Tech](https://capitalone.science/publications/vlms-are-confused-tourists): VLMs are confused tourists. A novel cultural adversarial robustness suite designed to assess VLMs’ stability against perturbed geographical cues. (CVPR) - [M4-RAG: A Multimodal RAG | Capital One Tech](https://capitalone.science/publications/m4-rag-a-multimodal-rag): M4-RAG: A multimodal RAG. A massive-scale benchmark for evaluating retrieval-augmented VQA across languages and modalities. (CVPR) - [Efficient Frequency Estimation](https://capitalone.science/publications/double-hashing-for-efficient-frequency-estimation): Double-hashing for efficient frequency estimation. A new double-hashing algorithm improves frequency estimation in data streams by reducing collisions.