Measurement Boundaries in LLM Financial Agent Evaluation: Fixed-Tape Execution and Multi-Defect Auditing
cs.LG, cs.AI, cs.CE, cs.SE
Submitted: 2026-09-26
Updated: 2026-09-26
Code: https://github.com/weich97/llm-evaluation-boundaries-artifact
Terminology
Sources
- Concrete Problems in AI Safety
- Non-Determinism of "Deterministic" LLM Settings
- Measuring Progress on Scalable Oversight for Large Language Models
- Supervising strong learners by amplifying weak experts
- Deep reinforcement learning from human preferences
- Large Language Model Agent in Financial Trading: A Survey
- Vulnerability Detection with Code Language Models: How Far Are We?
- AI Control: Improving Safety Despite Intentional Subversion
- A Survey on LLM-as-a-Judge
- AI safety via debate
- AI Agents That Matter
- Scalable agent alignment via reward modeling: a research direction
- Holistic Evaluation of Language Models
- LLM Evaluators Recognize and Favor Their Own Generations
- Self-critiquing models for assisting human evaluators
- Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting
- BloombergGPT: A Large Language Model for Finance
- TradingAgents: Multi-Agents LLM Financial Trading Framework
- Representation Signatures and Risk-Feedback Alignment in LLM Trading Agents
- FinGPT: Open-Source Financial Large Language Models
Related papers
- Polynomial-Augmented Neural Networks (PANNs) with Weak Orthogonality Constraints for Enhanced Function and PDE Approximation
- AIRL-S: Unifying Reinforcement Learning and Search-Based Test-Time Scaling via Adversarial Inverse Reinforcement Learning
- Transformers as Bayesian In-Context Experimenters: Smoothness-Adaptive Efficient ATE Estimation
- Convergence issues in Relational Concept Analysis based on AOC-posets
- Beliefs Beyond Posteriors: Local-Consistency Optimisation for Bayesian Neural Networks
- Understanding Diffusion Models via Ratio-Based Function Approximation with SignReLU Networks