newsReddit r/MachineLearningTrust 72 · CommunityPublished 1mo agoLive · 1mo ago
DeepSWE: new benchmark looking at how well today's frontier models can actually write code [R]
Why these links exist
Every edge carries a method, confidence, and the source snippet that justified it — so bad links are debuggable.
- LinkedLinked via unknownHelix-7B →
- LinkedLinked via unknownAre Performance-Optimization Benchmarks Reliably Measuring Coding Agents? →
- PossiblePossibly related (embedding) · 49%vitali87/code-graph-rag →
- PossiblePossibly related (embedding) · 51%OskarsEzerins/llm-benchmarks →
- PossiblePossibly related (embedding) · 46%sunrainyg/RandOpt →
- PossiblePossibly related (embedding) · 52%bridge-mind/bridgebench →
Covers
Covers (incoming)
paperNuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language ModelspaperCDR-Bench: Evaluating Faithful Execution of Compositional, Order-Sensitive Data Refinement RecipespaperAre Performance-Optimization Benchmarks Reliably Measuring Coding Agents?repovitali87/code-graph-ragrepoOskarsEzerins/llm-benchmarksreposunrainyg/RandOptrepobridge-mind/bridgebenchrepobenchopt/benchoptrepoTura-AI/turapaperSynH-Rank: Quality-Aware Code Search via Diverse Data Synthesis and Hierarchical Ranking Training
Related across the graph
paperAre Performance-Optimization Benchmarks Reliably Measuring Coding Agents?repoTura-AI/turareposunrainyg/RandOptrepobridge-mind/bridgebenchpaperCDR-Bench: Evaluating Faithful Execution of Compositional, Order-Sensitive Data Refinement Recipesrepovitali87/code-graph-ragrepobenchopt/benchoptmodelHelix-7BpaperSynH-Rank: Quality-Aware Code Search via Diverse Data Synthesis and Hierarchical Ranking TrainingrepoOskarsEzerins/llm-benchmarkspaperNuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models
