본문으로 건너뛰기

Benchmarks (벤치마크)

Benchmarks (벤치마크) 관련 AI 뉴스를 한국어로 요약해 드립니다.

이 카테고리에서 얻을 수 있는 정보

Benchmarks (벤치마크) 카테고리는 글로벌 AI/ML 뉴스에서 해당 주제와 직접 연결된 핵심 기사만 모아 빠르게 탐색할 수 있는 허브입니다. 태그별 빈도와 최신성을 함께 확인해 흐름을 파악하고, 관심 주제의 상세 기사로 바로 이동할 수 있습니다.

관심 태그 추가
ARC-AGI28ICML20Terminal-Bench13ARC-AGI 311ARC-AGI-29LongMemEval9MMLU9MTEB9tau-bench9OSWorld8ExtractBench7FORGE7HumanEval7LIBERO6LMSYS Arena6SWE-bench Verified6GAIA5Humanity's Last Exam5LiveCodeBench5RAGAS5Terminal-Bench 2.15ARC-AGI-14ARCUS-H4Continual Learning Bench 1.04DeepSWE4ExploitGym4FLUX.1-dev4GDPval4KernelBench4PostTrainBench4ROUGE4WEBArena4AIME3ARKit3AssetOpsBench3BLEU3GPQA3IRT3LLM judge3KITTI odometry3LIBERO-Pro3LMArena3MMEB-v23NDCG3Pace3Ramp AI index3Senior SWE-Bench3SPEED-Bench3Terminal-Bench 2.03TruthfulQA3VBench3ACL2AgentBench2AI GameStore2AI Observatory2ALE-bench2AndroidWorld2Anomaly detection2Artificial Analysis Intelligence Index2Aspire2AtCoder2BANKING772BEAVER2BEIR2BFCL2BFCL v32BRIGHT2ContextBench2CrowS-Pairs2Data Agent Benchmark2DeepResearch Bench2Defects4J2DELEGATE-522DSGym2EsoLang-Bench2F1 Score2FACTS Grounding2FINAL-Bench2FinanceBench2FrontierMath2GMTKN552Google Research Football2HaluEval-QA2IFEval2IRPAPERS2LiveBench2MATH5002MedAgentBench2Agent Memory Benchmark2MineBench2MLCommons2MLPerf2MountainCar2MS MARCO2ocr-mini-bench2OmniDocBench2OpenART2OSWorld 2.02ParseBench2Pass@K2PatientAgentBench2Pokémon Red2ProgramBench2RoboDojo2RULER2ScienceWorld2SOP-Bench2SpreadsheetBench2SWE-rebench V22τ2-bench2VBVR-Pro2VSArena2Waymo Open Dataset2WebShop2AA-Omniscience1AbstractEdit1ACES1Act2Answer1ActionBench1AgentDS1AgentEHR-Bench1AgentHazard1Agentic Abstention1AgenticDataBench1Agentic Evals1Agentic-MME1AgentIF-OneDay1AgentLens1Agent Security Bench1AGENTSOCIALBENCH1Agents on Rails1AgentVista1AgentWorldBench1AgentX1Age of Empires 21AgingBench1AI Arena1AI Intelligence Index1AILuminate1AIME241AI WeatherQuest1AndroTMem1AoE2 LLM Benchmark1APEX Testing1ARLArena1Artifact-Bench1Artificial Analysis Index1ASCIITermDraw-Bench1ASI-Bench1ATANT1AUC1AuditBench1BaldurBench1Bench2Drive1BenchmarkList1BenchMIRT1Berkeley Function Calling Leaderboard1BERTScore-F11BeyondSWE1BigCodeBench1BIRD1BizGenEval1BOOM1Boundary IoU1BRONCO1BrowseComp1BugBench1Bullshit Benchmark1Calendar Gym1CALVIN1CAPTURE1Cascaded Error Counting (CEC)1CausalDS1CC-Bench-V21CEO-BENCH1CFC Cross-Model Benchmark v11CF-Eval1CF-World1CGBench1CHAIN1CHAIR1CHANRG1Chinchilla Scaling Law1CIK-Bench1CiteAudit1ClawBench1CLBench-V1ClinSeek-Bench1CLIPScore1Club-30901Codetrace-Bench1Cohen’s kappa1COMB1ConceptEdit-Bench1Confusion Matrix1ConStory-Bench1Conv-FinRe1CORE1CoREB1Core War1COSMIC1CoT-Control1CoW-Bench1Craftax1CRMAgentBench1Crux Evals1CRYSTAL1CVABench1CVaR1DABStep1DA-Code1DailyReport1DARPA Cyber Challenge1DARPA SubT Challenge1DAVIS1Deep20Bench1DeepFact-Bench1DeepFakeBench1DeepMind Control Suite1DeepSearchQA1DeepSWE v1.11DelveRL1DEONTICBENCH1Design Arena1DexMimicGen1DiffusionBench1DiG-bench1DIGIWORLD1DiscoveryWorld1Distributional Alignment Score (DAS)1DMLab1DORA Metrics1DPG-Bench1DraftNEPABench1DriftBench1DTap1DTR1DystopiaBench1EarthSpatialBench1ECG-Reasoning-Benchmark1EdgeBench1Ego2Web1EinsteinArena1Eleusis1EmbodiedWorldBench1EnterpriseOps-Gym1enwik81Epoch Capability Index1ESARBench1Euro NCAP1EVA1EVA-Bench1Evals1Evaluation Benchmark1EvoClaw1ExploitBench1FActScore1FID1FinToolBench1FlavourBench1FMTI1FoodTruck Bench1ForesightSafety Bench1Frontend Code Arena1FrontierChallenge1FrontierCS1FrontierMath v21FrontierScience1FutureSim1GAIA 21GDP-Eval1GEditBench v21GenEval1GIFT-Eval1GM-1001Google Universal Image Embedding1GRPO Baseline1GSM-Symbolic1GSO1GST-Bench1Physics-IQ Benchmark1HackBench1HANDAL-X1HarnessDev1HarnessEval-W1HarnessOpt-Bench1HDS61HealthAgentBench1HealthBench1HealthBench Professional1HellaSwag1HiddenBench1HippoCamp1HomeSafe-Bench1HorizonMath1HPO-B v3-test1HumanCLAW-Bench1IA-Bench1ICLR 20251IG-Bench1IKEA-Bench1ImageBench1IMG Sign Score1InferenceX1IntentGrasp1Interactive Benchmarks1InteractWeb-Bench1InterLV-Search1Interphyre1InterruptBench1IOL1IT-Bench1iWorld-Bench1JMH1JPX Tokyo Stock Exchange Prediction1K12-Bench1Kaggle Game Arena1KellyBench1KernelBench Mega1KeyFrame-Compass1KillBench1Kitchen Rush1KnowGen1Ko-WideSearch1LABBench21LE-PDE-UQ1LFW1Long-Horizon-Terminal-Bench1LIBERO-Para1Lighthouse1LingxiDiagBench1LiveCodeBench_v61Live Gaming Benchmark1llama-bench1LLM Engineering Evaluation1LLMs4OL1LMEB1LMSYS Chatbot Arena1LOLAMEME1LongBench-v21LongCLI-Bench1Long Range Arena1LoopArena1LRBENCH1Lunar Lander1LunarLander-v31MADQA1MA-EgoQA1March Machine Learning Mania1Matbench1Mathet's Gamma1MATHNET1MCIF1MCP-Bench1MedAgentsBench1MedMNIST1MedQA1MemTrapBench1MerchantBench1MetricX1MHTE1MindEval1MindTopo1MindTrial1Minecraft MCU1MiniAppBench1Minimax Rate1MINJA1MirageBench1MiroEval1MirrorCode1MKNN1MLE-bench1MLIP Arena1MMAU1MM-CondChain1MMEB1MM-JudgeBias1MMLU-Pro1MMMU-Pro1MMR-Life1MobilePA-Bench1MobileWorld1MobileWorld-Real1MobilityBench1ModelSweep1MSAVBench1MulTaBench1MuseBench1music-bench1MuST-C1MyPhoneBench1NanoGPT Speedrun1NARMA-101NarrativeQA1NatureBench1NCP-Bench1NDCG@101needle-bench1Netflix Prize1NIAH1Nr3D1NR-R181OAKS1octobench1OfficeQA Pro V21OmniAssistBench1Omni-DuplexEval1OmniGAIA1OmniGUI1$OneMillion-Bench1OpenBioRQ1OpenEval1Open LLM Leaderboard1OpenML1Open Model Arena1OSReward1OSWorld-MCP1OVO-Bench1PAGE Bench1PanoSpace-Bench1PaperRecon1ParallelKernelBench1PatternEval1PAWBench1PAWEval1PazaBench1PDI-Bench1Pencil Puzzle Bench1PersonalRewardBench1PhotoBench1PhySciBench1PhysX-Bench1PickScore1PII-TRACE1PinchBench1Pinocchio Inventory1Pinpoint-Bench1PIRA-Bench1PISmith1PIXAR1PlanningBench1PLCBench1PolicyShiftBench1PopQA1PRESCAM1PRIDE1ProactiveBench1ProofBench1ProverBench1PVRBench1QCalEval1QOBLIB1QuantiPhy1QVal1Qwen-Bench1RA-Bench1RAGAS Faithfulness1ratel-bench1RBench1RCT1RecallBench1Ref-Adv1RefCOCO1ReMMDBench1Remote Labor Index1RestBench1Reversal Curse1RewardBench1RLBench1RoboLab1Robomimic1RoboMME1RoboTwin1RoboTwin-MeM1ROC-AUC1RTEB1RubberDuckBench1RubricBench1RxBrain-Bench1s2n-bignum-bench1SaaSBench1ScanQA1ScanRefer1scheduler_perf1ScholarQABench1SciPredict1SciIR-Bench1ScreenSpot-v21SemComp-Bench1Setlur et al1SetwiseEvalKit1Short-Drama-Bench1SimLex-9991SimpleQA1SIMPLER1SingGuard-Bench1Singularity Gate1SkillsBench1Skills Benchmark1Skill-X1SoapBench1SpatialGen-Bench1SpecSuite-Core1SpeechMap1SPLICE1StableToolBench1SteerEval1STEM2Code-Eval1StreamingBench1StructEval1StudentSimEval1Suboptimal-Value-Bench1SUPER1SWE-Bench ProMax1SWE-bench Science1SWE-fficiency1SWE-EVO1SWE-Interact1SWE-Marathon1SWE-Perf1SWE-Review-Bench1SWE-Search1SWE-WebDev Bench1T2S-Bench1tau21tbench1Terminal-Bench-21Terminal Bench 3.01Terminal-Bench+1TextArena1ThermoQA1TimeMachine-bench1Together Evaluations1ToolPrivBench1TRACES1Trajectory1TravelPlanner1Trimap IoU1TritonBench-T1TSB-AD1TSB-AD-M1TutorMoments1UniClawBench1UniG2U-Bench1UrbanGround1UTMOS1VAREX1VB Pulse1VBVR-Bench1VCReward-Bench1VectorGym1VSB (Vector Search Bench)1VerifierBench1Vesuvius Challenge1VGI-Bench1VibeBench1VideoMME1VideoZeroBench1ViDoRe1ViGoR-Bench1VisGym1Visual Spatial Planning1VisualToolBench1Vividh-ASR1VLMBias1VLM-Fix1VLM-SubtleBench1VP-Bench1VPhotoBench1VTC-Bench1VUS-PR1VWE-Bench1WANDS1WeaveBench1Web-Bench1Webgrid Eval1whatllm.org1WHEN2TOOL1WildBench1WMBench1Workunit Benchmarks1WorldMark1WorldReasonBench1WorldRewardBench1Xbench1xRouteBench1

자주 묻는 질문

Benchmarks (벤치마크) 카테고리에는 어떤 기준으로 기사가 포함되나요?

기사의 핵심 주제와 엔티티 태그를 기준으로 자동 분류되며, 관련성이 낮거나 중복된 항목은 우선순위가 낮게 조정됩니다.

태그 옆 숫자는 무엇을 의미하나요?

각 태그가 연결된 누적 기사 수를 의미합니다. 숫자가 클수록 해당 주제의 노출 빈도가 높은 편입니다.

최신 기사만 빠르게 보려면 어떻게 해야 하나요?

하단의 모든 뉴스 보기 링크를 통해 필터된 피드로 이동하면 최신순으로 관련 기사를 연속 탐색할 수 있습니다.