Repository Analysis

EvolvingLMMs-Lab/lmms-eval

One-for-All Multimodal Evaluation Toolkit Across Text, Image, Video, and Audio Tasks

34.0 Strong AI signal View on GitHub

Analysis Overview

This report presents the forensic synthetic code analysis of EvolvingLMMs-Lab/lmms-eval, a Python project with 4,383 GitHub stars. SynthScan v2.0 examined 318,408 lines of code across 3212 source files, recording 5998 pattern matches distributed across 23 syntactic categories. The overall adjusted score of 34.0 places this repository in the Strong AI signal band.

The scanner applied 160+ deterministic lexical heuristics, multi-line block detectors, abstract syntax tree depth profilers, and a cross-file Jaccard similarity matrix to construct a statistically normalised synthetic code estimate. All matches are individually weighted by severity coefficient and contextual multiplier before summation, and the resulting headline score is temporally discounted to account for the repository's development history relative to the commercial emergence of large language model coding tooling (November 2022 onward).

34.0
Adjusted Score
34.0
Raw Score
100%
Time Factor
2026-08-29
Last Push
4.4K
Stars
Python
Language
318.4K
Lines of Code
3.2K
Files
6.0K
Pattern Hits
2026-08-29
Scan Date
0.16
HC Hit Rate

What These Metrics Mean

Adjusted Score
Primary synthetic code indicator. Raw score normalised per 1,000 lines of code and multiplied by the temporal discount factor. This is the definitive comparative metric — use it to rank repositories by AI authorship density.
Raw Score
The unmodified sum of all severity-weighted, context-multiplied pattern match scores before temporal discounting. Reflects the absolute signal strength independent of when the repository was last active.
Time Factor
The temporal discount multiplier (0–100%) applied to the raw score. Repositories last updated before ChatGPT's launch (Nov 2022) receive a 5% factor. Full signal is only assigned to repositories active in the post-adoption era (Jan 2024+).
Pattern Hits
Total count of individual pattern matches across all files and categories. A high hit count with a low score may indicate a very large codebase with isolated AI snippets; a low count with a high score indicates dense, concentrated AI signatures.
HC Hit Rate
High+Critical pattern hits per file, averaged across the repository. This orthogonal signal catches repositories where a few files are densely packed with high-severity AI tells — a strong indicator even when the normalised score appears moderate due to codebase size.
Lines of Code / Files
Total lines and files analysed. The scanner examines 94 file extensions. These denominators are used to normalise the score, enabling fair comparison between repositories of vastly different sizes.

Score History

Longitudinal tracking requires multiple scan runs. Once this repository is re-scanned after new commits land, this chart will visualise how the synthetic code signal evolves over time — enabling you to detect whether AI authorship is growing, stabilising, or being actively corrected by human engineers.

No multi-scan history yet — run the scanner again to build trend data.

Severity Breakdown

Classifies detected patterns by their diagnostic confidence and structural impact. CRITICAL patterns (coefficient 10) represent definitive synthetic signatures — hallucinated imports, explicit LLM attribution metadata — virtually never produced by human authors. HIGH (5) indicates strong structural tells such as cross-file repetition or cross-linguistic idioms. MEDIUM (2) covers recognisable conversational padding and AI-specific vocabulary. LOW (1) captures subtle indicators like tautological comments and generic boilerplate that require density to carry independent signal.

CRITICAL 0HIGH 524MEDIUM 951LOW 4523

Directory Score Breakdown

This horizontal bar chart decomposes the repository's raw synthetic code score by top-level directory, allowing you to pinpoint precisely which modules or components carry the highest AI authorship density. Directories with disproportionately high scores relative to their size warrant targeted manual review: concentrated AI signatures often trace back to mass-generated configuration layers, auto-ported test suites, LLM-scaffolded boilerplate classes, or entire subsystems authored under heavy copilot assistance. Use this view to prioritise your human code-review effort.

Pattern Findings

The scanner identified 5998 distinct pattern matches across 23 syntactic categories. Each entry below represents a discrete location in the source code where the engine recorded a statistically significant AI authorship indicator. Expand any category row to inspect the individual file paths, line numbers, code snippets, and the lexical context (CODE, COMMENT, or STRING) in which each match was detected.

Reading the findings table: The Severity column indicates the diagnostic confidence level (CRITICAL / HIGH / MEDIUM / LOW). The Context column identifies whether the match occurred inside executable code, an inline comment, or a string literal — comment-context matches receive a ×1.5 weight because LLMs systematically over-annotate. The ⚡ bolt icon marks clustered matches: three or more patterns within a 10-line window, each receiving an additional ×1.5 density multiplier as dense clusters constitute far stronger evidence of synthetic authorship than isolated hits.

Decorative Section Separators753 hits · 2652 pts
SeverityFileLineSnippetContext
MEDIUMtest/conftest.py17# ---------------------------------------------------------------------------COMMENT
MEDIUMtest/conftest.py19# ---------------------------------------------------------------------------COMMENT
MEDIUMtest/conftest.py30# ---------------------------------------------------------------------------COMMENT
MEDIUMtest/conftest.py32# ---------------------------------------------------------------------------COMMENT
MEDIUMtest/conftest.py50# ---------------------------------------------------------------------------COMMENT
MEDIUMtest/conftest.py52# ---------------------------------------------------------------------------COMMENT
MEDIUMtest/conftest.py82# ---------------------------------------------------------------------------COMMENT
MEDIUMtest/conftest.py84# ---------------------------------------------------------------------------COMMENT
MEDIUMtest/conftest.py115# ---------------------------------------------------------------------------COMMENT
MEDIUMtest/conftest.py117# ---------------------------------------------------------------------------COMMENT
MEDIUMtest/cache/test_response_cache.py129# ===========================================================================COMMENT
MEDIUMtest/cache/test_response_cache.py131# ===========================================================================COMMENT
MEDIUMtest/cache/test_response_cache.py196# ===========================================================================COMMENT
MEDIUMtest/cache/test_response_cache.py198# ===========================================================================COMMENT
MEDIUMtest/cache/test_response_cache.py264# ===========================================================================COMMENT
MEDIUMtest/cache/test_response_cache.py266# ===========================================================================COMMENT
MEDIUMtest/cache/test_response_cache.py320# ===========================================================================COMMENT
MEDIUMtest/cache/test_response_cache.py322# ===========================================================================COMMENT
MEDIUMtest/cache/test_response_cache.py352# ===========================================================================COMMENT
MEDIUMtest/cache/test_response_cache.py354# ===========================================================================COMMENT
MEDIUMtest/cache/test_response_cache.py593# ===========================================================================COMMENT
MEDIUMtest/cache/test_response_cache.py595# ===========================================================================COMMENT
MEDIUMtest/cache/test_response_cache.py635# ===========================================================================COMMENT
MEDIUMtest/cache/test_response_cache.py637# ===========================================================================COMMENT
MEDIUMtest/cache/test_response_cache.py20# ---------------------------------------------------------------------------COMMENT
MEDIUMtest/cache/test_response_cache.py22# ---------------------------------------------------------------------------COMMENT
MEDIUMtest/cache/test_response_cache.py424# ===========================================================================COMMENT
MEDIUMtest/cache/test_response_cache.py426# ===========================================================================COMMENT
MEDIUMtest/cache/test_response_cache.py672# ===========================================================================COMMENT
MEDIUMtest/cache/test_response_cache.py675# ===========================================================================COMMENT
MEDIUMtest/cli/test_cli_dispatch_parametrized.py13# ---------------------------------------------------------------------------COMMENT
MEDIUMtest/cli/test_cli_dispatch_parametrized.py15# ---------------------------------------------------------------------------COMMENT
MEDIUMtest/cli/test_cli_dispatch_parametrized.py45# ---------------------------------------------------------------------------COMMENT
MEDIUMtest/cli/test_cli_dispatch_parametrized.py47# ---------------------------------------------------------------------------COMMENT
MEDIUMtest/cli/test_cli_dispatch_parametrized.py64# ---------------------------------------------------------------------------COMMENT
MEDIUMtest/cli/test_cli_dispatch_parametrized.py66# ---------------------------------------------------------------------------COMMENT
MEDIUMtest/entrypoints/test_job_scheduler_subprocess.py217# ---------------------------------------------------------------------------COMMENT
MEDIUMtest/entrypoints/test_job_scheduler_subprocess.py219# ---------------------------------------------------------------------------COMMENT
MEDIUMtest/eval/test_protocol.py30# ============================================================================COMMENT
MEDIUMtest/eval/test_protocol.py32# ============================================================================COMMENT
MEDIUMtest/eval/test_protocol.py53# ============================================================================COMMENT
MEDIUMtest/eval/test_protocol.py55# ============================================================================COMMENT
MEDIUMtest/eval/test_protocol.py78# ============================================================================COMMENT
MEDIUMtest/eval/test_protocol.py80# ============================================================================COMMENT
MEDIUMtest/eval/test_protocol.py101# ============================================================================COMMENT
MEDIUMtest/eval/test_protocol.py103# ============================================================================COMMENT
MEDIUMtest/eval/test_protocol.py124# ============================================================================COMMENT
MEDIUMtest/eval/test_protocol.py126# ============================================================================COMMENT
MEDIUMtest/eval/test_protocol.py183# ============================================================================COMMENT
MEDIUMtest/eval/test_protocol.py185# ============================================================================COMMENT
MEDIUMtest/eval/test_protocol.py224# ============================================================================COMMENT
MEDIUMtest/eval/test_protocol.py226# ============================================================================COMMENT
MEDIUMtest/eval/test_protocol.py385# ============================================================================COMMENT
MEDIUMtest/eval/test_protocol.py387# ============================================================================COMMENT
MEDIUMtest/eval/test_evaluator.py113# ===========================================================================COMMENT
MEDIUMtest/eval/test_evaluator.py115# ===========================================================================COMMENT
MEDIUMtest/eval/test_evaluator.py149# ===========================================================================COMMENT
MEDIUMtest/eval/test_evaluator.py151# ===========================================================================COMMENT
MEDIUMtest/eval/test_evaluator.py172# ===========================================================================COMMENT
MEDIUMtest/eval/test_evaluator.py174# ===========================================================================COMMENT
693 more matches not shown…
Hyper-Verbose Identifiers2328 hits · 2430 pts
SeverityFileLineSnippetContext
LOWtools/task_input_capture.py172def _capture_instance_boundary(task_obj, instance, *, capture_mode: str) -> dict[str, Any]:CODE
LOWtest/conftest.py143def pytest_collection_modifyitems(config, items):CODE
LOWtest/README.md77def test_is_legacy_invocation(argv, expected):CODE
LOWtest/README.md111def test_chat_precedence_and_force_simple():CODE
LOWtest/README.md154def test_task_output_type_is_generate_until(task_name, tm):CODE
LOWtest/README.md256def test_configurable_task_generate_until_tuple_shape():CODE
LOWtest/README.md292def test_extract_media_mixed_content(sample_image):CODE
LOWtest/README.md326def test_agentic_single_round_terminal():CODE
LOWtest/README.md342def test_cache_hit_miss_lifecycle(self):CODE
LOWtest/README.md420def test_unwrap_generation_result():CODE
LOWtest/README.md448def test_efficiency_metrics_tokens_per_correct(base_results):CODE
LOWtest/tools/test_batch_watchdog.py15 def test_find_stale_heartbeats_filters_by_phase_and_age(self):CODE
LOWtest/tools/test_batch_watchdog.py33 def test_write_timeout_snapshot_persists_payload(self):CODE
LOWtest/cache/test_agentic_response_cache.py68 def test_agentic_path_uses_response_cache(self):CODE
LOWtest/cache/test_agentic_response_cache.py79 def test_agentic_same_doc_different_prompt_not_collide(self):CODE
LOWtest/cache/test_response_cache.py62 def test_conditional_vs_unconditional_differ(self):CODE
LOWtest/cache/test_response_cache.py71 def test_different_idx_differ(self):CODE
LOWtest/cache/test_response_cache.py81 def test_task_fingerprint_invalidates(self):CODE
LOWtest/cache/test_response_cache.py86 def test_model_fingerprint_invalidates(self):CODE
LOWtest/cache/test_response_cache.py91 def test_generate_until_same_doc_idx_different_prompt_differ(self):CODE
LOWtest/cache/test_response_cache.py107 def test_no_dict_returns_empty(self):CODE
LOWtest/cache/test_response_cache.py116 def test_empty_string_rejected(self):CODE
LOWtest/cache/test_response_cache.py120 def test_malformed_loglikelihood_rejected(self):CODE
LOWtest/cache/test_response_cache.py124 def test_valid_responses_accepted(self):CODE
LOWtest/cache/test_response_cache.py202 def test_skipped_on_positive_temperature(self):CODE
LOWtest/cache/test_response_cache.py211 def test_temp_positive_repeats_all_bypass(self):CODE
LOWtest/cache/test_response_cache.py270 def test_nondeterministic_responses_logged(self):CODE
LOWtest/cache/test_response_cache.py326 def test_jsonl_replay_after_simulated_crash(self):CODE
LOWtest/cache/test_response_cache.py358 def test_separate_ranks_write_independently(self):CODE
LOWtest/cache/test_response_cache.py599 def test_fingerprint_stored_in_meta(self):CODE
LOWtest/cache/test_response_cache.py605 def test_different_models_use_separate_db_files(self):CODE
LOWtest/cache/test_response_cache.py625 def test_fingerprint_hash_and_schema_stored_in_meta(self):CODE
LOWtest/cache/test_response_cache.py641 def test_total_cached_entries_across_close_reopen(self):CODE
LOWtest/cache/test_response_cache.py175 def test_same_doc_idx_different_prompts_do_not_collide(self):CODE
LOWtest/cache/test_response_cache.py222 def test_temp_zero_repeats_all_hit_same_entry(self):CODE
LOWtest/cache/test_response_cache.py237 def test_do_sample_repeats_bypass(self):CODE
LOWtest/cache/test_response_cache.py248 def test_no_cross_run_poisoning(self):CODE
LOWtest/cache/test_response_cache.py285 def test_deterministic_responses_logged(self):CODE
LOWtest/cache/test_response_cache.py378 def test_merge_shards_combines_ranks(self):CODE
LOWtest/cache/test_response_cache.py400 def test_merge_shards_deduplicates_overlapping_keys(self):CODE
LOWtest/cache/test_response_cache.py442 def test_create_sets_up_run_directory(self):CODE
LOWtest/cache/test_response_cache.py460 def test_create_with_db_suffix_normalizes_to_directory(self):CODE
LOWtest/cache/test_response_cache.py474 def test_create_remote_uses_scratch(self):CODE
LOWtest/cache/test_response_cache.py492 def test_finalize_merges_rank_dbs_into_root(self):CODE
LOWtest/cache/test_response_cache.py529 def test_finalize_multi_rank_merge(self):CODE
LOWtest/cache/test_response_cache.py567 def test_finalize_skips_merge_on_failure(self):CODE
LOWtest/cache/test_response_cache.py659 def test_hit_miss_counters_reset_on_new_instance(self):CODE
LOWtest/models/test_vqtoken.py33def test_vqtoken_passes_released_attention_config(method: str) -> None:CODE
LOWtest/models/test_vqtoken.py63def test_vqtoken_rejects_non_public_or_invalid_config(method: str, min_clusters: int, max_clusters: int) -> None:CODE
LOWtest/models/test_vqtoken.py68def test_vqtoken_runtime_is_lazy_and_actionable() -> None:CODE
LOWtest/models/test_vqtoken.py74def test_vqtoken_rejects_runtime_without_attention_capability() -> None:CODE
LOWtest/models/test_vqtoken.py86def test_fixed_selection_uses_max_clusters_as_k() -> None:CODE
LOWtest/models/test_vqtoken.py94def test_vqtoken_rejects_frame_budget_larger_than_guaranteed_k(method: str, min_clusters: int, max_clusters: int, max_frCODE
LOWtest/models/test_vqtoken.py103def test_vqtoken_accepts_frame_budget_not_larger_than_guaranteed_k(method: str, min_clusters: int, max_clusters: int, maCODE
LOWtest/models/test_vqtoken.py111def test_vqtoken_rejects_multiple_video_placeholders() -> None:CODE
LOWtest/models/test_vqtoken.py116def test_vqtoken_rejects_base_checkpoint_without_learned_attention() -> None:CODE
LOWtest/models/test_vqtoken.py133def test_released_hub_checkpoint_does_not_require_local_header_inspection() -> None:CODE
LOWtest/models/test_vqtoken.py142def test_vqtoken_detects_embedded_vision_in_local_checkpoint() -> None:CODE
LOWtest/models/test_vqtoken.py164def test_parent_loader_merges_only_subclass_overrides() -> None:CODE
LOWtest/models/test_openai.py64 def test_simple_backend_preserves_requested_max_new_tokens(self):CODE
2268 more matches not shown…
Cross-File Repetition295 hits · 1475 pts
SeverityFileLineSnippetContext
HIGHdocs/releases/lmms-eval-0.3.md0[question] {question} [reference answer] {ground_truth} [model answer] {model_response} [task] rate the model's answer bSTRING
HIGHlmms_eval/tasks/openhermes/utils.py0[question] {question} [reference answer] {ground_truth} [model answer] {model_response} [task] rate the model's answer bSTRING
HIGHlmms_eval/tasks/clotho_aqa/utils.py0[question] {question} [reference answer] {ground_truth} [model answer] {model_response} [task] rate the model's answer bSTRING
HIGHlmms_eval/tasks/wavcaps/utils.py0[question] {question} [reference answer] {ground_truth} [model answer] {model_response} [task] rate the model's answer bSTRING
HIGHlmms_eval/tasks/alpaca_audio/utils.py0[question] {question} [reference answer] {ground_truth} [model answer] {model_response} [task] rate the model's answer bSTRING
HIGHlmms_eval/filters/extraction.py0regex_pattern: the basic regex pattern to use. if fails to match, we will use the customized match procedure - step 1 : STRING
HIGHlmms_eval/tasks/muirbench/utils.py0regex_pattern: the basic regex pattern to use. if fails to match, we will use the customized match procedure - step 1 : STRING
HIGHlmms_eval/tasks/mmlu_pro/utils.py0regex_pattern: the basic regex pattern to use. if fails to match, we will use the customized match procedure - step 1 : STRING
HIGHlmms_eval/tasks/ai2d/utils.py0regex_pattern: the basic regex pattern to use. if fails to match, we will use the customized match procedure - step 1 : STRING
HIGHlmms_eval/tasks/worldqa/utils.py0regex_pattern: the basic regex pattern to use. if fails to match, we will use the customized match procedure - step 1 : STRING
HIGHlmms_eval/tasks/realworldqa/utils.py0regex_pattern: the basic regex pattern to use. if fails to match, we will use the customized match procedure - step 1 : STRING
HIGHlmms_eval/tasks/sat/utils.py0regex_pattern: the basic regex pattern to use. if fails to match, we will use the customized match procedure - step 1 : STRING
HIGHlmms_eval/tasks/mmlu/flan_cot_zeroshot/utils.py0regex_pattern: the basic regex pattern to use. if fails to match, we will use the customized match procedure - step 1 : STRING
HIGHlmms_eval/tasks/mmlu/flan_n_shot/generative/utils.py0regex_pattern: the basic regex pattern to use. if fails to match, we will use the customized match procedure - step 1 : STRING
HIGHlmms_eval/tasks/illusionvqa/utils.py0regex_pattern: the basic regex pattern to use. if fails to match, we will use the customized match procedure - step 1 : STRING
HIGHlmms_eval/filters/selection.py0can define custom behavior here, if an individual instantiation of a filter class should have state.STRING
HIGHlmms_eval/tasks/mix_evals/video2text/utils.py0can define custom behavior here, if an individual instantiation of a filter class should have state.STRING
HIGHlmms_eval/tasks/mix_evals/image2text/utils.py0can define custom behavior here, if an individual instantiation of a filter class should have state.STRING
HIGHlmms_eval/api/filter.py0can define custom behavior here, if an individual instantiation of a filter class should have state.STRING
HIGHlmms_eval/tasks/egothink/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/mme/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/vl_rewardbench/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/camerabench_vqa/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/conbench/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/mme_cot/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/naturalbench/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/llava-in-the-wild/utils_ko.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/llava-in-the-wild/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/llava-bench-coco/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/screenspot/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/refcoco/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/ferret/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/llava_wilder/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/refcocog/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/refcoco+/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGH…al/tasks/multilingual-llava-bench-in-the-wild/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/xlrs/mcq_utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/vcr_wiki/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/timescope/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/longtimescope/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/mmvu/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/lsdbench/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/lvbench/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/video-tt/gpt_utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/videomme/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/mmworld/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/mlvu/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/nocaps/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/cinepile/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/worldsense/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/av_odyssey/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/tomato/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/video-tt/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/capability/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/videomathqa/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/mvbench/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/coco_cap/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/vatex/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/detailcaps/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
HIGHlmms_eval/tasks/mme_realworld/utils.py0args: doc: a instance of the eval dataset results: [pred] returns: a dictionary with key: metric name (in this case textSTRING
235 more matches not shown…
Magic Placeholder Names212 hits · 1412 pts
SeverityFileLineSnippetContext
HIGHREADME.md220export OPENAI_API_KEY="<YOUR_API_KEY>"CODE
HIGHREADME.md220export OPENAI_API_KEY="<YOUR_API_KEY>"CODE
HIGHREADME.md222export HF_TOKEN="<YOUR_API_KEY>"CODE
HIGHREADME.md222export HF_TOKEN="<YOUR_API_KEY>"CODE
HIGHREADME.md224export REKA_API_KEY="<YOUR_API_KEY>"CODE
HIGHREADME.md224export REKA_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/README.md52export OPENAI_API_KEY="your-api-key"CODE
HIGHdocs/getting-started/run_examples.md9export OPENAI_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/getting-started/run_examples.md9export OPENAI_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/getting-started/run_examples.md11export HF_TOKEN="<YOUR_API_KEY>"CODE
HIGHdocs/getting-started/run_examples.md11export HF_TOKEN="<YOUR_API_KEY>"CODE
HIGHdocs/getting-started/run_examples.md13export REKA_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/getting-started/run_examples.md13export REKA_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/getting-started/run_examples.md255export OPENAI_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/getting-started/run_examples.md255export OPENAI_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/getting-started/run_examples.md308export GOOGLE_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/getting-started/run_examples.md308export GOOGLE_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/getting-started/run_examples.md333export ANTHROPIC_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/getting-started/run_examples.md333export ANTHROPIC_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_id.md153export OPENAI_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_id.md153export OPENAI_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_id.md155export HF_TOKEN="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_id.md155export HF_TOKEN="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_id.md157export REKA_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_id.md157export REKA_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_ja.md146export OPENAI_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_ja.md146export OPENAI_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_ja.md148export HF_TOKEN="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_ja.md148export HF_TOKEN="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_ja.md150export REKA_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_ja.md150export REKA_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_pt-BR.md171export OPENAI_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_pt-BR.md171export OPENAI_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_pt-BR.md173export HF_TOKEN="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_pt-BR.md173export HF_TOKEN="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_pt-BR.md175export REKA_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_pt-BR.md175export REKA_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_zh-TW.md135export OPENAI_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_zh-TW.md135export OPENAI_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_zh-TW.md137export HF_TOKEN="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_zh-TW.md137export HF_TOKEN="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_zh-TW.md139export REKA_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_zh-TW.md139export REKA_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_vi.md139export OPENAI_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_vi.md139export OPENAI_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_vi.md141export HF_TOKEN="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_vi.md141export HF_TOKEN="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_vi.md143export REKA_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_vi.md143export REKA_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_pl.md136export OPENAI_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_pl.md136export OPENAI_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_pl.md138export HF_TOKEN="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_pl.md138export HF_TOKEN="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_pl.md140export REKA_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_pl.md140export REKA_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_zh-CN.md163export OPENAI_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_zh-CN.md163export OPENAI_API_KEY="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_zh-CN.md165export HF_TOKEN="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_zh-CN.md165export HF_TOKEN="<YOUR_API_KEY>"CODE
HIGHdocs/i18n/README_zh-CN.md167export REKA_API_KEY="<YOUR_API_KEY>"CODE
152 more matches not shown…
Excessive Try-Catch Wrapping856 hits · 968 pts
SeverityFileLineSnippetContext
LOWtools/bench_video_decode_backends.py97 except Exception as exc:CODE
LOWtools/task_input_capture.py74 except Exception:CODE
LOWtools/task_input_capture.py265 except Exception:CODE
MEDIUMtools/task_input_capture.py262def _norm(v):CODE
LOWtest/eval/utils.py145 except Exception:CODE
LOWtest/eval/utils.py342 except Exception as e:CODE
MEDIUMtest/eval/run_cicd.py31 print(f"Error: Model directory '{model_name}' not found in {test_dir}")CODE
LOWexamples/mcp_server/crop_video_mcp_server.py118 except Exception as e:CODE
LOWlmms_eval/utils.py307 except Exception as e:CODE
LOWlmms_eval/utils.py587 except Exception:CODE
LOWlmms_eval/utils.py861 except Exception:CODE
LOWlmms_eval/utils.py956 except Exception as ex:CODE
LOWlmms_eval/utils.py1051 except Exception as ex:CODE
MEDIUMlmms_eval/utils.py50def is_json(string):CODE
LOWlmms_eval/evaluator.py799 except Exception as e:CODE
LOWlmms_eval/__main__.py507 except Exception as e:CODE
LOWlmms_eval/__main__.py596 except Exception as e:CODE
LOWlmms_eval/__main__.py606 except Exception as e:CODE
LOWlmms_eval/__main__.py609 except Exception as e:CODE
LOWlmms_eval/logging_utils.py22except Exception as e:CODE
LOWlmms_eval/logging_utils.py76 except Exception as e:CODE
LOWlmms_eval/tasks/openhermes/utils.py100 except Exception as e:CODE
LOWlmms_eval/tasks/openhermes/utils.py127 except Exception as e:CODE
LOWlmms_eval/tasks/egothink/utils.py114 except Exception as e:CODE
LOWlmms_eval/tasks/llava-in-the-wild/utils_ko.py62 except Exception as e:CODE
LOWlmms_eval/tasks/llava-in-the-wild/utils_ko.py82 except Exception as e:CODE
LOWlmms_eval/tasks/llava-in-the-wild/utils_ko.py121 except Exception as e:CODE
LOWlmms_eval/tasks/llava-in-the-wild/utils_ko.py178 except Exception as e:CODE
MEDIUMlmms_eval/tasks/llava-in-the-wild/utils_ko.py72def parse_score(review):CODE
MEDIUMlmms_eval/tasks/llava-in-the-wild/utils_ko.py161def llava_aggregation(results, category):CODE
LOWlmms_eval/tasks/llava-in-the-wild/utils.py57 except Exception:CODE
LOWlmms_eval/tasks/llava-in-the-wild/utils.py128 except Exception as e:CODE
LOWlmms_eval/tasks/llava-in-the-wild/utils.py185 except Exception as e:CODE
MEDIUMlmms_eval/tasks/llava-in-the-wild/utils.py168def llava_aggregation(results, category):CODE
LOWlmms_eval/tasks/mmsearch/utils/image_utils.py22 except Exception as e:CODE
LOWlmms_eval/tasks/mmsearch/utils/utils.py46 except Exception as e:CODE
LOWlmms_eval/tasks/mmsearch/utils/utils.py83 except Exception as e:CODE
LOWlmms_eval/tasks/mmsearch/utils/utils.py109 except Exception as e:CODE
LOWlmms_eval/tasks/mmsearch/utils/utils.py148 except Exception as e:CODE
LOWlmms_eval/tasks/mmsearch/utils/utils.py153 except Exception as e:CODE
LOWlmms_eval/tasks/mmsearch/utils/utils.py224 except Exception as e:CODE
LOWlmms_eval/tasks/mmsearch/utils/utils.py227 except Exception as e:CODE
LOWlmms_eval/tasks/mmsearch/utils/utils.py287 except Exception as e:CODE
LOWlmms_eval/tasks/mmsearch/utils/utils.py290 except Exception as e:CODE
MEDIUMlmms_eval/tasks/mmsearch/utils/utils.py291 print(f"An error occurred: {e}")CODE
LOWlmms_eval/tasks/mmsearch/score/result_summary.py47 except Exception:CODE
LOWlmms_eval/tasks/ami/utils.py103 except Exception as e:CODE
MEDIUMlmms_eval/tasks/voicebench/utils.py98 print(f"Error converting AudioDecoder object: {e}")CODE
MEDIUMlmms_eval/tasks/voicebench/utils.py107 print(f"Error converting audio object: {e}")CODE
LOWlmms_eval/tasks/voicebench/utils.py97 except Exception as e:CODE
LOWlmms_eval/tasks/voicebench/utils.py106 except Exception as e:CODE
LOWlmms_eval/tasks/voicebench/utils.py1474 except Exception:CODE
LOWlmms_eval/tasks/voicebench/utils.py1479 except Exception as e:CODE
LOWlmms_eval/tasks/voicebench/utils.py1525 except Exception:CODE
LOWlmms_eval/tasks/voicebench/utils.py1530 except Exception:CODE
LOWlmms_eval/tasks/voicebench/utils.py1535 except Exception:CODE
LOWlmms_eval/tasks/voicebench/utils.py1540 except Exception as e:CODE
LOWlmms_eval/tasks/voicebench/utils.py1544 except Exception as e:CODE
LOWlmms_eval/tasks/voicebench/utils.py1552 except Exception as e:CODE
LOWlmms_eval/tasks/voicebench/utils.py55 except Exception:CODE
796 more matches not shown…
Deep Nesting716 hits · 647 pts
SeverityFileLineSnippetContext
LOWtools/regression.py90CODE
LOWtools/task_input_capture.py172CODE
LOWtest/eval/utils.py130CODE
LOWlmms_eval/protocol.py50CODE
LOWlmms_eval/protocol.py66CODE
LOWlmms_eval/protocol.py96CODE
LOWlmms_eval/protocol.py148CODE
LOWlmms_eval/evaluator_utils.py230CODE
LOWlmms_eval/evaluator_utils.py298CODE
LOWlmms_eval/evaluator_utils.py386CODE
LOWlmms_eval/evaluator_utils.py462CODE
LOWlmms_eval/evaluator_utils.py134CODE
LOWlmms_eval/evaluator_utils.py164CODE
LOWlmms_eval/utils.py157CODE
LOWlmms_eval/utils.py541CODE
LOWlmms_eval/evaluator.py195CODE
LOWlmms_eval/evaluator.py249CODE
LOWlmms_eval/evaluator.py298CODE
LOWlmms_eval/evaluator.py366CODE
LOWlmms_eval/evaluator.py810CODE
LOWlmms_eval/evaluator.py964CODE
LOWlmms_eval/evaluator.py563CODE
LOWlmms_eval/__main__.py477CODE
LOWlmms_eval/__main__.py633CODE
LOWlmms_eval/logging_utils.py155CODE
LOWlmms_eval/logging_utils.py319CODE
LOWlmms_eval/logging_utils.py169CODE
LOWlmms_eval/filters/extraction.py105CODE
LOWlmms_eval/tasks/__init__.py96CODE
LOWlmms_eval/tasks/__init__.py233CODE
LOWlmms_eval/tasks/__init__.py383CODE
LOWlmms_eval/tasks/egoplan/utils.py39CODE
LOWlmms_eval/tasks/mme/utils.py48CODE
LOWlmms_eval/tasks/hipho/utils.py13CODE
LOWlmms_eval/tasks/hipho/utils.py36CODE
LOWlmms_eval/tasks/hipho/utils.py63CODE
LOWlmms_eval/tasks/hipho/utils.py166CODE
LOWlmms_eval/tasks/mmsearch/lmms_eval_utils.py392CODE
LOWlmms_eval/tasks/mmsearch/utils/utils.py74CODE
LOWlmms_eval/tasks/vmcbench/utils.py55CODE
LOWlmms_eval/tasks/osworld_g/utils.py115CODE
LOWlmms_eval/tasks/ami/utils.py35CODE
LOWlmms_eval/tasks/ami/utils.py316CODE
LOWlmms_eval/tasks/voicebench/utils.py30CODE
LOWlmms_eval/tasks/voicebench/utils.py196CODE
LOWlmms_eval/tasks/voicebench/utils.py319CODE
LOWlmms_eval/tasks/voicebench/utils.py1162CODE
LOWlmms_eval/tasks/voicebench/utils.py1466CODE
LOWlmms_eval/tasks/voicebench/utils.py320CODE
LOWlmms_eval/tasks/voicebench/utils.py344CODE
LOWlmms_eval/tasks/voicebench/utils.py770CODE
LOWlmms_eval/tasks/voicebench/utils.py834CODE
LOWlmms_eval/tasks/voicebench/utils.py905CODE
LOWlmms_eval/tasks/voicebench/utils.py992CODE
LOWlmms_eval/tasks/voicebench/utils.py1511CODE
LOWlmms_eval/tasks/mmmu_pro/utils.py239CODE
LOWlmms_eval/tasks/mmmu_pro/utils.py268CODE
LOWlmms_eval/tasks/mmmu_pro/utils.py374CODE
LOWlmms_eval/tasks/mmmu_pro/utils.py382CODE
LOWlmms_eval/tasks/mmmu_pro/reasoning/utils.py258CODE
656 more matches not shown…
Redundant / Tautological Comments212 hits · 322 pts
SeverityFileLineSnippetContext
LOWlmms_eval/utils.py663 # Check if v is not empty (handle numpy array safely)COMMENT
LOWlmms_eval/tasks/__init__.py336 # Check if this is a duplicate.COMMENT
LOWlmms_eval/tasks/mmsearch/utils/image_utils.py42 # Check if the image is grayscale or colorCOMMENT
LOWlmms_eval/tasks/ami/utils.py60 # Check if samples itself has a data attributeCOMMENT
LOWlmms_eval/tasks/mmvu/utils.py200 # Check if choice text appears in predictionCOMMENT
LOWlmms_eval/tasks/mmvu/utils.py203 # Check if prediction contains both the letter and key words from choiceCOMMENT
LOWlmms_eval/tasks/mmvu/utils.py208 # Check if at least one key word appears in predictionCOMMENT
LOWlmms_eval/tasks/mmvu/utils.py260 # Check if all answer words appear in prediction (order-independent)COMMENT
LOWlmms_eval/tasks/temporalbench/utils.py144 # Print the resultsCOMMENT
LOWlmms_eval/tasks/mathvision/eval_utils.py60 # Check if string is a tuple representation and has more than one elementCOMMENT
LOWlmms_eval/tasks/mathvision/eval_utils.py67 # Check if string is a list representation and has more than one elementCOMMENT
LOWlmms_eval/tasks/mathvision/eval_utils.py158 # Check if the ID contains the specified area or if it matches the patternCOMMENT
LOWlmms_eval/tasks/mathvision/eval_utils.py222 # Check if there are any occurrences of '\frac' in the string.COMMENT
LOWlmms_eval/tasks/mathvision/eval_utils.py244 # Check if the denominator (b) is already braced.COMMENT
LOWlmms_eval/tasks/mathvision/eval_utils.py264 # Check if the string contains exactly one slash, which may indicate it's a fraction.COMMENT
LOWlmms_eval/tasks/mathvision/eval_utils.py276 # Check if the string is in the expected format after conversion.COMMENT
LOWlmms_eval/tasks/mathvision/eval_utils.py297 # Check if "\sqrt" is not in the string. If not, return the string as is.COMMENT
LOWlmms_eval/tasks/voxpopuli/utils.py57 # Check if samples itself has a data attributeCOMMENT
LOWlmms_eval/tasks/gedit_bench/viescore/utils.py18 # Check if value is an integer or floatCOMMENT
LOWlmms_eval/tasks/gedit_bench/viescore/utils.py21 # Check if value is a boolean or nullCOMMENT
LOWlmms_eval/tasks/gedit_bench/viescore/utils.py118 # Check if the parsed object is a listCOMMENT
LOWlmms_eval/tasks/gedit_bench/viescore/utils.py122 # Check if all elements are integers and between 0 to 10COMMENT
LOWlmms_eval/tasks/gedit_bench/viescore/utils.py220 # Check if we found two delimitersCOMMENT
LOWlmms_eval/tasks/gedit_bench/viescore/utils.py358 # Check if the key exists at the top level of the JSON structureCOMMENT
LOWlmms_eval/tasks/gedit_bench/viescore/utils.py101 # Check if the target sequence appears exactly twiceCOMMENT
LOWlmms_eval/tasks/gedit_bench/viescore/utils.py144 # Check if the key starts with 'score' and the value is in the correct rangeCOMMENT
LOWlmms_eval/tasks/gedit_bench/viescore/utils.py151 # Check if at least 'score1' and 'score2' are presentCOMMENT
LOWlmms_eval/tasks/gedit_bench/viescore/utils.py305 # Check if we found two delimitersCOMMENT
LOW…s/vbvr/vbvr_bench/evaluators/Out_of_Domain_50_part5.py197 # Check if control counts are reasonableCOMMENT
LOW…s/vbvr/vbvr_bench/evaluators/Out_of_Domain_50_part5.py322 # Check if cell is unchangedCOMMENT
LOW…s/vbvr/vbvr_bench/evaluators/Out_of_Domain_50_part5.py437 # Check if filledCOMMENT
LOW…s/vbvr/vbvr_bench/evaluators/Out_of_Domain_50_part5.py545 # Check if symbols are evenly spacedCOMMENT
LOW…s/vbvr/vbvr_bench/evaluators/Out_of_Domain_50_part5.py572 # Check if colors maintain relative orderCOMMENT
LOW…s/vbvr/vbvr_bench/evaluators/Out_of_Domain_50_part5.py692 # Check if a new symbol was addedCOMMENT
LOW…s/vbvr/vbvr_bench/evaluators/Out_of_Domain_50_part5.py707 # Check if original symbols are still present (by color)COMMENT
LOW…s/vbvr/vbvr_bench/evaluators/Out_of_Domain_50_part5.py930 # Check if correct number of symbols were insertedCOMMENT
LOW…s/vbvr/vbvr_bench/evaluators/Out_of_Domain_50_part5.py947 # Check if new symbols in final match the target typeCOMMENT
LOW…s/vbvr/vbvr_bench/evaluators/Out_of_Domain_50_part5.py1169 # Check if acceleration is roughly constant (gravity)COMMENT
LOW…s/vbvr/vbvr_bench/evaluators/Out_of_Domain_50_part5.py1188 # Check if the frames are nearly identical (GT vs GT case)COMMENT
LOW…s/vbvr/vbvr_bench/evaluators/Out_of_Domain_50_part5.py1207 # Check if ball is near ground (bottom of frame)COMMENT
LOW…s/vbvr/vbvr_bench/evaluators/Out_of_Domain_50_part5.py1342 # Check if animals moved from left to right sideCOMMENT
LOW…s/vbvr/vbvr_bench/evaluators/Out_of_Domain_50_part5.py1380 # Check if animals are on right side (target area)COMMENT
LOW…s/vbvr/vbvr_bench/evaluators/Out_of_Domain_50_part5.py1472 # Check if sizes increase left to rightCOMMENT
LOW…s/vbvr/vbvr_bench/evaluators/Out_of_Domain_50_part5.py1491 # Check if bottom y-coordinates are similar (aligned on baseline)COMMENT
LOW…s/vbvr/vbvr_bench/evaluators/Out_of_Domain_50_part5.py1688 # Check if rotation is consistent (all same direction)COMMENT
LOW…s/vbvr/vbvr_bench/evaluators/Out_of_Domain_50_part1.py1939 # Check if marking is on second largestCOMMENT
LOW…s/vbvr/vbvr_bench/evaluators/Out_of_Domain_50_part1.py1956 # Check if marking forms a proper borderCOMMENT
LOW…s/vbvr/vbvr_bench/evaluators/Out_of_Domain_50_part1.py2125 # Check if circle is in a reasonable positionCOMMENT
LOW…s/vbvr/vbvr_bench/evaluators/Out_of_Domain_50_part1.py252 # Check if agent reached the door (green agent at door position)COMMENT
LOW…s/vbvr/vbvr_bench/evaluators/Out_of_Domain_50_part1.py660 # Check if there's a continuous path of this color between themCOMMENT
LOW…s/vbvr/vbvr_bench/evaluators/Out_of_Domain_50_part1.py729 # Check if this pixel is colored (high saturation) and not backgroundCOMMENT
LOW…s/vbvr/vbvr_bench/evaluators/Out_of_Domain_50_part1.py865 # Check if marked candidate matches expected typeCOMMENT
LOW…s/vbvr/vbvr_bench/evaluators/Out_of_Domain_50_part1.py905 # Check if sizes increase smoothlyCOMMENT
LOW…s/vbvr/vbvr_bench/evaluators/Out_of_Domain_50_part1.py1286 # Check if outline is around topmost shapeCOMMENT
LOW…s/vbvr/vbvr_bench/evaluators/Out_of_Domain_50_part1.py1305 # Check if outline forms a closed shapeCOMMENT
LOW…s/vbvr/vbvr_bench/evaluators/Out_of_Domain_50_part1.py1459 # Check if circle marks the unique shapeCOMMENT
LOW…s/vbvr/vbvr_bench/evaluators/Out_of_Domain_50_part1.py1478 # Check if circle is in a reasonable position (not at edges)COMMENT
LOW…s/vbvr/vbvr_bench/evaluators/Out_of_Domain_50_part1.py1498 # Check if circle is reasonable sizeCOMMENT
LOW…s/vbvr/vbvr_bench/evaluators/Out_of_Domain_50_part1.py1721 # Check if circle is in reasonable position (not at edges)COMMENT
LOW…s/vbvr/vbvr_bench/evaluators/Out_of_Domain_50_part1.py2106 # Check if circle is near the longest edge midpointCOMMENT
152 more matches not shown…
Unused Imports188 hits · 186 pts
SeverityFileLineSnippetContext
LOWtools/task_input_capture.py15CODE
LOWtest/models/test_vqtoken.py1CODE
LOWtest/models/test_openai.py1CODE
LOWtest/models/test_litellm.py3CODE
LOWtest/models/test_vllm_sampling_params.py1CODE
LOWtest/models/test_llava_hf_generate_until.py13CODE
LOWtest/eval/test_messages_text_ctx.py17CODE
LOWlmms_eval/imports.py24CODE
LOWlmms_eval/filters/__init__.py1CODE
LOWlmms_eval/tasks/vstat/utils.py9CODE
LOWlmms_eval/tasks/cc_ocr/evaluators/__init__.py1CODE
LOWlmms_eval/tasks/cc_ocr/evaluators/__init__.py1CODE
LOWlmms_eval/tasks/cc_ocr/evaluators/__init__.py1CODE
LOWlmms_eval/tasks/vantage_vqa/utils.py1CODE
LOWlmms_eval/tasks/vbvr/utils.py21CODE
LOWlmms_eval/tasks/vbvr/vbvr_bench/__init__.py10CODE
LOWlmms_eval/tasks/vbvr/vbvr_bench/__init__.py11CODE
LOWlmms_eval/tasks/vbvr/vbvr_bench/__init__.py13CODE
LOWlmms_eval/tasks/vbvr/vbvr_bench/__init__.py16CODE
LOWlmms_eval/tasks/vbvr/vbvr_bench/__init__.py19CODE
LOWlmms_eval/tasks/vbvr/vbvr_bench/__init__.py22CODE
LOWlmms_eval/tasks/vsibench/utils.py3CODE
LOWlmms_eval/tasks/kris_bench/utils.py30CODE
LOWlmms_eval/tasks/mvp/utils.py32CODE
LOWlmms_eval/tasks/vbench/build_dataset.py19CODE
LOWlmms_eval/tasks/multi_crit/utils.py3CODE
LOW…reebench/metrics/mindcube_cogmap/src/utils/__init__.py6CODE
LOW…reebench/metrics/mindcube_cogmap/src/utils/__init__.py6CODE
LOW…reebench/metrics/mindcube_cogmap/src/utils/__init__.py6CODE
LOW…reebench/metrics/mindcube_cogmap/src/utils/__init__.py6CODE
LOW…reebench/metrics/mindcube_cogmap/src/utils/__init__.py6CODE
LOW…reebench/metrics/mindcube_cogmap/src/utils/__init__.py7CODE
LOW…reebench/metrics/mindcube_cogmap/src/utils/__init__.py7CODE
LOW…reebench/metrics/mindcube_cogmap/src/utils/__init__.py7CODE
LOW…reebench/metrics/mindcube_cogmap/src/utils/__init__.py12CODE
LOW…reebench/metrics/mindcube_cogmap/src/utils/__init__.py12CODE
LOW…reebench/metrics/mindcube_cogmap/src/utils/__init__.py12CODE
LOW…nch/metrics/mindcube_cogmap/src/evaluation/__init__.py23CODE
LOW…nch/metrics/mindcube_cogmap/src/evaluation/__init__.py23CODE
LOW…nch/metrics/mindcube_cogmap/src/evaluation/__init__.py23CODE
LOW…nch/metrics/mindcube_cogmap/src/evaluation/__init__.py26CODE
LOW…nch/metrics/mindcube_cogmap/src/evaluation/__init__.py26CODE
LOW…nch/metrics/mindcube_cogmap/src/evaluation/__init__.py26CODE
LOW…nch/metrics/mindcube_cogmap/src/evaluation/__init__.py26CODE
LOW…nch/metrics/mindcube_cogmap/src/evaluation/__init__.py26CODE
LOW…nch/metrics/mindcube_cogmap/src/evaluation/__init__.py26CODE
LOW…nch/metrics/mindcube_cogmap/src/evaluation/__init__.py34CODE
LOW…nch/metrics/mindcube_cogmap/src/evaluation/__init__.py34CODE
LOW…rics/mindcube_cogmap/src/evaluation/cogmap/__init__.py11CODE
LOW…rics/mindcube_cogmap/src/evaluation/cogmap/__init__.py11CODE
LOW…rics/mindcube_cogmap/src/evaluation/cogmap/__init__.py11CODE
LOW…rics/mindcube_cogmap/src/evaluation/cogmap/__init__.py11CODE
LOW…etrics/mindcube_cogmap/src/evaluation/core/__init__.py9CODE
LOW…etrics/mindcube_cogmap/src/evaluation/core/__init__.py10CODE
LOW…etrics/mindcube_cogmap/src/evaluation/core/__init__.py10CODE
LOW…etrics/mindcube_cogmap/src/evaluation/core/__init__.py11CODE
LOW…etrics/mindcube_cogmap/src/evaluation/core/__init__.py11CODE
LOW…etrics/mindcube_cogmap/src/evaluation/core/__init__.py11CODE
LOWlmms_eval/tasks/rvos/eval_sam2.py28CODE
LOWlmms_eval/tasks/rvos/utils.py23CODE
128 more matches not shown…
Self-Referential Comments54 hits · 156 pts
SeverityFileLineSnippetContext
MEDIUMtest/cache/test_response_cache.py548 # Create a rank-0 instance with finalize metadata and call finalizeCOMMENT
MEDIUMtest/eval/utils.py19 # Create a temporary directoryCOMMENT
MEDIUMexamples/models/plm.sh24# Define the tasks you want to evaluate PLM on. We support all the tasks present in lmms-eval, however have tested the fCOMMENT
MEDIUMlmms_eval/logging_utils.py27 # Define the pattern to match ',none' at the end of the stringCOMMENT
MEDIUMlmms_eval/tasks/llava-in-the-wild/utils_ko.py51 # Create a Request object for the unified judge APICOMMENT
MEDIUMlmms_eval/tasks/mmsearch/utils/utils.py173 # Create a 512x512 pixel blank imageCOMMENT
MEDIUMlmms_eval/tasks/mmsearch/utils/utils.py344 # Create an array of Promises, each corresponding to the loading of an imageSTRING
MEDIUMlmms_eval/tasks/ami/utils.py28 # Create a translation table that removes all punctuation except apostropheCOMMENT
MEDIUMlmms_eval/tasks/gedit_bench/viescore/vie_prompts.py1# This file is generated automatically through parse_prompt.pyCOMMENT
MEDIUMlmms_eval/tasks/gedit_bench/viescore/parse_prompt.py6 out_file.write("# This file is generated automatically through parse_prompt.py\n\n")CODE
MEDIUMlmms_eval/tasks/gedit_bench/viescore/utils.py170 # Define the delimitersCOMMENT
MEDIUMlmms_eval/tasks/gedit_bench/viescore/utils.py257 # Define the delimitersCOMMENT
MEDIUMlmms_eval/tasks/mathvista/mathvista_evals.py173 # Create a custom server config for this specific request with different parametersSTRING
MEDIUMlmms_eval/tasks/vbvr/vbvr_bench/utils.py110 # Create a mask of pixels that are NOT backgroundCOMMENT
MEDIUM…s/vbvr/vbvr_bench/evaluators/Out_of_Domain_50_part2.py1879 # Create a mask with the triangle contourCOMMENT
MEDIUMlmms_eval/tasks/refcoco/utils_rec.py35 # Create a new dataset from the exploded rowsCOMMENT
MEDIUMlmms_eval/tasks/refcoco/utils_rec.py66 # Define the regex pattern to find the first instance of four floats within square bracketsCOMMENT
MEDIUMlmms_eval/tasks/mmmu/utils.py231 # Define a regex pattern to match "validation_" at the beginning and "_<number>" at the endCOMMENT
MEDIUMlmms_eval/tasks/mmmu/utils_group_img.py20 # Create a drawing contextCOMMENT
MEDIUMlmms_eval/tasks/mmmu/utils_group_img.py198 # Define a regex pattern to match "validation_" at the beginning and "_<number>" at the endCOMMENT
MEDIUMlmms_eval/tasks/mmmu/reasoning/utils.py145 # Define a regex pattern to match "validation_" at the beginning and "_<number>" at the endCOMMENT
MEDIUM…indcube_cogmap/src/evaluation/cogmap/cogmap_metrics.py282 # Create an empty result structure to build uponCOMMENT
MEDIUMlmms_eval/tasks/mdpbench/table_utils.py190 # Define a regex pattern to find Markdown tables with newlinesCOMMENT
MEDIUMlmms_eval/tasks/jmmmu/utils.py93 # Define a regex pattern to match "validation_" at the beginning and "_<number>" at the endCOMMENT
MEDIUMlmms_eval/tasks/llava_wilder/utils.py57 # Create a Request object for the unified judge APICOMMENT
MEDIUMlmms_eval/tasks/refcocog/utils_rec.py35 # Create a new dataset from the exploded rowsCOMMENT
MEDIUMlmms_eval/tasks/refcocog/utils_rec.py66 # Define the regex pattern to find the first instance of four floats within square bracketsCOMMENT
MEDIUMlmms_eval/tasks/refcoco+/utils_rec.py35 # Create a new dataset from the exploded rowsCOMMENT
MEDIUMlmms_eval/tasks/refcoco+/utils_rec.py66 # Define the regex pattern to find the first instance of four floats within square bracketsCOMMENT
MEDIUMlmms_eval/tasks/nextqa/utils.py164# The following code copied from #COMMENT
MEDIUMlmms_eval/tasks/jmmmu_pro/utils.py93 # Define a regex pattern to match "validation_" at the beginning and "_<number>" at the endCOMMENT
MEDIUMlmms_eval/tasks/emma/utils.py170 # Create a Request object for the unified judge APICOMMENT
MEDIUMlmms_eval/tasks/videommmu/utils.py31# Define the mapping for subjects to their respective directoriesCOMMENT
MEDIUMlmms_eval/tasks/videommmu/utils.py123 # Define the option letters based on the number of optionsCOMMENT
MEDIUMlmms_eval/tasks/videommmu/utils.py156 # Define a regex pattern to match "validation_" at the beginning and "_<number>" at the endCOMMENT
MEDIUMlmms_eval/tasks/wild_vision_bench/utils.py273 # Create a DataFrame with "model" and "score" columnsSTRING
MEDIUMlmms_eval/tasks/mmvetv2/utils.py15 # Create a drawing contextCOMMENT
MEDIUMlmms_eval/tasks/mmvetv2/utils.py220 # Create a Request object for the unified judge APISTRING
MEDIUMlmms_eval/tasks/mmvet/utils.py47 # Create a Request object for the unified judge APISTRING
MEDIUM…s/megabench/metrics/scoring/general_numerical_match.py34 # Create a multiprocessing.Queue to receive the outputCOMMENT
MEDIUM…_eval/tasks/megabench/metrics/scoring/program_judge.py18 # Create a CodeTester instance with the response and the found test casesCOMMENT
MEDIUM…/tasks/megabench/metrics/scoring/common/conversions.py216 # Create a new image with the calculated sizeCOMMENT
MEDIUMlmms_eval/tasks/megabench/breakdown/analysis_utils.py90 meta = all_meta[task_name].copy() # Create a copy to avoid modifying originalCODE
MEDIUMlmms_eval/tasks/stare/utils.py126 # Create a Request object for the unified judge APICOMMENT
MEDIUMlmms_eval/tasks/tomato/utils.py122 # Create a VideoCapture objectSTRING
MEDIUM…al/tasks/multilingual-llava-bench-in-the-wild/utils.py41 # Create a Request object for the unified judge APICOMMENT
MEDIUMlmms_eval/tasks/ocrbench_v2/TEDS_metric.py365 # Create a dictionary for each combination of values.COMMENT
MEDIUMlmms_eval/tasks/ocrbench_v2/TEDS_metric.py377 # Create a dictionary for each combination of values.COMMENT
MEDIUMlmms_eval/loggers/utils.py24 # Define the pattern to match ',none' at the end of the stringCOMMENT
MEDIUMlmms_eval/models/model_utils/thyme/sandbox.py65# Define the temporary folder for processed imagesCOMMENT
MEDIUMlmms_eval/models/model_utils/thyme/sandbox.py186# Define a minimum dimension for the cropCOMMENT
MEDIUMlmms_eval/models/simple/llama_vid.py132 # Create the folder if it doesn't existCOMMENT
MEDIUMlmms_eval/models/simple/minicpm_o.py12 # Create a dedicated environment (recommended)STRING
MEDIUMlmms_eval/api/task.py1121 # Create a new symbolic linkCOMMENT
AI Structural Patterns123 hits · 119 pts
SeverityFileLineSnippetContext
LOWtest/conftest.py59CODE
LOWtest/cache/test_response_cache.py29CODE
LOWexamples/mcp_server/sample_mcp_server.py40CODE
LOWlmms_eval/evaluator_utils.py54CODE
LOWlmms_eval/evaluator.py366CODE
LOWlmms_eval/evaluator.py964CODE
LOWlmms_eval/tasks/asr_wer_utils.py102CODE
LOWlmms_eval/tasks/voicebench/utils.py342CODE
LOWlmms_eval/tasks/vcr_wiki/utils.py185CODE
LOWlmms_eval/tasks/plm_videobench/eval_utils.py27CODE
LOWlmms_eval/tasks/cc_ocr/evaluators/common.py32CODE
LOWlmms_eval/tasks/aime/utils.py126CODE
LOW…ms_eval/tasks/spatialtreebench/metrics/rule_metrics.py108CODE
LOW…ms_eval/tasks/spatialtreebench/metrics/rule_metrics.py928CODE
LOW…ms_eval/tasks/spatialtreebench/metrics/rule_metrics.py1133CODE
LOW…indcube_cogmap/src/evaluation/cogmap/cogmap_metrics.py243CODE
LOWlmms_eval/tasks/mmupd/mmupd_evals.py64CODE
LOWlmms_eval/tasks/librispeech/cn_tn.py645CODE
LOWlmms_eval/tasks/librispeech/cn_tn.py1040CODE
LOWlmms_eval/tasks/nextqa/utils.py244CODE
LOWlmms_eval/tasks/worldqa/utils.py175CODE
LOWlmms_eval/tasks/openai_math/utils.py123CODE
LOWlmms_eval/tasks/gpqa/openai/utils.py90CODE
LOW…tasks/megabench/metrics/scoring/latex_expr_equality.py74CODE
LOW…eval/tasks/megabench/metrics/scoring/sacrebleu_bleu.py21CODE
LOW…eval/tasks/megabench/metrics/parsing/common/parsers.py140CODE
LOWlmms_eval/tasks/tomato/utils.py214CODE
LOWlmms_eval/tasks/ocrbench_v2/TEDS_metric.py327CODE
LOWlmms_eval/tasks/ocrbench_v2/TEDS_metric.py885CODE
LOWlmms_eval/loggers/evaluation_tracker.py106CODE
LOWlmms_eval/verifiers/gemini.py68CODE
LOWlmms_eval/verifiers/openai.py76CODE
LOWlmms_eval/mcp/tools.py174CODE
LOWlmms_eval/models/whisper_tt.py36CODE
LOWlmms_eval/models/chat/llava_onevision2.py70CODE
LOWlmms_eval/models/chat/async_hf_model.py39CODE
LOWlmms_eval/models/chat/nanovlm.py47CODE
LOWlmms_eval/models/chat/vllm_generate.py41CODE
LOWlmms_eval/models/chat/fastvideo.py171CODE
LOWlmms_eval/models/chat/vllm.py25CODE
LOWlmms_eval/models/chat/longvila.py24CODE
LOWlmms_eval/models/chat/async_openai.py45CODE
LOWlmms_eval/models/chat/aero_realtime_vllm.py318CODE
LOWlmms_eval/models/chat/neo_ov.py155CODE
LOWlmms_eval/models/chat/huggingface.py44CODE
LOWlmms_eval/models/chat/sglang.py85CODE
LOWlmms_eval/models/chat/bagel_lmms_engine.py46CODE
LOWlmms_eval/models/chat/internvl_hf.py60CODE
LOWlmms_eval/models/simple/llama_vid.py40CODE
LOWlmms_eval/models/simple/cambrians_vsc.py56CODE
LOWlmms_eval/models/simple/llama_vision.py27CODE
LOWlmms_eval/models/simple/cambrians_vsc_streaming.py36CODE
LOWlmms_eval/models/simple/vila.py44CODE
LOWlmms_eval/models/simple/ovis_u1.py81CODE
LOWlmms_eval/models/simple/aria.py46CODE
LOWlmms_eval/models/simple/internvl.py103CODE
LOWlmms_eval/models/simple/internvl.py405CODE
LOWlmms_eval/models/simple/internvl.py537CODE
LOWlmms_eval/models/simple/egogpt.py81CODE
LOWlmms_eval/models/simple/mistral3_vl.py30CODE
63 more matches not shown…
Over-Commented Block106 hits · 104 pts
SeverityFileLineSnippetContext
LOWdocs/releases/lmms-eval-0.4.md341# "mme": {COMMENT
LOWexamples/test_reasoning_tag_stripping.sh21# --tasks mme \COMMENT
LOWexamples/models/plm.sh1# # STEP # 1: Install lmms-evalCOMMENT
LOWexamples/models/llava_onevision2.sh1export HF_HOME="~/.cache/huggingface"COMMENT
LOWexamples/models/llava_onevision2.sh21# canvas packing driven by motion vectors / bit-cost. It typicallyCOMMENT
LOWexamples/models/llava_onevision2.sh41# codec model_args reference:COMMENT
LOWexamples/models/bagel.sh1#!/bin/bashCOMMENT
LOWexamples/models/vqtoken.sh1#!/usr/bin/env bashCOMMENT
LOWexamples/models/sglang_qwen3vl.sh1#!/bin/bashCOMMENT
LOWexamples/models/sglang_qwen3vl.sh61# ============================================================================COMMENT
LOWexamples/models/sglang_qwen3vl.sh121# 1. Create an MCP server that exposes tools (e.g., image processing, web search)COMMENT
LOWexamples/models/sglang_qwen3vl.sh141# ──────────────────────────────────────────────COMMENT
LOWexamples/models/sglang_qwen3vl.sh161#COMMENT
LOWexamples/models/sglang_qwen3vl.sh181# max_frame_num : Max frames for videos (default: 768)COMMENT
LOWexamples/models/sglang_qwen3vl.sh201# 2. MCP SERVER:COMMENT
LOWexamples/models/async_openai_compatible.sh1#!/bin/bashCOMMENT
LOWexamples/models/async_openai_compatible.sh21# ============================================================================COMMENT
LOWexamples/models/async_openai_compatible.sh41COMMENT
LOWexamples/models/async_openai_compatible.sh61# 7. The result is sent back to the model for continuationCOMMENT
LOWexamples/models/async_openai_compatible.sh81#COMMENT
LOWexamples/models/async_openai_compatible.sh101# max_frames : Max frames for videos (default: 768)COMMENT
LOWexamples/models/openrouter_molmo.sh1#!/bin/bashCOMMENT
LOWexamples/models/openrouter_molmo.sh41# 1. OpenRouter free models have rate limits - use small --limit for testingCOMMENT
LOWexamples/models/cambrians.sh1# tested withCOMMENT
LOWexamples/models/qwen25vl.sh1# Run and exactly reproduce qwen2vl results!COMMENT
LOWexamples/models/vllm_qwen3vl.sh1#!/bin/bashCOMMENT
LOWexamples/models/vllm_qwen3vl.sh21# Available Qwen3-VL models:COMMENT
LOW.github/workflows/claude.yml41 actions: readCOMMENT
LOWlmms_eval/evaluator.py1261 ### Postprocess outputs ###COMMENT
LOWlmms_eval/tasks/kaleidoscope/utils.py181# ---------------------------------------------------------------------------COMMENT
LOWlmms_eval/tasks/saco/utils.py281 # Both have F1 scores — compare mean F1COMMENT
LOW…/voicebench/instruction_following_eval/instructions.py1# coding=utf-8COMMENT
LOW…ebench/instruction_following_eval/instructions_util.py1# coding=utf-8COMMENT
LOW…ch/instruction_following_eval/instructions_registry.py1# coding=utf-8COMMENT
LOWlmms_eval/tasks/ifeval/instructions.py1# Copyright 2023 The Google Research Authors.COMMENT
LOWlmms_eval/tasks/ifeval/instructions_util.py1# Copyright 2023 The Google Research Authors.COMMENT
LOWlmms_eval/tasks/ifeval/instructions_registry.py1# Copyright 2023 The Google Research Authors.COMMENT
LOWlmms_eval/tasks/chartqa/upload_chartqa.py1# Copyright 2020 The HuggingFace Datasets Authors and the current dataset script contributor.COMMENT
LOWlmms_eval/tasks/kris_bench/__init__.py1# KRIS-Bench taskCOMMENT
LOWlmms_eval/tasks/mmmu/mmmu_val_reasoning.yaml1dataset_path: lmms-lab-encoder/MMMUCOMMENT
LOWlmms_eval/tasks/hallusion_bench/utils.py281COMMENT
LOWlmms_eval/tasks/vlmsareblind/__init__.py1# VLMs Are Blind benchmark taskCOMMENT
LOW…atialtreebench/metrics/mindcube_cogmap/parse_output.py241 # else:COMMENT
LOWlmms_eval/tasks/mdpbench/match_quick.py21 get_pred_category_type,COMMENT
LOWlmms_eval/tasks/mdpbench/match_quick.py41# # 只处理满足条件的字典COMMENT
LOWlmms_eval/tasks/mdpbench/match_quick.py61# output.append(item)COMMENT
LOWlmms_eval/tasks/mdpbench/match_quick.py81COMMENT
LOWlmms_eval/tasks/mdpbench/match_quick.py101# idx_in_body = body.find(ln, search_from)COMMENT
LOWlmms_eval/tasks/mdpbench/match_quick.py501 # print(cost_matrix)COMMENT
LOWlmms_eval/tasks/mdpbench/match_quick.py521COMMENT
LOWlmms_eval/tasks/mdpbench/match_quick.py621COMMENT
LOWlmms_eval/tasks/mdpbench/match_quick.py641 # ignore_type = ['figure_caption', 'figure_footnote', 'table_caption', 'table_footnote', 'code_algorithmCOMMENT
LOWlmms_eval/tasks/mdpbench/data_preprocess.py61# "\u2018": "'", # Left single quote to straight quoteCOMMENT
LOWlmms_eval/tasks/mdpbench/data_preprocess.py381COMMENT
LOWlmms_eval/tasks/mdpbench/data_preprocess.py401# # inline_array.append(match.group(0))COMMENT
LOWlmms_eval/tasks/mdpbench/extract.py121 # markdown_table_content[i, j] = LatexNodes2Text().latex_to_text(content_str)COMMENT
LOWlmms_eval/tasks/mdpbench/extract.py161 # position = [match.start(), match.end()]COMMENT
LOWlmms_eval/tasks/mdpbench/extract.py201 single_line = re.sub(dollar_pattern, r"\\[\1\\]", single_line)COMMENT
LOWlmms_eval/tasks/mdpbench/extract.py221 # pred_all.append({COMMENT
LOWlmms_eval/tasks/mdpbench/extract.py261 # title_matches = title_reg.finditer(content)COMMENT
46 more matches not shown…
AI Slop Vocabulary30 hits · 71 pts
SeverityFileLineSnippetContext
MEDIUMtools/regression.py1# code from https://github.com/EleutherAI/lm-evaluation-harness/blob/main/scripts/regression.pyCOMMENT
MEDIUMlmms_eval/evaluator_utils.py1# credit to https://github.com/EleutherAI/lm-evaluation-harnessCOMMENT
MEDIUMlmms_eval/evaluator.py473 # See https://github.com/EleutherAI/lm-evaluation-harness/pull/1412COMMENT
MEDIUMlmms_eval/logging_utils.py1# Code mostly from: https://github.com/EleutherAI/lm-evaluation-harness/pull/1339, credit to: https://github.com/ayulockCOMMENT
MEDIUMlmms_eval/tasks/__init__.py1# credit to https://github.com/EleutherAI/lm-evaluation-harnessCOMMENT
LOWlmms_eval/tasks/mmvu/utils.py349 # For open-ended, just use the prediction as-is (truncated for logging)COMMENT
MEDIUM…s/vbvr/vbvr_bench/evaluators/Out_of_Domain_50_part1.py101 # Sort by area to match shapes (more robust than position)COMMENT
MEDIUMlmms_eval/tasks/charades_sta/eval_tvg.py90 # More comprehensive pattern to match various formats like:COMMENT
MEDIUMlmms_eval/tasks/mia_bench/utils.py168 # More robust regex patterns to extract scoresCOMMENT
MEDIUMlmms_eval/tasks/realunify/realunify.yaml2# Evaluates bidirectional capability synergy in unified multimodal modelsCOMMENT
MEDIUMlmms_eval/tasks/mmbench/mmbench_evals.py221 # Use robust MCQ extraction instead of GPT APICOMMENT
LOW…s/megabench/metrics/scoring/xml_norm_point_distance.py36 # Instead of normalizing by 1/sqrt(2), we just set it to 0 if the distance is above 1.COMMENT
LOW…s_eval/tasks/megabench/metrics/parsing/common/utils.py151 # the result overflows, simply return an empty stringCOMMENT
MEDIUMlmms_eval/tasks/multimodal_rewardbench/utils.py34 # TODO: we should use a more robust method to extract the judgment -- what if both "[[A]]" and "[[B]]" are in the juCOMMENT
MEDIUMlmms_eval/loggers/evaluation_tracker.py1# code is adapted from https://github.com/EleutherAI/lm-evaluation-harness/blob/main/lmms_eval/loggers/evaluation_trackeCOMMENT
MEDIUMlmms_eval/models/chat/aero_realtime_vllm.py338 # Accept (and ignore) unknown harness kwargs gracefully — be lenientCOMMENT
LOWlmms_eval/models/simple/internvl.py86 # The above steps can be optional, I add snapshot download, so now can just use hf repo_idCOMMENT
LOWlmms_eval/models/simple/minicpm_v.py199 # ominicpm does not give much information on how they do eval so I just use the chat format.COMMENT
LOWlmms_eval/models/simple/qwen2_vl.py257 # Update the original contexts list as well if needed elsewhere, otherwise just use current_contextCOMMENT
MEDIUMlmms_eval/models/simple/qwen2_vl.py265 # A more robust approach might map visuals back to their original context index.COMMENT
LOWlmms_eval/models/simple/vllm.py170 # Here we just use the same token as llava for convenientCOMMENT
LOWlmms_eval/models/simple/batch_gpt4.py66 # Here we just use the same token as llava for convenientCOMMENT
LOWlmms_eval/models/simple/srt_api.py50 # Here we just use the same token as llava for convenientCOMMENT
MEDIUMlmms_eval/models/simple/uni_moe_2_omni.py45SYSTEM_PROMPT = """You are Uni-MoE-2, a helpful multi-modal model. Your role as an assistant involves thoroughly exploriCODE
LOWlmms_eval/models/simple/gpt4v.py51 # Here we just use the same token as llava for convenientCOMMENT
LOWlmms_eval/models/simple/qwen2_audio.py226 # This placeholder is just use to make chat template workCOMMENT
MEDIUMlmms_eval/api/metrics.py1# the code is adapted from https://github.com/EleutherAI/lm-evaluation-harnessCOMMENT
MEDIUMlmms_eval/api/metrics.py641 # See https://github.com/EleutherAI/lm-evaluation-harness/pull/1390 for more documentation.COMMENT
MEDIUMlmms_eval/api/task.py1807 # built by build_all_requests and the simple adapters (lm-eval-harnessCOMMENT
LOWlmms_eval/api/task.py1623 # we just use the argmin hereCOMMENT
Modern AI Meta-Vocabulary21 hits · 63 pts
SeverityFileLineSnippetContext
MEDIUMtest/eval/test_construct_requests.py205# ConfigurableTask agentic testsCOMMENT
MEDIUMtest/eval/test_construct_requests.py336# ConfigurableMessagesTask agentic testsCOMMENT
MEDIUMtest/eval/test_construct_requests.py414 ("ctx", _GEN_KWARGS, _dummy_doc_to_visual, _dummy_doc_to_text, 0, "my_task", "my_split"), # agenticCODE
MEDIUMdocs/releases/CHANGELOG.md14- **Agentic task evaluation**: new `generate_until_agentic` output type with iterative tool-call loop, deterministic simCODE
MEDIUMdocs/releases/CHANGELOG.md91- **`generate_until_agentic` output type**: iterative evaluator loop where the model emits `<tool_call>` or `<submit>` tCODE
MEDIUMdocs/releases/lmms-eval-0.7.md11- [4. Agentic Task Evaluation](#4-agentic-task-evaluation)CODE
MEDIUMcicd/run_evalcicd.sh4# This allows for better GPU management and test orchestrationCOMMENT
MEDIUMlmms_eval/evaluator.py691 # add info about the model and few shot configCOMMENT
MEDIUMlmms_eval/tasks/mmsearch/score/f1_score.py33# from https://github.com/chanchimin/RQ-RAG/blob/96b4ec981d4a4399e8402da1b75e16f7812aedfe/retrieval_lm/output/sample_froCOMMENT
MEDIUMlmms_eval/tasks/kaleidoscope/utils.py137# Zero-shot chain-of-thought system message, translated into every evaluation language.COMMENT
MEDIUMlmms_eval/tasks/kris_bench/utils.py351 # Clamp score to valid 1-5 range (judge may hallucinate out-of-range values)COMMENT
MEDIUMlmms_eval/tasks/longvt/README.md3This directory contains evaluation tasks for [LongVT](https://github.com/EvolvingLMMs-Lab/LongVT), an agentic framework CODE
MEDIUMlmms_eval/tasks/mmsi_video/mmsi_video_u50.yaml4# Suitable for models with limited context window.COMMENT
MEDIUMlmms_eval/tasks/coco_cap_chair/utils.py995 # calculate the number of hallucinationCOMMENT
MEDIUMlmms_eval/tasks/coco_cap_chair/utils.py1014 # calculate the number of hallucinationCOMMENT
MEDIUMlmms_eval/models/chat/aero_realtime_vllm.py559 # no video item, no extra prompt scaffolding.COMMENT
MEDIUMlmms_eval/models/simple/cosmos_wm.py1358 # Public: extract last frame (for agentic use)COMMENT
MEDIUMlmms_eval/models/simple/wan2_2.py94 # Standard tasks pass a real doc; agentic rollout rounds 2+ pass aCOMMENT
MEDIUMlmms_eval/api/task.py1298 # if few-shot - append examples after the system promptCOMMENT
MEDIUMlmms_eval/api/task.py1806 # (description + few-shot examples + current question), matching the ctxCOMMENT
MEDIUMlmms_eval/api/samplers.py17 if fewshot_indices: # subset few-shot docs fromCODE
Cross-Language Confusion7 hits · 41 pts
SeverityFileLineSnippetContext
HIGHlmms_eval/tasks/mmsearch/utils/utils.py319 if (k * scrollStep < height && k * scrollStep < maxHeight) {{CODE
HIGHlmms_eval/tasks/mmsearch/utils/utils.py353 if (!img.src && img.dataset.src) {CODE
HIGHlmms_eval/tasks/gedit_bench/viescore/utils.py22 elif re.match(r"^(true|false|null)$", value, re.IGNORECASE):CODE
HIGHlmms_eval/tasks/rvos/utils.py226 # File is {"<internal_obj_id>": [rle, rle, ..., null, ...]}COMMENT
HIGH…tasks/megabench/metrics/scoring/latex_expr_equality.py35 result = 1 if responses_expr.equals(targets_expr) else 0CODE
HIGHlmms_eval/tasks/groundingme/utils.py136PROMPT = "All spatial relationships are defined from the viewer's perspective, where 'front' means closer to the viewer CODE
HIGHlmms_eval/tasks/groundingme/utils.py146 """Extract bounding box from JSON format: {"bbox_2d": [x1, y1, x2, y2]} or {"bbox_2d": null}."""STRING
Docstring Block Structure8 hits · 40 pts
SeverityFileLineSnippetContext
HIGHlmms_eval/imports.py43Import a module or attribute optionally, returning fallback if unavailable. Args: module_name: Full module STRING
HIGHlmms_eval/tasks/mathvision/eval_utils.py131Determine if a given ID falls within a specified area. This function checks if a provided ID contains the specifiedSTRING
HIGHlmms_eval/tasks/gedit_bench/viescore/utils.py76 Search for a file across a directory and return its absolute path. Args: filename (Union[str, os.PathLSTRING
HIGH…ch/metrics/mindcube_cogmap/src/evaluation/evaluator.py119Unified evaluation interface with automatic mode selection. Args: jsonl_path: Path to JSONL file with modelSTRING
HIGHlmms_eval/models/chat/thyme.py37 Context manager that extracts the user's image and saves it to a temporary file if needed. Args: messaSTRING
HIGHlmms_eval/models/simple/gemma3.py351Generate text in a multi-round conversation format. Args: requests: List of Instance objects for muSTRING
HIGHlmms_eval/entrypoints/client.py228 Wait for a job to complete and return results. Args: job_id: The job ID to wait for STRING
HIGHlmms_eval/entrypoints/client.py276 Merge FSDP2 sharded checkpoint into a single consolidated checkpoint. Args: checkpoint_patSTRING
Slop Phrases18 hits · 40 pts
SeverityFileLineSnippetContext
MEDIUMlmms_eval/tasks/voicebench/utils.py232 "As a language model",CODE
MEDIUMlmms_eval/tasks/voicebench/utils.py238 "I'm unable to",CODE
MEDIUMlmms_eval/tasks/plm_videobench/eval_utils.py177 "Your task is to compare the predicted answer with the correct answer and determine if they match meaningfully. CODE
MEDIUMlmms_eval/tasks/moviechat/utils.py105 "Your task is to compare the predicted answer with the correct answer and determine if they match meaningfulCODE
MEDIUMlmms_eval/tasks/cvrr/utils.py106 "Your task is to compare the predicted answer with the ground-truth answer and determine if the predicted anCODE
MEDIUMlmms_eval/tasks/video-tt/gpt_utils.py47 "Your task is to compare the predicted answer with the correct answer and determine if they match meaningfully. CODE
MEDIUMlmms_eval/tasks/activitynetqa/utils.py92 "Your task is to compare the predicted answer with the correct answer and determine if they match meaningfulCODE
MEDIUMlmms_eval/tasks/llava_interleave_bench/utils.py46 # Optionally, you can add a placeholder image or just continueCOMMENT
MEDIUMlmms_eval/tasks/vdc/utils.py197 "Here's how you can accomplish the task:"CODE
MEDIUMlmms_eval/tasks/vdc/utils.py224 "Your task is to compare the predicted answer with the correct answer and determine if they match meaningfully. CODE
MEDIUMlmms_eval/tasks/FALCONBench/utils.py366 "Your task is to compare the predicted answer with the correct answer and determine if they match meaningfulSTRING
MEDIUMlmms_eval/tasks/video_detail_description/utils.py90 "Your task is to compare the predicted answer with the correct answer and determine its level of detail, conCODE
MEDIUMlmms_eval/tasks/videochatgpt/utils.py222 "Your task is to compare the predicted answer with the correct answer and determine if they are factuallCODE
MEDIUMlmms_eval/tasks/videochatgpt/utils.py247 "Your task is to compare the predicted answer with the correct answer and determine its level of detail,CODE
MEDIUMlmms_eval/tasks/videochatgpt/utils.py272 "Your task is to compare the predicted answer with the correct answer and determine if the generated resCODE
MEDIUMlmms_eval/tasks/videochatgpt/utils.py297 "Your task is to compare the predicted answer with the correct answer and determine if they correctly reCODE
MEDIUMlmms_eval/tasks/videochatgpt/utils.py363 "Your task is to compare the predicted answers for two very similar question, with a common correct answer aCODE
MEDIUMlmms_eval/tasks/holisafe/utils.py110 "i cannot provide",CODE
Structural Annotation Overuse20 hits · 38 pts
SeverityFileLineSnippetContext
LOWdocs/advanced/mmmu-eval-discrepancy.md169 # Step 1: Strip punctuation, pad with spacesCOMMENT
LOWdocs/advanced/mmmu-eval-discrepancy.md174 # Step 2: Hierarchical pattern matchingCOMMENT
LOWdocs/advanced/mmmu-eval-discrepancy.md219 # Step 1: Replace punctuation with spacesCOMMENT
LOWdocs/advanced/mmmu-eval-discrepancy.md225 # Step 2: Count how many choice letters appearCOMMENT
LOWdocs/advanced/mmmu-eval-discrepancy.md228 # Step 3: If exactly one choice found, verify it's near the endCOMMENT
LOW…tasks/vbvr/vbvr_bench/evaluators/In_Domain_50_part5.py467 # Step 2: Detect which lights are ON in GT final (expected states)COMMENT
LOW…tasks/vbvr/vbvr_bench/evaluators/In_Domain_50_part5.py470 # Step 3: Detect which lights are ON in generated finalCOMMENT
LOW…tasks/vbvr/vbvr_bench/evaluators/In_Domain_50_part5.py473 # Step 4: Compare states - STRICT rule-basedCOMMENT
LOW…tasks/vbvr/vbvr_bench/evaluators/In_Domain_50_part5.py1139 # Step 1: Detect elements in GT first (the pattern)COMMENT
LOW…tasks/vbvr/vbvr_bench/evaluators/In_Domain_50_part5.py1142 # Step 2: Detect elements in GT final (includes correct answer)COMMENT
LOW…tasks/vbvr/vbvr_bench/evaluators/In_Domain_50_part5.py1145 # Step 3: Detect elements in generated finalCOMMENT
LOW…tasks/vbvr/vbvr_bench/evaluators/In_Domain_50_part5.py454 # Step 1: Find all light positions from GT first frameCOMMENT
LOWlmms_eval/tasks/longvt/README.md65#### Step 1: Start MCP ServerCOMMENT
LOWlmms_eval/tasks/longvt/README.md86#### Step 2: Run EvaluationCOMMENT
LOWlmms_eval/tasks/phyx/phyx_evals.py142 Predicted answer: ### Step 1: Calculate ( l_1 )CODE
LOWlmms_eval/models/simple/ovis_u1.py400 # Step 1: Unconditional baselineCOMMENT
LOWlmms_eval/models/simple/ovis_u1.py412 # Step 2: Conditional with original imageCOMMENT
LOWlmms_eval/models/simple/ovis_u1.py440 # Step 3: Generate the imageCOMMENT
LOWlmms_eval/cli/wizard.py251 # Step 4: confirmCOMMENT
LOWlmms_eval/entrypoints/http_server.py33# WARNING: This server is intended for use in trusted environments only.COMMENT
Modern Structural Boilerplate28 hits · 28 pts
SeverityFileLineSnippetContext
LOWexamples/mcp_server/crop_video_mcp_server.py21logger = logging.getLogger(__name__)CODE
LOW…s/mmsearch/retrieve_content/tokenization/tokenizers.py27 def update_lexeme(self, lex: str) -> None:CODE
LOWlmms_eval/tasks/cc_ocr/evaluators/__init__.py3__all__ = ["ocr_metric", "kie_metric", "doc_parsing_metric"]CODE
LOWlmms_eval/tasks/ifeval/instructions.py29logger = logging.getLogger(__name__)CODE
LOWlmms_eval/tasks/vbvr/vbvr_bench/evaluators/__init__.py640__all__ = [CODE
LOW…reebench/metrics/mindcube_cogmap/src/utils/__init__.py14__all__ = [CODE
LOW…nch/metrics/mindcube_cogmap/src/evaluation/__init__.py36__all__ = [CODE
LOW…rics/mindcube_cogmap/src/evaluation/cogmap/__init__.py18__all__ = [CODE
LOW…etrics/mindcube_cogmap/src/evaluation/core/__init__.py13__all__ = [CODE
LOWlmms_eval/tasks/worldvqa/utils.py85__all__ = [CODE
LOWlmms_eval/tasks/megabench/metrics/__init__.py5__all__ = [AggregationType, MetricType, ResponseParseType]CODE
LOWlmms_eval/tui/__init__.py15__all__ = ["run_tui", "server_app"]CODE
LOWlmms_eval/verifiers/__init__.py137__all__ = [CODE
LOWlmms_eval/verifiers/gemini.py17logger = logging.getLogger(__name__)CODE
LOWlmms_eval/verifiers/openai.py20logger = logging.getLogger(__name__)CODE
LOWlmms_eval/mcp/__init__.py10__all__ = ["MCPClient", "main"]CODE
LOWlmms_eval/models/model_utils/usage_metrics.py52def set_budget(max_tokens: Optional[int] = None) -> None:CODE
LOWlmms_eval/models/model_utils/usage_metrics.py65def set_task_context(task_name: Optional[str]) -> None:CODE
LOWlmms_eval/models/simple/vllm.py261 def _setup_tp_group_for_request_sync(self) -> None:CODE
LOWlmms_eval/cli/__init__.py5__all__ = ["main"]CODE
LOWlmms_eval/entrypoints/__init__.py16__all__ = [CODE
LOWlmms_eval/api/task.py706 def set_config(self, key: str, value: Any, update: bool = False) -> None:CODE
LOWlmms_eval/api/task.py742 def set_fewshot_seed(self, seed: Optional[int] = None) -> None:CODE
LOWlmms_eval/api/model.py161 def set_cache_hook(self, cache_hook) -> None:CODE
LOWlmms_eval/baselines/__init__.py52__all__ = ["BASELINE_REGISTRY", "get_baseline_display_name", "load_baseline"]CODE
LOWlmms_eval/llm_judge/__init__.py21__all__ = [CODE
LOWlmms_eval/llm_judge/launcher/__init__.py33__all__ = [CODE
LOWlmms_eval/llm_judge/providers/__init__.py9__all__ = [CODE
Verbosity Indicators13 hits · 24 pts
SeverityFileLineSnippetContext
LOW…tasks/vbvr/vbvr_bench/evaluators/In_Domain_50_part5.py467 # Step 2: Detect which lights are ON in GT final (expected states)COMMENT
LOW…tasks/vbvr/vbvr_bench/evaluators/In_Domain_50_part5.py470 # Step 3: Detect which lights are ON in generated finalCOMMENT
LOW…tasks/vbvr/vbvr_bench/evaluators/In_Domain_50_part5.py473 # Step 4: Compare states - STRICT rule-basedCOMMENT
LOW…tasks/vbvr/vbvr_bench/evaluators/In_Domain_50_part5.py1139 # Step 1: Detect elements in GT first (the pattern)COMMENT
LOW…tasks/vbvr/vbvr_bench/evaluators/In_Domain_50_part5.py1142 # Step 2: Detect elements in GT final (includes correct answer)COMMENT
LOW…tasks/vbvr/vbvr_bench/evaluators/In_Domain_50_part5.py1145 # Step 3: Detect elements in generated finalCOMMENT
LOW…tasks/vbvr/vbvr_bench/evaluators/In_Domain_50_part5.py454 # Step 1: Find all light positions from GT first frameCOMMENT
LOWlmms_eval/tasks/phyx/phyx_evals.py142 Predicted answer: ### Step 1: Calculate ( l_1 )CODE
LOWlmms_eval/models/simple/ovis_u1.py400 # Step 1: Unconditional baselineCOMMENT
LOWlmms_eval/models/simple/ovis_u1.py412 # Step 2: Conditional with original imageCOMMENT
LOWlmms_eval/models/simple/ovis_u1.py440 # Step 3: Generate the imageCOMMENT
LOWlmms_eval/cli/wizard.py251 # Step 4: confirmCOMMENT
LOWlmms_eval/api/task.py572 # FIXME: Bo - We need to check if the doc_to_visual if it's exists and restore it. If we use cache, the doc_to_vCOMMENT
Synthetic Comment Markers2 hits · 10 pts
SeverityFileLineSnippetContext
HIGHlmms_eval/tasks/moviechat/README.md5This repository contains an evaluation dataset designed for assessing the long video understanding performance of video CODE
HIGHlmms_eval/tasks/video_detail_description/README.md5This repository contains an evaluation dataset designed for assessing the performance of video models. The dataset incluCODE
TODO Padding5 hits · 8 pts
SeverityFileLineSnippetContext
LOWtools/regression.py34 # TODO: implement num_fewshot and limit per task, e.g. task1:5,task2:1:100,task3::1000COMMENT
LOWtools/regression.py37 # TODO: implement hf-auto to pick between causal and seq2seq models so we don't need thisCOMMENT
LOWtools/regression.py139 # TODO: implement proper timing for each taskCOMMENT
LOWlmms_eval/filters/__init__.py17 # TODO: implement this filter. either it should take in an arbitrary "scoring"/reward functionCOMMENT
LOWlmms_eval/filters/selection.py6# TODO: implement "arg_max" filter. either it should take in an arbitrary "scoring"/reward functionCOMMENT
Example Usage Blocks2 hits · 3 pts
SeverityFileLineSnippetContext
LOWexamples/models/bagel.sh16# Usage:COMMENT
LOWlmms_eval/tasks/gedit_bench/viescore/parse_prompt.py17# Example usageCOMMENT
Overly Generic Function Names1 hit · 1 pts
SeverityFileLineSnippetContext
LOWlmms_eval/tasks/ocrbench_v2/TEDS_metric.py317 def process_data(obj):CODE